Loading...
Loading...
共找到 65 个 Skills
Eval赋能加速器——帮助客户梳理其AI Agent的「合格标准」,随后生成可立即投入使用的结构化评估计划和测试用例。无需运行中的Agent,可基于功能描述、产品想法甚至模糊的目标开展工作。当有人提及Agent评估、评估规划、「我们应该测试什么」、「我们如何判断Agent是否达标」、测试用例生成或评估结果解读时即可使用。
主要基于微软的Agent评估生态系统(MS Learn、评估场景库、分类与改进手册、评估指导工具包),辅以精选行业资源,针对AI Agent评估方法相关问题提供实用、有明确倾向性的指导。
当用户的Copilot Studio Agent评估结果出炉,需要解读评分、诊断表现不佳的测试用例的根本原因、查找修复步骤,或是分析模式以优化其Agent时使用此技能。当用户提及以下内容时必须使用此技能:"eval failed"、"why did this fail"、"triage"、"diagnose failure"、"low pass rate"、"fix evaluation results"、"not passing"、"failing test cases"、"evaluation results"、"improve my eval scores",或是任何需要解读评估分数并采取行动的场景。
基于微软Eval Scenario Library和MS Learn Agent评估指南,在生成任何测试用例或运行评估前,产出一份具体的评估套件计划,涵盖场景类型、评估方法、质量信号、阈值和优先级顺序。
使用此Skill来操作Microsoft Foundry(Azure AI Foundry):从模型目录部署AI模型、借助知识索引构建RAG应用、创建并评估AI Agent。 适用场景:Microsoft Foundry、AI Foundry、模型部署、模型目录、RAG、知识索引、Agent创建、Agent评估、Agent监控。 不适用场景:Azure Functions(请使用azure-functions)、App Service(请使用azure-create-app)。
端到端GECX/CXAS/CES对话式Agent生命周期管理——从需求(PRD到Agent)构建Agent,创建并运行评估(基准测试、模拟测试、工具测试、回调测试),调试故障,迭代至生产级质量。当用户提及Google Customer Engagement Suite平台上的GECX、CXAS、CES、SCRAPI、对话式Agent、语音Agent、音频Agent、Agent评估、Agent推送/拉取/代码检查,或Agent指令/回调/工具时,使用此技能。
迭代式检查Agent仓库及可选追踪数据,与用户沟通,逐一创建、运行并审核Harbor评估。适用于Agent评估、基准测试任务、回归测试用例、基于追踪的评估、验证器设计或受控Agent环境。
适用于评估Agent性能、构建测试框架、衡量质量,或涉及「Agent评估」「LLM-as-Judge」「Agent测试」「质量指标」「评估准则」「Agent基准测试」相关问题时使用
适用于Python的Google Agent开发工具包(ADK)。功能包括:AI Agent构建、多Agent系统、工作流Agent(顺序/并行/循环)、工具集成(Google Search、Code Execution)、Vertex AI部署、Agent评估、人在环流程。可执行操作:构建、创建、部署、评估、编排AI Agent。关键词:Google ADK、Agent Development Kit、AI Agent、多Agent系统、LlmAgent、SequentialAgent、ParallelAgent、LoopAgent、工具集成、Google Search、Code Execution、Vertex AI、Cloud Run、Agent评估、人在环、Agent编排、工作流Agent、分层协调。适用场景:构建AI Agent、创建多Agent系统、实现工作流管道、将LLM Agent与工具集成、部署到Vertex AI、评估Agent性能、实现审批流程。
对LLM Agent进行测试与基准测试,包括行为测试、能力评估、可靠性指标以及生产环境监控——即使是顶尖的Agent在真实场景基准测试中的通过率也不足50%。适用场景:Agent测试、Agent评估、Agent基准测试、Agent可靠性验证、Agent测试实施。
当你设计AI Agent架构、实现工具调用、构建多Agent系统或创建Agent记忆时,可使用此技能。触发场景包括AI Agent、工具调用、Agent循环、ReAct模式、多Agent编排、Agent记忆、规划策略、Agent评估,以及任何需要自主AI Agent设计的任务。
面向软件与AI系统的综合测试准则——涵盖正向模式、反模式、编码Agent编写测试的准入规则、CI规范,以及LLM/Agent评估入门。适用于编写或评审测试、添加Mock、确定测试位置、通过Agent生成测试、调试不稳定的CI、为LLM功能设计评估套件,或重构脆弱的测试套件。包含12种正向模式(选择器层级、表驱动、构建器、真实系统准入规则)、分属脆弱性、不稳定性、Mock误用、流程、AI特定五大类的25种反模式、Agent编写测试的7项强制准入规则、带有隔离工作流的不稳定测试分类法、契约/属性/变异测试模式,以及LLM作为评判者和Agent评估的预言机阶梯入门。语言无关——仅使用伪代码。不适用于通用代码评审、与测试无关的库专属调试、非测试类CI流水线设计,或生产环境可观测性相关工作。