Loading...
Loading...
共找到 46 个 Skills
主要基于微软的Agent评估生态系统(MS Learn、评估场景库、分类与改进手册、评估指导工具包),辅以精选行业资源,针对AI Agent评估方法相关问题提供实用、有明确倾向性的指导。
当用户的Copilot Studio Agent评估结果出炉,需要解读评分、诊断表现不佳的测试用例的根本原因、查找修复步骤,或是分析模式以优化其Agent时使用此技能。当用户提及以下内容时必须使用此技能:"eval failed"、"why did this fail"、"triage"、"diagnose failure"、"low pass rate"、"fix evaluation results"、"not passing"、"failing test cases"、"evaluation results"、"improve my eval scores",或是任何需要解读评估分数并采取行动的场景。
基于微软Eval Scenario Library和MS Learn Agent评估指南,在生成任何测试用例或运行评估前,产出一份具体的评估套件计划,涵盖场景类型、评估方法、质量信号、阈值和优先级顺序。
当用户需要「开发Agent」「使用ADK构建Agent」「本地运行Agent」「调试Agent代码」「测试Agent」「部署Agent」「发布Agent」「监控Agent」,或者需要了解ADK(Agent Development Kit)开发生命周期及编码规范时,应使用本技能。它是构建ADK Agent的入口工具,始终可用——提供完整的工作流(脚手架搭建、构建、评估、部署、发布、监控)、代码保留规则、模型选择指南,以及针对ADK或任何Agent开发的故障排查步骤。
当用户要求“创建指标”“编写指标”“设计指标”“为……构建指标”“评估Agent性能”“衡量通话质量”“跟踪KPI”“添加工作流指标”“优化我的指标”“修复指标”“排查指标结果问题”“设置质量评分”或“我需要哪些指标”时使用。此外,在讨论LLM judge提示词、自定义代码指标、评估触发器、VALID_SKIP模式、章节提取,或针对Cekura语音AI Agent的指标最佳实践时也适用。内容涵盖新指标的创建,以及现有指标的审查、迭代或故障排查。
适用于Python的Azure AI Evaluation SDK。用于通过质量、安全性、Agent及自定义评估器评估生成式AI应用。 触发关键词:"azure-ai-evaluation"、"evaluators"、"GroundednessEvaluator"、"evaluate"、"AI quality metrics"、"RedTeam"、"agent evaluation"。
启动元评判者(meta-judge),随后启动评判子代理(judge sub-agent)以评估当前对话中生成的结果
Eval赋能加速器——帮助客户梳理其AI Agent的「合格标准」,随后生成可立即投入使用的结构化评估计划和测试用例。无需运行中的Agent,可基于功能描述、产品想法甚至模糊的目标开展工作。当有人提及Agent评估、评估规划、「我们应该测试什么」、「我们如何判断Agent是否达标」、测试用例生成或评估结果解读时即可使用。
基于微软分诊与改进手册(Triage & Improvement Playbook)分析Copilot Studio评估的CSV结果,返回SHIP/ITERATE/BLOCK判定,附带根因分类、诊断分诊、优先级修复方案和模式分析。
始终有效——在任何ADK Agent开发会话开始时阅读。ADK开发生命周期与强制编码指南——包括规范驱动的工作流、代码保留规则、模型选择以及故障排查。
用于评估和改进AI Agent输出的模式与技巧。在以下场景中使用本技能: - 实现自我批判与反思循环 - 为对质量要求严苛的生成任务构建评估器-优化器流水线 - 创建测试驱动的代码优化工作流 - 设计基于评分标准或LLM作为评判者的评估系统 - 为Agent输出(代码、报告、分析内容)添加迭代改进机制 - 衡量并提升Agent响应质量
当你需要评估、改进或优化现有LLM Agent的输出质量时使用本指南——包括提升工具选择准确性、回答质量、降低成本,或修复Agent给出错误/不完整响应的问题。通过MLflow的数据集、评分器和追踪功能,对Agent进行系统化评估。涵盖端到端评估工作流或单个组件(追踪设置、数据集创建、评分器定义、评估执行)。