Loading...
Loading...
共找到 65 个 Skills
提供基于LLM驱动的进化算法,在任意领域自动进化和优化AI Agent的指导方案。适用于构建自我改进型Agent、基于基准测试优化Agent提示词与技能,或实现自动化Agent评估循环的场景。
适用于用户需要构建AI Agent的场景,涵盖工具使用模式、内存管理、规划策略、多Agent协调、评估以及安全护栏。触发场景:用户提及「agent」、「构建agent」、「工具使用」、「agent循环」、「多agent」、「内存管理」、「护栏」、「agent评估」时使用。
采用Tree of Thoughts方法论,结合元评估(meta-judge)规范与多Agent评估,通过系统性探索、剪枝和扩展来执行任务
用于分析现有TypeScript或JavaScript代码库,以确定引入Inngest的位置和方式。涵盖仓库发现、框架与包检测,找出HTTP处理程序、Webhook、定时任务、队列、长时间运行任务、AI Agent、Agent评估、轮询循环、评估循环及副作用密集型代码中的耐久性缺口,进而生成并实施增量集成计划。
当用户需要「开发Agent」「使用ADK构建Agent」「本地运行Agent」「调试Agent代码」「测试Agent」「部署Agent」「发布Agent」「监控Agent」,或者需要了解ADK(Agent Development Kit)开发生命周期及编码规范时,应使用本技能。它是构建ADK Agent的入口工具,始终可用——提供完整的工作流(脚手架搭建、构建、评估、部署、发布、监控)、代码保留规则、模型选择指南,以及针对ADK或任何Agent开发的故障排查步骤。
设计并实现适用于AI Agent的全面评估系统。适用于为代码Agent、对话Agent、研究Agent或计算机操作Agent构建评估体系的场景。内容涵盖评估器类型、基准测试、8步实施路线图以及生产环境集成方案。
当某项声明依赖于Agent执行实际操作时使用。
可根据评估套件计划(/eval-suite-planner 的输出)或纯英文Agent描述生成评估测试用例,支持单响应和对话(多轮)两种评估模式,输出内容包括Copilot Studio测试集表格、可导入CSV文件(仅单响应模式支持)以及供人工审核的docx报告。
当用户要求“创建指标”“编写指标”“设计指标”“为……构建指标”“评估Agent性能”“衡量通话质量”“跟踪KPI”“添加工作流指标”“优化我的指标”“修复指标”“排查指标结果问题”“设置质量评分”或“我需要哪些指标”时使用。此外,在讨论LLM judge提示词、自定义代码指标、评估触发器、VALID_SKIP模式、章节提取,或针对Cekura语音AI Agent的指标最佳实践时也适用。内容涵盖新指标的创建,以及现有指标的审查、迭代或故障排查。
适用于Python的Azure AI Evaluation SDK。用于通过质量、安全性、Agent及自定义评估器评估生成式AI应用。 触发关键词:"azure-ai-evaluation"、"evaluators"、"GroundednessEvaluator"、"evaluate"、"AI quality metrics"、"RedTeam"、"agent evaluation"。
启动元评判者(meta-judge),随后启动评判子代理(judge sub-agent)以评估当前对话中生成的结果
当用户要求「评估Agent性能」「构建测试框架」「衡量Agent质量」「创建评估标准」,或者提及LLM-as-judge、多维度评估、Agent测试、Agent流水线质量门时,应使用本技能。本技能属于上下文工程技能套件的一部分——当用户在衡量Agent有效性的语境下提到「context engineering」或「context-engineering」时,也会触发本技能。