Loading...
Loading...
共找到 65 个 Skills
基于微软分诊与改进手册(Triage & Improvement Playbook)分析Copilot Studio评估的CSV结果,返回SHIP/ITERATE/BLOCK判定,附带根因分类、诊断分诊、优先级修复方案和模式分析。
始终有效——在任何ADK Agent开发会话开始时阅读。ADK开发生命周期与强制编码指南——包括规范驱动的工作流、代码保留规则、模型选择以及故障排查。
用于评估和改进AI Agent输出的模式与技巧。在以下场景中使用本技能: - 实现自我批判与反思循环 - 为对质量要求严苛的生成任务构建评估器-优化器流水线 - 创建测试驱动的代码优化工作流 - 设计基于评分标准或LLM作为评判者的评估系统 - 为Agent输出(代码、报告、分析内容)添加迭代改进机制 - 衡量并提升Agent响应质量
当你需要评估、改进或优化现有LLM Agent的输出质量时使用本指南——包括提升工具选择准确性、回答质量、降低成本,或修复Agent给出错误/不完整响应的问题。通过MLflow的数据集、评分器和追踪功能,对Agent进行系统化评估。涵盖端到端评估工作流或单个组件(追踪设置、数据集创建、评分器定义、评估执行)。
当用户询问“Cekura能做什么”“有哪些可用命令”“帮我使用Cekura”“我拥有哪些技能”“展示Cekura的功能”“有什么可用功能”“如何使用Cekura”,或者需要指导为任务选择合适的Cekura技能时,使用该技能。同时,当用户首次安装cekura-skills时,它也作为入口点适用。
评估并优化Claude Code的命令、技能与Agent。适用于测试提示词有效性、验证上下文工程选择或衡量优化质量的场景。
当用户要求“使用Google ADK构建Agent”、“使用Agent Development Kit”、“创建Google ADK Agent”、“设置ADK工具”,或者需要Google Agent Development Kit最佳实践、多智能体系统、智能体评估相关指导时,应使用本Skill。
用于讨论或使用DeepEval(Python AI评估框架)的场景
本技能可用于解决所有与为LangChain Agent创建测试或评估数据集相关的问题,涵盖从轨迹(final_response、single_step、trajectory、RAG类型)生成数据集、上传至LangSmith以及管理评估数据等内容。
使用评估质量飞轮(Eval Quality Flywheel)方法论,在Google Cloud上衡量并提升AI模型与Agent的质量。适用于评估Agent或模型、构建评估数据集、选择或编写评估指标、分析故障、对比修复前后的结果,或是需要Agent Platform评估方法论指导的场景——包括数据集 schema、LLM-as-judge评分以及常见故障原因。如需微调,请使用agent-platform-tuning;如需部署,请使用agent-platform-deploy。
使用包含识别、结构检查、内容分析、代码验证、集成校验、报告生成的6步评分准则,对Agent和Skill进行质量、完整性及合规性评估。适用于审计Agent/Skill、创建或更新后的质量检查,以及评估集合健康状况。触发词:"evaluate"、"audit"、"check quality"、"review agent"、"score skill"。请勿用于创建或修改Agent/Skill — 仅用于只读式评估和打分。
使用黄金数据集、评分准则和回归门为AI Agent构建自动化评估套件。