Loading...
Loading...
共找到 9 个 Skills
设计并实现适用于AI Agent的全面评估系统。适用于为代码Agent、对话Agent、研究Agent或计算机操作Agent构建评估体系的场景。内容涵盖评估器类型、基准测试、8步实施路线图以及生产环境集成方案。
当用户说出“开始使用Cekura”、“设置Cekura”、“加入Cekura平台”、“我是Cekura新手”、“帮我设置我的Agent”、“我该如何使用Cekura”、“带我了解Cekura”、“配置我的项目”、“首次使用Cekura”,或者需要平台初始设置指导时使用本技能。本技能涵盖两种入门路径:**测试**(默认路径——构建评估器并运行模拟调用)和**可观测性**(导入生产环境调用日志并进行评估)。
为Agentforce agents编写、运行和分析结构化测试套件。触发场景:用户编写或修改测试规范YAML(AiEvaluationDefinition);执行sf agent test create、run、run-eval或results命令;询问测试覆盖策略、指标选择或自定义评估;解读测试结果或诊断测试失败;询问批量测试、回归套件或CI/CD测试集成。不触发场景:用户创建、修改、预览或调试.agent文件(请使用agentforce-generate);部署或发布agents;编写Agent Script代码;使用sf agent preview进行开发迭代;分析生产会话跟踪(请使用agentforce-observe)。
當面臨 2 個以上獨立任務且無需共享狀態或順序依賴關係即可完成時使用
采用TDD风格的Skill测试方法论,通过全新的Subagent实例来防止启动偏差并验证Skill的有效性。适用于验证Skill改进效果、测试Skill有效性、防止启动偏差、衡量Skill对行为的影响场景。不适用于Skill实现(请使用skill-authoring)、钩子创建(请使用hook-authoring)场景。
用于对比编码Agent在递归模式开启和关闭状态下性能的配对基准测试编排工具。当用户需要对递归模式进行基准测试、对比同一项目中递归与非递归执行情况、生成一次性基准测试仓库、捕获时序/构建测试日志或撰写基准测试报告时使用。
ADK agents的evals(自动化对话测试)编写、运行与迭代完整参考指南。涵盖eval文件格式、所有断言类型、CLI用法以及针对各个基础组件的测试模式。
基于Playwright的端到端测试模式——包含页面对象、AI Agent测试、视觉回归测试、借助axe-core的可访问性测试,以及CI集成。适用于编写E2E测试、搭建Playwright环境、实现视觉回归测试或进行可访问性测试的场景。
ruflo、HAL及其他GAIA测试框架的对比分析——能力差距、设计决策与改进路线图