Loading...
Loading...
共找到 2 个 Skills
设计并实现适用于AI Agent的全面评估系统。适用于为代码Agent、对话Agent、研究Agent或计算机操作Agent构建评估体系的场景。内容涵盖评估器类型、基准测试、8步实施路线图以及生产环境集成方案。
为项目设置性能基准测试与CodSpeed测试Harness。当用户想要创建基准测试、添加性能测试、搭建CodSpeed环境、配置codspeed.yml、集成基准测试框架(criterion、divan、pytest-benchmark、vitest bench、go test -bench、google benchmark)时,或用户提及“添加基准测试”“设置性能测试”“创建基准测试”“对此进行基准测试”,或是首次想要测量其代码性能时,均可使用该技能。此外,当优化技能所需的基准测试尚未存在时,也可触发该技能。