Loading...
Loading...
共找到 2 个 Skills
根据官方规范和最佳实践评估Agent Skill的设计质量。适用于审核、审计或改进SKILL.md文件及Skill包的场景,提供多维度评分和可落地的改进建议。
针对任意编码Agent CLI,对Agent Skill进行全面的端到端评估——验证其脚本是否输出文档中记录的数值(确定性检查),测试其描述是否能在正确的提示词下触发,以及衡量遵循SKILL.md的Agent是否优于无Skill的基准版本(包含通过率差值、均值±标准差、基准测试)。当你需要测试、基准测试、验证、评级或量化某个Skill的质量,检查某个Skill“是否真的可用”,比较两个Skill版本,优化Skill的触发逻辑,或搭建评估套件时均可使用——即使用户只是问“这个Skill好用吗”、“我的Skill能正常工作吗”或“对这个Skill做基准测试”。支持以无头模式驱动Claude Code、OpenAI Codex、Antigravity(agy)、Cursor、GitHub Copilot、Amp、opencode或Grok。