Loading...
Loading...
共找到 41 个 Skills
针对任意编码Agent CLI,对Agent Skill进行全面的端到端评估——验证其脚本是否输出文档中记录的数值(确定性检查),测试其描述是否能在正确的提示词下触发,以及衡量遵循SKILL.md的Agent是否优于无Skill的基准版本(包含通过率差值、均值±标准差、基准测试)。当你需要测试、基准测试、验证、评级或量化某个Skill的质量,检查某个Skill“是否真的可用”,比较两个Skill版本,优化Skill的触发逻辑,或搭建评估套件时均可使用——即使用户只是问“这个Skill好用吗”、“我的Skill能正常工作吗”或“对这个Skill做基准测试”。支持以无头模式驱动Claude Code、OpenAI Codex、Antigravity(agy)、Cursor、GitHub Copilot、Amp、opencode或Grok。
根据前置元数据(frontmatter)、评估覆盖率和验证器报告Skill的生命周期阶段。适用于Skill的升级、弃用或仓库Skill审计场景。**不适用于实时安装**。
创建或修订Agent Skill。适用于添加新Skill文件、重命名Skill、简化现有Skill、优化触发描述,或是判断内容应归入Skill还是参考资料、脚本、资源或普通文档的场景。
通过需求分析把反复出现的问题制作成可安装、可分级验证的单个 Skill。用户要求做 Skill、把问题沉淀成 Skill、检查或测试候选 Skill 时使用;只有用户明确要求分享或发布时,才准备 GitHub 仓库并验证 `npx skills add`。
针对验证器无法判定的内容对Agent Skills进行审核:描述是否会触发、指令是否可被Agent执行、主体内容是否匹配其消耗的token成本(物有所值)、`compatibility`是否与主体需求一致,以及变更操作是否受管控。先运行仓库的结构验证器,结合引用证据对五个判定维度打分,并返回PASS/FAIL结论。