Loading...
Loading...
共找到 64 个 Skills
一种迭代式的工作者-审阅者循环机制,会生成一个批评家子代理(subagent)对工作成果进行1-10分的评分并提供可落地的反馈,然后反复修订直到达到质量门槛(quality gate)。适用于功能开发、编写规格文档、审阅现有代码,或任何质量优先于速度的任务场景。触发短语:"use review-loop"、"polish this"、"iterate on this"、"/review-loop"、"review with feedback loop"。
在保留经验积累并允许废弃代码的前提下,重复执行构建 -> QA -> re0-memo -> re0-work 循环。适用于长期Agent项目,此类项目的进度需通过质量合格的模板、可复用模块以及已消除的反模式来衡量,而非投入的时长或累积的功能数量。
按照此套件的方式评审并合并外部贡献:依据项目核心准则进行准入审核,保留作者署名权益后合并,完善新增Skill而非直接原始合并,随后在关闭PR前完成批准、署名致谢并作出说明。适用于任何协作者或维护者评审拉取请求(pull request)的场景,而非仅作者本人。
对计划或规格说明书(spec)进行全面审查,确保无意外情况、漏洞或错误。用于在实施前完善spec的严谨性。
验证实现是否符合其既定目标。当某个技能或Agent希望对自身输出获得二次意见,或者用户提出‘检查这个实现’‘验证你所做的内容’‘这是否正确?’‘审核输出结果’‘你做对了吗?’等请求时,可使用本技能。此外,本技能还会被其他技能(如memory-bridge、daily-update)自动生成为子代理,在向用户展示输出前进行自我检查。返回包含具体可操作问题的结构化通过/警告/失败判定结果。
可根据评估套件计划(/eval-suite-planner 的输出)或纯英文Agent描述生成评估测试用例,支持单响应和对话(多轮)两种评估模式,输出内容包括Copilot Studio测试集表格、可导入CSV文件(仅单响应模式支持)以及供人工审核的docx报告。
功能开发完成后,验证其是否符合规划要求、遵循系统架构与设计标准,并且已准备好投入生产。清晰地报告问题,由开发者决定需要修复的内容。
适用于TDD工作流、TDD循环相关工作场景
给一份 design 做一次架构体检——要么查 design 自己是否前后自洽(术语、契约、推进步骤之间不打架),要么查 design 和代码是否对得上(承诺了的东西代码真的做到了)。本技能只出问题清单和修复建议,不动手改东西。每次只锁定一个目标,不允许"顺手把另一项也查了"。触发场景:用户说"做架构检查"、"design 内部一致吗"、"方案和代码对得上吗",或 implement / acceptance 阶段想先做一次体检再继续。
为关键步骤实现带有LLM-as-Judge自动验证的任务执行流程
Amazon Bedrock AgentCore Evaluations 用于测试和监控AI Agent的质量。包含13个内置评估器以及自定义LLM-as-Judge模式。适用于Agent测试、生产质量监控、告警设置或Agent行为验证场景。
面向Claude Code会话的全面验证系统。