Loading...
Loading...
共找到 46 个 Skills
针对自定义任务的编码Agent(Claude Code、Aider、Codex等)的正面对比,涵盖通过率、成本、耗时和一致性指标
通过对比使用与不使用CodeGraph时的Agent行为,在真实代码库上对CodeGraph的检索质量进行基准测试。当用户运行/agent-eval命令,或要求针对某语言代码库测试、基准测试、审计或验证CodeGraph版本(本地开发构建版或已发布的npm版本)时使用。
端到端GECX/CXAS/CES对话式Agent生命周期管理——从需求(PRD到Agent)构建Agent,创建并运行评估(基准测试、模拟测试、工具测试、回调测试),调试故障,迭代至生产级质量。当用户提及Google Customer Engagement Suite平台上的GECX、CXAS、CES、SCRAPI、对话式Agent、语音Agent、音频Agent、Agent评估、Agent推送/拉取/代码检查,或Agent指令/回调/工具时,使用此技能。
当你需要衡量或提升agent的质量与性能时使用——设置评估器、在线监控、CI/CD质量门、可观测性或进行成本优化。触发场景包括:"evaluate my agent"、"add evaluator"、"measure quality"、"quality gate"、"run evals"、"agent too slow"、"why is it slow"、"reduce latency"、"set up observability"、"CloudWatch dashboard"、"how much does my agent cost"、"cost optimization"、"logs not showing up"、"logs missing"、"spans not found"、"eval failing"、"eval error"、"dev traces"、"local traces"、"agentcore dev traces"、"traces to CloudWatch"。请勿用于调试错误或崩溃——请使用agents-debug。响应缓慢但功能正常的路由使用本工具;功能故障的路由请使用调试工具。
对课件幻灯片进行全面教学审查。检查叙事脉络、学生预备知识、实例演示、符号清晰度以及幻灯片节奏。
为适配AI Agent的代码库搭建和优化Harness工程(包括AGENTS.md、docs/目录、lint规则、评估系统、项目级提示词工程)。触发场景包括:为AI Agent搭建新的/空白项目、创建AGENTS.md或CLAUDE.md、Harness工程相关问题、提升Agent在代码库上的运行效果。当用户对Agent质量不满或抱怨时也会触发——例如「Agent总是忽略约定」、「它从不遵守指令」、「为什么它一直在做X」、「Agent坏了」——因为Agent输出效果差几乎都是Harness存在缺口的信号,而非模型本身的问题。覆盖范围:上下文工程、架构约束、多Agent协调、评估、长期运行Agent Harness,以及Agent质量问题诊断。
agent 向けテキスト指示(skill / slash command / task プロンプト / CLAUDE.md 節 / コード生成プロンプト)を、バイアスを排した実行者に動かしてもらい、両面(実行者の自己申告 + 指示側メトリクス)で評価して反復改善する手法。改善が頭打ちになるまで回す。プロンプトや skill を新規作成・大幅改訂した直後、またはエージェントの挙動が期待通りにならない原因を指示側の曖昧さに求めたいときに使う。
为AI Agent选择并配置评估指标。指导用户通过用例推荐选择指标、通过提示词工程创建基于LLM的自定义指标,以及将指标附加为Agent默认配置。当用户提及「设置指标」「配置指标」「创建指标」「我应该使用哪些指标」「添加评估标准」或「自定义评分」时使用此流程。
从HuggingFace导入数据集并将其转换为Coval测试集。适用于用户希望从HuggingFace数据集或仓库创建测试用例的场景。
通过完整的LangWatch集成,将你的AI Agent提升到新高度。一站式添加追踪、提示版本控制、评估实验和模拟测试。适用于用户需要为其Agent实现全面可观测性、测试和提示管理的场景。
对任意Agent Skill进行基准测试,衡量其是否真的能提升性能。当用户想要评估、测试或对比某一Skill与基准水平的表现,或是提及“benchmark”“eval”“skill performance”“这个Skill有用吗”时,可使用本工具。它会分别在启用和不启用该Skill的情况下运行独立的评估会话,通过分层评分(确定性检查+LLM作为评审)对输出结果打分,分析行为信号,并生成带有“推荐使用/不推荐使用”结论的对比报告。
参加Clawvard入学考试,报告考试结果,并在获得用户明确确认后可选择保存Agent身份令牌。