Loading...
Loading...
共找到 65 个 Skills
针对自定义任务的编码Agent(Claude Code、Aider、Codex等)的正面对比,涵盖通过率、成本、耗时和一致性指标
配置Lean环境,安装外部证明技能,运行预检检查,并指导在本地证明下载的OpenMath Lean定理的工作流程。
面向AI Agent与LLM应用的DeepEval评估工作流。当用户希望评估或优化AI Agent、工具调用工作流、多轮对话机器人、RAG流水线或LLM应用;添加评估任务;生成数据集或黄金样本;使用deepeval generate命令;使用deepeval test run命令;添加追踪或@observe标记;将结果发送至Confident AI;监控生产环境;运行在线评估;检查追踪数据;或根据评估失败结果迭代优化提示词、工具、检索逻辑或Agent行为时触发。AI Agent是主要适用场景。涵盖Python SDK、pytest评估套件、CLI生成、追踪、Confident AI报告以及Agent驱动的优化循环。除非用户要求对比或迁移至DeepEval,否则请勿在无关的通用pytest、非AI测试设置或非DeepEval可观测性工作中触发。
当你需要测试或评估LangGraph/LangChain Agent时,请使用此Skill:编写单元或集成测试、生成测试脚手架、模拟LLM/工具行为、运行轨迹评估(匹配或LLM-as-judge模式)、运行LangSmith数据集评估,以及通过A/B式离线分析比较两个Agent版本。适用于Python和JavaScript/TypeScript工作流、评估器设计、实验设置、回归门控,以及调试不稳定/不正确的评估结果。
使用Future AGI的专业技能——这是一个开源的端到端平台,用于通过追踪、评估、模拟、数据集、网关和防护机制来评估、监控和改进LLM及AI Agent应用。
构建一套包含测试集和测试用例的完整测试套件,用于评估AI Agent。指导完成测试集类型选择、使用垂直领域特定模板设计场景、编写预期行为以及批量创建测试用例。当用户说出“创建测试用例”“构建测试套件”“添加测试场景”“设置评估测试”或“设计测试用例”时使用此功能。
通过对比使用与不使用CodeGraph时的Agent行为,在真实代码库上对CodeGraph的检索质量进行基准测试。当用户运行/agent-eval命令,或要求针对某语言代码库测试、基准测试、审计或验证CodeGraph版本(本地开发构建版或已发布的npm版本)时使用。
当你需要衡量或提升agent的质量与性能时使用——设置评估器、在线监控、CI/CD质量门、可观测性或进行成本优化。触发场景包括:"evaluate my agent"、"add evaluator"、"measure quality"、"quality gate"、"run evals"、"agent too slow"、"why is it slow"、"reduce latency"、"set up observability"、"CloudWatch dashboard"、"how much does my agent cost"、"cost optimization"、"logs not showing up"、"logs missing"、"spans not found"、"eval failing"、"eval error"、"dev traces"、"local traces"、"agentcore dev traces"、"traces to CloudWatch"。请勿用于调试错误或崩溃——请使用agents-debug。响应缓慢但功能正常的路由使用本工具;功能故障的路由请使用调试工具。
对课件幻灯片进行全面教学审查。检查叙事脉络、学生预备知识、实例演示、符号清晰度以及幻灯片节奏。
为适配AI Agent的代码库搭建和优化Harness工程(包括AGENTS.md、docs/目录、lint规则、评估系统、项目级提示词工程)。触发场景包括:为AI Agent搭建新的/空白项目、创建AGENTS.md或CLAUDE.md、Harness工程相关问题、提升Agent在代码库上的运行效果。当用户对Agent质量不满或抱怨时也会触发——例如「Agent总是忽略约定」、「它从不遵守指令」、「为什么它一直在做X」、「Agent坏了」——因为Agent输出效果差几乎都是Harness存在缺口的信号,而非模型本身的问题。覆盖范围:上下文工程、架构约束、多Agent协调、评估、长期运行Agent Harness,以及Agent质量问题诊断。
完整评估工作流——启动运行、监控进度并汇总结果。用于Agent的端到端测试。
agent 向けテキスト指示(skill / slash command / task プロンプト / CLAUDE.md 節 / コード生成プロンプト)を、バイアスを排した実行者に動かしてもらい、両面(実行者の自己申告 + 指示側メトリクス)で評価して反復改善する手法。改善が頭打ちになるまで回す。プロンプトや skill を新規作成・大幅改訂した直後、またはエージェントの挙動が期待通りにならない原因を指示側の曖昧さに求めたいときに使う。