Loading...
Loading...
共找到 46 个 Skills
当用户询问“Cekura能做什么”“有哪些可用命令”“帮我使用Cekura”“我拥有哪些技能”“展示Cekura的功能”“有什么可用功能”“如何使用Cekura”,或者需要指导为任务选择合适的Cekura技能时,使用该技能。同时,当用户首次安装cekura-skills时,它也作为入口点适用。
评估并优化Claude Code的命令、技能与Agent。适用于测试提示词有效性、验证上下文工程选择或衡量优化质量的场景。
当用户要求“使用Google ADK构建Agent”、“使用Agent Development Kit”、“创建Google ADK Agent”、“设置ADK工具”,或者需要Google Agent Development Kit最佳实践、多智能体系统、智能体评估相关指导时,应使用本Skill。
用于讨论或使用DeepEval(Python AI评估框架)的场景
本技能可用于解决所有与为LangChain Agent创建测试或评估数据集相关的问题,涵盖从轨迹(final_response、single_step、trajectory、RAG类型)生成数据集、上传至LangSmith以及管理评估数据等内容。
使用此Skill来操作Microsoft Foundry(Azure AI Foundry):从模型目录部署AI模型、借助知识索引构建RAG应用、创建并评估AI Agent。 适用场景:Microsoft Foundry、AI Foundry、模型部署、模型目录、RAG、知识索引、Agent创建、Agent评估、Agent监控。 不适用场景:Azure Functions(请使用azure-functions)、App Service(请使用azure-create-app)。
使用黄金数据集、评分准则和回归门为AI Agent构建自动化评估套件。
配置Lean环境,安装外部证明技能,运行预检检查,并指导在本地证明下载的OpenMath Lean定理的工作流程。
面向AI Agent与LLM应用的DeepEval评估工作流。当用户希望评估或优化AI Agent、工具调用工作流、多轮对话机器人、RAG流水线或LLM应用;添加评估任务;生成数据集或黄金样本;使用deepeval generate命令;使用deepeval test run命令;添加追踪或@observe标记;将结果发送至Confident AI;监控生产环境;运行在线评估;检查追踪数据;或根据评估失败结果迭代优化提示词、工具、检索逻辑或Agent行为时触发。AI Agent是主要适用场景。涵盖Python SDK、pytest评估套件、CLI生成、追踪、Confident AI报告以及Agent驱动的优化循环。除非用户要求对比或迁移至DeepEval,否则请勿在无关的通用pytest、非AI测试设置或非DeepEval可观测性工作中触发。
当你需要测试或评估LangGraph/LangChain Agent时,请使用此Skill:编写单元或集成测试、生成测试脚手架、模拟LLM/工具行为、运行轨迹评估(匹配或LLM-as-judge模式)、运行LangSmith数据集评估,以及通过A/B式离线分析比较两个Agent版本。适用于Python和JavaScript/TypeScript工作流、评估器设计、实验设置、回归门控,以及调试不稳定/不正确的评估结果。
使用Future AGI的专业技能——这是一个开源的端到端平台,用于通过追踪、评估、模拟、数据集、网关和防护机制来评估、监控和改进LLM及AI Agent应用。
构建一套包含测试集和测试用例的完整测试套件,用于评估AI Agent。指导完成测试集类型选择、使用垂直领域特定模板设计场景、编写预期行为以及批量创建测试用例。当用户说出“创建测试用例”“构建测试套件”“添加测试场景”“设置评估测试”或“设计测试用例”时使用此功能。