Loading...
Loading...
共找到 65 个 Skills
为AI Agent选择并配置评估指标。指导用户通过用例推荐选择指标、通过提示词工程创建基于LLM的自定义指标,以及将指标附加为Agent默认配置。当用户提及「设置指标」「配置指标」「创建指标」「我应该使用哪些指标」「添加评估标准」或「自定义评分」时使用此流程。
从HuggingFace导入数据集并将其转换为Coval测试集。适用于用户希望从HuggingFace数据集或仓库创建测试用例的场景。
通过完整的LangWatch集成,将你的AI Agent提升到新高度。一站式添加追踪、提示版本控制、评估实验和模拟测试。适用于用户需要为其Agent实现全面可观测性、测试和提示管理的场景。
通过采用多智能体评估的Tree of Thoughts(思维树)方法论,执行系统性探索、剪枝和扩展任务
对任意Agent Skill进行基准测试,衡量其是否真的能提升性能。当用户想要评估、测试或对比某一Skill与基准水平的表现,或是提及“benchmark”“eval”“skill performance”“这个Skill有用吗”时,可使用本工具。它会分别在启用和不启用该Skill的情况下运行独立的评估会话,通过分层评分(确定性检查+LLM作为评审)对输出结果打分,分析行为信号,并生成带有“推荐使用/不推荐使用”结论的对比报告。
参加Clawvard入学考试,报告考试结果,并在获得用户明确确认后可选择保存Agent身份令牌。
当用户询问“有哪些预定义指标可用”、“我应该使用哪些内置指标”、“CSAT衡量什么”、“幻觉检测如何工作”、“Interruption Score与AI Interrupting User有什么区别”、“哪些指标是免费的”、“哪些指标需要音频”、“配置静音阈值”、“设置情感指标”,或任何关于Cekura开箱即用指标的问题时,使用本技能。本技能涵盖完整的预定义指标目录——包括每个指标的功能、成本、约束、配置选项以及适用场景。
当使用Inngest和AgentKit构建持久化AI Agent或Agent工作流时使用,包括模型调用、工具调用、多Agent网络、人工审批、实时进度、服务商速率限制、崩溃安全执行以及Agent Evals交接。涵盖AgentKit、`step.ai`、`step.run`、`step.waitForEvent`、原生实时功能,以及何时使用底层Inngest原语替代内存中的Agent循环。当用户需要为Agent进行评分、会话管理、实验、延迟评分或基于结果的评估时,可搭配`inngest-agent-evals`使用此技能。
审计工具权限、审批流程、内存管理、遥测、评估(evals)、版本发布以及故障遏制方面的运行时控制。适用于审查搭载工具的Agent系统。不适用于安全扫描、仅提示词优化工作或静态代码审查。
创建用于评估Agent的新Harbor任务。适用于用户想要搭建、构建或设计新任务、基准测试问题或评估项的场景。指导用户完成指令编写、环境配置、验证器设计(pytest、Reward Kit或自定义方案对比)以及解决方案脚本编写的全流程。
MLflow 3 GenAI 代理评估。适用于编写mlflow.genai.evaluate()代码、创建@scorer函数、使用内置评分器(Guidelines、Correctness、Safety、RetrievalGroundedness)、从追踪数据构建评估数据集、设置追踪数据摄入与生产监控、借助领域专家反馈通过MemAlign对齐评审模型(judge),或使用GEPA运行optimize_prompts()以实现提示词自动优化的场景。
为代码或工作流Agent设计轻量级评估框架,尤其适用于测试Agent是否遵循steering docs、正确使用工具、保留用户编辑内容、从故障中恢复以及生成预期产物的场景。