Loading...
Loading...
共找到 46 个 Skills
当用户询问“有哪些预定义指标可用”、“我应该使用哪些内置指标”、“CSAT衡量什么”、“幻觉检测如何工作”、“Interruption Score与AI Interrupting User有什么区别”、“哪些指标是免费的”、“哪些指标需要音频”、“配置静音阈值”、“设置情感指标”,或任何关于Cekura开箱即用指标的问题时,使用本技能。本技能涵盖完整的预定义指标目录——包括每个指标的功能、成本、约束、配置选项以及适用场景。
当使用Inngest和AgentKit构建持久化AI Agent或Agent工作流时使用,包括模型调用、工具调用、多Agent网络、人工审批、实时进度、服务商速率限制、崩溃安全执行以及Agent Evals交接。涵盖AgentKit、`step.ai`、`step.run`、`step.waitForEvent`、原生实时功能,以及何时使用底层Inngest原语替代内存中的Agent循环。当用户需要为Agent进行评分、会话管理、实验、延迟评分或基于结果的评估时,可搭配`inngest-agent-evals`使用此技能。
审计工具权限、审批流程、内存管理、遥测、评估(evals)、版本发布以及故障遏制方面的运行时控制。适用于审查搭载工具的Agent系统。不适用于安全扫描、仅提示词优化工作或静态代码审查。
创建用于评估Agent的新Harbor任务。适用于用户想要搭建、构建或设计新任务、基准测试问题或评估项的场景。指导用户完成指令编写、环境配置、验证器设计(pytest、Reward Kit或自定义方案对比)以及解决方案脚本编写的全流程。
MLflow 3 GenAI 代理评估。适用于编写mlflow.genai.evaluate()代码、创建@scorer函数、使用内置评分器(Guidelines、Correctness、Safety、RetrievalGroundedness)、从追踪数据构建评估数据集、设置追踪数据摄入与生产监控、借助领域专家反馈通过MemAlign对齐评审模型(judge),或使用GEPA运行optimize_prompts()以实现提示词自动优化的场景。
AI Agent学习路线图与精选资源,助你基于Claude Code、OpenClaw、Skills、MCP及评估等现代模式构建可投入生产的Agent系统
提交关于Expo技能或Expo本身的反馈,并控制捆绑的匿名使用遥测(默认关闭/需主动开启)。使用以下命令提交反馈:npx --yes submit-expo-feedback@latest "ACTIONABLE_FEEDBACK"。可选择添加其中一个或两个参数:--category "CATEGORY" 和 --subject "SUBJECT"。运行前替换大写占位符。适用于以下场景:技能有用、易混淆、故障、缺失上下文或需要改进;Expo、Expo CLI、EAS CLI、文档或MCP表现良好或存在不足;AI Agent多次失败、卡住或需要用户接管Expo任务(作为评估候选上报);用户明确要求启用/禁用遥测(跟踪)、检查其状态或了解收集内容。
配置Celigo防护栏资源——用于验证集成中流转数据的安全与合规检查机制。适用于创建或编辑针对PII检测、内容审核或基于AI的评估规则的防护栏。
适用于在Inngest上构建、迁移或调试Agent Evals的场景:包括为AI代理或工作流结果评分、延迟评分器、会话、追踪、步骤实验、实验变体归因、Insights查询,以及针对提示词、模型、工具、提供商和代理行为的生产环境评估循环。涵盖TypeScript SDK v4评分beta API,如`scoreMiddleware`、`step.score`、`inngest.score`、`createScorer`、`defer`、`group.experiment`、`experimentRef`、`meta.sessions`,以及何时使用持久化工作流原语进行基于结果的评估。
为首次用户提供一个简短、以价值为核心的Kitaru导览,使用公共returns-agent模板。适用于以下场景:用户尚未拥有任何Agent或相关痕迹、来自Kitaru入门引导、请求演示/教程/快速入门/引导示例、需要克隆或准备公共模板、希望编码Agent在他们评估会话前准备trace annotations,或是希望在学习完整调查方法前体验Kitaru的价值。准备一个包含三个会话的前端审核流程,让用户提供判定结果,将一个被接受的发现转化为确定性评估器,并以一个获批的有限重放实验收尾。将真实Agent、开放式探索和生产证据引导至kitaru-investigation流程。