Loading...
Loading...
共找到 32 个 Skills
当用户想要「运行评估」「评估我的ADK Agent」「编写评估集」「调试评估分数」「比较评估结果」,或需要ADK(Agent Development Kit)评估方法及评估-修复循环的指导时,应使用本技能。内容涵盖评估指标、评估集schema、LLM-as-judge、工具轨迹评分以及常见失败原因。属于Google ADK(Agent Development Kit)技能套件的一部分。请勿将其用于API代码模式(请使用google-agents-cli-adk-code)、部署(请使用google-agents-cli-deploy)或项目脚手架搭建(请使用google-agents-cli-scaffold)。
使用Promptfoo框架配置并运行LLM评估。适用于设置提示词测试、创建评估配置(promptfooconfig.yaml)、编写Python自定义断言、为LLM-as-judge实现llm-rubric,或管理提示词中的少样本示例场景。触发关键词包括"promptfoo"、"eval"、"LLM evaluation"、"prompt testing"或"model comparison"。
大语言模型开发、训练、微调与部署最佳实践。
运行Codex就绪性集成测试。当您需要带有构建/测试评分的端到端Agent循环时使用。
一款用于追踪、评估、提示词管理和成本跟踪的LLM可观测性平台。适用于Langfuse部署、LLM成本监控、token使用量追踪或提示词版本控制场景。
使用Phoenix构建并运行AI/LLM应用的评估器。
MLflow机器学习生命周期管理,用于机器学习实验追踪。
生成并管理评估数据集——通过「维度-元组-自然语言」的结构化生成方式、基于描述快速生成、从现有数据扩展,同时通过去重、重新平衡和补全来维护数据集质量。适用于创建评估数据、扩展测试覆盖范围或清理数据集的场景。**请勿**在已有足够真实生产数据时使用(请改用analyze-trace-failures)。**请勿**用于评估器创建(请改用build-evaluator)。
创建并运行orq.ai实验——使用评估器对比数据集与配置,分析结果并生成优先级明确的行动计划。适用于对LLM Agent、部署、对话或RAG管道进行端到端评估。**请勿在没有数据集和评估器的情况下使用**。**请勿用于与外部Agent的跨框架对比(请使用compare-agents)**。
使用NeMo Evaluator Launcher (NEL) 评估量化或非量化LLM的准确性。触发指令包括“evaluate model”、“benchmark accuracy”、“run MMLU”、“evaluate quantized model”、“accuracy drop”、“run nel”。负责处理部署、配置生成和评估执行。不用于模型量化(请使用ptq)或模型部署/服务(请使用deployment)。
当用户想要挑选笔记发布为博客文章时使用。触发指令包括「选一篇笔记发博客」「note to blog」「写博客」「博客选题」。通过Python脚本扫描Obsidian笔记,评估笔记是否适合发布为博客,支持批量选择,提供快速/深度双轨处理以及并行Agent调度功能。
Galileo AI平台TypeScript/JS SDK的完整参考手册,用于评估、观测和保护GenAI应用。当你构建需要借助Galileo实现LLM评估、生产环境可观测性、链路追踪或运行时防护规则的Node.js或TypeScript应用时,可以使用该SDK。