Loading...
Loading...
共找到 32 个 Skills
评估机器学习(ML)模型的性能、公平性和可靠性。适用于指标选择、交叉验证策略、过拟合/欠拟合诊断、超参数调优、LLM评估、A/B测试以及模型漂移的生产环境监控。
使用Promptfoo进行LLM提示词测试、评估与CI/CD质量管控。 适用场景: - 搭建提示词评估或回归测试体系 - 将LLM测试集成至CI/CD流水线 - 配置安全测试(红队测试、越狱测试) - 对比提示词或模型性能 - 为RAG、事实性或安全性构建评估套件 关键词:promptfoo, llm evaluation, prompt testing, red team, CI/CD, regression testing
分五个阶段将包含硬编码LLM提示词的应用迁移至完整的LaunchDarkly AgentControl实现:代码审计、封装调用、迁移工具、添加追踪、关联评估器。适用于用户希望将模型/提示词配置外部化、从直接调用提供商(OpenAI、Anthropic、Bedrock、Gemini、Strands)切换至托管配置,或是分阶段完成从硬编码到LaunchDarkly的完整迁移场景。
从成本、速度、质量和功能方面对比Replicate模型。
编写、优化、运行并对promptfoo评估套件进行质量检查:包括promptfooconfig.yaml、提示词、提供者、变量、测试用例、断言、模型评分规则、转换、数据集、导出以及CI关卡。适用于非红队评估覆盖、回归测试或新评估矩阵构建。请勿用于对抗性红队插件或策略设置。
通过nemo-evaluator-launcher运行、监控、分析和调试LLM评估。内容涵盖运行评估、检查状态与实时进度、调试失败的运行任务、导出工件与日志,以及分析结果。当提及运行评估、检查进度、调试失败的评估任务、分析运行过程或结果、集群上的运行目录或工件路径、Slurm作业问题、调用ID,或是检查日志(客户端日志、服务器日志、SSH连接集群、查看日志尾部、过滤日志)时,均可触发此技能。请勿用于创建或修改评估配置。
使用orqkit中的evaluatorq进行跨框架Agent对比——在同一数据集上对任意组合的Agent(orq.ai、LangGraph、CrewAI、OpenAI Agents SDK、Vercel AI SDK)进行正面交锋式对比,并采用LLM-as-a-judge评分机制。适用于Agent对比、基准测试或需要并排评估的场景。仅对比orq.ai配置且不涉及外部Agent时请勿使用(请改用run-experiment)。
使用BYOB装饰器框架创建自定义LLM评估基准。适用于用户需要以下场景时:(1) 从数据集创建新基准,(2) 选择或编写评分器,(3) 编译并运行BYOB基准,(4) 将基准容器化,(5) 使用LLM-as-Judge评估。当提及BYOB、自定义基准、bring your own benchmark、评分器或基准编译时触发。
适用于开发Evaluator插件CLI、任务、基于SDK的规格说明,或插件所属的Evaluator技能时使用。
当用户要求“优化提示词”“设计提示模板”“评估LLM输出”“构建Agent系统”“实现RAG”“创建少样本示例”“分析Token使用情况”或“设计AI工作流”时,应使用本Skill。适用于提示工程模式、LLM评估框架、Agent架构和结构化输出设计。
针对参考分数(PyTorch后端或已发布基准)调试AutoDeploy精度回归问题。当AutoDeploy模型的评估分数显著低于参考值且根本原因未知时使用。
MCP(Model Context Protocol)服务器构建与评估指南,涵盖工具界面、配置和测试的本地约定