Loading...
Loading...
共找到 32 个 Skills
为仓库Skill生成包含基准用例的evals/evals.json清单模板。用于添加行为评估覆盖场景,**不用于实时LLM评估执行**。
通过分析用户的代码库、提示词、生产追踪数据和参考资料,生成逼真的合成评估数据集。采用交互式顾问风格——会提出澄清问题、生成方案、产出预览供确认,最终交付完整数据集并上传至LangWatch。适用于用户要求生成、创建评估、测试或基准测试数据集的场景。
基于开放式编码的追踪注释构建失败模式的结构化分类体系。当用户拥有审查LLM追踪得到的自由格式注释,希望将其聚类为一组连贯、无重叠的二元失败类别(axial coding)时,可使用此技能。当用户提及“failure modes”“error taxonomy”“axial coding”“cluster annotations”“categorize errors”“failure analysis”,或希望将原始观察笔记转化为结构化评估标准时,也可使用此技能。该技能覆盖完整流程:对开放式编码进行分组、定义失败模式、重新标记追踪记录以及量化错误率。
使用视觉LLM作为评估工具对图像进行评分和对比。针对11种使用场景(文本生成图像、照片真实感、文档OCR、图表、UI、肖像、产品、科学图像、发票、替代文本、艺术风格)提供YAML定义的标准预设。支持OpenAI、Anthropic、Gemini、Mistral和OpenRouter作为评估模型提供商。通过SOPS + age自动解密密钥。
掌握构建生产级AI Agent系统的上下文工程原则,包括高效的上下文管理、多Agent架构和内存系统。
NeMo Evaluator Launcher(NEL)的交互式配置向导。适用于用户需要从零创建新的评估配置、基于现有配置搭建评估或修改NEL配置(部署、任务、多节点、拦截器)的场景。当用户提及创建配置、搭建评估、为评估配置模型或修改NEL YAML文件时,将触发此向导。请勿用于监控、调试或分析已在运行的评估。
评估任务的入口。当用户请求评估相关帮助、不知从何入手,或者需求与插件中其他技能均不匹配时使用。如果插件中已有更匹配的特定技能,则请勿使用此入口,直接加载该特定技能即可。
对数据集进行错误分析。构建评审UI,选择多样化样本,监控标注情况,并整理失败模式。