Loading...
Loading...
对任何评估、指标、实验或基准测试进行泄露审计——外部真实数据是否独立输入,还是模型、评分器和设计者只是在确认一个从未由外部真实数据生成的结果?在信任任何“验证成效的方式”(如A/B测试、保留数据集、评分、验证)之前,以及当结果看起来过于完美或自我印证时使用。它会遍历8种泄露模式分类,仅返回触发的模式,并为每种模式提供独立修复方案。仅可读,不修改。
npx skill4agent add lilmgenius/paperthin mandelamandela