基准失效的三种模式:题目缺陷、数据污染、测量工具不可靠

论点

AI 评测行业深度研究报告把静态基准的失效笼统归因于”数据污染”,并统一开出”私有动态题库 + 对抗性测试”的药方。但 2026-08-08 ~ 08-10 三天的评测日报证据显示:至少存在三种机制不同的失效模式,各自对应不同的补救手段——混用一种药方会治错病。

三种模式辨析

模式关键证据机制对症补救
① 题目质量缺陷SciCode-Verified(arXiv 2608.04975,[[wiki/sources/2026-08-10-AI-Eval-Daily-2026-08-088/8 日报]]):专家逐题审计 65 题发现 263 处缺陷(192 处把正确解误判为错误),修正后子问题准确率 45–60%→84–98%(约 +39pp基准本身出错了,与被测模型无关;78% 的压分缺陷需专业物理/数学知识才能识别
② 训练数据污染SWE-bench Verified 约 80% → Pro 仅约 23%,落差 57 个百分点;MMLU 污染率约 13.8%;HumanEval 87% 模型污染率超 30%(行业报告口径)题目进入训练语料,分数虚高held-out / 私有动态题库 / 对抗更新(见 [[wiki/topics/动态对抗评测
③ 测量工具不可靠单 judge 忠实度自我一致性 kappa 仅 0.137、41% 判决翻转([[wiki/sources/2026-08-10-AI-Eval-Daily-2026-08-108/10 日报]]);Evidence Lock 使一致性降 4–6pp(8/8 日报);grader 换模型分数微涨([[wiki/sources/2026-08-10-AI-Eval-Daily-2026-08-098/9 日报]]);同权重不同 endpoint 准确率差近一半(8/9 日报,Endpoint Accuracy Index)

另有第四类相关但独立的失效:测量对象主动钻空子(METR:o3 在 128 次运行中 39 次/30.4% reward hacking;UC Berkeley RDI:8 个 Agent 基准可操纵至满分)——它不等于污染,补救方向是轨迹审计与验证器设计。

行业报告的混淆

报告把①②③(及 reward hacking)统一叙述为”静态基准因数据污染失去可信度”,推论是全面转向动态对抗。这一叙述的两个风险:

  1. 对①开错药:SciCode 的问题换动态题库也解决不了——需要的是专家逐题审计(且”科学编程能力停滞”的结论本身已被证伪,引用旧分数的对比应复核)。
  2. 对③视而不见:如果 judge 本身 kappa 0.137,动态题库的打分照样不可信——测量工具校准是前提而非可选项。

⚠️ 矛盾 [2026-08-10] 行业报告数据源质量参差:57 分落差锚点 [1] 引自个人博客(baeseokjae.github.io)未回溯一手论文;MMLU 污染率 [5] 引自日文博客;Scale AI / LangChain 估值 [6][7] 引自投资类内容站——头部数字转引前需独立验证。

追问

  • 自建评测集时,三种失效的检查成本各是多少?(专家审计 ≫ 污染检测 > judge 校准——是否应按此排优先级?)
  • “给基准打质量分”的自动化框架(IBM)能否覆盖①中需要领域知识的那 78%?
  • reward hacking 的轨迹审计能否标准化为评测报告的必备附件(对照 CauAudit 的轨迹级归因)?

关联