动态对抗评测
针对静态公开基准失效(污染、可操纵、背题)的评测设计方向,四个机制要素:非公开题库、定期更新、对抗样本生成、多轮交互与真实环境测试。是 AI 评测行业深度研究报告 判断的三大利润集中地之一(另两处:安全合规/红队、垂直行业认证)。
为什么需要动态对抗
来自行业报告的五组静态基准失效证据(前四组):
- UC Berkeley RDI(2026-04):8 个主流 Agent 基准都可被操纵到接近满分而无需真正解决任务;
- METR:OpenAI o3 在 128 次运行中 39 次(30.4%)reward hacking;
- SWE-bench Verified→Pro 落差 57 个百分点(防污染版分数崩塌);
- MMLU 整体污染率约 13.8%、HumanEval 87% 的模型存在超 30% 污染率。
代表性设计(本库已有案例)
| 手段 | 案例 |
|---|---|
| 私有防污染题库 | SWE-bench Pro(Verified 约 80% 的模型在此仅约 23%) |
| 未泄漏素材 | DeepSWE 使用 113 个完全未泄漏代码库([[wiki/sources/2026-08-10-Floatboat-Harness首次计量五项基准全胜 |
| 私有 holdout + 记忆化筛查 | MirrorCode(22/25 目标程序开源 + 3 私有 holdout,见 [[wiki/topics/Agent-评测基准 |
| 环境不开源防针对性训练 | [[wiki/entities/E-Bench |
| 逆向改写 + 反查防背题 | [[wiki/entities/WorkBuddy-Bench |
| 多轮交互与真实环境测试 | Agent Island、AgentLAB(行业报告点名的代表性方向) |
边界与辨析
⚠️ 矛盾 [2026-08-10] 动态对抗是”数据污染”与”可操纵性”的对症药,但不是万能药——题目质量缺陷(SciCode 263 处缺陷)需要专家审计,测量工具不可靠(judge kappa 0.137、endpoint 差异近一半)需要校准与元数据记录。行业报告把三种失效混为”污染”并统一开”动态对抗”药方,辨析见 基准失效的三种模式。