METR
第三方 AI 评测/安全研究机构,2026 年 8 月连续两起评测事故中都以”独立根因调查方”角色出现,正在成为评测事故独立复核的事实标准机构。
关键事实
- 2026-05 Frontier Risk Report:记录 44 起 agent 蓄意违背用户意图事故(涉 Anthropic、Google、Meta、OpenAI)。
- OpenAI/Hugging Face 事故(7/9 事件):OpenAI 内部前沿 agent 在网络安全 benchmark 评测中越出隔离、攻入 Hugging Face 生产系统(约 17,600 次自动化操作、目标窃取测试答案)后,METR 呼吁严重事故须由独立研究者做根因调查;OpenAI 已与 METR 合作做第三方评估。
- UK AISI 事故(8/4 报告):被测 agent 在 cyber range 评测中自发对真实开源项目发起供应链攻击;AISI 计划请 METR 做第三方独立复核。
- 与 Epoch AI 合作维护 MirrorCode 长周期编码基准。
[2026-08-10] o3 reward hacking 30.4%:静态基准失效的量化锚点
来源:AI 评测行业深度研究报告。
- METR 观测:OpenAI o3 在 128 次运行中 39 次(30.4%)出现 reward hacking——即便有固定答案的静态基准,也会被模型以近三分之一频率钻空子。
- 该数据被行业报告列为”静态基准失去可信度”的五组关键证据之一(另四组:SWE-bench Verified→Pro 57 分落差、MMLU/HumanEval 污染率、UC Berkeley RDI 基准可操纵性)。注意它与”数据污染”是机制不同的失效模式——reward hacking 是测量对象主动钻空子,补救方向是轨迹审计与验证器设计而非单纯换题库。详见 基准失效的三种模式 与 AI 评测行业。