Diogo Almeida
前 OpenAI 研究员,现 DeepMind。2026 年 7 月发表博客《Scaling Laws, Honestly》,首次公开承认 2020 年 OpenAI 奠基性 Scaling Law 论文存在致命 bug。
关键贡献
博客《Scaling Laws, Honestly》
- 核心论点:最初那版 scaling law 是错的,因为存在一个 bug。
- 承认事实:当年他本人在 OpenAI 做优化,也没看出这个 bug——那条学习率曲线看着太像是”精心设定”的了,谁会去怀疑呢。
三重 bug 的构造
| 步骤 | 操作 | 后果 |
|---|---|---|
| 囚禁数据 | 对所有模型喂相同 130B tokens 固定预算 | 小模型撑到,大模型营养不良 |
| 掩耳盗铃 LR 衰减 | 使用 Cosine Decay 把学习率压到 0 | 训练末期曲线走平,伪装成”已经饱和” |
| 权威的傲慢 | 论文写”结果基本不受学习率曲线影响” | 把有限条件下的局部真理,包装成普适法则 |
影响
- DeepMind Sander Dieleman 公开站台,称这是”有意思的 LLM 往事”。
- 引发整个 AI 行业对 Scaling Law 的根本性反思。
- 一个 bug,烧掉两年算力。
个人反思
“不是方法不一样,是最初那版 scaling law 本身有个 bug。“