Diogo Almeida

前 OpenAI 研究员,现 DeepMind。2026 年 7 月发表博客《Scaling Laws, Honestly》,首次公开承认 2020 年 OpenAI 奠基性 Scaling Law 论文存在致命 bug


关键贡献

博客《Scaling Laws, Honestly》

  • 核心论点:最初那版 scaling law 是错的,因为存在一个 bug。
  • 承认事实:当年他本人在 OpenAI 做优化,也没看出这个 bug——那条学习率曲线看着太像是”精心设定”的了,谁会去怀疑呢。

三重 bug 的构造

步骤操作后果
囚禁数据对所有模型喂相同 130B tokens 固定预算小模型撑到,大模型营养不良
掩耳盗铃 LR 衰减使用 Cosine Decay 把学习率压到 0训练末期曲线走平,伪装成”已经饱和”
权威的傲慢论文写”结果基本不受学习率曲线影响”把有限条件下的局部真理,包装成普适法则

影响

  • DeepMind Sander Dieleman 公开站台,称这是”有意思的 LLM 往事”。
  • 引发整个 AI 行业对 Scaling Law 的根本性反思。
  • 一个 bug,烧掉两年算力。

个人反思

“不是方法不一样,是最初那版 scaling law 本身有个 bug。“

相关 Wiki