Scaling Law 争议:原作 bug 与英语偏见

2026 年 7 月,Scaling Law 原始论文被前 OpenAI 研究员 Diogo Almeida 公开指出存在致命 bug,整个 AI 行业开始反思”堆参数”路线。


核心事件

  • 博客:《Scaling Laws, Honestly》—— Diogo Almeida(前 OpenAI,现 DeepMind)
  • 站台:Sander Dieleman(DeepMind,扩散模型权威)
  • 核心结论:2020 年 OpenAI 奠基性 Scaling Law 论文存在 bug,导致行业浪费了两年算力

bug 的三重构造

步骤操作后果
囚禁数据对所有模型喂相同 130B tokens 固定预算小模型撑到,大模型营养不良
掩耳盗铃 LR 衰减使用 Cosine Decay 把学习率压到 0训练末期曲线走平,伪装成”已经饱和”
权威的傲慢论文写”结果基本不受学习率曲线影响”把有限条件下的局部真理,包装成普适法则

Chinchilla 也不干净

  • 2024 年 Besiroglu 等人重跑 Chinchilla 数据点,发现它自己也有 bug。
  • 优化器的 loss 尺度设得过高,Huber 损失按样本求平均(而非求和),导致拟合过早终止。

隐藏盲点:英语 Scaling Law

  • 研究者 Adam Zachary Wasserman 实验发现:法语模型达到某种语法能力的效率比英语高 50–100 倍
  • 原因:英语是”形态贫乏”语言,高度依赖分布规律;中文、法语等形态丰富语言自带大量结构信息。
  • 隐喻:试图用猪的胃口制定全宇宙生物营养标准。

反思与影响

  • Scaling Law 不是牛顿三定律,是经验拟合曲线
  • 行业本可以用更小的模型 + 更多优质数据,实现更强性能,节省数以万计的 H100。
  • OpenAI 是”误打误撞”,但代价是全球 AI 集体在错误跑道上狂奔了两年。

行业反应

  • 推动 效率研究复兴:MoE、小模型+大数据、跨语言 scaling 都是新方向。
  • Loop Engineering、Harness Engineering 等”非 Scaling”路线获得更多关注。
  • 让 Karpathy《LOOPS.md》的”harness 比模型更重要”思想获得更强支撑。

[2026-07-20] Kimi K3:资本市场的”去杠杆”注脚

来源:Fable 5 × CursorBench / Kimi K3(2026-07-17)。

本页此前的 Scaling Law 反思来自学术侧(Almeida 指出原作 bug、Chinchilla 重跑、英语偏见)。2026-07-17 Kimi K3 发布引发的全球算力股抛售,则从资本市场侧给出同向注脚:

  • 高盛 Rich Privorotsky 定性为”去杠杆事件”:判断并非扩展定律已经失效,而是单纯扩大预训练算力不再是获得领先模型能力的唯一路径——模型架构、数据质量、强化学习、后训练效率的重要性正在上升。
  • 摩根大通将市场新增担忧概括为”DeepSeek 2.0”:Kimi K3 以 2.8T 参数、1M 上下文、约 Opus 4.8 一半成本(智能指数 57)逼近前沿,催化费城半导体指数较 6 月高点回落超 20% 入技术性熊市。
  • 与本主题对接:这与本页”行业本可以用更小模型+更多优质数据实现更强性能""效率研究复兴(MoE、小模型+大数据、跨语言 scaling)“的论断方向一致——Kimi K3 是”非单纯堆预训练算力”路线在商业上的又一次验证,强化了 Loop/Harness Engineering 等”非 Scaling”路线的合理性。

? 反向张力(保留):Kimi K3 itself 仍是 2.8T 参数的庞然大物,且文章指出更便宜模型可能刺激企业扩量、带动推理算力/存储需求——它压低的是模型服务价格,未必降低芯片长期需求。即”预训练 scaling 溢价被压缩” ≠ “算力总需求下降”,口径需区分。

[2026-08-06] 字节的反向豪赌:讨论训练超 5 万亿参数模型

在学术界与资本市场反思”堆参数”(本页主题)的同时,《晚点 LatePost》2026-08-06 报道 字节跳动正在讨论训练超 5 万亿参数的大模型(超过 Qwen 3.8-Max 2.4T、Kimi K3 2.8T),试图把参数规模一次推到同行数倍、争取领先——内部动机是”与其在现有尺寸上继续追赶,不如赌一把弯道超车”(据晚点报道)。

  • 这是对本页”效率研究复兴”论点的反向样本:字节的豪赌表明,至少有一家头部厂商仍把”继续做大预训练规模”视为通往第一梯队的可行路线。
  • 报道给出的行业背景同样支持”做大模型尺寸成为行业共识”:xAI 把 Grok 底座从 5000 亿扩到 1.5 万亿并称下一代要做到 6 万亿;OpenAI、Anthropic 也曾传出要训练更大尺寸模型。
  • 张一鸣定调(据晚点):可接受短期落后、追求智能上限;反对蒸馏路线,要从更底层维度构建 AGI 壁垒。

5T 计划仍处早期讨论阶段,不代表一定发布;且”更大尺寸 = 更强智能”在 5T 量级是否依然成立,本页的 bug 讨论(固定数据预算、LR 衰减伪装饱和)恰好给出了反面的警示。

相关 Wiki