Scaling Law 争议:原作 bug 与英语偏见
2026 年 7 月,Scaling Law 原始论文被前 OpenAI 研究员 Diogo Almeida 公开指出存在致命 bug,整个 AI 行业开始反思”堆参数”路线。
核心事件
- 博客:《Scaling Laws, Honestly》—— Diogo Almeida(前 OpenAI,现 DeepMind)
- 站台:Sander Dieleman(DeepMind,扩散模型权威)
- 核心结论:2020 年 OpenAI 奠基性 Scaling Law 论文存在 bug,导致行业浪费了两年算力。
bug 的三重构造
| 步骤 | 操作 | 后果 |
|---|---|---|
| 囚禁数据 | 对所有模型喂相同 130B tokens 固定预算 | 小模型撑到,大模型营养不良 |
| 掩耳盗铃 LR 衰减 | 使用 Cosine Decay 把学习率压到 0 | 训练末期曲线走平,伪装成”已经饱和” |
| 权威的傲慢 | 论文写”结果基本不受学习率曲线影响” | 把有限条件下的局部真理,包装成普适法则 |
Chinchilla 也不干净
- 2024 年 Besiroglu 等人重跑 Chinchilla 数据点,发现它自己也有 bug。
- 优化器的 loss 尺度设得过高,Huber 损失按样本求平均(而非求和),导致拟合过早终止。
隐藏盲点:英语 Scaling Law
- 研究者 Adam Zachary Wasserman 实验发现:法语模型达到某种语法能力的效率比英语高 50–100 倍。
- 原因:英语是”形态贫乏”语言,高度依赖分布规律;中文、法语等形态丰富语言自带大量结构信息。
- 隐喻:试图用猪的胃口制定全宇宙生物营养标准。
反思与影响
- Scaling Law 不是牛顿三定律,是经验拟合曲线。
- 行业本可以用更小的模型 + 更多优质数据,实现更强性能,节省数以万计的 H100。
- OpenAI 是”误打误撞”,但代价是全球 AI 集体在错误跑道上狂奔了两年。
行业反应
- 推动 效率研究复兴:MoE、小模型+大数据、跨语言 scaling 都是新方向。
- 让 Loop Engineering、Harness Engineering 等”非 Scaling”路线获得更多关注。
- 让 Karpathy《LOOPS.md》的”harness 比模型更重要”思想获得更强支撑。
[2026-07-20] Kimi K3:资本市场的”去杠杆”注脚
来源:Fable 5 × CursorBench / Kimi K3(2026-07-17)。
本页此前的 Scaling Law 反思来自学术侧(Almeida 指出原作 bug、Chinchilla 重跑、英语偏见)。2026-07-17 Kimi K3 发布引发的全球算力股抛售,则从资本市场侧给出同向注脚:
- 高盛 Rich Privorotsky 定性为”去杠杆事件”:判断并非扩展定律已经失效,而是单纯扩大预训练算力不再是获得领先模型能力的唯一路径——模型架构、数据质量、强化学习、后训练效率的重要性正在上升。
- 摩根大通将市场新增担忧概括为”DeepSeek 2.0”:Kimi K3 以 2.8T 参数、1M 上下文、约 Opus 4.8 一半成本(智能指数 57)逼近前沿,催化费城半导体指数较 6 月高点回落超 20% 入技术性熊市。
- 与本主题对接:这与本页”行业本可以用更小模型+更多优质数据实现更强性能""效率研究复兴(MoE、小模型+大数据、跨语言 scaling)“的论断方向一致——Kimi K3 是”非单纯堆预训练算力”路线在商业上的又一次验证,强化了 Loop/Harness Engineering 等”非 Scaling”路线的合理性。
? 反向张力(保留):Kimi K3 itself 仍是 2.8T 参数的庞然大物,且文章指出更便宜模型可能刺激企业扩量、带动推理算力/存储需求——它压低的是模型服务价格,未必降低芯片长期需求。即”预训练 scaling 溢价被压缩” ≠ “算力总需求下降”,口径需区分。
[2026-08-06] 字节的反向豪赌:讨论训练超 5 万亿参数模型
在学术界与资本市场反思”堆参数”(本页主题)的同时,《晚点 LatePost》2026-08-06 报道 字节跳动正在讨论训练超 5 万亿参数的大模型(超过 Qwen 3.8-Max 2.4T、Kimi K3 2.8T),试图把参数规模一次推到同行数倍、争取领先——内部动机是”与其在现有尺寸上继续追赶,不如赌一把弯道超车”(据晚点报道)。
- 这是对本页”效率研究复兴”论点的反向样本:字节的豪赌表明,至少有一家头部厂商仍把”继续做大预训练规模”视为通往第一梯队的可行路线。
- 报道给出的行业背景同样支持”做大模型尺寸成为行业共识”:xAI 把 Grok 底座从 5000 亿扩到 1.5 万亿并称下一代要做到 6 万亿;OpenAI、Anthropic 也曾传出要训练更大尺寸模型。
- 张一鸣定调(据晚点):可接受短期落后、追求智能上限;反对蒸馏路线,要从更底层维度构建 AGI 壁垒。
? 5T 计划仍处早期讨论阶段,不代表一定发布;且”更大尺寸 = 更强智能”在 5T 量级是否依然成立,本页的 bug 讨论(固定数据预算、LR 衰减伪装饱和)恰好给出了反面的警示。