大模型
大模型(Large Language Models, LLM)指基于 Transformer 架构、在海量文本上预训练的大参数量神经网络,是当前 AI 应用的基础设施。本 wiki 关注 2025-2026 年间的模型发布、能力演进与竞争格局,涵盖 DeepSeek、Qwen、Claude、GPT、Gemini 等主力系列。相关讨论常涉及 Scaling Law、推理能力、上下文长度与多模态扩展。
[2026-08-06] 参数规模竞赛:5 万亿级进入讨论
据《晚点 LatePost》报道(2026-08-06),做大模型尺寸仍是 2026 年的行业共识,国内参数规模竞赛已进入万亿级:
| 模型 | 参数规模 | 状态 |
|---|---|---|
| Qwen 3.8-Max(阿里) | 2.4 万亿 | 据晚点报道 |
| Kimi K3(月之暗面) | 2.8 万亿 | 2026-07 发布,国内最大开源模型 |
| 字节新模型 | 超 5 万亿 | 早期讨论阶段,未必发布 |
| Grok(xAI) | 5000 亿 → 1.5 万亿 | 马斯克称下一代要做到 6 万亿 |
字节此举的动机是在语言模型落后(GLM-5、Kimi K3 相继逼近前沿)的局面下押注”弯道超车”;张一鸣同时定调”不蒸馏”、别被 Coding 短期热点牵着走。详见 晚点独家:字节讨论训超 5 万亿参数模型 与 Scaling Law 争议。
? OpenAI、Anthropic 也”曾传出”要训练更大尺寸模型,未获官方证实。