大模型

大模型(Large Language Models, LLM)指基于 Transformer 架构、在海量文本上预训练的大参数量神经网络,是当前 AI 应用的基础设施。本 wiki 关注 2025-2026 年间的模型发布、能力演进与竞争格局,涵盖 DeepSeek、Qwen、Claude、GPT、Gemini 等主力系列。相关讨论常涉及 Scaling Law、推理能力、上下文长度与多模态扩展。

[2026-08-06] 参数规模竞赛:5 万亿级进入讨论

据《晚点 LatePost》报道(2026-08-06),做大模型尺寸仍是 2026 年的行业共识,国内参数规模竞赛已进入万亿级:

模型参数规模状态
Qwen 3.8-Max(阿里)2.4 万亿据晚点报道
Kimi K3(月之暗面)2.8 万亿2026-07 发布,国内最大开源模型
字节新模型超 5 万亿早期讨论阶段,未必发布
Grok(xAI)5000 亿 → 1.5 万亿马斯克称下一代要做到 6 万亿

字节此举的动机是在语言模型落后(GLM-5、Kimi K3 相继逼近前沿)的局面下押注”弯道超车”;张一鸣同时定调”不蒸馏”、别被 Coding 短期热点牵着走。详见 晚点独家:字节讨论训超 5 万亿参数模型Scaling Law 争议

OpenAI、Anthropic 也”曾传出”要训练更大尺寸模型,未获官方证实。

关联