Kimi K3
月之暗面(Moonshot AI)2026-07-17 发布的旗舰模型,面向长周期编程、复杂知识工作与多步骤任务。发布当晚催化全球 AI/半导体股抛售(被摩根大通称为”DeepSeek 2.0”),打破了”美国前沿闭源模型享有稳定技术溢价”的市场预期。
Specifications
| Spec | Value |
|---|---|
| Total Parameters | 2.8 万亿(2.8T) |
| Context Window | 100 万(1M)tokens |
| Artificial Analysis 智能指数 | 57(接近 GPT-5.5 与 Claude Opus 4.8) |
| 单任务平均成本 | $0.94(约为 Opus 4.8 一半) |
| 前端代码竞技场 | 1679 分(升至第一) |
| 完整权重发布 | 最晚 2026-07-27 |
Pricing
| 项目 | 价格(每百万 token) |
|---|---|
| API 输入 | $3 |
| API 输出 | $15 |
能力定位
- 在编程、智能体、多模态任务中表现出接近美国头部模型的能力。
- 以约一半成本逼近前沿水平 → 可能压缩 OpenAI、Anthropic 等闭源厂商定价空间。
- 未证明前沿 AI 可摆脱庞大算力:2.8T 参数使完整模型本地部署门槛极高(运行或需价值数十万美元以上设备)。
市场冲击(2026-07-17 发布后)
- 高盛 Rich Privorotsky 定性为”去杠杆事件”:并非扩展定律失效,而是单纯扩大预训练算力不再是获得领先模型能力的唯一路径——架构、数据质量、强化学习、后训练效率重要性上升。
- 费城半导体指数当日 −1.6%、一周约 −10%、较 6 月高点回落超 20% 进入技术性熊市;港股智谱 −28.5%、MiniMax −15.6%;日经 −4.03%(软银 −9%、铠侠 −16.1%);台积电 −7.3%、英伟达 −2.2%、应用材料 −5.6%。
- 是催化剂而非唯一原因:发布前芯片股已在调整(SOXL 较 6 月高点跌超 50%)。
- 双向效应:可能压低模型服务价格,却因更便宜模型刺激企业扩量,未必降低芯片长期需求。
Notes
- 相较 Kimi K2(1T 参数 / 128K 上下文):参数量与上下文大幅扩张,定位从”高性价比编码模型”升级为”接近前沿的通用智能体模型”。
- “中国 AI Trinity”(Kimi / Qwen / GLM)之一。
Related: Moonshot-AI | Kimi-K2 | China-AI-Model-Landscape-2025-2026 | Scaling-Law-Debate | AI-Model-Competition
[2026-08-02] 权重开放 + 三项 Infra + 全球大使(开源引爆海外后续)
继 2026-07-17 发布、07-27 完整权重放出后,本次补 07-29 机器之心报道的 Infra 与生态细节(源)。
三项 Infra 开放
- MoonEP:超大规模细粒度 MoE 专家并行通信。
- FlashKDA:KDA 高性能算子,英伟达 H20 上 prefill 较 flash-linear-attention 基线提升 1.72-2.22 倍。
- AgentEnv:大规模 Agent 后训练沙箱,支持快照/恢复/分叉。
规模与效率
- 2.8 万亿参数 MoE、原生视觉、1M 上下文,规模约为 Kimi K2.5 的 3 倍;借 KDA / Attention Residuals / MoonEP,规模化效率提升 2.5 倍(与 07-28 焚诀一文”训练效率 2.5x”相互印证)。
- Stable LatentMoE:每 token 从 896 路由专家激活 16 个(AI 评测日报 K3 技术报告细节)。
评测与海外反响
- Arena.ai 前端代码排名第一;Artificial Analysis 智能指数第三(与 07-17 本页记录的 57 分/第三一致);马斯克留言”Impressive”,称 xAI 正训练 2 万亿参数模型”可能超过 Kimi”。
- Nathan Lambert(《Interconnects》创办人):K3 已属真正前沿模型,把开源-闭源能力差距从原 6-9 个月压缩到 3-5 个月;华尔街分析师以”本垒打”形容。
- 微软正评估 K3 用于 Copilot 并接入 Azure;黄仁勋称美企”当然应该”被允许使用中国模型。
生态与政策
- K3 上线 48 小时内请求量超预期,暂停新增会员订阅、会员页全部售罄。
- 全球大使计划:对标 Anthropic Claude Community Ambassadors 与 OpenAI Codex Ambassadors;提供前沿模型优先体验/API 额度/一线团队共创/官方曝光/全球网络五类资源。
- 政策背景:特朗普政府内部重新讨论加强对中国开源模型管控;近 200 家硅谷初创公司组成”小科技联盟”警告封杀廉价开源模型将逼初创公司向 OpenAI/Anthropic 缴高额 API 费。
⚠️ 矛盾:参数规模 2.8 万亿 vs 同篇”全球首个开放权重的 3 万亿参数级模型”两处表述并存;厂商自述 K3 整体仍落后 Claude Fable 5 / GPT-5.6 Sol,与”开源已逼近闭源前沿”的部分叙事存在张力;特定长程智能体沙盒”超越 Opus 4.8/Fable 5/GPT 5.6 Sol”(07-28 文)属单一口径营销化转述,须与综合榜第三并列阅读。
来源:../sources/2026-08-02-开放K3权重-Kimi全球大使、../sources/2026-08-02-AI评测日报-2026-07-30-InMind-PerceptionBench、../sources/2026-07-28-Kimi-K3-开源引爆海外
[2026-08-10] E-Bench 总分第一(73.79%),但可靠性是真瓶颈
腾讯混元 E-Bench(323 道有状态多步工具调用任务)成绩单(来源:腾讯 Agent 评测):
- 总分第一:11 个前沿模型中最强,73.79%——但最好的模型仍有近四分之一的任务做不对。
- 可靠性瓶颈:Pass@3 = 87.62%(三次里做对过一次)vs Pass³ = 58.82%(三次全做对);目前没有一个模型的 Pass³ 超过 60%——做对一次是运气,连续做对才是能力。
- 成本:单任务 API 成本 0.634 美元(对照:DeepSeek-V4-Pro 0.028 美元 / 准确率 47.7%);E-Bench 同时统计准确率与成本。
- 给解题者开放代码执行后达 77.61%,仍被 Claude Opus 4.8(81.11%)反超——代码执行能力改写 E-Bench 排名。