Kimi K3

月之暗面(Moonshot AI)2026-07-17 发布的旗舰模型,面向长周期编程、复杂知识工作与多步骤任务。发布当晚催化全球 AI/半导体股抛售(被摩根大通称为”DeepSeek 2.0”),打破了”美国前沿闭源模型享有稳定技术溢价”的市场预期。

Specifications

SpecValue
Total Parameters2.8 万亿(2.8T)
Context Window100 万(1M)tokens
Artificial Analysis 智能指数57(接近 GPT-5.5 与 Claude Opus 4.8)
单任务平均成本$0.94(约为 Opus 4.8 一半)
前端代码竞技场1679 分(升至第一)
完整权重发布最晚 2026-07-27

Pricing

项目价格(每百万 token)
API 输入$3
API 输出$15

能力定位

  • 在编程、智能体、多模态任务中表现出接近美国头部模型的能力。
  • 以约一半成本逼近前沿水平 → 可能压缩 OpenAI、Anthropic 等闭源厂商定价空间。
  • 未证明前沿 AI 可摆脱庞大算力:2.8T 参数使完整模型本地部署门槛极高(运行或需价值数十万美元以上设备)。

市场冲击(2026-07-17 发布后)

  • 高盛 Rich Privorotsky 定性为”去杠杆事件”:并非扩展定律失效,而是单纯扩大预训练算力不再是获得领先模型能力的唯一路径——架构、数据质量、强化学习、后训练效率重要性上升。
  • 费城半导体指数当日 −1.6%、一周约 −10%、较 6 月高点回落超 20% 进入技术性熊市;港股智谱 −28.5%、MiniMax −15.6%;日经 −4.03%(软银 −9%、铠侠 −16.1%);台积电 −7.3%、英伟达 −2.2%、应用材料 −5.6%。
  • 是催化剂而非唯一原因:发布前芯片股已在调整(SOXL 较 6 月高点跌超 50%)。
  • 双向效应:可能压低模型服务价格,却因更便宜模型刺激企业扩量,未必降低芯片长期需求

Notes

  • 相较 Kimi K2(1T 参数 / 128K 上下文):参数量与上下文大幅扩张,定位从”高性价比编码模型”升级为”接近前沿的通用智能体模型”。
  • “中国 AI Trinity”(Kimi / Qwen / GLM)之一。

Related: Moonshot-AI | Kimi-K2 | China-AI-Model-Landscape-2025-2026 | Scaling-Law-Debate | AI-Model-Competition

[2026-08-02] 权重开放 + 三项 Infra + 全球大使(开源引爆海外后续)

继 2026-07-17 发布、07-27 完整权重放出后,本次补 07-29 机器之心报道的 Infra 与生态细节()。

三项 Infra 开放

  • MoonEP:超大规模细粒度 MoE 专家并行通信。
  • FlashKDA:KDA 高性能算子,英伟达 H20 上 prefill 较 flash-linear-attention 基线提升 1.72-2.22 倍
  • AgentEnv:大规模 Agent 后训练沙箱,支持快照/恢复/分叉。

规模与效率

  • 2.8 万亿参数 MoE、原生视觉、1M 上下文,规模约为 Kimi K2.5 的 3 倍;借 KDA / Attention Residuals / MoonEP,规模化效率提升 2.5 倍(与 07-28 焚诀一文”训练效率 2.5x”相互印证)。
  • Stable LatentMoE:每 token 从 896 路由专家激活 16 个(AI 评测日报 K3 技术报告细节)。

评测与海外反响

  • Arena.ai 前端代码排名第一;Artificial Analysis 智能指数第三(与 07-17 本页记录的 57 分/第三一致);马斯克留言”Impressive”,称 xAI 正训练 2 万亿参数模型”可能超过 Kimi”。
  • Nathan Lambert(《Interconnects》创办人):K3 已属真正前沿模型,把开源-闭源能力差距从原 6-9 个月压缩到 3-5 个月;华尔街分析师以”本垒打”形容。
  • 微软正评估 K3 用于 Copilot 并接入 Azure;黄仁勋称美企”当然应该”被允许使用中国模型。

生态与政策

  • K3 上线 48 小时内请求量超预期,暂停新增会员订阅、会员页全部售罄。
  • 全球大使计划:对标 Anthropic Claude Community Ambassadors 与 OpenAI Codex Ambassadors;提供前沿模型优先体验/API 额度/一线团队共创/官方曝光/全球网络五类资源。
  • 政策背景:特朗普政府内部重新讨论加强对中国开源模型管控;近 200 家硅谷初创公司组成”小科技联盟”警告封杀廉价开源模型将逼初创公司向 OpenAI/Anthropic 缴高额 API 费。

⚠️ 矛盾:参数规模 2.8 万亿 vs 同篇”全球首个开放权重的 3 万亿参数级模型”两处表述并存;厂商自述 K3 整体仍落后 Claude Fable 5 / GPT-5.6 Sol,与”开源已逼近闭源前沿”的部分叙事存在张力;特定长程智能体沙盒”超越 Opus 4.8/Fable 5/GPT 5.6 Sol”(07-28 文)属单一口径营销化转述,须与综合榜第三并列阅读。

来源:../sources/2026-08-02-开放K3权重-Kimi全球大使../sources/2026-08-02-AI评测日报-2026-07-30-InMind-PerceptionBench../sources/2026-07-28-Kimi-K3-开源引爆海外

[2026-08-10] E-Bench 总分第一(73.79%),但可靠性是真瓶颈

腾讯混元 E-Bench(323 道有状态多步工具调用任务)成绩单(来源:腾讯 Agent 评测):

  • 总分第一:11 个前沿模型中最强,73.79%——但最好的模型仍有近四分之一的任务做不对。
  • 可靠性瓶颈:Pass@3 = 87.62%(三次里做对过一次)vs Pass³ = 58.82%(三次全做对);目前没有一个模型的 Pass³ 超过 60%——做对一次是运气,连续做对才是能力。
  • 成本:单任务 API 成本 0.634 美元(对照:DeepSeek-V4-Pro 0.028 美元 / 准确率 47.7%);E-Bench 同时统计准确率与成本。
  • 给解题者开放代码执行后达 77.61%,仍被 Claude Opus 4.8(81.11%)反超——代码执行能力改写 E-Bench 排名。