智谱 GLM-5 系列社区反馈调研 (2026-06-18)

TL;DR

智谱 GLM-5 系列(5 / 5.1 / 5.2)在 2026 年 2-6 月成为开源 LLM 最大黑马。Pony Alpha 匿名测试引爆海外社区,MIT 协议 + 华为昇腾训练是核心卖点,SWE-bench 77.8 / HLE 50.4 进入 Claude Opus 4.5 同一梯队。社区主流声音:编程/Agent 能力对标 Opus 4.5,价格 1/13,但中文场景的稳定性、复杂推理、长程任务仍有差距


一、GLM-5 系列时间线

版本发布时间关键变化
GLM-52026-02-11744B/40B 激活 MoE, 200K 上下文, DSA 稀疏注意力, MIT 协议, 全程华为昇腾训练
GLM-5.12026-04-07754B/40B 激活, 编码 +28%, SWE-Bench Pro 58.4 (开源第一)
GLM-5.22026-06-13753B, 1M tokens 上下文 (业界顶级), High/Max 双思考强度, MIT 开源下周到

7 个月内迭代三代,节奏激进。GLM-5.2 还未发布第三方基准,需等待。


二、海外社区反馈(Hacker News / Twitter / Reddit)

🔥 正面声音(占主流)

来源评价
@ArtificialAnlysGLM-5 是新的开源 SOTA”,在 GDPval-AA agentic benchmark 显著超越 GLM-4.7
@iruletheworldmo”glm 5 is kinda wild…”
@scaling01”Pony-Alpha 要么是 AGI,要么就是把我的 SVG 题目库背下来了”
Pony Alpha 匿名测试25% 用户猜 Claude Sonnet 5, 20% 猜 Grok, 仅少数猜中 GLM-5
Hacker News (452 评论, 373 分)深度讨论集中在 slime 异步 RL 训练框架而非模型本身
@jfaganel99 (HN)“所有人都吵 benchmark,但实际 frontier 和 non-frontier 的差距在 RL 基础设施,不是预训练算力”

🧊 负面/质疑声音

来源评价
@usb_type_d (Twitter)“发 GLM-5 同时把 Pro 套餐的旗舰模型更新拿走,还大幅涨价…”
Automateed Review”real-world deployment 不如闭源成熟,公开 benchmark 数据有限”
部分开发者中文数据训练可能在西方 niche 场景表现弱

三、中文社区反馈(阮一峰 / 虎嗅 / 知乎 / CSDN)

阮一峰深度评测(2026-02-12)

编程能力 vs Opus 4.6 / GPT-5.3(4 个测试):

测试最佳次佳备注
网页设计(杂志式排版)Opus 4.6 / GLM-5 并列-GLM-5 更具设计感
3D 太阳系沙盒Opus 4.6GLM-5GLM-5 缺引力网格线
网页游戏(愤怒的小鸟)Opus 4.6GLM-5GLM-5 游戏性不足
Laravel → Next.js 转换GLM-5 胜(5 分钟 vs Opus 4.6 的 20 分钟)GPT-5.3GLM-5 全程零报错

阮一峰结论

“GLM-5 编程表现可圈可点,是拿得出手的,能够跟国外最新的旗舰模型放在一起。**特别是’复杂系统’和’长程任务’**这两个强化点是有感的。它生成的系统逻辑和后端代码,可靠性不错,无论是生成时还是运行时,报错都不多。“

虎嗅 AppSo 体验评测

实测亮点:

  • 卫星物理模拟(多普勒效应波纹动画)
  • 单提示词生成完整网站 / 媒体播放器(编译 15MB)
  • “火柴人开放世界游戏”长程交互 + 经济系统 + 战斗 + 背包 UI + NPC 对话
  • macOS 桌面复刻(顶部状态栏同步 + Dock 栏全部应用可点击)

关键发现:GLM-5 在 Claude Code 等主流工具中已经打通,可通过工具调用执行复杂任务。

知乎 / V2EX / CSDN 总结

平台主流声音
知乎”国产之光但别神话”,“SWE-bench 77.8 vs Claude Opus 4.6 的 80+ 还有 3 分差距”
V2EX”Coding Plan 性价比真香(49 元/月)”,“峰谷计费高峰期 3 倍额度有点坑”
CSDN”vLLM/SGLang 本地部署已适配”,“中文业务场景比国际模型更准”
稀土掘金”重构中文电商项目 - ‘用户订单管理’等业务概念理解精准”

四、性能基准(GLM-5 vs 主流模型)

GLM-5(2026-02)

基准得分对比
SWE-bench Verified77.8开源 SOTA, ≈ Claude Opus 4.5
Terminal Bench 2.056.2开源 SOTA
HLE(含工具)50.4超 Claude Opus 4.5 / Gemini 3 Pro
Artificial Analysis Index v4.050开放权重模型首次达到 50 分

GLM-5.1(2026-04)

基准GLM-5.1Kimi K2.6DeepSeek V4 Pro
SWE-Bench Pro58.458.655.4
Terminal Bench 2.063.566.767.9
HLE(含工具)52.354.048.2
AIME 202695.396.4
GPQA Diamond86.290.590.1
BrowseComp79.383.283.4

GLM-5.2(2026-06,未独立验证)

基准得分备注
GPQA Diamond(思考)91.2全球第 15
HLE(思考+工具)54.7全球第 8
AIME 202699.2全球第 1
IMO-AnswerBench91全球第 1
SWE-Bench Pro62.1全球第 5
TerminalBench 2.181全球第 4

五、价格对比(2026-06-17)

模型输入价 (¥/M)输出价 (¥/M)上下文
DeepSeek V4 Flash1.002.001M
Qwen3.5 Flash0.202.00131K
DeepSeek V4 Pro3.006.001M
GLM-54.0018.00200K
Doubao 1.62.4024.00256K
Qwen3 Max2.5010.00131K
Kimi K2.66.5027.00262K

对比海外(USD/M):

模型输入输出备注
GLM-5.1$0.98$3.08Coding Plan Pro ¥216/月
GLM-5$0.80$2.56旗舰但比 Claude Opus 便宜 80%+
Claude Opus 4.7~$15~$7513x 价格差
GPT-5.5~$10~$305-10x 价格差

GLM Coding Plan(智谱订阅):

  • Lite ¥72/月(季付 $30)— 含 GLM-5.1/Turbo/4.7/4.6/4.5-Air
  • Pro ¥216/月 — 上述 + GLM-5
  • Max ¥576/月 — Pro 用量 4x

六、社区核心观点总结

✅ 公认的强项

  1. 编程 Agent 能力接近 Opus 4.5(SWE-bench 77.8 / SWE-Bench Pro 58.4)
  2. MIT 开源 + 商用自由,本地部署已适配 vLLM/SGLang
  3. 华为昇腾训练,去 NVIDIA 化,国产芯片生态完整(华为/摩尔/寒武纪/昆仑芯/沐曦/燧原/海光)
  4. slime 异步 RL 框架开源是隐形杀手锏(HN 讨论热度第一)
  5. 价格优势显著(Claude Opus 1/13, GPT-5.5 1/5-10)
  6. 中文场景业务概念理解准确(如”用户订单管理”、“商品库存同步”)
  7. Pony Alpha 匿名测试证明技术不靠地缘标签(25% 猜 Claude, 20% 猜 Grok)

⚠️ 公认的短板

  1. 复杂推理与全球顶级仍有 ~5% 差距(HLE/GPQA vs GPT-5.4/Gemini 3.1 Pro)
  2. 速度最慢(GLM-5.2 同任务 45 分钟 vs Claude Opus 4.8 的 33 分钟;DeepSeek 节奏更慢)
  3. **指令遵循存在”过度思考挤占输出”**问题(多步指令偶尔缺分隔符,否定约束首调空输出)
  4. Pricing 持续涨价(自 GLM-5 发布以来 Coding Plan 涨 3 轮 ≥30%,海外 API +67%~100%)
  5. Pro 订阅被砍旗舰更新(社区情绪负面)
  6. 峰谷计费复杂(高峰期 3x 额度消耗)
  7. 每日限量发售 + 严格退款政策
  8. GLM-5.2 长上下文保持力未验证(DeepSeek V4 Pro 多针检索仅 60%)

🎯 适用场景推荐

场景推荐度理由
国产替代 / 私有化部署⭐⭐⭐⭐⭐MIT + 华为昇腾 + 中文优
性价比 Coding Plan⭐⭐⭐⭐⭐¥72-216/月 vs Claude Pro ¥144 但用量 3-5 倍
长程 Agent 任务(8h+)⭐⭐⭐⭐官方 demo 强,但独立基准有限
中文业务代码生成⭐⭐⭐⭐⭐国内团队首选
复杂数学/学术研究⭐⭐⭐GLM-5.2 AIME 99.2 很强,但 GPQA/HLE 仍差
英文 niche 场景⭐⭐训练数据以中文为主
实时交互⭐⭐速度最慢是硬伤

七、智谱商业进展

  • 2026 年 1 月港股 IPO,募资 ~43.5 亿港元($558M)
  • 2025 年营收 7.24 亿元同比翻倍,MaaS API 平台 ARR 17 亿元
  • 智谱是中国首家上市的基础模型公司
  • Coding Plan 用户快速扩张,但商业策略(涨价 + 限购)引发社区批评

八、王黑侠的结论(给主人的投资 + 使用视角)

💼 投资角度(02513.HK)

  • ✅ 港股代码 2513.HK,今天大涨 17.7%(市场对 GLM-5.2 利好反应)
  • ✅ 营收 ARR 双增长 + IPO 后融资充沛
  • ⚠️ Coding Plan 涨价策略可能短期收入增长但伤害长期生态(开发者流失)
  • ⚠️ 与 DeepSeek V4 / Kimi K2.6 / Qwen3.5 竞争白热化,护城河是 MIT + 昇腾
  • 建议:基本面持续跟踪 GLM-5.2 MIT 开源后的下载量 + Coding Plan 订阅数 + ARR 增速

🛠️ 使用角度

  • Coding Plan Pro ¥216/月 是性价比甜点(含 GLM-5,5x Lite 用量)
  • 本地部署 GLM-5(744B)需要 ≥8x H100 或华为 Atlas 900,实际不太现实
  • 推荐路线:Claude Code(主力)+ GLM Coding Plan(备选/中文项目)

📊 跟踪建议

  • 等待 GLM-5.2 独立 benchmark(API 已上线,下周 MIT 开源)
  • 关注 Coding Plan 价格策略是否反转
  • 关注 GitHub zai-org/GLM-5 star 增长趋势(vs DeepSeek V4 仓库对比)

📚 数据来源(15+ 篇)

官方

  • z.ai/blog/glm-5(官方公告)
  • arxiv.org/abs/2602.15763(GLM-5 论文)
  • github.com/zai-org/GLM-5
  • huggingface.co/zai-org/GLM-5.2

英文评测

  • ruanyifeng.com(阮一峰博客,4 测试)
  • curateclick.com / a2aprotocol.ai(HN/Twitter 反馈聚合)
  • baeseokjae.github.io(开发者深度评测)
  • airank.dev(基准数据)
  • lmmarketcap.com(价格 + Arena Elo)
  • automateed.com(5 维度 review)

中文评测

  • 虎嗅 AppSo(公众号转载)
  • 36氪(量子位)
  • 腾讯新闻 i 黑马(GLM-5.2 评测)
  • CSDN(多个本地部署 + 实测文)
  • DataLearnerAI(GLM-5.1 / GLM-5.2 分析)
  • 算盘 LLM Abacus(价格对比)
  • vibecoding.app(价格全解析)
  • codingfleet.com(Kimi K2.6 vs GLM-5.1)
  • lixx.cn(开源双雄对决)
  • aiproducthub.cn(Coding Plan 教程)

Reddit/HN

  • r/LocalLLaMA(GLM-5.2 部署讨论)
  • Hacker News(slime 框架讨论 452 评论)

报告生成时间:2026-06-18 22:55 | 王黑侠调研