智谱 GLM-5 系列社区反馈调研 (2026-06-18)
TL;DR
智谱 GLM-5 系列(5 / 5.1 / 5.2)在 2026 年 2-6 月成为开源 LLM 最大黑马。Pony Alpha 匿名测试引爆海外社区,MIT 协议 + 华为昇腾训练是核心卖点,SWE-bench 77.8 / HLE 50.4 进入 Claude Opus 4.5 同一梯队。社区主流声音:编程/Agent 能力对标 Opus 4.5,价格 1/13,但中文场景的稳定性、复杂推理、长程任务仍有差距。
一、GLM-5 系列时间线
| 版本 | 发布时间 | 关键变化 |
|---|---|---|
| GLM-5 | 2026-02-11 | 744B/40B 激活 MoE, 200K 上下文, DSA 稀疏注意力, MIT 协议, 全程华为昇腾训练 |
| GLM-5.1 | 2026-04-07 | 754B/40B 激活, 编码 +28%, SWE-Bench Pro 58.4 (开源第一) |
| GLM-5.2 | 2026-06-13 | 753B, 1M tokens 上下文 (业界顶级), High/Max 双思考强度, MIT 开源下周到 |
7 个月内迭代三代,节奏激进。GLM-5.2 还未发布第三方基准,需等待。
二、海外社区反馈(Hacker News / Twitter / Reddit)
🔥 正面声音(占主流)
| 来源 | 评价 |
|---|---|
| @ArtificialAnlys | ”GLM-5 是新的开源 SOTA”,在 GDPval-AA agentic benchmark 显著超越 GLM-4.7 |
| @iruletheworldmo | ”glm 5 is kinda wild…” |
| @scaling01 | ”Pony-Alpha 要么是 AGI,要么就是把我的 SVG 题目库背下来了” |
| Pony Alpha 匿名测试 | 25% 用户猜 Claude Sonnet 5, 20% 猜 Grok, 仅少数猜中 GLM-5 |
| Hacker News (452 评论, 373 分) | 深度讨论集中在 slime 异步 RL 训练框架而非模型本身 |
| @jfaganel99 (HN) | “所有人都吵 benchmark,但实际 frontier 和 non-frontier 的差距在 RL 基础设施,不是预训练算力” |
🧊 负面/质疑声音
| 来源 | 评价 |
|---|---|
| @usb_type_d (Twitter) | “发 GLM-5 同时把 Pro 套餐的旗舰模型更新拿走,还大幅涨价…” |
| Automateed Review | ”real-world deployment 不如闭源成熟,公开 benchmark 数据有限” |
| 部分开发者 | 中文数据训练可能在西方 niche 场景表现弱 |
三、中文社区反馈(阮一峰 / 虎嗅 / 知乎 / CSDN)
阮一峰深度评测(2026-02-12)
编程能力 vs Opus 4.6 / GPT-5.3(4 个测试):
| 测试 | 最佳 | 次佳 | 备注 |
|---|---|---|---|
| 网页设计(杂志式排版) | Opus 4.6 / GLM-5 并列 | - | GLM-5 更具设计感 |
| 3D 太阳系沙盒 | Opus 4.6 | GLM-5 | GLM-5 缺引力网格线 |
| 网页游戏(愤怒的小鸟) | Opus 4.6 | GLM-5 | GLM-5 游戏性不足 |
| Laravel → Next.js 转换 | GLM-5 胜(5 分钟 vs Opus 4.6 的 20 分钟) | GPT-5.3 | GLM-5 全程零报错 |
阮一峰结论:
“GLM-5 编程表现可圈可点,是拿得出手的,能够跟国外最新的旗舰模型放在一起。**特别是’复杂系统’和’长程任务’**这两个强化点是有感的。它生成的系统逻辑和后端代码,可靠性不错,无论是生成时还是运行时,报错都不多。“
虎嗅 AppSo 体验评测
实测亮点:
- 卫星物理模拟(多普勒效应波纹动画)
- 单提示词生成完整网站 / 媒体播放器(编译 15MB)
- “火柴人开放世界游戏”长程交互 + 经济系统 + 战斗 + 背包 UI + NPC 对话
- macOS 桌面复刻(顶部状态栏同步 + Dock 栏全部应用可点击)
关键发现:GLM-5 在 Claude Code 等主流工具中已经打通,可通过工具调用执行复杂任务。
知乎 / V2EX / CSDN 总结
| 平台 | 主流声音 |
|---|---|
| 知乎 | ”国产之光但别神话”,“SWE-bench 77.8 vs Claude Opus 4.6 的 80+ 还有 3 分差距” |
| V2EX | ”Coding Plan 性价比真香(49 元/月)”,“峰谷计费高峰期 3 倍额度有点坑” |
| CSDN | ”vLLM/SGLang 本地部署已适配”,“中文业务场景比国际模型更准” |
| 稀土掘金 | ”重构中文电商项目 - ‘用户订单管理’等业务概念理解精准” |
四、性能基准(GLM-5 vs 主流模型)
GLM-5(2026-02)
| 基准 | 得分 | 对比 |
|---|---|---|
| SWE-bench Verified | 77.8 | 开源 SOTA, ≈ Claude Opus 4.5 |
| Terminal Bench 2.0 | 56.2 | 开源 SOTA |
| HLE(含工具) | 50.4 | 超 Claude Opus 4.5 / Gemini 3 Pro |
| Artificial Analysis Index v4.0 | 50 | 开放权重模型首次达到 50 分 |
GLM-5.1(2026-04)
| 基准 | GLM-5.1 | Kimi K2.6 | DeepSeek V4 Pro |
|---|---|---|---|
| SWE-Bench Pro | 58.4 | 58.6 | 55.4 |
| Terminal Bench 2.0 | 63.5 | 66.7 | 67.9 |
| HLE(含工具) | 52.3 | 54.0 | 48.2 |
| AIME 2026 | 95.3 | 96.4 | — |
| GPQA Diamond | 86.2 | 90.5 | 90.1 |
| BrowseComp | 79.3 | 83.2 | 83.4 |
GLM-5.2(2026-06,未独立验证)
| 基准 | 得分 | 备注 |
|---|---|---|
| GPQA Diamond(思考) | 91.2 | 全球第 15 |
| HLE(思考+工具) | 54.7 | 全球第 8 |
| AIME 2026 | 99.2 | 全球第 1 |
| IMO-AnswerBench | 91 | 全球第 1 |
| SWE-Bench Pro | 62.1 | 全球第 5 |
| TerminalBench 2.1 | 81 | 全球第 4 |
五、价格对比(2026-06-17)
| 模型 | 输入价 (¥/M) | 输出价 (¥/M) | 上下文 |
|---|---|---|---|
| DeepSeek V4 Flash | 1.00 | 2.00 | 1M |
| Qwen3.5 Flash | 0.20 | 2.00 | 131K |
| DeepSeek V4 Pro | 3.00 | 6.00 | 1M |
| GLM-5 | 4.00 | 18.00 | 200K |
| Doubao 1.6 | 2.40 | 24.00 | 256K |
| Qwen3 Max | 2.50 | 10.00 | 131K |
| Kimi K2.6 | 6.50 | 27.00 | 262K |
对比海外(USD/M):
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| GLM-5.1 | $0.98 | $3.08 | Coding Plan Pro ¥216/月 |
| GLM-5 | $0.80 | $2.56 | 旗舰但比 Claude Opus 便宜 80%+ |
| Claude Opus 4.7 | ~$15 | ~$75 | 13x 价格差 |
| GPT-5.5 | ~$10 | ~$30 | 5-10x 价格差 |
GLM Coding Plan(智谱订阅):
- Lite ¥72/月(季付 $30)— 含 GLM-5.1/Turbo/4.7/4.6/4.5-Air
- Pro ¥216/月 — 上述 + GLM-5
- Max ¥576/月 — Pro 用量 4x
六、社区核心观点总结
✅ 公认的强项
- 编程 Agent 能力接近 Opus 4.5(SWE-bench 77.8 / SWE-Bench Pro 58.4)
- MIT 开源 + 商用自由,本地部署已适配 vLLM/SGLang
- 华为昇腾训练,去 NVIDIA 化,国产芯片生态完整(华为/摩尔/寒武纪/昆仑芯/沐曦/燧原/海光)
- slime 异步 RL 框架开源是隐形杀手锏(HN 讨论热度第一)
- 价格优势显著(Claude Opus 1/13, GPT-5.5 1/5-10)
- 中文场景业务概念理解准确(如”用户订单管理”、“商品库存同步”)
- Pony Alpha 匿名测试证明技术不靠地缘标签(25% 猜 Claude, 20% 猜 Grok)
⚠️ 公认的短板
- 复杂推理与全球顶级仍有 ~5% 差距(HLE/GPQA vs GPT-5.4/Gemini 3.1 Pro)
- 速度最慢(GLM-5.2 同任务 45 分钟 vs Claude Opus 4.8 的 33 分钟;DeepSeek 节奏更慢)
- **指令遵循存在”过度思考挤占输出”**问题(多步指令偶尔缺分隔符,否定约束首调空输出)
- Pricing 持续涨价(自 GLM-5 发布以来 Coding Plan 涨 3 轮 ≥30%,海外 API +67%~100%)
- Pro 订阅被砍旗舰更新(社区情绪负面)
- 峰谷计费复杂(高峰期 3x 额度消耗)
- 每日限量发售 + 严格退款政策
- GLM-5.2 长上下文保持力未验证(DeepSeek V4 Pro 多针检索仅 60%)
🎯 适用场景推荐
| 场景 | 推荐度 | 理由 |
|---|---|---|
| 国产替代 / 私有化部署 | ⭐⭐⭐⭐⭐ | MIT + 华为昇腾 + 中文优 |
| 性价比 Coding Plan | ⭐⭐⭐⭐⭐ | ¥72-216/月 vs Claude Pro ¥144 但用量 3-5 倍 |
| 长程 Agent 任务(8h+) | ⭐⭐⭐⭐ | 官方 demo 强,但独立基准有限 |
| 中文业务代码生成 | ⭐⭐⭐⭐⭐ | 国内团队首选 |
| 复杂数学/学术研究 | ⭐⭐⭐ | GLM-5.2 AIME 99.2 很强,但 GPQA/HLE 仍差 |
| 英文 niche 场景 | ⭐⭐ | 训练数据以中文为主 |
| 实时交互 | ⭐⭐ | 速度最慢是硬伤 |
七、智谱商业进展
- 2026 年 1 月港股 IPO,募资 ~43.5 亿港元($558M)
- 2025 年营收 7.24 亿元同比翻倍,MaaS API 平台 ARR 17 亿元
- 智谱是中国首家上市的基础模型公司
- Coding Plan 用户快速扩张,但商业策略(涨价 + 限购)引发社区批评
八、王黑侠的结论(给主人的投资 + 使用视角)
💼 投资角度(02513.HK)
- ✅ 港股代码 2513.HK,今天大涨 17.7%(市场对 GLM-5.2 利好反应)
- ✅ 营收 ARR 双增长 + IPO 后融资充沛
- ⚠️ Coding Plan 涨价策略可能短期收入增长但伤害长期生态(开发者流失)
- ⚠️ 与 DeepSeek V4 / Kimi K2.6 / Qwen3.5 竞争白热化,护城河是 MIT + 昇腾
- 建议:基本面持续跟踪 GLM-5.2 MIT 开源后的下载量 + Coding Plan 订阅数 + ARR 增速
🛠️ 使用角度
- Coding Plan Pro ¥216/月 是性价比甜点(含 GLM-5,5x Lite 用量)
- 本地部署 GLM-5(744B)需要 ≥8x H100 或华为 Atlas 900,实际不太现实
- 推荐路线:Claude Code(主力)+ GLM Coding Plan(备选/中文项目)
📊 跟踪建议
- 等待 GLM-5.2 独立 benchmark(API 已上线,下周 MIT 开源)
- 关注 Coding Plan 价格策略是否反转
- 关注 GitHub
zai-org/GLM-5star 增长趋势(vs DeepSeek V4 仓库对比)
📚 数据来源(15+ 篇)
官方:
- z.ai/blog/glm-5(官方公告)
- arxiv.org/abs/2602.15763(GLM-5 论文)
- github.com/zai-org/GLM-5
- huggingface.co/zai-org/GLM-5.2
英文评测:
- ruanyifeng.com(阮一峰博客,4 测试)
- curateclick.com / a2aprotocol.ai(HN/Twitter 反馈聚合)
- baeseokjae.github.io(开发者深度评测)
- airank.dev(基准数据)
- lmmarketcap.com(价格 + Arena Elo)
- automateed.com(5 维度 review)
中文评测:
- 虎嗅 AppSo(公众号转载)
- 36氪(量子位)
- 腾讯新闻 i 黑马(GLM-5.2 评测)
- CSDN(多个本地部署 + 实测文)
- DataLearnerAI(GLM-5.1 / GLM-5.2 分析)
- 算盘 LLM Abacus(价格对比)
- vibecoding.app(价格全解析)
- codingfleet.com(Kimi K2.6 vs GLM-5.1)
- lixx.cn(开源双雄对决)
- aiproducthub.cn(Coding Plan 教程)
Reddit/HN:
- r/LocalLLaMA(GLM-5.2 部署讨论)
- Hacker News(slime 框架讨论 452 评论)
报告生成时间:2026-06-18 22:55 | 王黑侠调研