Qwen(通义千问)
Qwen 是 阿里巴巴 推出的大模型家族(通义千问),是国产开源模型的代表之一,覆盖语言、编码(Qwen-Coder)、多模态(Qwen-Image)等系列。它以开源 + 长上下文为卖点,在开发者与中文生态中具有广泛影响。
编码能力是 Qwen 的重点方向。Qwen3-Coder 携 1M 上下文 主打百万级上下文与代码生成,直接对标 Claude Code;GLM-4.5-Air vs Qwen3-Coder 对比 则显示其与 智谱 GLM 等国产模型的内部竞争。多模态方面,魔搭社区训练 Qwen-Image LoRA 体现其低门槛生态。整体定位见 中国大模型版图 与 开源 AI。
[2026-08-06] Qwen3.8-Max GA 与端侧/语音延伸
- Qwen3.8-Max GA(2026-08-02,来源:评测日报 08-04):2.4T 参数 MoE、1M 上下文。官方表关键分数:Terminal-Bench 2.1 86.6 / SWE-bench Pro 67.7(Fable 5 80.0)/ FrontierSWE 73.5(Fable 5 88.8)/ GPQA Diamond 92.6 / PaperBench 93.0 / IFBench 82.8 / OSWorld-Verified 86.1;代际提升集中在 agentic/多模态(DeepSWE 1.1 21.6→56.6、JobBench 31.3→53.4),纯推理几乎持平。⚠️ 两处口径问题:多模态对比基线用了 Qwen3.7-Plus 而非同级 Max;官方 RL scaling 曲线约 4,000 训练环境见顶(0.725)后回落。8/2 进入 Frontend Code/Text/Vision Arena。
- 端侧部署:Swiftlet 专家流式运行时为 Qwen3-Next-80B-A3B(Mac 峰值内存 4.3 GB、4.5–5 tok/s)与 Qwen3.6-35B-A3B(iPhone 17 原生运行,约 2.5 GB、~1 tok/s)提供 Apple Silicon 部署路径——混合架构 = Gated DeltaNet 线性注意力 + 门控 GQA + 高稀疏 MoE(80B 版 512 专家路由 10 个)。来源:Swiftlet 源页。
- 语音方向:Qwen3-TTS / Qwen CustomVoice 为 Voicebox 内置 TTS 引擎,Qwen3 小模型用于口语清理。
[2026-08-10] Qwen3.7-Max 任 FinEvo-Bench 统一底座;Skill-Entropy RL 大幅提升小模型
- FinEvo-Bench 统一底座(北航 + 阿里云通义点金,arXiv 2608.06144):首个纵向评测”自进化 agent”的金融基准(120 真实任务 × 20 场景 × 6 金融领域,质量 + 合规双评)。同一 Qwen3.7-Max 底座对比 4 种自进化 scaffold:Letta 进化后最高分 91.65、合规问题最少(0.09/任务);Codex 自进化增益最大(+19.37)。详见 金融 AI 与 Agent 自我改进。来源:评测日报 08-10。
- Skill-Entropy RL(Princeton Skill²-Bench 反向应用,arXiv 2608.05139):以技能切换难度(Skill Entropy)作训练信号——Qwen3-4B-Instruct 34.4%→68.4%、Qwen3-1.7B 14.6%→40.1%。注意:增益幅度很大(+34 分),需警惕对自家基准过拟合,复现时应加测外部长程基准。来源:评测日报 08-09。