扩散语言模型

扩散语言模型(Diffusion Language Model)区别于传统自回归逐 token 生成,采用前向并行起草多个 token 再迭代收敛的方式生成文本。代表项目 Google DiffusionGemma 基于 Gemma 4 系列(26B-A4B MoE),每次前向并行起草 256 个 token,在 RTX 5090 上达 700+ token/s,将本地推理瓶颈从内存带宽转移到计算。代价是整体输出质量不及自回归模型,更适合延迟敏感的实时交互场景。

关联