展开目录
#扩散模型#Diffusion LLM#大模型#推理加速#LLaDA#Mercury#架构

扩散语言模型:告别「逐字生成」,AI 推理迎来并行时代

自回归大模型统治生成式 AI 五年,但逐 token 串行生成正在成为推理成本与延迟的瓶颈。2025 年起 Mercury、LLaDA 把图像领域大杀四方的扩散范式搬到文本:并行生成、双向上下文、迭代修正。本文详解扩散语言模型的两条技术路线、代表工作与「推理快 10 倍」背后的真相。

预计阅读 9 分钟

一句话总结

主流大模型清一色是自回归(AR)架构——从左到右逐 token 生成,一个字一个字「挤」出来。2025 年起,Inception Labs 的 Mercury、蚂蚁 + 人大的 LLaDA 把图像领域大杀四方的扩散模型搬到了文本上:并行生成、双向上下文、迭代修正。两年间这个方向从论文走向商业化 API 与开源生态,正在改写「推理速度与生成质量二选一」的旧规则。


数据来源

本文事实依据来自:LLMGuide 扩散语言模型专题(meko1.github.io,2026 更新)、知乎「扩散语言模型(DLM)综述」、康奈尔 Kuleshov 实验室技术分享(经 80aj.com 转载)、GitHub 仓库数据(ML-GSAI/LLaDA ⭐3.9k、inclusionAI/LLaDA2.0 ⭐693、LLaDA2.X ⭐517)、Inception Labs Mercury 产品公开信息,以及钛媒体 Edge AI Daily 早报(2026-09-01)对扩散语言模型产业化的汇总。


自回归的瓶颈:一个字一个字「挤」出来的 AI

过去五年,GPT、Claude、Gemini 这些我们熟悉的模型,底层都是同一种范式:自回归。生成一个句子就像排队过闸机——第一个 token 出来,第二个才能动,第 N 个必须等前 N-1 个全部完成。

这套「串行」机制带来三大痛点:

  1. 延迟随长度线性增长:写一篇长文,等待时间与字数成正比;
  2. 单向视野:只能看左边,改不了右边已经写错的部分;
  3. 一步错、步步错:早期的错误会在后续生成中被不断放大,无法回头修正。

自回归 vs 扩散:两种「写出句子」的方式

在消费级场景里,这几秒的等待尚可忍受;但在代码补全、实时对话、Agent 多轮调用这些低延迟、高吞吐场景里,串行生成正在成为推理成本与体验的双重瓶颈。

扩散范式:图像领域已验证的「先骨架、后细节」

扩散模型(Diffusion Models)在图像领域早已封神:Stable Diffusion、Midjourney、Sora 都是它的作品。它的核心思想是从噪声中逐步去噪,由粗到细——先定整体骨架,再补细节纹理。

把同样的思路搬到文本,直觉上非常诱人:一次生成多个 token、任意位置同时推进、写错了可以多轮迭代修正——这更接近人类写作,而不是打字机。

但难点也在这里:文本是离散的。图像扩散往像素上加的是连续高斯噪声,有成熟的数学工具;而文本 token 是离散符号,不能直接加高斯噪声。怎么办?业界走出两条路。

文本是离散的:两条技术路线

扩散语言模型的两条技术路线

掩码扩散(Masking Diffusion):多步 BERT,主流路线

前向过程:把句子中比例 t 的 token 替换成 [MASK],t 从 0 一路涨到接近 1——t=0 是原文,t=1 是全部掩码。这与 BERT 的掩码语言建模是同一个操作,只是变成了连续可调的时间步

反向过程:训练 Transformer 在「部分被掩码的句子 + 时间步 t」条件下,同时预测所有被掩码的位置。推理时多轮迭代 unmask,由粗到细生成完整文本。

这套框架与 BERT 的 MLM 训练数学上兼容——LLaDA 甚至可以理解为「多步、可控噪声比例的 BERT 生成器」。工程成本低(沿用 MLM 代码),是当前绝对主流,代表工作:LLaDA、Dream 7B、Mercury

得分式离散扩散(SEDD):数学严谨,工程复杂

另一条路用连续时间马尔可夫链定义「token 之间的跳转」,训练目标是得分熵损失(score entropy loss),推理时用类似 Euler 求解器逐步降噪。数学上与图像扩散更同构,但工程实现复杂得多——目前学界成果多、工业部署少,代表工作:SEDD、DiffuBERT。

代表工作时间线:2024 - 2026

扩散语言模型代表工作:2024 - 2026

时间工作发布方意义
2024SEDDStanford首个困惑度追平 GPT-2 的离散扩散模型,证明「扩散能做语言建模」
2025LLaDA-8B人大 + 蚂蚁首个 8B 级「从零训练」扩散 LLM,指令跟随、少样本推理接近 LLaMA3-8B
2025Dream 7BHKU用 Qwen2.5 权重初始化,一次 forward 出多 token,编辑任务大幅领先 AR
2025Mercury / Mercury CoderInception Labs首个商业化扩散 LLM,官方展示 1000+ token/s,主打代码生成
2025DiffuLLaMA / DiffuGPT学术界从预训练 AR 模型「改造」为 DLM,几万步微调即可,为大规模落地铺路
2026LLaDA2.0 / LLaDA2.X蚂蚁 InclusionAI扩散 LLM 系列开源生态成型,目标「理解与生成整个世界」
2026Mercury 2Inception Labs新一代扩散模型 API,社区已出现流式去噪展示应用

DLM vs AR:一张表看懂取舍

维度自回归 LLM扩散 LLM
生成顺序从左到右,严格因果任意顺序、可并行
单次 forward 产出1 个 token多 token(数十到上百)
上下文可见性只能看左边双向,全序列可见
长文本一致性追赶中,容易「局部通顺、全局失衡」
精确问答 / 数学目前弱于顶级 AR
代码填洞 / 编辑需要专门 FIM 目标原生支持,双向语境天然贴合
输出长度无上限(EOS 结束)通常固定长度,需预设或迭代扩展
推理延迟与生成长度线性相关与去噪步数 K 相关(K 远小于长度)
KV Cache有,且是核心优化无标准 KV Cache,每步需重算注意力

一句话:DLM 与 AR 不是「谁替代谁」,而是**「推理速度 / 编辑灵活性」vs「生成质量 / 生态成熟度」**的取舍。

「快 10 倍」的真相:吞吐与延迟的公式变了

为什么扩散 LLM 号称推理快 10 倍?关键在于单次 forward 的产出变了

  • 自回归:一次 forward 只出一个 token,权重加载成本被 1 个 token 平摊;
  • 扩散:一次 forward 同时填多个位置,把「过一遍权重」的成本平摊到几十上百个 token 上。

这在内存带宽受限的推理场景(batch 小、序列长)优势最大——这也是 Mercury 为什么主打代码补全:低延迟、高吞吐、中短序列,恰好是扩散 LLM 的主场。官方展示的 1000+ token/s,在代码场景里已经具备商用吸引力。

但要注意:10 倍加速不是普适的。长上下文下,双向注意力的 O(L²) 开销会吃掉并行收益;精确问答、数学推理等「必须答对」的任务,扩散模型目前仍落后于顶级自回归模型。

尚待攻克的短板

  • 规模未验证:扩散 LLM 尚未扩展到千亿参数,通用基准上与前沿 AR 模型仍有 5-20 个百分点差距
  • 无标准 KV Cache:双向注意力每轮 refine 都要重算 K/V,只能靠 prefix cache、减少去噪步数、稀疏化注意力弥补
  • 输出长度控制:AR 的「生成到 EOS 就停」依然是最优雅的方案,DLM 需要固定长度、块式扩展或长度预测头
  • 对齐困难:DLM 的生成概率是多步去噪的联合分布,直接套 PPO/DPO 不成立,需要专门设计
  • 训练稳定性:每个样本要「多角度」看不同掩码比例,收敛所需数据量更大

2026 趋势:混合架构与工业落地

2026 年最值得关注的方向,是混合架构——AR 主干出草稿、扩散头做局部并行填空/refine;或反过来,扩散主干出骨架、AR 头收尾。DiffuLLaMA 证明的「AR 模型低成本改造为 DLM」路径(权重初始化 + 双向注意力 + 扩散化微调,便宜一到两个数量级),让扩散能力可以借力现有生态快速铺开。

产业侧,9 月初的行业早报(Edge AI Daily)将扩散语言模型列为「跨入工业主流」的关键信号:Google 开源 DiffusionGemma(块级扩散,约 4 倍加速)、NVIDIA 推出 Nemotron-Labs-Diffusion(多模式切换,最高约 6.4 倍加速)等进展密集出现——从「论文玩具」到「开源权重 + 商业 API」,这个范式正在完成最后一公里。

对开发者的意义

  • 代码补全场景:扩散 LLM 的 1000+ token/s 与原生填洞能力,是 Copilot 类工具的新选择
  • 文档编辑 / 重写:双向上下文让「改一段、补一句」天然比 AR 更顺手
  • Agent 调用成本:并行生成降低多轮调用的延迟累积,长时运行 Agent 的体验会明显改善
  • 开源生态:LLaDA2.0 系列已在 GitHub 开源(蚂蚁 InclusionAI),可本地部署实验;相关模型与生态可在 Hugging Face 找到

总结

  • 自回归的三大痛点——串行延迟、单向视野、无法修正——正是扩散 LLM 的三大卖点
  • 两条技术路线:掩码扩散(主流,多步 BERT)vs 得分式离散扩散(SEDD,数学严谨、工程复杂)
  • 两年时间线:SEDD 2024 追平 GPT-2 → LLaDA-8B 2025 从零训练 → Mercury 商业化 → LLaDA2.0 与 Mercury 2 在 2026 走向工业主流
  • 快 10 倍的真相:单次 forward 产出多 token,摊薄权重加载成本,内存带宽受限场景优势最大
  • 短期不会取代 AR:质量差距、生态成熟度、对齐与训练稳定性仍是硬伤;混合架构(AR 骨架 + 扩散填空)是更现实的落地路径
  • 给开发者的信号:代码补全、文档编辑、Agent 延迟优化,是扩散 LLM 最早兑现价值的三个场景

Related

相关文章

延伸阅读

查看全部 →