DiffusionGemma解析:扩散模型如何让LLM快5倍

谷歌DeepMind在2025年8月悄然发布了一份技术报告(arXiv编号2508.00146),推出了名为DiffusionGemma的扩散语言模型。它最大的卖点只有一个字:快。在同一张英伟达H100显卡上,它每秒可以生成约1500个token,而上一代自回归模型仅能吐出约300个——足足快了近5倍。
英伟达H100是基于Hopper架构的数据中心GPU,于2022年发布,是当前AI训练和推理的主力硬件。它拥有80GB HBM3显存、3.35TB/s的显存带宽,以及约990 TFLOPS的FP16算力(使用Tensor Core时可达近2000 TFLOPS)。H100的定价在2.5-4万美元之间,正因为如此昂贵,如何提升其利用率成为整个AI基础设施领域的核心问题。DiffusionGemma在同一张H100上实现5倍加速,本质上是将GPU利用率从不到10%提升到接近满载——这意味着同样的硬件投资能服务5倍的用户请求,直接影响云服务商的经济模型。
更重要的是,这份报告披露了不少此前业界未曾公开的工程细节:扩散模型不再是图像生成的专属,它正在为大语言模型的生成范式打开一条全新的路径。
自回归的瓶颈:为什么传统LLM那么慢
要理解DiffusionGemma的突破,首先得明白传统大模型为什么慢。
现代主流LLM采用的是**自回归(Autoregressive)**生成方式,即一个token一个token地按顺序往外吐。这里的token是大语言模型处理文本的基本单位,不等同于一个字或一个词。现代LLM通常使用BPE(Byte Pair Encoding)或SentencePiece等分词算法,将文本切分为子词单元。例如英文"unhappiness"可能被切为"un"+"happiness"两个token,中文一个汉字通常对应1-2个token。Gemma系列使用约25万词表的SentencePiece分词器。理解token概念对理解生成速度至关重要:1500 tokens/s大约相当于英文每秒生成1000-1200个单词,或中文每秒生成750-1000个汉字,已经远超人类阅读速度。
自回归生成就像在果树上按顺序摘果子:必须先看清前一个果子在哪儿,才能决定下一个往哪伸手。
问题在于,每生成一个token,模型都要把庞大的权重从显存(HBM)重新搬运到计算单元一次。这里的显存指的是HBM(High Bandwidth Memory,高带宽内存),是现代GPU如H100上使用的堆叠式DRAM。H100的HBM带宽约为3.35 TB/s,看似很快,但当模型权重动辄数十GB时,每次推理都要完整读取一遍权重,真正的计算量却很小。衡量这一瓶颈的核心指标是"算术强度"(Arithmetic Intensity),即每字节数据搬运所对应的浮点运算次数。自回归推理时batch size通常为1,每个token的生成只做一次矩阵-向量乘法,算术强度极低,GPU的数万个CUDA核心大部分时间处于空闲等待状态。这就是业界所说的"memory-bound"(内存带宽受限)问题——昂贵的显卡大部分时间都在"等待数据搬运",算力被严重浪费,这正是自回归推理效率低下的根本原因,也是为什么自回归模型在单用户场景下GPU利用率往往不到10%。

换个路数:整片并行去噪的生成机制
DiffusionGemma彻底换了一种思路。可以把它想象成一张有256个格子的草稿纸。
- 老办法:从第一格开始,写完一个才能写下一个,严格串行。
- DiffusionGemma:先把256个格子全部铺开,每格先随机放一个"乱字"(噪声),然后一轮一轮地整体检查。
要理解这一思路的来源,需要了解扩散模型从图像到文本的迁移历程。扩散模型最初在图像生成领域大放异彩,代表作包括2020年的DDPM(Denoising Diffusion Probabilistic Models)以及后来的Stable Diffusion和DALL·E系列。其核心思想是:先把干净数据逐步加噪直至变成纯随机噪声(前向过程),再训练一个神经网络学会逐步去噪还原(反向过程)。将这一范式迁移到离散文本领域面临的主要挑战是:图像像素是连续值,可以自然地加高斯噪声;而文本token是离散的,需要定义离散噪声过程(如随机替换为其他token或mask token)。
离散扩散模型的发展经历了几个关键里程碑:2021年Austin等人提出D3PM(Discrete Denoising Diffusion Probabilistic Models),首次定义了离散空间的前向噪声过程(包括均匀噪声、吸收态噪声等);2023年Sahoo等人的MDLM(Masked Diffusion Language Models)将掩码语言建模重新解释为连续时间扩散过程,建立了与BERT式训练的理论联系;同年Lou等人的SEDD(Score Entropy Discrete Diffusion)引入了离散空间的score函数概念。然而这些工作的模型规模通常不超过1B参数,在开放式文本生成质量上与GPT级别的自回归模型差距明显。DiffusionGemma通过复用26B预训练权重跳过了从零训练的成本瓶颈,首次在主流LLM规模上验证了扩散范式的可行性。
在每一轮迭代中,模型会同时审视256个位置,把其中置信度最高、犹豫最少的字先固定下来;而那些拿不准的位置,则重新打乱、混入噪声,留到下一轮再想。这种策略在学术上被称为"置信度解码"(Confidence-based Decoding)或"掩码调度"(Mask Scheduling)。具体来说,模型对每个位置输出一个概率分布,分布越尖锐(熵越低)表示模型越确定该位置应该是什么token。每轮结束后,系统按照熵从低到高排序,将最确定的若干位置"冻结",剩余位置重新注入噪声进入下一轮。这种机制本质上是一种自适应的生成顺序:简单的、上下文约束强的位置先被确定(如固定搭配、语法词),而需要更多全局信息才能决定的位置(如关键论点词、代码逻辑变量)被推迟到后续轮次处理,天然实现了从易到难的生成策略。
这种"整片同时改"的机制依赖双向注意力,让前后位置能够互相照应、反复修正——这也是它质量不掉的关键。传统自回归Transformer使用因果注意力(Causal Attention),通过一个下三角掩码确保每个位置只能看到它前面的token,保证了生成时的自左向右顺序性。而双向注意力则去掉了这个掩码,允许每个位置同时关注序列中所有其他位置——无论前后。这与BERT等编码器模型的注意力机制相同。在DiffusionGemma的去噪过程中,双向注意力至关重要:当模型需要决定某个位置应该填什么字时,它可以同时参考该位置前面和后面已经被固定的token,从而做出更协调、更连贯的预测。这种"全局视野"是扩散文本模型质量不输自回归的核心机制保障。它不再是排队写字,而是一次性锁定整片区域,逐轮逼近最终答案。
自适应停步机制:平均只需12轮
有人会问:既然要跑多轮,凭什么比逐字生成还快?
关键在于自适应停止机制。每次生成最多允许跑48步,但模型内置了"心里有谱就喊停"的判断逻辑。实测下来,一次完整生成平均只需约12轮,简单题目甚至更少。
由于每一步都在256个位置上并行填字,报告测出的平均每步生成token数达到19.74个,而自回归方法每步只能吐1个。近20倍的单步吞吐差距,正是5倍端到端加速的来源。为什么不是20倍而只有5倍?因为每一步的计算量比自回归的单步要大——256个位置的双向注意力计算量远超单个位置的因果注意力,但由于这些计算是矩阵-矩阵乘法(而非矩阵-向量乘法),算术强度大幅提升,GPU的计算单元终于能被充分利用,从memory-bound变为compute-bound,这才是真正的效率提升根源。
在高性能计算中,一个计算任务要么受限于计算能力(compute-bound),要么受限于数据搬运带宽(memory-bound)。GPU设计时算力和带宽有一个比值,称为"屋顶线"(Roofline)——H100的屋顶线约为300 FLOPS/Byte。只有当算术强度超过这个阈值时,GPU才能发挥全部算力。自回归推理的算术强度约为1-2 FLOPS/Byte,远低于屋顶线,因此GPU超过99%的算力都在空转。DiffusionGemma通过并行处理256个位置,将矩阵-向量乘法变为矩阵-矩阵乘法,算术强度提升约256倍,成功突破屋顶线进入compute-bound区域。这也解释了为什么batch推理(同时处理多个用户请求)也能提升GPU利用率——本质上是同一个原理。
训练路线:站在Gemma模型肩膀上

为什么这么好的路子以前没人做?答案很现实:从零训练一个如此规模的扩散语言模型,成本高得吓人,没人敢白手起家。
DiffusionGemma的做法非常"贼"——它不从零开始,而是直接复用现成的Gemma系列(约26B)模型权重,通过两步改造完成转换:
第一步:监督微调(SFT)
教这个原本只会"从左往右吐字"的模型,学会"看一整片乱码并往里填正确的字"。具体来说,就是把原来使用因果注意力掩码的Transformer改为使用双向注意力,并在训练数据中构造"带噪声的输入→干净的输出"配对,让模型学会去噪任务。这一步的成本不到原模型训练总开销的10%,极大降低了门槛。之所以成本如此低,是因为模型的大部分知识(世界知识、语言理解能力)已经在预训练阶段学会了,SFT只需要教它一种新的"读题方式"——从看前文预测下一个字,变成看整片带噪文本预测所有被遮盖的字。
第二步:采样器蒸馏与强化学习

第二步更为精巧,它把"提升答案质量"和"压缩生成步数"两件事塞进同一个目标函数里一起训练:
-
质量靠强化学习(RL)提升。这延续了RLHF(Reinforcement Learning from Human Feedback)以来的技术路线,但在DiffusionGemma的场景中有所不同:由于生成过程是多步去噪而非逐token采样,奖励信号需要作用于整个去噪轨迹。报告将质量奖励与步数惩罚统一到同一个目标函数中,本质上是一个多目标优化问题——模型需要在"写得准"和"写得快"之间找到帕累托最优点。这种将效率约束直接编码进训练目标的做法,在传统自回归RL微调中几乎没有先例。
-
步数靠蒸馏压缩:让一个"慢慢改、写得很准"的教师模型先生成,再让学生模型学着"少改几步、写得差不多准",模仿到最后自己也能又快又稳。知识蒸馏(Knowledge Distillation)最早由Hinton等人在2015年提出,核心思想是让小模型模仿大模型的输出分布。在这里,蒸馏被创造性地用于"步数压缩":教师模型使用较多的去噪步数(如48步)生成高质量结果,学生模型则被训练为用更少的步数(如12步)达到相近的输出质量。具体做法是让学生在每一步的输出分布尽可能接近教师在对应阶段的输出分布,从而将教师"慢工出细活"的知识压缩进学生的"快速粗修"过程中。这种思路在图像扩散模型中已有先例(如Progressive Distillation、Consistency Models),但在26B参数规模的语言模型上成功应用,DiffusionGemma是开创性的。
报告特别指出,不能一开始就追求快。如果直接压步数,模型容易陷入死循环,反复生成重复字符出不来。只有先练准、再练快,才能避免卡壳——报告中给出的对比示例证明,只做第一步的版本碰上难题就会卡死,第二步之后才能顺利完成。
涌现的简洁性:更短更精炼的输出
一个有趣的副产品是报告中称之为"涌现的简洁性(Emergent Conciseness)"的现象:模型不仅学会了快,还学会了少说废话。它生成的文本比自回归方法短了约一半——本来30个字才说清的事,15个字就搞定,进一步节省了时间。
这一现象的出现可能与训练目标的设计有关:当步数惩罚被纳入目标函数后,模型发现生成更短的文本能减少总步数、获得更高奖励。这相当于模型自发学会了"能不说的就不说"——一种在信息论意义上更高效的表达方式。这个发现对实际应用有重要意义:在API调用按token计费的商业模式下,输出减半意味着用户成本直接减半,同时信息密度反而更高。
质量基准测试:速度快且准确率不降

速度快,是不是拿准确率换来的?报告用数据回应了这个疑问。
在两个公认较硬的评测上——GPQA Diamond(研究生水平科学问答)和 LiveCodeBench V6(新版代码题)——DiffusionGemma的平均得分与自回归基线基本持平,差距仅几分。GPQA(Graduate-Level Google-Proof Q&A)Diamond是由纽约大学等机构于2023年推出的高难度问答基准,包含物理、化学、生物等领域的研究生水平问题,即使是相关领域的博士生准确率也仅约65%,而非专业人士几乎无法通过搜索引擎获得答案。LiveCodeBench则是一个持续更新的代码生成评测集,V6版本包含2024年下半年新出现的编程题目,确保模型未在训练数据中见过这些题目,有效防止数据污染。这两个基准分别代表了"深度推理"和"代码生成"两大实用能力维度,是当前LLM评测中公认难度较高、区分度较好的测试集。
报告绘制的"速度-准确率"帕累托前沿图中,DiffusionGemma稳居右上角:别的模型要么在它左边(没它快),要么在它下边(没它准)。
帕累托前沿(Pareto Frontier)是多目标优化中的核心概念,指的是在多个相互冲突的目标之间,不存在任何方案能同时在所有目标上优于它的那组解。在LLM评测语境中,横轴通常是生成速度(tokens/s),纵轴是任务准确率。一个模型处于帕累托前沿意味着:要想在速度上超过它,必须牺牲准确率;反之亦然。DiffusionGemma"稳居右上角"意味着它在速度和质量两个维度上同时优于或持平于其他方案,这在技术评测中是非常强的声明——它不是简单地"用质量换速度",而是通过范式创新将整条前沿向右上方推移。
Apache 2.0开源协议:社区可自由商用
这份报告最具产业价值的一点,是它的权重按Apache 2.0宽松协议开放,任何人都可以下载、微调、商用。
这意味着的不是"被抄袭",而是"接着造"。报告举了一个数独的例子:用LoRA这种轻量微调方法调整后,原本解不开数独的模型能在10步之内填对九宫格,正确率达80%。LoRA(Low-Rank Adaptation)是由微软研究院Edward Hu等人在2021年提出的参数高效微调方法,其核心思想是大模型微调时权重的变化量通常是低秩的,因此不需要更新全部参数,只需在原始权重矩阵旁边插入两个小矩阵(秩通常为4-64),训练时只更新这两个小矩阵,参数量仅为原模型的0.1%-1%。对于DiffusionGemma这样的26B模型,全量微调需要数百GB显存和大量算力,而LoRA可以在单张消费级GPU上完成特定任务的适配。数独例子的成功还暗示扩散范式在约束满足类推理任务上可能具有天然优势——因为去噪过程本身就是一个逐步满足约束的过程。
此外,已经有人基于它开发多语种语音转文字应用,还有团队用它在医院辅助撰写放射科报告。小公司和研究者,都能低成本地在此基础上打造自己的产品。
结语:大语言模型生成的另一条道路
DiffusionGemma传递的核心信息可以概括为三点:
- 快,不是因为它更聪明,而是因为它一次性处理一整片,用并行去噪替代串行生成;
- 准,不是因为它突然长了本事,而是双向注意力让前后位置互相照应,改完还能再改;
- 开放,不是因为谷歌大方,而是Apache 2.0让整个社区都能拉下来自己改进。
当然,报告第十节也如实列出了若干已知限制,扩散范式相较自回归基线在某些场景仍有取舍。但它真正证明的一件事是:大语言模型的生成,并非只有自回归这一条路。当有人第一次尝试"同时盯住整片",就看见了另一整片林子——一条与旧路完全不在同一方向上的新道路。
相关推荐

OverMCP:透明竞价+真实点击,重新定义开发者产品曝光
OverMCP是一个面向开发者的透明产品竞价市场,通过真实点击追踪和公开竞价机制,帮助Builder获得公平曝光。本文深度解析其核心机制、创新价值与现实挑战。

grill-me:写代码前让AI拷问你45分钟,省下无数返工
grill-me是一个现象级开源技能,让AI像面试官一样在编码前拷问你的技术方案。本文详解其工作机制、四阶段拷问流程、安装方法与最佳实践,帮你把返工成本前置为思考成本。

PaymentKit:多支付商路由账单平台,支付商宕机也能持续收款
PaymentKit 是面向 SaaS 和电商的多支付商账单平台,通过跨处理商智能路由和独立令牌保管库,确保支付通道中断时账单依然运转。本文深度解析其核心能力、产品哲学与差异化定位。