DeepSeek推理提速85%:投机解码如何重塑AI速度竞赛

一场关于"下注"的推理革命
想象一下,在 DeepSeek 的服务器内部有一座赌场。每当你向它的 AI 提出一个问题,"庄家"就会对你即将看到的下一个词下最多五个注。而就在近期,DeepSeek 公布了让"庄家"稳赢的精确数学公式——这让全球最便宜的前沿 AI 推理速度暴涨了最多 85%。
关键在于:模型没变,GPU 没变,答案在数学上完全等价,连概率分布都一模一样。没有任何东西变得更聪明,它们只是学会了"何时下注"。
本文基于 DeepSeek 与北京大学联合发表、创始人梁文锋位列作者名单的论文《DS Spark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》。这不是泄露或传言,PDF 就躺在他们的开源仓库里。
为什么大模型这么"慢"
像 DeepSeek V4 Pro 这样的巨兽拥有 1.6 万亿参数,但它每次只能吐出一个 token。
什么是 Token 与前向传播?
「Token」是大语言模型处理文本的基本单位,通常对应一个词、一个词根或一个标点符号。以 GPT 系列常用的 BPE(Byte-Pair Encoding)分词器为例,「推理」可能被拆分为两个 token,而「AI」通常是一个 token。「前向传播」(Forward Pass)则是神经网络从输入到输出的完整计算过程:数据依次流经嵌入层、数十乃至数百层 Transformer 注意力块,最终输出下一个 token 的概率分布。对于拥有千亿参数的模型,单次前向传播就需要数以万亿计的浮点运算。自回归生成模式意味着每个 token 都需要独立触发一次完整的前向传播,这是大模型推理延迟的根本来源,也是投机解码试图规避的核心约束。
生成一个词片段就要完整地跑一遍前向传播,10000 个 token 就意味着 10000 次往返。荒谬的是,在每一次往返中,那些庞大的 GPU 大部分时间都在"等待"——这背后有深刻的硬件原因。
内存带宽:真正的瓶颈所在
大模型推理速度慢的根本原因在于「内存带宽瓶颈」(Memory Bandwidth Bottleneck)。现代 GPU 拥有强大的浮点计算能力,但在自回归推理阶段,每生成一个 token 都需要将模型的全部权重从显存(HBM)加载到计算核心,而权重读取速度受限于内存带宽而非算力本身。这种状态被称为「内存密集型」(Memory-Bound)操作,GPU 的计算单元大部分时间都在等待数据传输,利用率极低。以 DeepSeek V4 Pro 的 1.6 万亿参数为例,仅存储权重就需要数 TB 级别的显存,每次前向传播都要完整读取一遍。这正是投机解码得以提速的物理基础:批量验证多个 token 时,权重只需加载一次,分摊了带宽成本,使 GPU 的实际利用率大幅提升。
就像坐拥超级赌场,却一次只让一位客人进门。
现代 AI 的整个推理速度问题,可以浓缩成一行数学公式:
延迟 = (起草时间 + 验证时间) ÷ 每轮被接受的 token 数
你听过的每一个加速技巧,本质上都是在拉动这三个杠杆中的某一个。
投机解码:小赌徒与大庄家
为了解决推理速度问题,业界发明了一个漂亮的技巧——投机解码(Speculative Decoding)。与其让大模型逐字书写,不如雇一个又小又快的"赌徒"(草稿模型)提前下注:"我赌接下来五个 token 是……" 然后大模型这个"庄家"在一次前向传播中同时核验这五个注。一次往返顶五次。
每个下对的注都兑现;在第一个错误的注上,庄家扫掉那个筹码及其之后的所有筹码。这里最容易被误解的一点是:这不是近似。
数学等价性的严格保证
投机解码最反直觉的特性在于其「数学无损性」——它不是一种近似算法,而是一种严格等价的加速方案。这一保证来自 2023 年 Google DeepMind 论文中提出的「拒绝采样校正」机制。具体来说,当草稿模型提出的 token 被大模型拒绝时,系统并不直接跳过,而是按照大模型与草稿模型概率分布之差进行重采样,从而精确补偿草稿模型引入的分布偏差。最终输出的 token 序列,在统计意义上与原始大模型独立自回归采样的结果完全一致。这一性质至关重要:它意味着投机解码可以无缝替换现有推理栈,无需重新评估模型安全性或对齐特性,部署风险极低,这也是工业界迅速跟进的重要原因之一。
接受规则在数学上严格保留了大模型的精确输出分布。同样的检查点,同样的答案,唯一改变的只有速度。

两种"破碎"的赌徒
但问题在于,市面上存在两种赌徒,而两者都有缺陷:
- 谨慎的赌徒(自回归起草):如 Eagle 3。它下一个注、看一眼、再下一个注。下注彼此建立在前一个之上,因此质量很高——但下注时间随筹码增加而增长,被迫只能保持又小又浅。
- 鲁莽的赌徒(并行起草):如 DeepSeek 自家的 D-Flash。一把甩下所有筹码,速度极快,因为起草成本低,它还能负担更深的"大脑"。但它的每个注彼此看不见对方。
第二种赌徒的致命伤被论文称为"多模态碰撞(multimodal collision)"。假设一句话可以有两种结尾,两个各自有效的答案被混合成了乱码。这导致靠后的下注质量快速衰减——在聊天场景中,接受率会从块首的 72% 一路滑落到块尾的 63%。庄家吃掉了这部分损失。

DS Spark 的三张王牌
第一张牌:混合赌徒与"马尔可夫头"
DeepSeek 的第一步是造一个混合赌徒:保留鲁莽赌徒又深又并行的大脑(一次前向传播、所有筹码齐发),但额外加装一个极小的顺序"耳语"——论文将其称为 Markov head。当筹码从左到右落下时,每个注都会受到前一个注的轻推,碰撞就此消失。
低秩分解与马尔可夫假设的工程含义
DS Spark 的 Markov head 采用「Rank 256 低秩矩阵」实现顺序条件依赖,这一设计借鉴了 LoRA(Low-Rank Adaptation)等参数高效微调领域的核心思想。低秩分解的直觉是:高维空间中的复杂映射,往往可以被分解为两个小矩阵的乘积来近似,在大幅降低参数量的同时保留主要信息。「马尔可夫」一词来自数学家安德烈·马尔可夫,马尔可夫假设指当前状态只依赖于前一状态,而非完整历史——这正是 Markov head 的工作方式:第 k 个草稿 token 只需「看」第 k-1 个,而非重跑完整的注意力机制。这种一阶依赖足以消除「多模态碰撞」,又将额外计算开销压缩在 1% 量级以内,体现了工程上以最小代价解决核心问题的精确取舍。
而这个"耳语"几乎是免费的:它是一个 Rank 256 的低秩查找表,是"口袋笔记本"而非"第二个大脑"。数据相当惊人——混合方案在数学任务上以 93% 的接受率开局,并全程保持高位。两层的 DS Spark 起草器击败了五层的 D-Flash,"耳语"只增加了 0.2%~1.3% 的延迟,却换来最多 30% 更长的接受序列。在 DeepSeek 的离线测试中,DS Spark 比 Eagle 3 快约 30%,比自家旧并行起草器快约 18%。
第二张牌:作为"赔率员"的置信度头
区分赌徒与赌场的,是"知道赔率"。DS Spark 引入了一个"赔率员"——置信度头(confidence head)。每个筹码落桌时都会被标注一个概率分数:在此前所有注都存活的前提下,这个注能通过庄家核验的概率。0.93 留下、0.81 留下、0.22 立刻扫掉,不浪费庄家时间。
但神经网络长期存在"过度自信"的毛病。
为什么神经网络需要校准?
神经网络的「过度自信」(Overconfidence)问题由来已久:模型输出的 softmax 概率往往高估自身准确率,一个声称 95% 置信度的预测,实际准确率可能只有 70%。「温度缩放」(Temperature Scaling)是校准领域最简洁有效的后处理方法:在 softmax 之前将 logits 除以一个标量温度 T,T > 1 时概率分布变平(降低置信度),T < 1 时分布变尖。关键在于,这个操作不改变 argmax 结果,即不影响模型的预测排名,却能大幅改善概率的可靠性。DS Spark 的「顺序温度缩放」是其变体——对草稿序列的每个位置学习一个独立的温度值,因为靠后的 token 天然更不确定,需要更激进的压缩。校准后的置信度分数才能成为调度器可信赖的「赔率」,整个系统的决策质量因此大幅提升。
为此,DeepSeek 采用**顺序温度缩放(sequential temperature scaling)**逐位置校准赔率员,直到标注的赔率与现实吻合,校准误差从高达 8% 降到约 1%。在聊天这一最混乱的负载上,剪除低置信度筹码将接受率从 45.7% 拉升到了 95.7%。
第三张牌:几乎无人报道的"堂口经理"
这是这篇论文最精彩、也最被忽视的部分。单张牌桌的赔率毫无意义,你必须看整个赌场大厅。
批处理推理:为什么"大厅人数"至关重要
「批处理」(Batching)是 GPU 推理系统提升吞吐的核心手段。GPU 的并行架构天然适合同时处理多个请求:将若干用户的输入拼成一个批次,单次前向传播就能同时生成多个答案,硬件利用率显著提升。然而,投机解码在批处理场景下引入了新的复杂性:不同用户请求的草稿接受率各不相同,如果统一为所有请求生成相同数量的草稿 token,高置信度请求的算力就会被低置信度请求「拖慢」。DS Spark 的硬件感知调度器正是针对这一问题设计的——它在全局层面动态分配草稿预算,本质上是在解决一个实时资源分配优化问题。这类「连续批处理」(Continuous Batching)与投机解码的协同优化,是当前 LLM 推理工程的核心前沿,也是 vLLM、TensorRT-LLM 等框架持续演进的主战场。
真实的服务系统不是一个用户,而是数百个请求同时共享同一批 GPU。只有当大厅空着时,多核验一个筹码才是免费的;当大厅爆满时,庄家每多查一个筹码,都在从另一位付费客人那里偷走算力。

于是 DS Spark 引入了"堂口经理"——硬件感知的前缀调度器。它在启动时把真实硬件性能剖析成一张成本表,然后每一轮从大厅所有牌桌抽出所有筹码,按存活赔率全局排序,逐个准入,直到整个大厅的预期收益不再上升为止。空厅时,每位客人放行四五六个筹码;满厅时,只保留最稳的注,预算自动收紧。旧系统 MTP-1 被硬编码为固定的两个筹码,而现在"庄家"会随人流动态调整。
一个体现工程严谨性的细节:在生产速度下,调度器甚至等不及当前步的置信度分数(那会阻塞 GPU 流水线),所以它用两步之前的预测来调度。而正是这种延迟保证了数学无损——准入决策永远不会偷看它正在准入的那个 token,这是一道"因果防火墙"。
真实收益与开源的边界
庄家究竟赢了多少
以下是 DeepSeek 在真实用户流量上对比自家旧基线的生产数据:
- V4 Flash(2840 亿参数主力):相同总吞吐下,单用户生成速度快 60%~85%
- V4 Pro(1.6 万亿参数旗舰):快 57%~78%
- 在中等延迟目标下,每 GPU 总吞吐提升约 51%
至于坊间流传的 661% 数字,诚实的版本是:它只出现在一个严苛的速度档位上,那里旧基线基本已经崩溃、几乎撑不住一个批次。它不是通用倍率,真正的含义是"过去根本不存在的速度档位,现在存在了"——前沿被推移了。同时补充一点,目前尚无 DeepSeek 之外的第三方独立复现这些服务数据,对任何实验室的发布都应保持这条审慎原则。
开源新范式:给算法,留赌场

DeepSeek 开源了名为 DeepSpec 的仓库,MIT 许可,发布首周就收获数千 star。它是一套完整的草稿模型训练与评估栈,包含 DS Spark、旧版 D-Flash 和作为基线的 Eagle 3,附带 Open Qwen 和 Gemma 的训练检查点,NVIDIA 几天内就发布了官方训练配方,还能通过一个 speculative config 标志直接接入 vLLM。
但仔细看小字:支撑那 60%~85% 提速的 V4 生产级草稿器和定制服务内核,并不在盒子里。你可以复现离线科学,却无法克隆他们的赌场。
「战略性开源」的商业逻辑
DeepSeek 的「给算法、留赌场」开源模式,是近年科技公司在 AI 领域普遍采用的「战略性开源」(Strategic Open Source)策略的典型案例。其商业逻辑在于:开放论文和基础代码可以快速建立技术信誉、吸引顶尖研究者、加速生态繁荣(如 NVIDIA 官方支持、vLLM 集成),这些外溢效应带来的品牌价值远超代码本身;而真正构成护城河的,是定制化的生产级推理内核、针对自研硬件集群深度调优的算子库、以及数月积累的线上流量调度经验。这些「隐性资产」无法通过开源代码复现。类似模式在历史上也有先例:谷歌开源了 MapReduce 论文,但其 GFS 集群的实际工程实现从未公开;Meta 开放了 LLaMA 权重,但其内部推理基础设施依然是黑盒。开源成为技术领先者建立行业标准、同时维持竞争壁垒的双赢工具。
这就是新的开源潜规则——DeepSeek 送出算法,留住大厅。
AI速度竞赛:战局正在悄然改变
退一步看,这才是真正的故事。AI 竞赛的游戏规则正在改变:曾经比拼的是"谁的模型最聪明",而现在比拼的是"谁能用每一美元的硅片,最快地把智能送达最多的人"。
DeepSeek V4 Pro 版输出定价约每百万 token 1.70 美元,大约是 GPT-5.5 输出费率的 1/17,甚至像电力公司一样引入了峰谷定价机制。推理速度正是这一切的底层逻辑——DS Spark 让每块 GPU 服务更多用户,闲置算力就能转化为折扣。而对于整天燃烧 token 的 AI Agent 而言,推理速度直接就是你的利润率。
所以留给你的思考视角是:下次任何实验室宣称"我们的 AI 变快了",请只问一个问题——是大脑变了,还是赌场变聪明了? 从现在起,你将永远能分辨两者的区别。
核心要点
相关推荐

SlopCodeBench:AI代码基准测试为何正在失效
SlopCodeBench项目引发对AI编程评测体系的深度反思。从基准污染到通过率陷阱,探讨为何现有代码基准无法衡量真实代码质量,以及开发者如何建立更有效的评测方法。

AI科研自动化:更像数据清洗而非发明Transformer
AI科研自动化的真正方向是什么?本文分析为何自动化AI研究更像数据清洗而非发明Transformer,探讨科研中60%-80%重复性工作的自动化价值,以及人机协作如何重塑AI研究范式。

Gemini 3.5 Flash-Lite发布:最小最快模型反超Gemini 3
谷歌发布Gemini 3.5 Flash-Lite轻量级AI模型,体积最小速度最快,却在多数场景下超越Gemini 3。本文解析其核心优势、成本优势及对开发者的实际影响。