DSpark:DeepSeek联合北大开源推理加速技术,速度提升最高85%

DSpark是什么:不改模型,只提速
DeepSeek近日联合北京大学开源了一项推理加速技术——DSpark。同时放出的还有两个增强版模型权重(DeepSeek V4 Flash DSpark 与 DeepSeek V4 Pro DSpark),以及配套的开源框架 DSpec。
需要首先厘清的一点是:DSpark 不是一个新模型。模型本身的能力没有任何改变,它更像是挂在 V4 上的一个"加速插件",专门让大模型生成文字的速度更快。用一个形象的比喻——大脑还是同一个大脑,只是嘴皮子变利索了。
官方给出的核心数字是:在同样的服务压力下,单个用户拿到回答的速度,比上一代方案快了 57% 到 85%。要理解这个提速从何而来,得先搞清楚大模型为什么慢。
大模型推理为什么慢:搬运比计算更耗时
大模型生成文字是"一个字一个字往外蹦"的,专业说法叫自回归。它先算出下一个字,接到已有句子后面,然后再算下一个字,如此循环。
问题在于,每蹦出一个字,它都要把整个模型——成百上千亿个参数——从显存里完整地搬运一遍。这里的关键认知是:慢的真正原因不是算力不够,而是这个搬运太费时间。
搬一趟的成本是固定的,可你只换来了一个字。这就好比每次只为取一件东西,就把整个仓库从头翻一遍,搬运的功夫远远大于真正干活的功夫。结果就是,显卡上昂贵的计算单元,大部分时间其实是在干等数据。

推测解码:一趟搬运换多个字
既然搬运一趟只换一个字太不划算,那能不能一趟搬运多换几个字?这就是**推测解码(Speculative Decoding)**的核心思路,也是 DSpark 推理加速的底层逻辑。
具体做法是:一个又小又快的"草稿模型"一口气把接下来的好几个字都猜出来,然后让完整的大模型一次性把这几个候选字同时检查一遍。从头开始,连续猜对的部分全部采纳,从第一个猜错的地方往后全部作废。
这里有两个关键点:
- 检查成本≈生成成本:对大模型来说,检查一串字和生成一个字花的力气差不多,都是搬运一趟、算一次。所以一次能放行好几个字,就是净赚。
- 输出质量不变:因为最终拍板的还是大模型,它只接受自己本来就认可的字。最后的输出,和一个字一个字老实生成的结果完全一致,只是更快了。

打个比方:草稿员刷刷写出后面几个字,审稿员一眼扫过去,对的一次性放行,从第一个错字开始往后画掉。这比审稿员从头写要快得多,整体速度就上来了。
老大难问题:高并发下容易翻车
推测解码听起来很美,却有个绕不开的痛点:它在单人使用、机器不忙时效果出色,可一旦很多人同时访问(高并发),就容易适得其反。
原因是,检查候选字本身也要占用显卡算力。当机器已经满载,那些排在后面、大概率会被否决的字,会白白吃掉宝贵的算力,挤占本该服务其他用户的资源,算下来反而可能更慢。
DeepSeek 之前线上用的方案叫 MTP,一次稳妥地猜一个字,但提速有限。DSpark 要解决的,正是如何在多人同时使用的真实生产环境里,做到"既猜得多、又不添乱"。
DSpark的三个核心设计
设计一:半自回归草稿模型
猜字有两个极端。纯并行地猜——几个字同时生成,速度快,但这几个字互相不参考彼此,容易前言不搭后语,被采纳的少;纯串行地猜——一个接一个,准确率高,但速度又慢下去了。
DSpark 走中间路线,分两步:先用一个并行的主干网络,一口气把所有候选位置的草稿都铺出来,这一步很快;再用一个轻量的顺序小模块,逐个给这些字补上上下文依赖,让同一批字之间能互相"通个气"。这样既保住了并行的快,又比纯并行猜得更准,最终被采纳的字更多。

设计二:置信度评分机制
草稿模型在生成每个候选字时,会额外打一个分,预测该字最终能被大模型采纳的概率。这样系统就能清楚地知道:哪些字有把握,哪些字大概率会被否掉,从而为后续的算力调度提供数据依据。
设计三:感知负载的自适应调度器
这是 DSpark 解决高并发难题的关键。调度器会实时感知显卡当前的负载状态,动态决定每个请求应该验证多长的候选序列,并优先把大模型的算力分配给那些置信度最高的字。
简单说就是:显卡空闲时,多猜几个、多放几个;显卡繁忙时,少猜几个、不添乱。正是这套自适应负载的机制,让 DSpark 在高并发场景下也能稳定实现推理提速。
效果如何:多项实测对比数据
官方核心数据显示:相比之前线上的 MTP 方案,在同等吞吐压力下,单用户的生成速度提升了 57% 到 85%。
在以千问三系列模型为基准的公开对比测试中:
- DSpark 平均每次能采纳的字数,比业界常用的 EAGLE-3 高出约 30.9%;
- 比 DeepSeek 自家上一代方案 DFlash 高出约 16.3%;
- 整体推理速度提升接近 80%。

值得再次强调的是:整个加速过程中,模型本身的能力丝毫未变,纯粹是推理引擎层面的工程优化。目前 DSpark 已部署在 DeepSeek V4 Flash 和 V4 Pro 的预览版上。
这次开源了什么:DSpec框架详解
本次开源内容相当丰富,主要包含两部分:
第一,两个增强版模型权重——DeepSeek V4 Flash DSpark 和 DeepSeek V4 Pro DSpark。本质是原来的基座模型加上预装好的 DSpark 模块,已发布至 Hugging Face。
第二,DSpec 全栈开源框架,托管于 GitHub。可以把它理解成一个专门生产草稿模型的工具箱:内置 DSpark、DFlash 和 EAGLE-3 三种推测解码方案的训练代码、评测脚本和现成权重,方便研究者横向对比、复现,乃至训练自己的推理加速模块。目标模型目前支持千问三和 Gemma 系列。
总结
一句话概括本次更新:DSpark 是让 DeepSeek V4 嘴皮子更利索的推理加速插件,DSpec 则是把这套提速方法完整开源出来的工具箱,背后是 DeepSeek 与北京大学的联合研究成果。
它的价值不仅在于 57%~85% 的速度提升,更在于把"高并发下的推测解码"这一工程难题的完整解法公开出来。对于关注大模型推理效率的开发者和企业而言,这套自适应负载调度的思路,以及三方案横向对比的工具箱,具备很高的复现与借鉴价值。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。