[控场AI]
模型DeepSpark / DeepSeek投机解码算法

DSpark

DeepSeek发布的投机解码算法,针对MLA(Multi-head Latent Attention)架构特点进行工程优化,设计专用草稿策略,已合并入vLLM主干,支持Qwen3和Gemma系列模型

时间轴 (近 90 天)

9月12日

DFlash和DSpark在草稿生成效率和硬件适配上做了针对性优化,在特定模型和工作负载下可能反超经典方案

待验证50%
9月12日

vLLM v0.28.0 在推测解码领域引入了 DFlash2 以及 DSpark 置信度调度验证(confidence-scheduled verification)

待验证50%
9月11日

DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果

待验证50%
9月11日

Q8主模型占用162GB导致drafter无法装入统一内存,DSpark加速失效,将三层MoE专家放回CPU后输出仅从22.87提升到23.49 token/秒(快2.7%),prefill从95.38降至76.65

待验证50%

全部知识事实 (4)

来源文章