模型DeepSpark / DeepSeek投机解码算法
DSpark
DeepSeek发布的投机解码算法,针对MLA(Multi-head Latent Attention)架构特点进行工程优化,设计专用草稿策略,已合并入vLLM主干,支持Qwen3和Gemma系列模型
时间轴 (近 90 天)
9月12日
DFlash和DSpark在草稿生成效率和硬件适配上做了针对性优化,在特定模型和工作负载下可能反超经典方案
待验证50%
9月12日
vLLM v0.28.0 在推测解码领域引入了 DFlash2 以及 DSpark 置信度调度验证(confidence-scheduled verification)
待验证50%
9月11日
DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果
待验证50%
9月11日
Q8主模型占用162GB导致drafter无法装入统一内存,DSpark加速失效,将三层MoE专家放回CPU后输出仅从22.87提升到23.49 token/秒(快2.7%),prefill从95.38降至76.65
待验证50%
全部知识事实 (4)
待验证
DFlash和DSpark在草稿生成效率和硬件适配上做了针对性优化,在特定模型和工作负载下可能反超经典方案
50%待验证vLLM v0.28.0 在推测解码领域引入了 DFlash2 以及 DSpark 置信度调度验证(confidence-scheduled verification)
50%待验证DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果
50%待验证Q8主模型占用162GB导致drafter无法装入统一内存,DSpark加速失效,将三层MoE专家放回CPU后输出仅从22.87提升到23.49 token/秒(快2.7%),prefill从95.38降至76.65
50%