MTP
一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近
核心事实
时间轴 (近 90 天)
MTP(多 token 预测)是 Qwen3 内置的投机解码变体,利用模型自身多头输出预测后续多个位置,无需额外草稿模型
本次使用的推理框架不支持MTP相关推测批次,开启MTP会直接报错
本次测试未使用任何推测解码方法或MTP
Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高
Hybrid HiSparse 与 vLLM 的前缀缓存、OffloadingConnector、P/D 分离导入以及 MTP 等现有功能保持兼容
MTP是Qwen3系列原生支持的特性,需要推理框架侧相应支持才能激活
GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置
MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭
MTP在几乎所有主流推理工具中默认处于关闭状态
Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置
还有 26 条时间轴事件
全部知识事实 (20)
MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量
75%已验证MTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速
75%已验证Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力
65%待验证Qwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型
85%部分验证MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次
75%部分验证多 Token 预测(MTP)是 Meta 在 2024 年提出的训练与推理加速技术,并在 DeepSeek-V3 等模型中应用
75%待验证MTP技术可以将推理速度提升约2倍
70%待验证DeepSeek早在V3版本就引入了MTP技术
60%待验证MTP(多 token 预测)是 Qwen3 内置的投机解码变体,利用模型自身多头输出预测后续多个位置,无需额外草稿模型
50%待验证本次使用的推理框架不支持MTP相关推测批次,开启MTP会直接报错
50%待验证本次测试未使用任何推测解码方法或MTP
50%待验证Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高
50%待验证Hybrid HiSparse 与 vLLM 的前缀缓存、OffloadingConnector、P/D 分离导入以及 MTP 等现有功能保持兼容
50%待验证MTP是Qwen3系列原生支持的特性,需要推理框架侧相应支持才能激活
50%待验证GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置
50%待验证MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭
50%待验证MTP在几乎所有主流推理工具中默认处于关闭状态
50%待验证Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置
50%待验证Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s
50%待验证吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化
50%