[控场AI]
概念Multi-Token Prediction / 多Token预测

MTP

一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近

核心事实

时间轴 (近 90 天)

9月16日

MTP(多 token 预测)是 Qwen3 内置的投机解码变体,利用模型自身多头输出预测后续多个位置,无需额外草稿模型

待验证50%
9月16日

本次使用的推理框架不支持MTP相关推测批次,开启MTP会直接报错

待验证50%
9月16日

本次测试未使用任何推测解码方法或MTP

待验证50%
9月16日

Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高

待验证50%
9月15日

Hybrid HiSparse 与 vLLM 的前缀缓存、OffloadingConnector、P/D 分离导入以及 MTP 等现有功能保持兼容

待验证50%
9月13日

MTP是Qwen3系列原生支持的特性,需要推理框架侧相应支持才能激活

待验证50%
9月12日

GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置

待验证50%
9月11日

MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭

待验证50%
9月10日

MTP在几乎所有主流推理工具中默认处于关闭状态

待验证50%
9月10日

Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置

待验证50%

还有 26 条时间轴事件

全部知识事实 (20)

已验证

MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量

75%
已验证

MTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速

75%
已验证

Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力

65%
待验证

Qwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型

85%
部分验证

MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次

75%
部分验证

多 Token 预测(MTP)是 Meta 在 2024 年提出的训练与推理加速技术,并在 DeepSeek-V3 等模型中应用

75%
待验证

MTP技术可以将推理速度提升约2倍

70%
待验证

DeepSeek早在V3版本就引入了MTP技术

60%
待验证

MTP(多 token 预测)是 Qwen3 内置的投机解码变体,利用模型自身多头输出预测后续多个位置,无需额外草稿模型

50%
待验证

本次使用的推理框架不支持MTP相关推测批次,开启MTP会直接报错

50%
待验证

本次测试未使用任何推测解码方法或MTP

50%
待验证

Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高

50%
待验证

Hybrid HiSparse 与 vLLM 的前缀缓存、OffloadingConnector、P/D 分离导入以及 MTP 等现有功能保持兼容

50%
待验证

MTP是Qwen3系列原生支持的特性,需要推理框架侧相应支持才能激活

50%
待验证

GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置

50%
待验证

MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭

50%
待验证

MTP在几乎所有主流推理工具中默认处于关闭状态

50%
待验证

Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置

50%
待验证

Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s

50%
待验证

吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化

50%

来源文章