一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近
GLM-5.2 对 MTP 层(Multi-Token Prediction)的改进将投机解码的接受长度最高提升了 20%
MTP技术可以将推理速度提升约2倍
Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力