待验证60% 置信事实时间未知
RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Qwen3.6 MTP加速实测:单GPU推理飙到220 token/s
bilibili普通鱼学家呀
涉及实体
相关事实
待验证Qwen3.6 35B模型借助MTP技术在oMLX上达到了86.7 tokens/s的生成速度,prompt处理速度为1735 tokens/s85% 相似待验证千问3.6 27B FP8模型开启MTP后正常速度约38 token/s,平均测速可达70 token/s以上78% 相似待验证在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低76% 相似待验证在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒76% 相似待验证RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18058API
curl https://kongchang.com/api/v1/knowledge/claims/18058MCP
get_claim(id=18058)