待验证50% 置信基准精确时间
在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/25
首次发现
有效期至:2026/11/23
来源
涉及实体
相关事实
待验证RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB78% 相似待验证对于RTX 4090(24GB显存),WhichLLM可能会推荐Qwen3.6 27B的Q5量化版本,预计推理速度约为每秒27 Token77% 相似待验证RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s76% 相似待验证Qwythos-9B在Q8量化版本下Token输出速度达到每秒75个左右76% 相似待验证Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/798209API
curl https://kongchang.com/api/v1/knowledge/claims/798209MCP
get_claim(id=798209)