待验证75% 置信事实时间未知
使用Gemma 4 2B版本本地运行Codex时,处理速度大约每秒30到40个Token
1
来源数
75%
置信度
长期有效
时效性
2026/6/3
首次发现
来源
Ollama+Gemma 4本地运行Codex:零成本AI编程完整指南
bilibili薛定猫AI
涉及实体
相关事实
待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s70% 相似待验证Claude Haiku 4.5的处理速度可达每秒100-200+ token68% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒68% 相似待验证Qwen3.6 35B模型借助MTP技术在oMLX上达到了86.7 tokens/s的生成速度,prompt处理速度为1735 tokens/s67% 相似待验证RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/38842API
curl https://kongchang.com/api/v1/knowledge/claims/38842MCP
get_claim(id=38842)