待验证75% 置信事实时间未知
GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s
1
来源数
75%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
OpenAI开源GPT-OSS:16G显存跑O4级模型,部署教程全解析
bilibili九天Hector
涉及实体
相关事实
待验证使用RTX 5090(32GB显存)运行GPT-OSS-20B时,GPU显存占用约53%,系统内存占用约2.5GB,响应速度1-2秒80% 相似待验证单卡RTX 4090即可运行GPT-OSS 20B,单卡A100即可运行GPT-OSS 120B74% 相似待验证将模型权重从FP16压缩到INT8或INT4的量化技术,可使消费级GPU如RTX 4090在本地部署时达到30-80 TPS的实用速度73% 相似待验证在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低73% 相似已验证消费级GPU RTX 4090的显存上限为24GB72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/23209API
curl https://kongchang.com/api/v1/knowledge/claims/23209MCP
get_claim(id=23209)