待验证85% 置信事实时间未知
单卡A100(80GB显存)可运行7B-13B级别模型,4卡A100(320GB显存)可运行70B级别模型
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
企业大模型选型指南:Llama3.1、Qwen2.5、DeepSeek深度对比
bilibili云栖智联
涉及实体
相关事实
已验证8GB显存建议运行7B模型(Q4量化),16GB显存建议运行7B到14B模型,24GB显存建议运行14B到32B模型,32GB显存建议运行32B到70B模型(Q4量化)79% 相似已验证以70B参数模型、FP16精度、32层注意力头为例,单条200K长度请求的KV Cache约需80-120GB显存,远超单张A100 GPU的80GB显存上限77% 相似已验证一个原本需要60GB显存的30B参数模型,经过量化后能在16GB甚至8GB显存的消费级显卡上运行76% 相似待验证70B量级模型的全量微调至少需要8张A100 80G显卡76% 相似已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18070API
curl https://kongchang.com/api/v1/knowledge/claims/18070MCP
get_claim(id=18070)