待验证50% 置信事实精确时间
QLoRA 在 LoRA 基础上引入 NF4(Normal Float 4)4-bit量化格式,并采用双量化和分页优化器,可在24GB RTX 4090单张消费级显卡上微调7B模型
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
已验证QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能80% 相似部分验证QLoRA论文验证了NF4量化配合LoRA微调可在65B参数模型上将显存需求从780GB降至48GB,同时保持接近全精度微调的性能74% 相似待验证使用IQ4_XS配合-fa 1 -ctk q8_0 -ctv q8_0对KV缓存进行q8_0量化后,可加载完整32k上下文,常驻内存约16.6GB72% 相似待验证Llama 3 70B量化版(Q4精度)仍需约35GB内存71% 相似待验证使用QLoRA在RTX 4090上微调Llama 7B模型,显存占用约5-8GB71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/527823API
curl https://kongchang.com/api/v1/knowledge/claims/527823MCP
get_claim(id=527823)