共 5 篇相关文章

nvidia-smi显示GPU利用率100%并不意味着训练效率最优。本文解析GPU利用率的欺骗性,介绍DCGM、PyTorch Profiler等专业诊断工具,以及如何用MFU指标衡量真实训练效率。

详解如何在4GB显存的笔记本显卡上微调80亿参数大模型,涵盖QLoRA量化、梯度检查点、梯度累积等显存优化技术原理,分析其实际价值与局限性。
JAX主机卸载技术:突破LLM训练显存瓶颈的实战指南
显存不足是LLM训练的核心瓶颈。本文深入解析基于JAX的主机卸载(Host Offloading)技术原理,涵盖优化器状态、激活值卸载策略、PCIe带宽权衡,以及与激活重计算的互补关系,帮助你在不增加GPU的前提下训练更大规模的模型。

Unsloth发布v0.1.47-beta版本,这款拥有6.79万Star的开源大模型微调框架,可将Llama、Mistral、Qwen等主流模型微调速度提升2倍以上,显存占用降低约70%,让消费级GPU也能完成高效微调。
教程攻略详解如何使用QLoRA和Unsloth框架在消费级GPU上微调LLaMA 3 8B大模型。涵盖4-bit量化、LoRA低秩适配、Alpaca数据格式、训练流水线搭建到模型部署的完整流程,RTX 3090即可运行。