Unsloth支持AMD GPU:500+模型训练加速2倍、显存省70%

Unsloth联手AMD,大模型训练迎来硬件新选择
长期以来,大语言模型的训练与微调几乎被NVIDIA的CUDA生态所垄断。NVIDIA的CUDA(Compute Unified Device Architecture)于2007年发布,经过十余年的积累,已形成从底层驱动到上层框架的完整软件栈。PyTorch、TensorFlow等主流深度学习框架均以CUDA为首要优化目标,cuDNN、cuBLAS、NCCL等加速库构成了AI训练的基础设施。这种软件生态的深度绑定使得即便其他厂商硬件在性价比上有优势,开发者也往往因软件兼容性问题而被迫选择NVIDIA,形成了事实上的平台锁定效应。
而近日,知名开源微调框架 Unsloth 宣布与 AMD 达成深度合作,正式将其高效训练能力扩展至AMD GPU平台,为AI训练生态注入了新的可能性。Unsloth是由Daniel和Michael Han兄弟于2023年创立的开源项目,专注于大语言模型的高效微调。其核心技术通过手动反向传播内核重写(而非依赖PyTorch自动求导)、4-bit量化训练(QLoRA)优化、以及智能内存管理等手段,在不牺牲模型精度的前提下大幅降低训练资源需求。Unsloth在GitHub上迅速积累了数万星标,成为个人开发者和小团队微调Llama、Mistral、Gemma等主流开源模型的首选工具之一。
根据Unsloth团队的官方公告,此次合作为 Unsloth 与 Unsloth Studio 带来了强化学习(RL)、推理、Notebook支持等一系列功能,并宣称在超过 500个模型 上实现了 2倍训练加速 和 高达70%的显存(VRAM)节省。

覆盖广泛的AMD硬件支持
此次合作最引人注目的地方在于其硬件覆盖的广度。Unsloth明确列出了支持的AMD产品线,几乎横跨从消费级到数据中心的全部主流架构:
-
RDNA 3-4 架构:涵盖AMD近两代消费级Radeon显卡,普通开发者用手头的游戏显卡即可进行高效微调。RDNA(Radeon DNA)是AMD自2019年起推出的消费级GPU架构系列。RDNA 3(Radeon RX 7000系列)引入了chiplet(小芯片)设计,将计算单元与显存控制器分离制造,并首次在消费GPU中采用5nm+6nm混合工艺。RDNA 4(Radeon RX 9000系列)于2025年初发布,进一步增强了AI推理相关的矩阵运算能力。值得注意的是,RDNA架构对FP16/BF16矩阵运算的支持在每一代都有实质性提升,这为在消费级显卡上运行AI训练任务提供了硬件基础。
-
Strix Halo:AMD面向高性能移动端与迷你工作站的APU平台,为边缘侧AI开发提供了想象空间。Strix Halo集成了强大的RDNA 3.5 GPU核心与大容量统一内存,其CPU与GPU共享的内存池可达128GB,这对于加载大参数模型具有独特优势。
-
MI300、MI325 等数据中心加速卡:对标NVIDIA H100/H200的旗舰级AI芯片,直接面向企业级大规模训练场景。AMD Instinct MI300X采用CDNA 3架构,配备192GB HBM3显存(远超NVIDIA H100的80GB),显存带宽达5.3TB/s。MI325X则是升级版本,将HBM3e显存提升至256GB。这些产品的超大显存容量在处理超长上下文或超大模型时具有天然优势,Meta、微软等公司已在部分工作负载中部署MI300系列。
这种从桌面到数据中心的全线覆盖,意味着开发者无论持有何种档次的AMD设备,都有机会接入Unsloth的优化训练流程,大幅降低了尝试门槛。
打破平台壁垒:Windows、Linux与WSL全支持
在软件兼容性层面,Unsloth此次同样下了功夫。官方宣布支持 Windows、Linux 以及 WSL(Windows Subsystem for Linux) 三大环境。
WSL是微软在Windows 10/11中内置的Linux兼容层,WSL2通过轻量级虚拟机运行完整的Linux内核。对AI开发者而言,WSL2的关键价值在于它支持GPU直通——NVIDIA早在2020年就实现了CUDA on WSL的支持,而AMD的ROCm对WSL的支持则较为滞后。WSL让开发者在保留Windows桌面环境(用于日常办公和IDE)的同时,获得原生Linux级别的AI训练环境,避免了双系统切换的繁琐。
这一点对AMD生态尤为关键。过去AMD的ROCm(Radeon Open Compute)软件栈在Windows平台的支持相对薄弱,很多训练工作流只能在Linux下跑通。ROCm提供HIP(Heterogeneous-compute Interface for Portability)编程接口,允许开发者将CUDA代码相对轻松地移植到AMD GPU上,但长期面临Windows支持不完善、对消费级GPU覆盖有限、部分深度学习算子优化不足等挑战。近年来AMD持续加大投入,ROCm 6.x版本在稳定性和兼容性上有显著进步,PyTorch也已原生支持ROCm后端。
如今三端全支持,尤其是对Windows原生和WSL的兼容,让大量使用Windows工作站的个人开发者与研究者能够更平滑地在AMD硬件上开展模型微调工作,无需被迫切换操作系统或搭建复杂的双系统环境。
强化学习与推理能力的加持
除了基础的监督微调(SFT),此次更新还引入了对 强化学习(RL) 的支持,这在当前对齐(Alignment)和推理模型训练日益重要的背景下显得尤为及时。当前业界普遍采用RLHF(基于人类反馈的强化学习)、DPO(直接偏好优化)、GRPO(群体相对策略优化)等技术来提升模型的对齐能力和推理表现,这些方法对计算资源的需求往往远超基础的监督微调。
值得关注的一个技术细节是 RL vLLM权重共享(weight sharing)。vLLM是加州大学伯克利分校开发的高性能LLM推理引擎,其核心创新是PagedAttention技术,通过类似操作系统虚拟内存分页的方式管理KV Cache,大幅提升推理吞吐量和显存利用率。在强化学习训练中,通常需要同时维护训练模型(演员模型,用于策略更新)和用于生成采样的推理模型(生成响应供奖励模型评判),这往往带来巨大的显存开销——对于70B参数的模型,仅加载两份模型副本就需要消耗上百GB的显存。通过与vLLM推理引擎的权重共享机制,Unsloth能够让训练框架与推理引擎共用同一份模型权重的内存空间,避免重复加载,从而进一步压缩显存占用并提升整体吞吐速度。这也是其实现"70%显存节省"承诺的关键技术之一。
此外,内置的 推理(inference) 支持和 Notebook 集成,让用户在完成微调后可以立即验证模型效果,形成从训练到测试的闭环工作流,显著提升开发效率。
免费远程HTTPS:降低体验门槛
官方还特别提到了 免费的远程HTTPS(Free remote HTTPS) 功能。这一特性意味着用户可以更便捷地远程访问、共享或部署自己的训练环境与模型服务,对于团队协作和快速演示场景颇具价值。类似ngrok等内网穿透工具的集成,可以让开发者无需配置复杂的网络环境或购买公网IP,即可将本地运行的模型服务暴露为可访问的HTTPS端点。这类"开箱即用"的便利功能,往往是开源工具能否被广泛采纳的重要因素。
意义分析:CUDA垄断格局的一次松动
从行业视角来看,Unsloth与AMD的这次合作意义不小。
首先,它为开发者提供了 CUDA之外的真实可行选项。长期以来,AI训练对NVIDIA硬件的强依赖导致算力成本高企、供应紧张。2023-2024年间,NVIDIA H100的市场溢价一度超过标价的2-3倍,交货周期长达数月。当一个成熟且以"高效"著称的微调框架开始原生支持AMD全线产品时,市场的多元化竞争才真正有了落地基础。
其次,Unsloth本身以 省显存、快速度 而闻名,其核心价值主张是让资源有限的开发者也能微调大模型。其底层依赖的QLoRA(Quantized Low-Rank Adaptation)技术将预训练模型量化为4-bit精度存储,同时在少量低秩适配器参数上以全精度进行梯度计算和更新,使得在单张24GB显存的GPU上微调65B参数模型成为可能。Unsloth在此基础上进一步优化了量化反量化的计算内核和内存访问模式。将这套优化能力移植到通常性价比更高的AMD硬件上,无疑放大了这一价值——用更便宜的显卡,跑更省显存、更快的训练,这对个人研究者、初创团队和高校实验室都极具吸引力。
当然,提一嘴,官方宣称的"2倍加速"和"70%显存节省"通常是与未经优化的基线(baseline)相比得出的结果,具体表现会因模型规模、硬件型号和任务类型而异。开发者在实际采用前,仍建议结合自身场景进行验证。
结语
Unsloth与AMD的合作,标志着高效大模型训练工具正在积极拥抱多元硬件生态。对于苦于算力成本或NVIDIA显卡供应的开发者而言,这至少提供了一条值得尝试的新路径。随着支持的模型数量突破500个、硬件覆盖从桌面延伸至数据中心,AMD在AI训练领域的存在感有望进一步提升。与此同时,Intel的oneAPI和Gaudi加速卡、以及各类国产AI芯片也在努力构建自己的训练生态,整个AI算力市场正从NVIDIA一家独大逐步走向多元竞争的格局。这场围绕AI算力生态的竞争,正变得愈发精彩。
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。