后训练技术全解析:SFT、PPO、DPO与GRPO原理及选型指南

引言:从预训练到后训练的范式转移
近日,Reddit 上出现了一个专注于 AI 后训练(Post-training)的新社区 r/posttrain,聚焦于微调、SFT、RLHF、DPO、偏好数据、评估以及实用实验等主题。这一社区的诞生,恰好反映了当前大模型技术演进的一个重要趋势:模型能力的差异化,越来越多地取决于预训练之后的工作。

如果说预训练(Pretraining)赋予了模型广博的世界知识和语言能力,那么后训练则决定了模型是否"好用"、是否"对齐"、是否"专业"。本文将系统梳理后训练领域的核心技术栈——从监督微调 SFT,到强化学习方法 PPO、DPO 和近期备受关注的 GRPO,帮助读者建立完整的技术认知框架。
什么是后训练(Post-training)
后训练指的是在基础模型完成大规模无监督预训练之后,通过一系列有监督或强化学习手段,进一步调整模型行为的过程。要理解后训练的意义,首先需要理解预训练的产物是什么:预训练阶段,模型通过自监督学习的方式——通常是"下一个 token 预测"(Next Token Prediction)任务——在海量文本语料(通常达到数万亿 token 规模)上进行训练。这个过程需要数千块 GPU 运行数周甚至数月,成本可达数千万美元。预训练完成后,模型获得了广泛的语言理解和世界知识,但它本质上仍然是一个文本补全引擎,无法直接作为对话助手使用。这就是后训练存在的根本原因。
后训练的核心目标通常包括三个方面:
- 指令遵循:让模型能够理解并执行人类的指令,而非仅仅续写文本;
- 对齐(Alignment):使模型的输出符合人类价值观,减少有害、偏见或不实内容;
- 能力增强:在特定领域(如数学、代码、推理)提升模型的专项表现。
一个典型的后训练流水线通常是:预训练 → 监督微调(SFT)→ 偏好优化(RLHF / DPO / GRPO)。这三个阶段层层递进,共同将一个"原始"的语言模型打磨成可用的 AI 助手。
SFT:监督微调是一切的起点
SFT 的核心原理
监督微调(Supervised Fine-Tuning, SFT)是后训练的第一步。它使用高质量的"指令-回答"配对数据,通过标准的交叉熵损失对模型进行训练。交叉熵损失(Cross-Entropy Loss)是自然语言处理中最基础的训练目标函数,它衡量的是模型预测的概率分布与真实标签之间的差异。在 SFT 的语境下,模型被要求逐个 token 预测目标回答的下一个词,交叉熵损失会惩罚模型对正确 token 赋予低概率的情况。值得注意的是,在 SFT 训练中,通常只对回答部分计算损失,而不对用户指令部分计算损失,这种做法被称为"仅对 completion 计算损失",以确保模型学会的是如何回答,而不是重复用户的问题。
本质上,SFT 是在教模型"当用户这样问时,应该这样回答"。SFT 的效果高度依赖数据质量。业界的共识是:少而精的高质量数据,往往优于海量的低质量数据。这也是为什么许多团队将大量精力投入到数据清洗、标注和构造上。
SFT 的局限性
SFT 虽然能让模型学会回答问题的"格式"和"风格",但它只能模仿示范数据中出现过的行为。它无法告诉模型"哪个回答更好",也难以处理开放式问题中的细微偏好差异。这正是强化学习方法登场的原因。
RLHF 与 PPO:经典的对齐范式
RLHF 的三段式流程
基于人类反馈的强化学习(RLHF, Reinforcement Learning from Human Feedback)是 ChatGPT 成功的关键技术之一。它通常包含三个步骤:
- 用 SFT 得到初始策略模型;
- 训练一个奖励模型(Reward Model),学习人类对不同回答的偏好排序;
- 使用强化学习算法(如 PPO)优化策略模型,使其输出获得更高的奖励分数。
其中,奖励模型(Reward Model, RM)的训练本身就是一个重大工程挑战。它本质上是一个从语言模型改造而来的回归模型,训练数据来自人类标注员的偏好判断:对于同一个问题的多个回答,标注员会标注哪个更好。奖励模型通过 Bradley-Terry 排序模型学习这些偏好,最终能够对任意一个"问题-回答"对输出一个标量分数,分数越高代表回答质量越好。然而,奖励模型容易出现"奖励黑客"(Reward Hacking)问题——即策略模型学会利用奖励模型的漏洞获取高分,而非真正提升回答质量。这也是 RLHF 实践中需要格外警惕的风险。
PPO 的特点与代价
近端策略优化(Proximal Policy Optimization, PPO)是 RLHF 中最经典的强化学习算法,由 OpenAI 于 2017 年提出。它是一种基于策略梯度的强化学习算法,核心思想是通过一个"裁剪"(Clipping)机制限制每次策略更新的幅度:当新策略与旧策略之间的概率比超出一定范围(通常设为 1±0.2)时,梯度会被截断,防止策略发生剧烈变化,从而保证训练的稳定性。
然而,PPO 的实现相当复杂:
- 需要同时维护策略模型(Actor)、参考模型(Reference Model,通常是 SFT 后的模型快照,用于提供 KL 散度约束)、奖励模型和价值模型(Critic),显存开销巨大——对于一个 70B 参数的模型,这意味着需要同时加载约四倍的模型参数,对 GPU 集群的要求极为苛刻;
- 超参数敏感,训练过程容易不稳定;
- 工程实现门槛高,调试成本大。
正是这些痛点,催生了一系列更简洁的替代方案。
DPO:绕过奖励模型的简化路径
直接偏好优化(Direct Preference Optimization, DPO)是近年来的一项重要突破。它的核心洞察是:无需显式训练奖励模型和进行强化学习,可以直接用偏好数据优化策略模型。
DPO 的理论基础来自对 RLHF 目标函数的精巧数学变换。在标准 RLHF 中,目标是最大化奖励的同时约束策略不偏离参考模型太远(通过 KL 散度惩罚)。DPO 的作者(Rafailov 等人,2023 年)发现,这个约束优化问题存在一个闭式解——最优策略可以用奖励函数和参考策略直接表达。反过来,奖励函数也可以用最优策略和参考策略来表示。将这个关系代入 Bradley-Terry 偏好模型,就得到了一个只涉及策略模型和参考模型的损失函数,完全绕过了奖励模型。这一推导堪称优雅,它将一个复杂的强化学习问题转化为了一个简洁的分类问题。
在实际操作中,给定一对"更好的回答"和"更差的回答",DPO 直接调整模型,使其提高好回答的概率、降低差回答的概率。
相比 PPO,DPO 的优势非常明显:
- 实现简单:不需要奖励模型和 Critic,训练流程接近 SFT;
- 稳定性高:避免了强化学习的诸多不稳定因素;
- 资源友好:显存和计算开销大幅降低。
这些优点使 DPO 迅速成为开源社区最受欢迎的对齐方法之一。当然,DPO 也有其局限:它对偏好数据的质量要求很高,且在某些复杂推理任务上的效果上限可能不如精心调优的 PPO。此外,DPO 使用的是离线偏好数据(即在训练前就收集好的数据),而非模型在线生成的数据,这限制了模型在训练过程中探索更优策略的能力。
GRPO:面向推理的强化学习新范式
从 DeepSeek 崛起的方法
组相对策略优化(Group Relative Policy Optimization, GRPO)随着 DeepSeek 系列模型的成功而广受关注,尤其在提升模型的数学推理和代码生成能力方面表现突出。
GRPO 的核心创新在于取消了 PPO 中的价值模型(Critic)。它不再单独训练一个网络来估计状态价值,而是针对同一个问题采样一组回答,用这组回答的平均奖励作为基线(baseline),从而计算每个回答的相对优势。
具体而言,对于训练集中的每个问题,GRPO 会让当前策略模型生成 G 个独立的回答(G 通常设为 8 到 64 个)。然后,每个回答都会获得一个奖励分数(可以来自规则验证器或奖励模型)。GRPO 将这组回答的平均奖励作为基线,每个回答的优势值(Advantage)就是其奖励减去组内平均值再除以组内标准差。这种标准化处理使得模型能够区分同一难度问题下的好坏回答,避免了传统 Critic 模型估计不准确带来的偏差。
GRPO 的核心优势
这一设计带来了几个关键好处:
- 省去 Critic 模型,显著降低了显存和计算成本;
- 天然适合可验证任务:在数学、代码等有明确对错的场景中,可以用规则化的奖励(如答案是否正确、代码是否通过测试用例)替代复杂的奖励模型,获得精确的二值奖励信号;
- 推动了推理能力的大幅提升,成为当前"推理模型"训练的主流方法之一。
GRPO 的流行与 2024-2025 年"推理模型"(Reasoning Model)的兴起密不可分。以 OpenAI 的 o1/o3 系列、DeepSeek-R1 和 Google 的 Gemini 2.5 为代表,推理模型通过在推理阶段生成长链思维过程(Chain-of-Thought),显著提升了在数学竞赛、代码编程和科学问题上的表现。这类模型的训练核心就是使用强化学习——特别是 GRPO 及其变体——激励模型学会"慢思考",即在生成最终答案前进行多步推理、自我验证和错误修正。
GRPO 的流行标志着后训练领域的一个新方向:用强化学习激发模型的推理潜能,而非仅仅做行为对齐。这一范式被认为是大语言模型从"模式匹配"走向"真正推理"的关键一步,也是后训练技术最前沿的应用方向。
技术选型:SFT、PPO、DPO、GRPO 如何选择
面对 SFT、PPO、DPO、GRPO 等多种后训练方法,实践者应如何取舍?以下是一些经验性的建议:
- 入门与基础对齐:从 SFT 开始,这是不可跳过的第一步;
- 追求简单高效的偏好对齐:优先考虑 DPO,实现成本低、效果稳定;
- 需要极致对齐效果、有充足工程资源:可考虑 PPO 及其变体;
- 提升数学、代码等推理能力:GRPO 是当前的首选方案。
值得强调的是,这些方法并非互斥,实际生产中往往是组合使用——先 SFT 打底,再用 DPO 或 GRPO 进一步优化。许多前沿实验室的完整训练流程甚至会包含多轮迭代:SFT → DPO 进行初步对齐 → GRPO 进行推理能力强化 → 再用 DPO 微调输出风格,形成一个完整的训练闭环。
结语:后训练成为大模型竞争的新高地
r/posttrain 社区的成立,从侧面印证了一个事实:随着预训练技术逐渐趋同、开源基座模型日益丰富,后训练正在成为决定模型质量的关键差异化环节。无论是数据构造、奖励设计,还是算法选择,后训练都充满了值得探索的实践空间。
对于开发者和研究者而言,理解 SFT、PPO、DPO、GRPO 这套技术栈的原理与权衡,已经成为一项必备技能。而像 r/posttrain 这样聚焦于实用经验分享的社区,正是学习和交流这些技术的宝贵资源。
核心要点
相关推荐

Shoggoth隐喻:AI对齐问题的深层焦虑与思考
Shoggoth(修格斯)隐喻将大语言模型比作戴着笑脸面具的克苏鲁怪物,精准揭示了AI对齐的核心难题。本文解析这一AI文化符号的由来、含义及其背后关于能力与理解鸿沟、RLHF对齐局限性的深层思考。

AI经济学研究入门指南:经济学博士生的系统路线图
面对AI经济学这个庞大领域,经济学博士生该如何系统入门?本文梳理AI经济学四大研究主线、文献阅读方法、技术学习优先级,提供从Acemoglu到Brynjolfsson的完整知识体系搭建路径。

自托管ASR模型vs云端API:成本与可靠性全面对比
深入分析自托管ASR开源模型与Google等云端语音识别API的成本差异、可靠性对比及盈亏平衡点计算,提供Whisper、IBM Granite等方案的实用选型建议,帮助团队做出最优技术决策。