[控场AI]
概念Supervised Fine-Tuning / 有监督微调

SFT

监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。

核心事实

时间轴 (近 90 天)

9月14日

从修复后的SFT检查点出发再做强化学习,能带来更大且更稳定的性能收益,说明先修复后强化存在协同效应

待验证50%
9月14日

R2VC的生成器经过监督微调(SFT)和DPO对齐训练,产出多个多样化的结构化判定候选

待验证50%
9月12日

团队以Nemotron 3 Ultra为起点,通过监督微调(SFT)和强化学习(RL)训练出两个专门针对奥数的专家检查点

待验证50%
9月12日

对于中等规模模型直接生成高质量法律要旨,纯监督微调的边际收益有限

待验证50%
9月12日

DPO偏好优化可在SFT基础上用好要旨与差要旨的偏好对进一步对齐输出质量

待验证50%
9月7日

微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上

待验证50%
9月7日

过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点

待验证50%
9月7日

标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间

待验证50%
9月4日

点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练

待验证50%
8月31日

监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答

待验证50%

还有 9 条时间轴事件

全部知识事实 (20)

已验证

当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)

80%
已验证

大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐

65%
已验证

SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问

65%
待验证

继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力

85%
部分验证

从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段

65%
待验证

SFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识

60%
待验证

从修复后的SFT检查点出发再做强化学习,能带来更大且更稳定的性能收益,说明先修复后强化存在协同效应

50%
待验证

R2VC的生成器经过监督微调(SFT)和DPO对齐训练,产出多个多样化的结构化判定候选

50%
待验证

团队以Nemotron 3 Ultra为起点,通过监督微调(SFT)和强化学习(RL)训练出两个专门针对奥数的专家检查点

50%
待验证

DPO偏好优化可在SFT基础上用好要旨与差要旨的偏好对进一步对齐输出质量

50%
待验证

对于中等规模模型直接生成高质量法律要旨,纯监督微调的边际收益有限

50%
待验证

标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间

50%
待验证

过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点

50%
待验证

微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上

50%
待验证

点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练

50%
待验证

监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答

50%
待验证

SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出

50%
待验证

一个典型的后训练流水线是:预训练 → 监督微调(SFT)→ 偏好优化(RLHF / DPO / GRPO)

50%
待验证

在 SFT 中少而精的高质量数据往往优于海量的低质量数据

50%
待验证

一个典型的对话AI模型训练需经历四个阶段:预训练、有监督微调(SFT)、奖励模型训练和近端策略优化(PPO)

50%

来源文章