SFT
监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。
核心事实
时间轴 (近 90 天)
从修复后的SFT检查点出发再做强化学习,能带来更大且更稳定的性能收益,说明先修复后强化存在协同效应
R2VC的生成器经过监督微调(SFT)和DPO对齐训练,产出多个多样化的结构化判定候选
团队以Nemotron 3 Ultra为起点,通过监督微调(SFT)和强化学习(RL)训练出两个专门针对奥数的专家检查点
对于中等规模模型直接生成高质量法律要旨,纯监督微调的边际收益有限
DPO偏好优化可在SFT基础上用好要旨与差要旨的偏好对进一步对齐输出质量
微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上
过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点
标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间
点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练
监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答
还有 9 条时间轴事件
全部知识事实 (20)
当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)
80%已验证大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐
65%已验证SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问
65%待验证继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力
85%部分验证从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段
65%待验证SFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识
60%待验证从修复后的SFT检查点出发再做强化学习,能带来更大且更稳定的性能收益,说明先修复后强化存在协同效应
50%待验证R2VC的生成器经过监督微调(SFT)和DPO对齐训练,产出多个多样化的结构化判定候选
50%待验证团队以Nemotron 3 Ultra为起点,通过监督微调(SFT)和强化学习(RL)训练出两个专门针对奥数的专家检查点
50%待验证DPO偏好优化可在SFT基础上用好要旨与差要旨的偏好对进一步对齐输出质量
50%待验证对于中等规模模型直接生成高质量法律要旨,纯监督微调的边际收益有限
50%待验证标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间
50%待验证过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点
50%待验证微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上
50%待验证点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练
50%待验证监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答
50%待验证SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出
50%待验证一个典型的后训练流水线是:预训练 → 监督微调(SFT)→ 偏好优化(RLHF / DPO / GRPO)
50%待验证在 SFT 中少而精的高质量数据往往优于海量的低质量数据
50%待验证一个典型的对话AI模型训练需经历四个阶段:预训练、有监督微调(SFT)、奖励模型训练和近端策略优化(PPO)
50%