概念Supervised Fine-Tuning / 有监督微调
SFT
监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。
核心事实
时间轴 (近 90 天)
6月3日
大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐
已验证65%
6月3日
SFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识
待验证60%
6月3日
继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力
待验证85%
6月3日
SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问
待验证60%
6月1日
MYLLM项目覆盖了训练、LoRA微调、SFT、知识蒸馏、强化学习、多模态和Agent七个技术方向
待验证90%
6月1日
现代大语言模型通常经历预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个训练阶段
已验证80%
6月1日
经过强化学习(RL)训练的模型在Agent任务中表现优于仅经过SFT的模型
待验证75%
6月1日
教程基础篇涵盖Python快速入门、AI开发环境搭建、提示词工程,以及Transformer架构、预训练、SFT、RLHF等大模型核心原理
待验证90%
6月1日
大模型核心原理包括Transformer架构、预训练、SFT监督微调、RLHF人类反馈强化学习等关键概念
待验证95%