[控场AI]
概念基于人类反馈的强化学习 / Reinforcement Learning from Human Feedback

RLHF

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一种将人类偏好判断引入模型训练过程的机器学习方法。其核心流程包括:收集人类对模型输出的偏好标注、训练奖励模型以拟合人类评价,再通过强化学习优化语言模型使其输出更符合人类期望。该方法广泛应用于大语言模型的对齐训练,旨在减少有害输出并提升指令遵循能力。

核心事实

时间轴 (近 90 天)

6月3日

Anthropic采用Constitutional AI框架,在RLHF对齐时特别注重模型输出的细微差别和情感层次感

待验证75%
6月3日

Gemini 3.5 Flash的性能进步很大程度上得益于后训练技术的优化,包括RLHF、指令微调和DPO等技术

待验证75%
6月3日

OpenAI和Anthropic都采用了RLHF和代码执行反馈来优化模型的编程表现

已验证70%
6月3日

现代AI聊天系统的内容审核通常采用多层过滤架构,包括输入端语义检测、模型层面RLHF对齐训练和输出端安全过滤器

待验证60%
6月3日

RLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求

待验证85%
6月3日

OpenAI和Anthropic等公司通过收集人类标注员对模型输出的偏好排序数据,训练奖励模型,再用PPO等强化学习算法微调语言模型进行安全对齐

待验证60%
6月1日

传统RLHF需要先训练奖励模型,再用PPO等强化学习算法优化,流程复杂且不稳定

已验证80%
6月1日

MYLLM项目覆盖了训练、LoRA微调、SFT、知识蒸馏、强化学习、多模态和Agent七个技术方向

待验证90%
6月1日

DPO(直接偏好优化)是RLHF的更简洁替代方案,近年来正在崛起

已验证70%
6月1日

Claude的谄媚问题本质上是RLHF(基于人类反馈的强化学习)训练留下的后遗症

待验证70%

还有 40 条时间轴事件

全部知识事实 (7)

来源文章