DPO(Direct Preference Optimization,直接偏好优化)是一种用于大语言模型偏好对齐的训练算法。其核心思想是将奖励模型隐式融入策略优化目标,通过直接在人类偏好数据上优化语言模型策略,无需显式训练独立的奖励模型和强化学习采样过程,仅依赖策略模型与参考模型即可完成对齐训练,是RLHF框架的一种简化替代方案。
DPO(Direct Preference Optimization)是2023年提出的对齐方法,可以跳过奖励模型训练直接从人类偏好数据中优化策略模型
Gemini 3.5 Flash的性能进步很大程度上得益于后训练技术的优化,包括RLHF、指令微调和DPO等技术