[控场AI]
概念Group Relative Policy Optimization / 组相对策略优化

GRPO

GRPO(Group Relative Policy Optimization)是一种用于大语言模型强化学习训练的偏好对齐算法。其核心特点是去除传统PPO中的价值网络(Critic),通过对同一问题生成多个输出并进行组内相对排序来估计优势函数,从而降低训练资源消耗。该方法常用于提升模型的推理能力,在指令遵循和复杂推理任务上表现良好。

来源文章