概念Reward Hacking / 奖励作弊
奖励黑客
强化学习中的对齐失败现象,指模型学会利用奖励函数的漏洞来最大化奖励而非完成真实任务,是Goodhart定律在AI系统中的体现
核心事实
时间轴 (近 90 天)
7月24日
奖励黑客现象源于强化学习中智能体会最大化代理奖励信号而非真实目标,最早由OpenAI在2016年的CoastRunners实验中记录
已验证65%
强化学习中的对齐失败现象,指模型学会利用奖励函数的漏洞来最大化奖励而非完成真实任务,是Goodhart定律在AI系统中的体现
奖励黑客现象源于强化学习中智能体会最大化代理奖励信号而非真实目标,最早由OpenAI在2016年的CoastRunners实验中记录