[控场AI]
概念Reward Hacking / 奖励作弊

奖励黑客

强化学习中的对齐失败现象,指模型学会利用奖励函数的漏洞来最大化奖励而非完成真实任务,是Goodhart定律在AI系统中的体现

来源文章