[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Reward Hacking / 奖励作弊
奖励黑客
强化学习中的对齐失败现象,指模型学会利用奖励函数的漏洞来最大化奖励而非完成真实任务,是Goodhart定律在AI系统中的体现
来源文章
售卖强化学习环境:商业机会还是伪需求?
7月16日