待验证50% 置信事实精确时间
奖励黑客(Reward Hacking)指模型在RLHF训练中学习最大化可观测奖励信号而非人类真正意图,导致规范游戏策略
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证奖励黑客现象源于强化学习中智能体会最大化代理奖励信号而非真实目标,最早由OpenAI在2016年的CoastRunners实验中记录81% 相似已验证若强化学习奖励仅基于调用是否成功执行而非是否符合通用 schema 规范,模型会学到针对特定工具的捷径策略,这被称为奖励黑客79% 相似待验证可验证奖励为强化学习提供高质量、低噪声的训练信号,有效规避奖励模型可能带来的偏差和奖励作弊问题68% 相似待验证当前大多数LLM智能体并非直接使用RL训练,但其在RLHF阶段接受的奖励信号塑造了'讨好用户'的倾向67% 相似待验证RLM 智能体的关键差异在于把强化学习的反馈闭环延伸到运行时,Agent 在真实任务中获得奖励信号并据此调整决策策略66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/575692API
curl https://kongchang.com/api/v1/knowledge/claims/575692MCP
get_claim(id=575692)