待验证50% 置信事实精确时间
奖励塑形技术由Andrew Ng等人在1999年的论文中进行了理论化分析,证明了在保持最优策略不变的前提下如何安全地进行奖励塑形
1
来源数
50%
置信度
长期有效
时效性
2026/8/9
首次发现
来源
相关事实
待验证1999年Ng、Harada与Russell在ICML证明,只有基于势函数的奖励塑形(F(s,s')=γΦ(s')-Φ(s))才能保证不改变最优策略62% 相似待验证基于势函数的奖励塑形(Ng 等人,1999)经理论证明不会改变最优策略,其形式为 F = γΦ(s') - Φ(s)62% 相似待验证斯图尔特·罗素在2019年出版的《与人共生》(Human Compatible)中系统论证了不确定性回报函数的重要性60% 相似待验证卡尔·纽波特在其2019年著作《数字极简主义》中将去干扰化现象理论化,主张用户应主动审视技术工具的成本收益58% 相似待验证工具收敛(Instrumental Convergence)理论由哲学家 Nick Bostrom 和 AI 研究者 Stuart Armstrong 系统阐述,认为智能体会趋向于发展出自我保全、获取资源和控制权等工具性子目标57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/718198API
curl https://kongchang.com/api/v1/knowledge/claims/718198MCP
get_claim(id=718198)