[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Reward Shaping
奖励塑形
强化学习中设计和调整奖励函数的方法,用于引导智能体学习期望行为,是RL调试中的核心难题之一
来源文章
强化学习奖励塑形与调试实战:从振荡到收敛的系统指南
7月11日