[控场AI]
概念Experience Replay / Replay Buffer

经验回放

深度强化学习中的核心技术,由DeepMind在2013年DQN论文中引入,将Agent与环境交互产生的状态-动作-奖励-下一状态四元组存入回放缓冲区,训练时随机采样以打破时序相关性、提升样本利用效率。

时间轴 (近 90 天)

8月26日

经验回放将交互经验存入固定大小缓冲区并随机采样小批量训练,打破连续经验的时间相关性,使神经网络训练更稳定

待验证50%
7月18日

DeepMind在2013年发表论文展示了能自学玩Atari游戏的系统

待验证50%

全部知识事实 (2)

来源文章