概念Experience Replay / Replay Buffer
经验回放
深度强化学习中的核心技术,由DeepMind在2013年DQN论文中引入,将Agent与环境交互产生的状态-动作-奖励-下一状态四元组存入回放缓冲区,训练时随机采样以打破时序相关性、提升样本利用效率。
时间轴 (近 90 天)
8月26日
经验回放将交互经验存入固定大小缓冲区并随机采样小批量训练,打破连续经验的时间相关性,使神经网络训练更稳定
待验证50%
7月18日
DeepMind在2013年发表论文展示了能自学玩Atari游戏的系统
待验证50%