模型Deep Q-Network / DQN算法
DQN
DeepMind于2013年提出的深度强化学习算法,首次将深度神经网络与Q-learning结合,引入经验回放机制
时间轴 (近 90 天)
8月26日
当状态空间变大或连续时表格法会失效,需要用线性函数或神经网络逼近 Q 值,即迈向 Deep Q-Network(DQN)
待验证50%
8月26日
Stable-Baselines3(SB3)基于PyTorch实现,采用模块化设计,内置PPO、SAC、DQN等算法
待验证50%
8月23日
经验回放最早在DeepMind的DQN算法中被提出,智能体将过去的交互经验存储在缓冲区中,训练时随机采样以提高样本利用效率
待验证50%
7月18日
DeepMind在2013年发表论文展示了能自学玩Atari游戏的系统
待验证50%