模型
AlphaZero
AlphaZero是由DeepMind开发的通用棋类博弈AI系统,采用深度强化学习与蒙特卡洛树搜索相结合的方法,无需人类先验知识,仅通过自我对弈即可从零开始学习。该系统在围棋、国际象棋和将棋等多种棋类游戏中达到或超越人类顶级水平,展示了通用游戏AI的强大潜力。
时间轴 (近 90 天)
9月11日
AlphaZero将同一套框架推广到国际象棋、将棋等多种博弈
待验证50%
9月10日
AlphaZero没有使用任何人类棋谱,仅通过4小时的自我对弈就超越了Stockfish
待验证50%
8月30日
AlphaProof将AlphaZero的强化学习方法与Lean形式化语言相结合,通过自我博弈生成证明
待验证50%
7月12日
世界模型指机器人对物理环境的内部预测能力,给定当前状态和一个动作能够预测下一步会发生什么
待验证50%