[控场AI]
模型

AlphaZero

AlphaZero是由DeepMind开发的通用棋类博弈AI系统,采用深度强化学习与蒙特卡洛树搜索相结合的方法,无需人类先验知识,仅通过自我对弈即可从零开始学习。该系统在围棋、国际象棋和将棋等多种棋类游戏中达到或超越人类顶级水平,展示了通用游戏AI的强大潜力。

时间轴 (近 90 天)

9月11日

AlphaZero将同一套框架推广到国际象棋、将棋等多种博弈

待验证50%
9月10日

AlphaZero没有使用任何人类棋谱,仅通过4小时的自我对弈就超越了Stockfish

待验证50%
8月30日

AlphaProof将AlphaZero的强化学习方法与Lean形式化语言相结合,通过自我博弈生成证明

待验证50%
7月12日

世界模型指机器人对物理环境的内部预测能力,给定当前状态和一个动作能够预测下一步会发生什么

待验证50%

全部知识事实 (5)

来源文章