World Models详解:AI如何在梦中学会决策

什么是World Models(世界模型)
近日,一个名为 worldmodels_demo 的开源项目在 Reddit 上引发广泛关注。这个由开发者 Gananath 发布的演示项目,重新聚焦了AI研究中一个既古老又前沿的话题——世界模型(World Models)。
世界模型的核心思想源自 David Ha 与 Jürgen Schmidhuber 在 2018 年发表的经典论文《World Models》。David Ha 是 Google Brain 的研究科学家(后加入 Stability AI 担任研究负责人),以创意性的深度学习研究著称;Jürgen Schmidhuber 则被誉为"现代AI之父"之一,是 LSTM 的共同发明人,长期在瑞士 IDSIA 实验室从事递归神经网络和元学习研究。两人在这篇论文中选择了 OpenAI 的赛车游戏环境 CarRacing-v0 和 VizDoom 作为实验平台,首次系统性地证明了智能体可以完全在自己学习到的环境模型中完成策略训练。这篇论文以其优雅的架构设计和直观的可视化呈现方式,成为强化学习与生成模型交叉领域的里程碑式工作。
其基本理念是:与其让智能体(Agent)直接在复杂的真实环境中通过海量试错来学习,不如先让它建立一个对世界运行规律的"内部模型",然后在这个压缩的、抽象的想象空间里进行训练和规划。
换句话说,智能体可以"在梦中学习"。当它对环境的动态有了足够好的内部表征后,甚至能够脱离真实环境,仅在自己构建的模拟世界里完成大量决策训练。这一思路在样本效率和泛化能力上都展现出巨大潜力。传统强化学习面临的一个核心瓶颈正是样本效率极低——以 DeepMind 的 Atari 游戏实验为例,DQN 算法通常需要数千万帧的游戏画面交互才能学会一个游戏,相当于人类玩家数百小时的游戏时间。在真实物理世界中(如机器人操控),每次试错都意味着真实的时间消耗和硬件磨损,这一问题会被进一步放大。世界模型通过在内部模拟中大量"虚拟试错"来替代真实环境交互,理论上可以将所需的真实样本量降低一到两个数量级。

三大核心组件:VAE、RNN与Controller
世界模型的经典架构通常由三个模块协同工作,这也是 worldmodels_demo 所复现的核心结构。
VAE:压缩感知
第一个组件是变分自编码器(Variational Autoencoder, VAE),负责视觉感知。环境每一帧的高维图像输入(例如游戏画面)会被 VAE 编码压缩成一个低维的潜在向量(latent vector)。
VAE 由 Diederik Kingma 和 Max Welling 在 2013 年提出,是生成模型领域的基础架构之一。与普通自编码器不同,VAE 不是将输入映射为一个确定性的编码点,而是映射为一个概率分布(通常是高斯分布)的均值和方差参数。训练时通过"重参数化技巧"(reparameterization trick)从该分布中采样,使得反向传播得以通过随机采样步骤进行。其损失函数由重建误差和 KL 散度两部分组成——前者确保解码后的输出尽可能还原输入,后者约束潜在空间的分布接近标准正态分布,从而使潜在空间具有连续性和可插值性。在世界模型中,VAE 通常将 64×64 像素的游戏画面压缩为 32 维或 64 维的潜在向量,压缩比可达数百倍。
这一步至关重要——它把冗余、庞大的像素信息浓缩为紧凑的抽象表征,使后续的推理和规划能够在一个远小于原始空间的维度上高效进行。
MDN-RNN:预测未来
第二个组件是循环神经网络,通常采用混合密度网络与 RNN 结合(MDN-RNN)的形式,扮演"记忆"与"想象"的双重角色。
MDN-RNN 结合了两项关键技术。RNN(特别是其变体 LSTM)擅长处理时间序列数据,通过隐藏状态在时间步之间传递信息来捕捉长程依赖关系。而混合密度网络(Mixture Density Network, MDN)由 Christopher Bishop 在 1994 年提出,它不像普通神经网络那样输出一个确定性的预测值,而是输出一个由多个高斯分布组成的混合模型的参数(包括各分量的均值、方差和混合权重)。这种设计使得模型能够表达未来状态的多模态不确定性——比如在十字路口,车辆可能左转也可能右转,这两种可能性需要用不同的高斯分量来分别建模。在世界模型中,MDN-RNN 通常使用 256 个隐藏单元的 LSTM 和 5 个高斯混合分量来预测下一帧的潜在向量分布。
它接收当前的潜在状态和智能体的动作,预测下一时刻的潜在状态。这本质上是在学习环境的动态规律:给定当前状态并做出某个动作,未来大概率会怎样演化。正是这个模块赋予了智能体"在梦中推演"的能力。
Controller:决策输出
第三个组件是控制器(Controller),通常结构非常简单,仅由少量参数构成。它基于 VAE 提供的当前感知和 RNN 提供的未来预测,输出具体的动作决策。
由于繁重的表征学习和动态建模已经由前两个模块承担,控制器可以保持轻量,往往通过进化策略(如 CMA-ES)等方法进行优化。CMA-ES(协方差矩阵自适应进化策略)是一种无梯度优化算法,由 Nikolaus Hansen 在 2001 年提出。与基于梯度下降的优化方法不同,CMA-ES 通过维护一个多元正态分布来搜索参数空间:每一代从当前分布中采样一批候选解,评估其适应度(即累积奖励),然后根据表现最好的候选解来更新分布的均值和协方差矩阵。这种方法特别适合参数量较少(通常在几百到几千个)的优化问题,正好匹配控制器的轻量设计。选择进化策略而非反向传播来优化控制器,还有一个优势:它天然支持并行化,可以同时评估数百个候选策略,且不需要对奖励函数求导。
这个开源演示为什么值得关注
对于希望入门世界模型的开发者来说,一个可运行的最小化演示项目具有很高的实用价值。相比动辄需要庞大算力的前沿研究复现,worldmodels_demo 显著降低了理解门槛,让人可以直观看到 VAE 重建、RNN 想象序列以及控制器决策的完整流程。
世界模型的思想在近两年再次成为研究热点。从 DeepMind 的 Dreamer 系列算法,到各类"神经网络生成可交互世界"的研究(如 Google 的 Genie、以及各种游戏画面生成模型),其底层逻辑都与世界模型一脉相承:让 AI 学会对世界建立可预测的内部表征。
Dreamer 系列是世界模型思想最成功的现代化延伸。Dreamer V1(2020年)首次证明在连续控制任务中,基于学习到的世界模型进行"想象中的反向传播"可以匹敌甚至超越无模型强化学习方法。Dreamer V2(2021年)引入了离散潜在表征,在 Atari 55 款游戏上首次以基于模型的方法超越了人类基准。Dreamer V3(2023年)则实现了跨领域的通用性,用同一套超参数在从 Atari 像素游戏到 Minecraft 钻石采集等迥异的任务上都取得了优异表现,甚至成为首个在 Minecraft 中从零开始收集钻石的强化学习算法。这一系列工作不断验证着世界模型范式的工程可行性。
而 Google DeepMind 在 2024 年初发布的 Genie 则代表了世界模型在生成式AI方向的重要突破。Genie 是一个 110 亿参数的基础世界模型,通过观看大量未标注的互联网游戏视频,学会了生成可交互的 2D 虚拟世界。用户只需提供一张图片甚至一段文字描述,Genie 就能生成一个可以通过动作控制来探索的环境。其关键创新在于无监督地从视频中发现了"潜在动作空间"——即使训练数据中没有任何动作标注,模型也能自动推断出控制环境变化的基本动作。这代表了世界模型从"任务特定"到"通用基础模型"的范式转变,暗示着未来可能出现类似 GPT 之于语言的"世界基础模型"。
可以说,世界模型正在从一个学术概念,逐步走向通用智能体(Agent)和具身智能的关键基础设施。
世界模型与当前AI浪潮的关系
在大语言模型主导的当下,世界模型代表了一条不同却互补的技术路径。LLM 擅长处理语言和符号世界的规律,而世界模型更擅长处理具有连续动态、物理交互的环境。
随着AI应用向机器人、自动驾驶、游戏 NPC 等真实或仿真物理场景延伸,能够"预测世界如何演化"的模型变得愈发重要。业界普遍认为,具备可靠世界模型的智能体,才可能真正实现长时程规划和高效的样本利用。值得注意的是,这两条路径正在出现融合趋势——研究者们开始探索将大语言模型的推理能力与世界模型的物理预测能力结合,构建既能理解语言指令又能预测物理后果的统一智能体架构。
对于开发者而言,从 worldmodels_demo 这样的开源演示入手,理解 VAE、MDN-RNN 与 Controller 的协作机制,是切入这一领域的良好起点。尽管它只是一个演示项目,但麻雀虽小五脏俱全,恰好勾勒出了世界模型这一强大范式的完整轮廓。
核心要点
相关推荐

Apple Watch心电图检测房颤救命:铁人三项选手的真实经历
铁人三项选手Connor在运动中心率飙升至219次/分,通过Apple Watch ECG功能发现房颤,最终接受开胸手术成功治疗。了解智能手表心电图如何帮助发现隐藏心脏问题。

诺克罗斯缅因州森林火灾地图:百年制图遗产与数据可视化先驱
探索Archie G. Norcross在1918-1922年间绘制的缅因州森林火灾地图,了解这份手工制图杰作如何成为早期数据可视化实践的典范,以及其对现代气候研究、历史GIS和AI火灾监测的深远价值。

Apogee:用本地AI重建Mozilla Orbit的隐私优先浏览器摘要插件
Mozilla停摆Orbit后,独立开发者用Ollama、WebGPU和Transformers.js重建了一款完全本地运行的AI浏览器摘要插件Apogee,支持网页、YouTube、Bilibili视频摘要,不发送任何用户数据。