谷歌Project Genie结合街景数据模拟真实世界,AI世界模型迎来关键突破

谷歌Project Genie结合街景数据,为AI Ultra用户生成可交互的真实世界模拟环境。
谷歌扩展Project Genie全球访问范围,面向AI Ultra订阅用户开放。该项目是DeepMind推出的基础世界模型,能从图像生成可交互虚拟环境。新功能结合Google Street View的海量街景数据,可将真实地点转化为具备物理逻辑和空间连贯性的动态模拟场景,标志着AI生成技术与地理空间数据的深度融合。
概述
谷歌近日宣布扩展其 Project Genie 的全球访问范围,面向 Google AI Ultra 订阅用户开放,并引入了一项由 Google Street View(谷歌街景)驱动的全新能力——模拟真实世界的地点。这一举措标志着 AI 生成式技术与地理空间数据的深度融合,为虚拟世界构建开辟了全新的可能性。

什么是 Project Genie?
从游戏生成到世界模拟
Project Genie 是谷歌 DeepMind 推出的**基础世界模型(Foundation World Model)**项目。所谓"基础世界模型",是近年来AI研究的前沿方向之一——与大语言模型(LLM)专注于文本理解不同,世界模型的目标是让AI建立对物理世界的内在表征,理解物体如何运动、空间如何组织、因果关系如何运作。这一概念最早可追溯到认知科学家Kenneth Craik在1943年提出的"心智模型"理论,而在深度学习时代,Yann LeCun等学者将其重新定义为AI通向通用智能的核心路径。Project Genie的"基础"(Foundation)定位意味着它类似于GPT系列的预训练大模型——通过海量无标注视觉数据进行自监督学习,习得通用的世界理解能力,再针对具体任务进行微调,而非为每个场景单独训练。
它的核心定位是通过 AI 从图像、文本等输入中生成可交互的虚拟环境。与传统游戏引擎不同,Genie 不需要开发者手动搭建场景,而是通过学习大量视觉数据,自动理解物理规则、空间关系和环境逻辑,从而"凭空"创造出可以探索的 2D 甚至 3D 世界。
此前,Project Genie 已经展示了从单张图片生成可玩游戏关卡的能力,引发了业界广泛关注。如今它与 Google Street View 的结合,将这一能力从虚构场景延伸到了真实世界。值得一提的是,Project Genie 的技术演进站在了近年来3D场景生成研究的肩膀上:2020年提出的神经辐射场(NeRF)技术首次实现了从少量2D图像重建高质量3D场景的突破,此后3D高斯溅射(3D Gaussian Splatting)大幅提升了渲染速度。而Project Genie的创新在于更进一步——它不仅要重建静态场景,还要赋予场景"可交互性",让AI理解哪些元素可以被操作、物理规律如何约束运动,代表了从"被动感知"到"主动理解"的质的飞跃。
谷歌街景数据的全新用途
Google Street View 自2007年推出以来,已积累了覆盖全球220多个国家和地区、超过1000亿张街景图像的庞大数据库,总里程超过1600万公里。其采集系统综合运用了多目鱼眼相机、激光雷达(LiDAR)、GPS和IMU惯性测量单元,能够同步采集360度全景影像与精确的三维点云数据。这些数据经过谷歌的Structure from Motion(SfM)算法处理,可重建出精确的三维空间结构。正是这种"图像+深度+位姿"的多模态数据特性,使其成为训练世界模型的理想原料——AI不仅能看到场景外观,还能理解其三维几何关系,这是Project Genie生成具备空间连贯性环境的数据基础。
这些街景数据此前主要服务于地图导航和虚拟游览。Project Genie 的新能力意味着,这些街景图像可以被 AI 模型"理解"并转化为可交互的模拟环境。用户只需指定一个真实地点,AI 就能基于街景数据生成该地点的虚拟模拟场景,支持用户在其中进行探索和交互。这不是静态的全景浏览,而是具备物理逻辑和空间连贯性的动态环境。
面向 AI Ultra 订阅用户全球开放
订阅策略与商业化路径
Google AI Ultra 是谷歌于2025年推出的旗舰AI订阅服务,月费约249.99美元,是其订阅体系中的最高层级,整合了Gemini Ultra模型、NotebookLM Plus、Google One云存储及各类前沿实验功能。这一定价策略与OpenAI的ChatGPT Pro(月费200美元)、Anthropic的Claude Max直接竞争,共同构成了当前AI订阅市场的高端战场。谷歌选择将 Project Genie 这一功能绑定在 Google AI Ultra 订阅服务中,将计算密集型的世界模型生成能力与高端订阅层级挂钩,一方面是成本管控的现实考量,另一方面也是科技公司惯用的"功能分层
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。