Agentic Loop实战:86个AI智能体22小时构建GTA 6原型的启示

一个大胆的实验:让AI从零构建GTA 6
在Reddit的r/ClaudeAI社区,一位开发者分享了一项引人注目的实验——尝试用AI智能体循环(Agentic Loop)从头构建一款类似《GTA 6》的3D游戏原型。这篇帖子迅速登顶社区当日榜首,引发了关于AI辅助游戏开发能力边界的广泛讨论。
Agentic Loop是一种让AI模型在循环中自主执行任务的编程范式。与传统的单次提示-响应模式不同,智能体循环允许AI在一个持续运行的反馈闭环中反复执行代码、观察结果、分析错误并自行修正。这种架构模拟了人类开发者"编写-运行-调试-修改"的工作流程。在实际实现中,智能体通常被赋予工具调用能力(如文件读写、终端执行、浏览器操作等),每一轮循环中AI会根据上一轮的执行结果决定下一步动作,直到任务完成或达到预设的迭代上限。
作者坦言,这个成果"远非完美",但真正令人印象深刻的,是当"正确的框架(harness)"与"智能体循环"结合时所展现出的构建潜力。这不是一个精雕细琢的产品,而是一次关于AI自主编程能力的探索性实验。

从Worms到GTA 6:野心的升级
这项实验建立在作者此前对Matt Shumer提出的"Gauntlet Loop"的探索之上。Matt Shumer是AI创业公司HyperWrite的CEO,他在AI应用架构方面有诸多探索。Gauntlet Loop是他提出的一种智能体编排方法,核心思想是让AI在一个"挑战循环"中不断面对任务、尝试解决、接收反馈,并在失败时自动调整策略重新尝试。这个名称借用了"Gauntlet"(试炼)的含义,暗示AI需要像通过重重关卡一样逐步完成复杂任务。与简单的重试机制不同,Gauntlet Loop强调每次迭代都要积累上下文和经验,使后续尝试质量递增。
此前,作者曾用单个提示词(single prompt)启动整个循环,成功复刻了经典游戏《Worms Armageddon》的demo。
然而,作者认为复刻《Worms》意义有限——因为原版已有优秀的浏览器移植版本,没有太多打磨的价值。于是他将目标瞄准了一个更具野心的项目:《GTA 6》这样的开放世界3D游戏。
首次尝试的"惨败"
第一次尝试"失败得相当彻底"。AI在生成了一个基础的3D世界后就卡住了,无法继续推进。这也印证了当前AI在处理复杂、多层次工程任务时的现实局限——单纯依靠一次性生成,难以应对大型项目的复杂度。一个开放世界游戏涉及渲染管线、物理模拟、AI行为树、车辆系统、地图生成、UI交互等数十个相互耦合的子系统,这种复杂度远超当前模型的单次生成能力上限。
但作者没有止步。通过多轮额外的循环和工作流迭代,项目最终演化出了视频中所展示的"非常粗糙的原型"。这个从失败到可运行原型的过程,恰恰是Agentic Loop价值的核心体现:通过反复迭代与反馈,让AI逐步逼近目标。
关键突破:给智能体更丰富的调试信息
作者在实验中总结出了一条重要经验——推动项目进展的关键,在于为智能体提供更丰富的调试信息。
视频帧提取 vs 结构化JSON
一个核心痛点是:Claude Code无法原生理解游戏画面视频。Claude Code是Anthropic推出的命令行AI编程工具,允许Claude模型直接在开发者的本地环境中读写文件、执行终端命令、运行测试和管理项目。它本质上是将Claude的推理能力与实际的开发环境工具链结合起来,使AI能够像一个"结对编程伙伴"一样参与完整的软件开发流程。然而,在持续运行的开发循环中处理实时视频帧仍是一个重大技术挑战。
为了让AI"看懂"游戏运行状态,作者最初采用的方法是提取视频帧,让模型基于这些静态图像进行推理。
这种方式"有一定用处",但效果有限。真正的突破来自另一种思路:导出描述游戏状态的结构化JSON。
"导出描述游戏状态的结构化JSON效果好得多,因为它能直接理解世界中正在发生什么。"
这个洞察揭示了当前AI编程实践中的一个普遍规律:与其让模型"看"模糊的视觉信息,不如给它结构化、语义明确的数据。在传统游戏开发中,调试通常依赖视觉观察和日志输出。但对于AI智能体而言,视觉信息存在语义损失严重的问题——一张游戏截图中,AI很难精确判断某个物体的坐标偏移了多少像素、碰撞箱是否正确对齐、物理模拟的数值是否合理。而结构化JSON状态导出则将游戏的运行时信息以精确的键值对形式呈现:玩家位置{x: 12.5, y: 0, z: -3.2}、当前速度向量、所有活跃实体的列表、碰撞事件队列等。这种表示方式与大语言模型的文本推理能力天然契合,使AI能够进行精确的数值分析和逻辑推断,反馈闭环的质量因此大幅提升。
成本与规模:22小时、86个智能体
作者透明地公开了实验的资源消耗:截至目前,这个原型"耗费了22小时和86个智能体"才达到当前状态。
这里的"86个智能体"并非86个同时运行的并行进程,而更可能是指在整个开发过程中依次或协调启动的86个智能体会话(sessions)。在多智能体编排架构中,常见的模式包括:顺序执行(一个智能体完成后将结果传递给下一个)、分工协作(不同智能体负责不同子系统如物理、渲染、UI)、以及层级式编排(一个"管理者"智能体分配任务给"工人"智能体)。22小时86个智能体意味着平均每个智能体会话约15分钟,这与当前AI编程工具中单次复杂任务的典型执行时长相吻合。
这个数字本身就颇具启示意义。它一方面说明当前AI自主构建复杂软件仍需大量的计算与迭代成本,远未达到"一句话生成游戏"的理想状态;另一方面也证明了,通过合理编排大量智能体协作,AI确实能够逐步攻克传统上需要专业团队数月才能完成的原型开发。
作者对未来抱有明确期待:
"我相信通过更好的反馈循环,类似这样的东西最终能够从单个提示词构建出来,并产生显著更好的结果。"
下一步:优化框架与技术栈迁移
实验并未结束。作者透露了后续的改进方向:
- 改进harness(框架):优化智能体的工作流编排与反馈机制
- 技术栈迁移:考虑从纯Three.js迁移到Babylon.js,后者作为更完整的游戏引擎,可能为AI提供更好的构建基础
Three.js是一个轻量级的JavaScript 3D图形库,它对WebGL进行了高层封装,使开发者能够较为便捷地在浏览器中创建3D场景、模型和动画。它的设计哲学偏向于灵活的图形渲染库,而非完整的游戏引擎,因此物理系统、碰撞检测、场景管理等游戏开发核心功能需要开发者自行集成第三方方案。Babylon.js则是微软支持的开源3D游戏引擎,内置了物理引擎、粒子系统、GUI框架、音频管理、导航网格等完整的游戏开发工具链。对于AI驱动的开发场景,Babylon.js更完整的API抽象意味着AI可以用更少的代码实现更复杂的游戏功能,减少了需要从头搭建底层系统的工作量,从而降低了智能体循环中出错和卡住的概率。
这些方向都指向同一个目标:构建更高质量的反馈闭环,让AI智能体获得更准确、更及时的运行时信息,从而做出更好的开发决策。
这个实验意味着什么
抛开"复刻GTA 6"这个吸睛的标题,这项实验真正的价值在于它探索了Agentic Loop在复杂软件工程中的可行性边界。
几点值得关注的启示:
- 反馈质量决定成败:AI自主编程的瓶颈往往不在于模型的生成能力,而在于它能否"理解"自己产出的结果。结构化状态数据远胜于视觉帧推理。这也解释了为何当前AI编程工具普遍强调与测试框架、类型系统和静态分析工具的深度集成——这些本质上都是为AI提供结构化反馈的机制。
- 失败是循环的一部分:首次尝试的彻底失败,在Agentic Loop范式下并非终点,而是迭代的起点。这与传统软件工程中的"快速失败"(fail fast)理念一脉相承,但在AI语境下具有了新的含义——每次失败都为模型提供了关于问题空间的额外信息。
- 规模化协作已现雏形:86个智能体协同完成一个原型,展示了多智能体编排的实际潜力。随着智能体编排框架的成熟和模型推理成本的持续下降,这种"AI开发团队"的模式可能成为未来软件工程的常态。
当然,我们也应保持理性。当前成果仍是"非常粗糙的原型",距离真正可玩的游戏还有巨大差距。但正如作者所说,"这可以被推进得更远"。对于所有关注AI编程与自主智能体的人来说,这类真实的、透明公开成本与失败的实验,比任何营销演示都更有参考价值。
相关推荐

无状态数据库:AI智能体记忆的轻量化方案详解
深入解析无状态智能体记忆数据库的设计原理与工程价值,探讨轻量化方案如何解决AI Agent记忆管理痛点,涵盖无状态架构优势、向量检索替代方案及实际落地挑战。

零框架实现RAG与Agent:AI工程师必备的底层能力
深入解析AI Engineer Notebooks开源项目,通过零框架方式从底层代码实现RAG检索增强生成、Agent智能体和Evals评估体系,帮助开发者摆脱框架黑盒,真正理解AI工程核心原理。支持Google Colab免费运行。

Gemini Omni 1.1 Flash深度解读:全模态+极速推理如何改变AI落地
深度解读谷歌Gemini Omni 1.1 Flash模型的全模态能力与极速推理特性,分析其产品定位、开发者应用场景、与GPT和Claude的竞品对比,以及对AI规模化落地的实际意义。