AI造游戏实测:Claude、Kimi K3、ChatGPT复刻经典谁最强

近期,B站UP主LanceyPoo进行了一场颇具话题性的AI编程对决:让三款顶尖AI模型——Claude(搭配Fable 5)、Kimi K3和ChatGPT(Codex)分别复刻《空洞骑士》《茶杯头》和《塞尔达传说》三款经典游戏。这场测试不仅是模型代码能力的直接比拼,更展现了当前AI在复杂交互式项目上的真实水平。本文将梳理测试过程与结论,并对三款模型的表现进行分析。
测试方法:统一提示词与极限推理模式
为保证公平,UP主采用了相对一致的测试流程:先让AI自己生成一段详细的游戏克隆提示词,再将其粘贴回对应工具执行。三款模型都被调至各自的最高性能档位——Claude拉到「Ultra Code」,Kimi K3开启「最大推理/YOLO模式」,ChatGPT则使用Codex的「终极代码模式」。
这些极限模式的背后是不同的技术实现路径。Claude的Fable 5是Anthropic推出的专注于代码生成的产品形态,Ultra Code模式会调用更多计算资源进行深度推理,允许模型在更长的思维链上反复验证代码逻辑;Kimi K3是月之暗面(Moonshot AI)推出的大模型,其YOLO模式打破常规token限制,让模型在单次响应中自由探索最优解决方案;ChatGPT的Codex则是OpenAI专为编程任务设计的代理工具,能够在沙盒环境中自主编写、运行和调试代码。这些模式的共同特点是牺牲响应速度换取输出质量,让模型在单次生成中投入更多「思考」步骤。
测试目标很明确:在浏览器中运行、素材从网络获取、尽可能接近原作。三款游戏各有难点——《空洞骑士》考验平台跳跃与Boss战设计,《茶杯头》强调格挡与弹幕战斗,《塞尔达传说》则需要开放世界、地图系统和解谜机制。这种设定几乎把AI生成游戏最容易翻车的环节全部囊括其中。
这里有必要解释这些技术难点为何如此关键。「软锁」(Softlock)指玩家在游戏中陷入无法继续但也无法死亡的状态,通常由关卡设计逻辑漏洞导致,比如角色跳到一个无法离开也无法触发死亡的平台上。「碰撞检测」(Collision Detection)是判断游戏中物体是否接触的算法,2D平台跳跃游戏中尤为关键——如果检测不精确,角色会穿过平台坠入虚空或卡在墙壁里动弹不得。「状态机」(State Machine)是管理游戏对象行为切换的编程模式,比如Boss从「巡逻」到「攻击」到「受伤」再到「死亡」的状态转换,每个状态有独立的逻辑和明确的过渡条件。这三者的质量直接决定了一款游戏是否「可玩」,而非仅仅「能运行」。
Claude Fable 5表现:意外的赢家
Claude的表现堪称惊艳。它生成的《空洞骑士》克隆版被UP主评价为「我看过人工智能生成的最好的2D游戏之一」。这款游戏不仅有完整的世界观(飞蛾之光、暗影系统),还实现了地图、货币「极欧」、面具碎片、灵魂容器、冲刺和墙壁攀爬等一系列核心机制。
对于不熟悉《空洞骑士》的读者,有必要说明这些机制的复杂程度。《空洞骑士》(Hollow Knight)是Team Cherry开发的类银河战士恶魔城(Metroidvania)游戏,以其精密的战斗系统和庞大的互联世界著称。「面具碎片」是游戏中的生命值系统——每收集四个碎片增加一格生命上限,这意味着AI需要实现一个带有进度追踪的收集系统;「灵魂容器」则是法力系统,通过攻击敌人积攒灵魂能量来释放法术或回血,这要求AI理解「攻击→积攒→消耗」的资源循环;「冲刺」和「墙壁攀爬」属于能力解锁型探索机制,玩家获得新能力后可以到达之前无法抵达的区域,这对关卡设计的前后一致性提出了很高要求。AI能完整实现这套互相嵌套的系统,说明其对复杂游戏逻辑架构具备相当的理解力。

最令人印象深刻的是Boss战设计——多阶段变身、召唤小兵、向下瞄准攻击等机制一应俱全,难度甚至让UP主直呼「这是我人生中最难的事」而最终放弃通关。这从侧面证明了游戏逻辑的完整度——一个设计糟糕的Boss战要么毫无挑战(AI总是处于同一状态),要么直接卡死(状态转换出错),而Claude生成的版本显然实现了合理的难度曲线和完整的行为树。
《茶杯头》克隆版同样出色,格挡系统、多种武器、大招机制和Boss形态切换都得到了还原,UP主表示「和我在视频里看到的原版几乎一模一样」。《茶杯头》(Cuphead)是Studio MDHR制作的横版射击游戏,以1930年代橡皮管动画风格和极高的Boss战难度闻名。游戏的核心循环围绕「格挡」(Parry)机制展开——玩家在空中对粉色物体按下跳跃键可以弹开它们,同时积攒大招能量。这一机制将被动闪避转化为主动进攻选择,构成了游戏的策略深度。Claude能准确实现这种「风险-收益」的博弈设计,体现了其对游戏设计哲学的深层理解。
《塞尔达传说》版本则加入了长笛演奏解谜(输入按键序列触发旋律)、锁定目标、后空翻、弹弓、符文地图等塞尔达标志性元素。《塞尔达传说》系列(特别是《旷野之息》之后)以开放世界探索、物理引擎交互和地下城解谜三大支柱构成核心体验。「符文地图」对应游戏中的希卡之石功能,玩家通过特殊能力与环境互动解决谜题;「锁定目标」和「后空翻」则是系列标志性的Z注目战斗系统——锁定敌人后可以环绕移动并执行闪避动作;长笛演奏解谜致敬了《时之笛》中通过演奏特定旋律触发机关的经典设计。这些机制之间的互相配合构成了极其复杂的系统网络。UP主称其为「目前最酷的游戏」,唯一的遗憾是战斗系统仍需打磨。
Kimi K3表现:潜力巨大但细节欠佳
Kimi K3的表现处于中游,属于「有想法但执行不够完善」的类型。它的《空洞骑士》版本引入了「明线」和「苍白王国之听」的设定,游戏性被评价为「挺有趣」,但外观明显不及Claude,地图质量也较差,且存在软锁问题——平台跳跃有时无法稳定落到目标平台上。

《茶杯头》版本反而收获了不错的评价。虽然加入了UP主并不喜欢的胶片颗粒效果(好在可以关闭),但格挡手感和Boss第二阶段的设计都可圈可点,被认为「在风格上与原版不同,但这是好事」。值得一提的是,胶片颗粒效果是模拟老式赛璐珞动画放映时的画面噪点,是《茶杯头》原版视觉风格的标志性元素——Kimi K3选择加入这一效果说明它对原作美学有一定认知,只是在浏览器游戏的语境下这种滤镜反而成了干扰。
《塞尔达》版本创造了「岁月之冠破碎」的完整世界观,有世界地图、地下城地图、魔法弓、Boss钥匙与小钥匙的锁匙系统。可惜稳定性是硬伤——UP主多次遭遇无限循环卡死,甚至不得不重启整个游戏。无限循环通常源于状态机的转换条件设计不当,比如两个状态互相触发对方的进入条件,导致程序在两个状态之间无限跳转而无法继续执行游戏逻辑。但即便如此,他仍认为「Kimi K3创造了一个奇妙的世界,潜力巨大」。

ChatGPT Codex表现:全面翻车
令人意外的是,被寄予厚望的ChatGPT Codex在这场测试中表现最差。它的《空洞骑士》克隆版存在严重的跳跃高度和碰撞检测问题——角色跳不到应有的高度,下落后又会被莫名传送回原点,UP主直言「这是最差的,而且你花了太久,我对你太失望了」。

这些问题看似简单,实则暴露了模型在物理参数协调上的根本缺陷。跳跃高度取决于初始速度和重力加速度的配合,而平台的垂直间距必须与跳跃抛物线匹配——如果AI在设置物理参数和关卡布局时没有进行统一规划,就会出现「看得到但跳不到」的致命问题。被传送回原点则通常是碰撞检测的回退机制(fallback)被错误触发,说明模型没有正确处理角色与环境交互的边界情况。
《茶杯头》版本虽然勉强能玩,但缺乏挑战性,激光等核心弹幕机制几乎缺失,UP主「连发就赢了」,评价为「彻底失败」。《塞尔达》版本更是问题重重:门的开合操作是反的、角色比例失调(「我和房子一样高」)、地图上到处都是无意义的灯塔。UP主最终评价「太糟了,我甚至不想再给你机会」。
最终排名与思考
综合三轮测试,最终排名清晰:Claude(Fable 5)> Kimi K3 > ChatGPT(Codex)。
这个结果值得玩味。它说明在「一次性生成复杂交互式项目」这类任务上,模型的代码质量、状态管理和对游戏机制的理解存在显著差异,而这种差异并不总与模型的通用名气成正比。
从技术角度看,让AI在单次对话中生成完整可玩游戏,本质上考验的是模型在超长输出中维持逻辑一致性的能力。传统软件开发是增量式的——开发者逐步编写、测试、修复代码,每一步都有人类验证。而AI一次性生成则要求模型在输出第一行代码时就「预见」数千行之后的系统交互关系:第100行定义的物理参数必须与第3000行的关卡布局兼容,第500行的状态机定义必须与第2000行的Boss行为逻辑自洽。这涉及长上下文窗口的有效利用、代码模块间依赖关系的正确规划、以及对边界条件(如玩家在极端位置的行为)的预判。
Claude在游戏逻辑完整度、碰撞检测和Boss状态机上的稳定表现,反映了其在长上下文代码生成上的优势,这可能源于Anthropic在训练中对长文档代码生成的特别优化,以及其Constitutional AI框架下对输出一致性的重视;Kimi K3展现了不错的创意与世界观构建能力,但工程稳定性(软锁、无限循环)是其主要短板,说明模型在「想象力」和「工程严谨性」之间尚未找到平衡点;而ChatGPT此次的失利,则提醒我们同一模型在不同工具链和配置下的表现波动可能非常大——Codex的沙盒执行环境理论上应该有助于代码调试,但在这次测试中似乎并未发挥预期作用。
当然,这类对比更多是娱乐性质的横评,样本量有限、提示词和工具链差异也会影响结果,不宜作为严谨的基准测试结论。但它直观地告诉我们:AI生成完整可玩游戏的时代已经到来,「软锁问题」「碰撞检测」「平台跳跃稳定性」正成为衡量AI编程能力的新试金石。对于开发者而言,AI已能快速搭建出一个「有很好基础」的游戏原型,剩下的打磨工作——微调物理参数、修复边界情况、平衡难度曲线——仍需人类介入。而这恰恰是游戏开发中最耗时也最需要「手感」的部分。
相关推荐

Qwen3 27B深度评测:推理能力强大却过度思考的解决方案
深度评测Qwen3 27B开源模型的推理能力与过度思考问题。分析27B参数规模的性能优势、过度思考的原因与代价,并提供关闭思考模式、分场景配置等实用优化建议。

Gemini 3.7 Flash发布:智能体经济学之争全面打响
Google DeepMind发布Gemini 3.7 Flash,聚焦编程与智能体能力,激进定价抢占市场。OpenAI推出Ultrafast押注延迟,DeepSeek持续施压成本效率,AI行业智能体经济学竞争格局深度解析。

AI算法工程师自学路线:从零基础到拿到Offer的完整规划
详解AI算法工程师自学路线图,涵盖基础阶段、核心算法、CV与NLP方向选择及转行就业策略。帮助零基础和跨专业学习者建立系统学习规划,掌握从需求分析到模型部署的全链路能力。