Gemini 4 Pro对决Opus 5 Max:Three.js建3D龙谁更强?

未发布的Gemini 4 Pro与满血Opus 5用Three.js生成3D龙,结果两者平手。
本文记录了一次非官方的横向对比测试:使用同一提示词,分别让尚未正式发布的Gemini 4 Pro与以最高Max档运行的Claude Opus 5,通过Three.js从零生成一条3D龙。这项任务综合考验模型对WebGL建模、材质光照与动画的掌握程度,结果可视化且难以造假。令人意外的是,两者表现基本处于同一水准——Gemini在"未定稿"状态下硬是咬住了满配对手。文章由此延伸出两个趋势判断:头部大模型的代码生成能力差距正快速收窄,以及评测时必须说明算力配置才有公平可言。
同一条提示词,交给两大顶尖模型,让它们用 Three.js 从零搭建一条 3D 龙——这样的横向对比,往往比跑分榜更能反映模型在真实编程场景下的实力。这次的主角是尚未正式发布的 Gemini 4 Pro,以及火力全开、拉满 Max 档的 Opus 5。
测试设定:不对等的较量
这场对比有一个关键前提值得先说清楚:两个模型并非站在同一起跑线上。Opus 5 这次是以 Max 档满血状态参战,相当于拿出了最强配置;而 Gemini 4 Pro 还没有正式发布,测试用的是尚在打磨阶段的版本。

换句话说,这是一场“未定稿的新秀”对阵“满配的老将”的较量。理解了这个背景,才能真正读懂结果的含金量。

用 Three.js 搭建 3D 龙是一个相当综合的考验:它既要求模型理解 WebGL 与 Three.js 的几何建模逻辑,又需要处理材质、光照、动画等多个维度,还得让最终产物在浏览器里真正“跑起来”。这类任务难以靠背题蒙混,非常考验模型的代码生成质量与工程完整度。
Three.js 是一个基于 WebGL 的开源 JavaScript 3D 图形库,允许开发者在浏览器中无需直接操作底层 GPU 指令即可创建复杂的三维场景。用它构建一条有细节的 3D 龙,需要同时处理几何体建模(骨骼结构、鳞片曲面)、材质与纹理映射、动态光照渲染,以及骨骼动画或关键帧动画等多个子系统。对 AI 模型来说,挑战不仅在于能否写出语法正确的代码,更在于能否把这些模块有机整合成一个在真实浏览器环境下可直接运行、视觉上完整的作品——任何一个环节的逻辑缺失或 API 调用失误,都会导致画面空白或控制台报错,结果当场可验证,无从掩盖。
结果:Gemini 咬得很紧
从实际生成效果看,结论出乎不少人意料——Gemini 4 Pro 确实跟得上,两者基本处在同一水准线上。

考虑到 Opus 5 是满血 Max 档,而 Gemini 4 Pro 尚未定稿,能在这样的对手面前“咬住不掉队”,本身就说明了不少问题。UP 主给出的评价是:这个表现“已经很能打了”。

对于一个还未正式发布的版本来说,能与顶级竞品打成平手,意味着其正式版极可能进一步拉高上限。这也从侧面反映出当下头部大模型在代码生成能力上的差距正在快速收窄。
Claude Opus 5 的"Max 档"指的是 Anthropic 为 Claude 系列提供的最高算力推理配置,通常意味着更长的上下文窗口、更多的内部计算步骤(extended thinking)以及更低的速率限制,代价是更高的 token 成本和更长的响应延迟。在代码生成场景中,Max 档允许模型在输出前进行更深入的规划与自我校验,理论上能生成结构更完整、逻辑更严密的代码。因此,将其与仍处于预发布阶段的 Gemini 4 Pro 直接比较,相当于让后者在资源受限的情况下迎战对手的"超频"状态,Gemini 能在此条件下持平,说明其基础代码能力的天花板具备相当竞争力。
为什么这类对比值得关注
跑分榜单固然直观,但真实的开发者更关心模型能不能“一次成型”地写出可运行的复杂代码。Three.js 3D 场景恰好是这样一块试金石——它把抽象的建模能力、API 熟悉度、调试逻辑和审美判断浓缩进了一个可视化的产物里。
模型输出的龙好不好看、动画顺不顺、代码报不报错,用户一眼就能感知。这种“所见即所得”的对比,比枯燥的基准测试更有说服力,也更贴近实际生产力场景。
从这次结果延伸看,两点趋势比较清晰:一是主流大模型在代码生成这条赛道上已经进入贴身肉搏阶段,头部之间的差异越来越微妙;二是模型的“档位/算力配置”对最终表现有实质影响,评测时把配置说清楚才有公平可言。
结语
满血 Opus 5 与未发布的 Gemini 4 Pro 在 3D 龙这道题上打成平手,既是 Gemini 潜力的证明,也是整个大模型编程能力集体跃升的缩影。至于正式版发布后谁能更胜一筹,还要留待更多实测验证。
你会押哪一个?欢迎在评论区聊聊你的判断。
注:本文基于单一 B 站 UP 主的对比测试,样本有限,结果仅供参考,不代表两模型的全面能力排名。
相关推荐

Vercel AI SDK 更新:@ai-sdk/xai 新增 Grok 模型支持
Vercel AI SDK 发布 @ai-sdk/xai@3.0.134 补丁更新,新增对新版 Grok 模型 ID 的支持,并同步升级 provider-utils 与 openai-compatible 依赖。本文解读更新内容及开发者应对建议。

Gemini Pro 订阅方案对比:Pixel 失效后如何选择
Gemini Pro 订阅方案最新对比:Pixel 渠道被谷歌封控失效,学生优惠认证收紧仅推荐老账号,Jio 渠道虽便捷但存在掉订阅与价格波动风险。一文看懂如何选择合适的 Gemini Pro 订阅渠道。

Gemini 3.5 Pro难产背后:谷歌为何疯狂押注Flash
Gemini 3.5 Pro延期难产,谷歌却疯狂迭代3.8 Flash。本文从智能、速度、单位任务成本与TPU算力能效角度,解析谷歌如何重新定义大模型战争,从军备竞赛转向工业竞赛。