花20万美元实测GPT-5.6:AI编程助手的临界点到了吗

知名开发者与科技博主 Theo(t3.gg)在最新视频中分享了一段极为罕见的亲身经历:在获得 GPT-5.6 提前访问权限的一个半月里,他消耗了约 18 万到 24 万美元的推理算力,横跨 67 个项目,将这个模型推到了前所未有的极限。他明确表示,这不是一篇评测,而是一份「我到底用它做了什么」的实战记录。
一个半月、20万美元:这场测试有多极端?
Theo 坦言,这种量级的用量远超正常使用场景,「没有人应该每个月这么干」。他之所以如此激进,是因为 OpenAI 给了他近乎无限的额度,而他想看看这个模型的天花板到底在哪里。
你可能没注意到,他强调 OpenAI 并未为这次内容付费,他自己仍在按全价支付 200 美元/月的订阅。大型语言模型的推理成本通常按 token 计费,GPT 系列 API 定价区分输入与输出 token,而「Fast Mode」是优先级更高、延迟更低的推理通道,单价往往是标准模式的数倍。若按 Fast Mode 定价,他做的很多单项工作就要花费上万美元——比如一次运行就烧掉了 712 亿 tokens,折合约 9.1 万美元,对应单价约为每百万 token 12-13 美元,与 GPT-4o 级别高优先级 API 定价吻合。但他也指出,如果不用 Fast Mode,价格几乎能砍半,而 200 美元套餐本身每月就附带约 1.4 万美元的 Codex 推理额度——这一额度通过用量上限而非无限量来控制成本,意味着对绝大多数开发者而言,日常编程辅助的合理用量完全在订阅覆盖范围之内。

从「会走神」到「咬住任务不放」:5.6 与 5.5 的本质差异
Theo 认为 GPT-5.6 相比前代 5.5 最核心的进步,在于任务持久性和意图理解能力。
「任务持久性」本质上是长上下文窗口管理与指令遵循能力的综合体现。早期大模型在处理超长对话时面临「上下文遗忘」问题——随着 token 数量增加,模型对早期指令的权重降低,导致任务偏移甚至停滞。他形容 5.5「像是会迷路然后停下来」,一旦上下文中混入错误信息,就得重开线程,正是这一问题的典型表现。而 5.6 完全没有这个问题——他可以让一个线程「永远跑下去」都不出错,意味着其在长上下文检索、中间状态追踪以及错误恢复机制上都有显著改进,与当前业界对「代理可靠性(agent reliability)」的核心研究方向高度吻合。
最夸张的案例是,他让模型执行一个大任务,它连续运行了 20 多个小时,中途无需任何干预,直到把事情做完。这种「工作马」式的稳定性,让他原本觉得鸡肋的长任务功能(Slash Goal)重新变得有意义——尽管他后来发现根本不太需要它,因为模型本身就能持续运行数小时。
在子代理(sub-agent)编排上,差距同样显著。子代理编排是多智能体系统的核心模式:一个「编排者」将复杂任务分解为子任务,动态派发给多个专职代理并行处理,最终汇总结果。GPT-5.5 在此场景的失败——维护多线程任务状态和处理异步结果回调时的上下文管理缺陷——正是 Theo 所描述的「困惑、迷失」的底层原因。Theo 曾展示过一些让模型自动开线程审查 PR 的循环,事后他承认那些其实都是 5.6 完成的,只是当时手动伪装成了 5.5。当他真拿同样的提示词去测试 5.5 时,「它就困惑、迷失了」。GPT-5.6 稳定扮演编排者角色的能力,对构建自动化 DevOps 流水线和企业级 AI 工具具有重要意义。
AI操作计算机:真正的「我们到了」时刻
如果说有一件事让 Theo 彻底改观,那就是 GPT-5.6 的计算机操作(computer use)能力,尤其是浏览器控制。他此前对 AI 操作电脑这件事极度怀疑——既要截图、又要手动移动鼠标到坐标、点击、等待,凭什么会比人快?
AI 操作计算机(Computer Use)是当前智能体研究的重要方向,其核心技术路径包括:截图+坐标映射(通过视觉模型识别屏幕元素并输出点击坐标)、DOM 解析(直接读取网页结构而非截图)以及无障碍 API 调用(利用操作系统的 Accessibility 接口)。Anthropic 在 2024 年率先将 Computer Use 能力开放给 Claude 3.5 Sonnet,引发广泛关注。
但 5.6 改变了他的看法。他分享了一个颇具戏剧性的案例:他有台机器因为拔 SSD 导致引导分区损坏,卡在了只能跑内存测试的 grub 界面。他把情况告诉模型,模型「说了句 hold my beer」,反复重启几次、进入 grub shell、正确引导系统,然后通过远程控制打开终端、修复了引导分区——全程自主完成。GPT-5.6 在此任务中展现出的稳定性,使其能够处理上下文需要跨越物理重启边界的高难度任务,正是「操作-观察-决策」循环可靠性的体现。
他形容这是「那种最强烈的『卧槽我们真的到了』的时刻」,因为这类任务通常需要大量研究、耐心和风险承受能力。他还搭建了一个可启动的 Codex U盘,插入任意机器即可获得预装好 Codex 的远程访问环境,配合 GL.iNet 的远程 KVM(一种将物理机的键盘、显示器、鼠标信号通过 IP 网络转发的硬件设备),实现了对整个机房的自动化配置——理论上可对无法远程 SSH 连接的裸机进行全自动运维。

大规模代码重写:React Native、Swift 与 Rust 实验
Theo 用大量篇幅描述了他最兴奋的部分——大规模 AI 代码重写。
React Native 是 Meta 开发的跨平台移动应用框架,允许开发者使用 JavaScript/TypeScript 一套代码同时构建 iOS 和 Android 应用。AppKit 是苹果基于 Objective-C 时代的成熟 macOS 原生 UI 框架,SwiftUI 则是 2019 年推出的声明式现代框架。将 React Native 应用完整迁移为原生 Swift 实现,通常需要数周乃至数月的工程投入,因为两者的组件模型、状态管理哲学和平台 API 差异巨大。
在 T3 Code 项目中,他让 GPT-5.6 把整个 React Native 移动应用分别用 AppKit/Swift 和 SwiftUI 从零重建了两遍。令他震惊的是,两个原生版本都功能完整、端到端可用,且每个都只花了 2 到 4 个小时——这不仅考验代码生成能力,更考验对不同框架范式的跨域理解能力。
更激进的是两个 Rust 重写实验。Rust 是 Mozilla 发起的系统编程语言,以内存安全、零成本抽象和极高性能著称,近年来在替代 C/C++ 的高性能场景中快速崛起。TSGo(TypeScript to Go transpiler)是将 TypeScript 代码转译为 Go 语言的工具,用 Rust 重写其 Go 移植版,意味着需要实现完整的 TypeScript 语法解析器、类型系统建模以及代码生成器——这是编译器工程中的顶级复杂度任务。他先是把 Hermes Agent 用 Rust 完整重写,得到一个只占用约 15MB 内存的版本,能独立响应、创建线程、调用模型,运行约一天后验证可用。随后他挑战了更疯狂的目标:用 Rust 重写 TypeScript 的 Go 移植版(TSGo)。
结果耐人寻味。他确实得到了一个 100% 可用、比 Go 版快最多 18 倍的转译器,代码库达到近 20 万行 Rust,分布在 29 个 crate 中。但他也如实引用了另一模型 Fable 的评估:这是「一个宽泛的原型,只有极小的已验证切片」,距离可用工具约 15-20%,距离真正替代 TSGo 仅 5%,且当前测试处于失败状态。这揭示了 AI 生成大型代码库的典型问题:表面完成度(代码量、模块结构)与实际可用性(边界情况覆盖、测试通过率、生产验证)之间存在巨大鸿沟——这种诚实的自我评价,恰恰揭示了大规模 AI 生成代码「看起来完成度很高,实则未经证明」的典型陷阱,也是当前 AI 辅助软件工程领域亟待解决的核心挑战之一。

前端与3D生成:进步真实,但远未成熟
Theo 特意泼了盆冷水:GPT-5.6 并不是一个「魔法般完美」的前端模型。它生成的终端 token 追踪器 UI「极其丑陋」,他最终不得不用 Opus 4.8 重做。他的评价是,5.6「更可控、默认审美没那么糟」,但「无论如何都算不上优秀的前端模型」。
在 3D 游戏生成方面,他让模型重建了一个 3D 版小游戏 Fish Slop,模型自行生成了 3D 环境、地面石头和纹理——有些纹理甚至比 Grok 的输出更好,但石头明显更差,怪物和鱼的模型则「奇丑无比」。他形容 5.6 对 3D 的理解「很奇怪」,还未到能发布的程度,但进步速度足以让他持续关注这个方向。
结语:这个模型让他「想得更大」
Theo 反复强调一个感受:GPT-5.6 让他重新燃起兴奋,想要构建更多、思考更大。他甚至把最近在 CascadiaJS 和 AI Engineer 大会上「思考得更宏大」的主题演讲,部分归因于这个模型的推动——「简单的事情对它来说太简单了,我不得不逼它去做更大、更难的东西」。

需要说明的是,本文基于 Theo 的单一来源(t3.gg 视频),且他本人明确表示尚未阅读任何其他评测、未接触基准数据、未测试 Pro 版本或 ChatGPT 内的表现,也不涉及定价、速率限制等信息。他承诺后续会推出正式评测、与 Fable 的对比以及日常使用技巧。因此,这份记录更适合作为「一位重度用户的真实体验样本」来理解,而非对 GPT-5.6 的全面结论。
即便如此,其中透露的信号已足够清晰:AI 编程正在从「需要精细引导的助手」向「能独立咬住复杂任务数小时甚至数天的工作马」演进,而计算机操作能力的成熟,或许正是下一个真正改变开发者生产力的临界点。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。