GPT-5.6三模型深度实测:Soul/Terra/Luna能力与体验全解析

GPT-5.6:一次发布,三个模型
OpenAI 这次的 GPT-5.6 发布方式颇为特别——它并非单一模型的迭代,而是以 GPT-5.6 为统一命名,一次性推出了三个独立模型。据科技测评博主 Bijan Bowen 的实测分析,这三个模型分别面向不同的使用场景与预算:
- Soul:新的旗舰版本,性能最强、成本最高;
- Terra:定位日常工作的平衡型模型;
- Luna:最具成本效益的入门级模型。
OpenAI 在官方博文中详细拆分了各订阅层级对应的访问权限。这种「一名多模」的策略,本质上是用一套命名体系覆盖从个人到企业的全部需求层次。
多模型分层策略的行业背景:OpenAI 此次「一名多模」策略并非孤例,而是整个大模型行业在2024-2025年间逐渐形成的产品范式。Anthropic 的 Claude 系列(Haiku/Sonnet/Opus)、Google 的 Gemini 系列(Flash/Pro/Ultra)均采用类似的三层架构:旗舰模型追求性能天花板,中间层平衡性能与成本,入门层主攻高频低复杂度任务。这种分层背后的工程逻辑,通常来自知识蒸馏(Distillation)技术——将大模型的「知识」压缩进更小的模型中——以及混合专家架构(Mixture of Experts, MoE),允许模型根据任务复杂度动态调用不同规模的子模块。对企业客户而言,这种分层意味着可以根据业务场景精细化控制成本,而非为所有查询支付旗舰价格。
定价结构同样值得关注。旗舰 Soul 的输入价为每百万 Token 5 美元、输出 30 美元;Terra 恰好减半,输入 2.5 美元、输出 15 美元;Luna 则进一步下探至输入 1 美元、输出 6 美元。此外还有面向专业和企业用户的 GPT-5.6 Soul Pro——博主推测它未必是新收费层级,而更可能是消耗更多 Token 的高强度运行模式。
Token 效率:被低估的核心竞争力
Token 是大语言模型处理文本的基本计量单位。在英文中,一个 Token 大约对应 3/4 个单词;中文由于字符密度更高,通常 1-2 个汉字对应一个 Token。当我们谈论「每百万 Token X 美元」的定价时,本质上是在衡量模型处理和生成信息的算力消耗。输入 Token(Prompt)和输出 Token(Completion)通常单独计费,这是因为生成文本比读取文本消耗更多算力——模型需要逐个预测下一个 Token 的概率分布。对开发者而言,Token 效率不仅关乎成本,更影响响应速度:同等任务若能用更少 Token 完成,意味着更低的延迟和更高的并发上限。
在解读基准测试数据时,博主特别点出了一个容易被忽视的维度——完成同等任务的实际成本。GPT-5.6 系列在多项测试中,能以明显更低的成本达到与竞品(如 Opus 4.8、Fable 5)同等甚至更高的性能水平。
Token 效率的持续提升是 GPT-5.5 相比 5.4 的核心改进,GPT-5.6 延续了这一趋势。对于自掏腰包的开发者和个人用户而言,这意味着实实在在的费用节省——即便在性能超越 Opus 4.8 的场景下,Soul 的成本仍显著低于 Cloud Fable 5 的最大努力模式。
惊艳的能力:从操作系统到混合现实
博主的第一个测试是 BrowserOS V2.5,使用 Soul 的最大努力模式(通过 Cursor 运行,因为该模型最先在 Cursor 上开放)。生成的「NovaOS」桌面环境相当完整:macOS 风格的 Dock、顶部菜单栏、右键菜单、Ctrl+K 搜索,甚至内置了一个可自动播放的音序器「声音实验室」。其中的 GTA 克隆游戏、绘图应用(画布能随窗口缩放)、计算器均表现正常。博主评价这是「非常出色的结果」,那个出乎意料的键盘音序器尤其加分。

Vision Pro 应用:超出预期的震撼
Apple Vision Pro 于2024年初正式发售,其核心开发框架是 RealityKit 和 visionOS SDK。与传统 iOS/macOS 开发不同,visionOS 引入了「空间计算」(Spatial Computing)概念,要求开发者处理3D场景图(Scene Graph)、手势追踪(Hand Tracking)、碰撞检测(Collision Detection)等全新维度。能够自动生成包含灵敏度调节、3D定位和交互响应的架子鼓应用,意味着模型需要同时掌握 SwiftUI/RealityKit API、3D音频空间化原理以及 visionOS 的窗口管理机制。
真正让博主惊叹的是 Apple Vision Pro 测试。他给出一个简单提示——制作一个可以用手在混合现实中敲击的虚拟架子鼓应用。模型不仅生成了 3D 逼真的架子鼓,还配上了灵敏度、鼓面高度等调节选项,甚至放置了实际的应用图标。
博主直言「完全没有预料到这样的质量」,认为体验「差不多就是坐在真实架子鼓前的感觉」。相比此前用 GPT-5.5 和 CodeX 做 Vision Pro 内容的尝试,这一次「简直是天壤之别」。这类「空间应用」的开发难度远高于普通2D应用,因为错误的深度估计或手势映射会直接导致令人不适的感官体验,行业内通常需要有XR开发经验的专业团队才能完成高质量实现。
硬核挑战:让绝版网络平板重新联网
最能体现模型「自主解决问题能力」的,是一个极端案例:让一台 21 世纪初从未公开发售的 Intel 网络平板(演示样机,无驱动、无说明书)重新联网工作。

模型展现出令人印象深刻的推理链条:确认原始软件仅支持 Windows 98/ME → 规划用 UTM(基于 QEMU 的模拟器)运行 X86 虚拟机并进行 USB 穿透 → 找不到原始安装介质后转向暴力编写用户空间驱动,以绕开苹果内核扩展签名障碍。
UTM 与 QEMU 虚拟化技术背景:UTM 是基于 QEMU 开源虚拟机框架开发的 macOS/iOS 虚拟化工具。QEMU(Quick Emulator)通过动态二进制翻译技术,可以在现代 ARM 芯片(如 Apple Silicon)上模拟 x86 指令集,使得运行 Windows 98/ME 等老旧操作系统成为可能。苹果自 macOS 10.15 起逐步废弃了内核扩展(kext)机制,转向更安全的 System Extension 框架,这直接导致大量依赖底层硬件访问的老旧驱动程序无法在现代 macOS 上运行。模型选择在用户空间(User Space)编写驱动的绕过方案,本质上是避开苹果的内核签名验证机制——这一推理路径展示了大模型在系统级工程问题上,能够综合考量操作系统安全策略、硬件兼容性和实际约束条件的复杂推理能力。
最终,基站适配器成功变绿并开始闪烁——这是博主此前从未见过的状态,说明取得了实质性进展,尽管平板本身尚未完全联通。
令人抓狂的体验:新「工作应用」是最大败笔
然而,这次测试也是博主口中「最令人沮丧的测试之一」。问题几乎全部集中在 OpenAI 同步发布的全新在线「工作」界面上,他明确表示「同时发布它们是一个糟糕的决定」。

多个前端项目(滑板模拟、跳伞模拟、僵尸 FPS、街袭低多边形游戏)在生成后陷入困境:预览连接丢失、云浏览器无法使用、文件不落到输出目录、点击预览返回服务器错误。博主反复要求「把文件给我」,模型却持续生成大量仅用于自身预览的冗余文件。
云端开发环境的产品化挑战:OpenAI 新推出的在线「工作」界面属于云端 IDE(Integrated Development Environment)范畴,类似产品还包括 GitHub Codespaces、StackBlitz 的 WebContainers、Replit 等。这类产品的核心技术挑战在于:将代码执行环境、文件系统、预览服务器和 AI 生成流程无缝整合在一个浏览器会话中,同时处理网络中断、会话超时和沙箱安全隔离等工程问题。文中出现的「预览连接丢失」「云浏览器无法使用」「文件不落到输出目录」等问题,都是这类产品在初期上线时的典型工程债务(Technical Debt)。相比之下,Cursor 等本地 AI 代码编辑器因为直接操作本地文件系统,天然规避了云端状态同步问题,但也牺牲了跨设备访问和协作能力。这一取舍反映了当前 AI 辅助开发工具在「易用性」与「可靠性」之间仍未找到最优解。
结果无法验证,挫败感倍增
最典型的案例是那个手表公司前端——模型执意在自带预览中展示,而博主「无法绕过登录」,也无法访问最终网站。

更耐人寻味的是,某个手表设计的输出质量反而不如几周前「据说是 GPT-5.5」的版本,博主因此怀疑那可能是 5.6 的隐藏早期测试。而最后临时生成的「街袭」低多边形打击游戏,虽然场景完整可玩(可以打鸽子、汽车、行人),却持续拖垮 Firefox,换机、清缓存后依然无法正常游玩。
总结:模型能力强悍,产品体验拖了后腿
Bijan Bowen 的核心判断可以浓缩为一句话:GPT-5.6 模型本身可能很出色,但被同步推出的工作应用严重拖累。
模型层面,GPT-5.6 在 Token 效率、成本控制、3D 与混合现实内容生成、长链条问题求解等方面均有亮眼表现。Vision Pro 架子鼓和老平板复活案例,展现了强大的自主执行与创造能力。但在精细前端细节上,5.6 通过 Cursor max 模式运行时并未完全达到博主预期,个别结果甚至不如前代。
体验层面则是另一个故事。新的在线工作界面逻辑混乱、频繁报错、结果难以导出与验证,几乎抹杀了测试的实用价值。博主坦言本次测试「非常耗费精力」,剪辑时不得不删去大量自己情绪失控的片段。
对普通用户的建议:GPT-5.6 值得期待,但若想真正发挥其潜力,目前更推荐通过 Cursor 等成熟的第三方工具接入,而非仓促上线的官方工作应用。多模型分层与 Token 效率的进步,代表了 OpenAI 在成本竞争上的持续发力;但产品化成熟度的打磨,仍需时间。
核心要点
相关推荐

Bullet登场:YC新秀主打更快的编程Agent
YC S26初创公司Bullet推出主打速度的编程Agent,瞄准开发者延迟痛点。本文分析Bullet的差异化定位、编程Agent提速技术路径,以及在Cursor、Claude Code等竞品环绕下的市场机会。

Ballet:用代码固化AI工作流,每次执行都给出确定结果
Ballet将自然语言描述的工作流转化为确定性代码执行,配合审计日志、一键回滚、模拟模式等企业级功能,解决AI Agent结果不稳定的痛点,让运营团队实现可靠的业务自动化。

AI Group Call:六个AI同时语音开会为你出谋划策
AI Group Call 让六个AI角色在语音会议中轮流发言、相互辩论,为你提供多角度决策建议。支持即时打断、自动转录总结和持续对话,探索多智能体协作的全新交互范式。