GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析

GPT-5.6发布:ChatGPT与Codex的深度整合
OpenAI正式发布GPT-5.6,这一代最大的看点并非单纯堆参数,而是让每一个Token产出更多有用工作。据B站UP主Kate的实测分享,随着GPT-5.6的发布,Codex和ChatGPT两款App正式合体,统一命名为ChatGPT,用户可以在同一个App里直接调用Codex功能。
Codex最初是OpenAI于2021年推出的专注于代码生成的AI模型,基于GPT-3微调而来,也是GitHub Copilot的底层引擎。值得一提的是,Codex的训练数据涵盖了来自GitHub的数千万个公开代码仓库,覆盖Python、JavaScript、Go、Ruby等数十种编程语言,其核心突破在于将自然语言意图映射为可执行代码的能力,使「注释即代码」的开发体验成为可能。此次与ChatGPT的合并,标志着OpenAI从「多产品线并行」向「统一平台入口」战略的明确转变——代码生成能力从独立工具演变为通用智能基础设施,用户无需在不同应用间切换,即可在同一对话流中完成从需求分析到代码交付的全链路工作。
有意思的是,选择Codex模式调用GPT-5.6 Sol模型时,消耗的积分是GPT-5.5的两倍。UP主提到,即便是5倍额度的Pro会员,在密集测试中也明显感到不够用,一天内额度被重置了两次(其中一次是OpenAI官方主动重置)。这从侧面反映出新模型的算力消耗确实不小。
三种产品形态与模型分级
GPT-5.6目前呈现出三种产品形态:
- Chat:日常快速对话、问答、分析、写作
- Worker:类似Claude的Code Worker,可制作表格、文档、PPT、网站等
- Codex:面向开发者的编程代理
在模型层级上,GPT-5.6被拆成三个等级:旗舰级的Sol、兼顾日常工作的Terra,以及速度最快、成本最低的Luna。这种分级策略与业界主流做法趋同——Anthropic的Claude同样区分Haiku/Sonnet/Opus,Google的Gemini也有Flash/Pro/Ultra之分。这一趋势背后有其经济学逻辑:单次旗舰模型调用成本可达轻量模型的百倍,分级体系本质上是对「Pareto最优」的工程实现——80%的用户需求可由轻量模型满足,仅20%的高复杂度任务需要旗舰模型介入,使AI服务商能够在不牺牲高端用户体验的前提下显著降低大众用户的服务成本。
这套分级架构在技术实现上还涉及「模型蒸馏」(Knowledge Distillation)的应用:轻量级的Terra和Luna并非简单裁剪参数,而是通过让小模型学习大模型的输出分布来压缩能力,使其在特定任务域(如日常问答、简单代码补全)上以极低推理成本达到接近旗舰模型的效果。这种「教师-学生」训练范式已成为工业界部署大模型的标准实践,也是各家AI公司能够将旗舰能力下沉至免费层级的核心技术支撑。其中Sol是OpenAI目前最强的编码模型,在编码代理指数上达到80分,同时用不到一半的输出Token和时间,把性价比推到新高度。
基准表现:单位成本产出的跃升
从官方公布的数据来看,GPT-5.6 Sol模型在多个基准上表现突出。专业知识工作方面超过GPT-5.5;编码方面与5.5各有优劣;科学、健康、计算机使用、网络安全、多模态等方面优势更为明显。
几项关键硬指标值得重点关注:
- BrowseComp(浏览任务)达到92.2%——该基准由OpenAI研究团队设计,专门衡量AI在真实网页环境中完成多步骤信息检索与交互操作的能力。与传统静态问答基准不同,BrowseComp要求模型动态解析网页结构、跨页面追踪信息、处理动态加载内容,并在面对反爬机制时做出策略调整。92.2%意味着模型已能可靠地执行大多数日常浏览场景中的复合任务,剩余7.8%的失败案例通常集中于需要登录验证或页面结构高度动态化的场景,这也是当前浏览器Agent的主要技术瓶颈。
- OSWorld 2.0(计算机操作)达到62.6%,超越Opus 4.8,同时输出Token减少85%——OSWorld 2.0在真实操作系统环境中测试AI通过GUI完成任务的能力,覆盖文件管理、应用操作等场景,62.6%是目前公开模型的领先水平。值得注意的是「输出Token减少85%」这一指标——在Agent任务中,Token消耗不仅代表成本,更代表推理路径的简洁性。Token大幅减少而性能不降,说明模型发展出了更高效的「思维压缩」能力,能够跳过冗余的中间推理步骤直达关键决策点,这与人类专家在熟悉领域中的「直觉式决策」在认知层面高度类似。
- ExploitBench(网络安全)从GPT-5.5的40%跃升至73.5%——ExploitBench通过模拟CTF(Capture The Flag)竞赛场景和真实CVE漏洞环境,评估模型发现和利用软件漏洞的能力。73.5%意味着GPT-5.6已能自动化完成中等难度的漏洞挖掘和利用链构建,对防御性安全具有重大价值——安全团队可利用AI将原本需要数周的渗透测试缩短至数小时。然而这一大幅跃升也在安全研究界引发讨论:强大的漏洞挖掘能力若被恶意行为者利用,可降低发动网络攻击的技术门槛,这正是「能力对齐」研究中的核心困境,也是OpenAI同步加强安全防护的直接原因之一。
OpenAI这次特别强调「更强的单位美元表现」,即同样预算可完成更多成功任务——这被普遍解读为对竞品高定价的直接回应。在第三方榜单上,GPT-5.6 Sol Max模型已位居第二,多位博主反馈5.6 Sol比前代更实用,尤其擅长协调子Agent。
Max与Ultra模式的取舍
面对更复杂的任务,Max模式会投入更多推理时间;Ultra模式则默认协调四个智能体并行推进,用更高计算量换取更高质量和更快完成速度,代价是Token消耗急剧上升。多Agent并行架构的核心挑战横跨三个层面:任务分解(准确识别子任务间的依赖关系,避免将存在前置依赖的任务并行执行)、状态同步(要求各子Agent共享对任务进展的一致认知,防止重复劳动或遗漏)、以及冲突解决(在子Agent返回矛盾结论时做出权威裁定)。
从分布式系统的视角看,四Agent并行本质上是一个「共识问题」(Consensus Problem)——这在计算机科学中与Paxos、Raft等分布式一致性协议所解决的问题高度同构。不同的是,传统分布式系统中节点故障是随机的硬件错误,而AI Agent的「故障」往往表现为推理偏差或上下文丢失,更难以通过心跳检测等传统手段发现。GPT-5.6 Sol被评价为「擅长协调子Agent」,正是其在上述三个维度均表现优异的体现,也是其在Agent编排任务上超越前代的核心原因。目前在网页端可选择X-High、Pro等档位,Worker模式下Pro用户可开启Ultra模式(同时启动四个Agent协作)。
设计生成能力的显著跃升
GPT-5.6在设计判断上有明显进步,能从高层需求出发,检查真实界面并反复修正到可直接交付的程度。以下是UP主多项实测的核心发现。
网页与界面生成实测
在耳机产品网页测试中,5.6 Sol呈现出细腻的金属拉丝质感,耳罩结构处理得当,页面支持颜色切换与多页面导航,技术规格展示专业规范。相比此前模型偏向简约2D展示的风格,这次完成度大幅提升——其关键在于生成页面前会先调用图片生成工具产出多张参考图。这一「先生成视觉参考、再编写代码实现」的两阶段策略,有效弥补了语言模型在空间想象与像素级布局上的先天短板。从技术层面理解,Transformer的自回归生成机制擅长序列逻辑,但对二维视觉空间的隐式表达相对薄弱;两阶段策略将视觉意图的表达与代码的精确实现解耦——第一阶段由图像生成模型将模糊的设计意图具象化为可参照的视觉锚点,第二阶段再由代码生成模型基于明确的视觉目标进行精确实现,有效规避了纯文本到视觉代码转换中的幻觉风险。
更令人印象深刻的是音乐播放器和图片复刻任务。在「根据截图实现网页」的任务中,5.6 Sol采用了一个巧妙的技巧:将原图置于画面底层作参考,同时实现手机与桌面宽度的自适应,还原度极高,几乎看不出破绽。

在天气应用复刻中,页面内大量元素均可交互,包括场景主题切换、雨刮强度调节等,一次提示便可达到如此还原度,效果相当可观。
Skill插件系统的价值
据UP主观察,5.6 Sol在推理过程中调用了image to code技能,追问后得知这属于Product Design插件的一部分。该插件包含四个Skill:image to code、design QA、user context和index。其中index skill负责路由判断——若用户要求根据截图实现网页则调用image to code,若要100%复刻某个网页URL则路由至url to code。
这套插件设计体现了「工具调用路由」的工程思想,在工程上对应「命令模式」(Command Pattern)与「策略模式」(Strategy Pattern)的组合应用:意图分类器作为轻量级路由层,将用户自然语言请求分类后分发至各专用工具,每个工具针对特定任务类型深度优化而非追求通用性。这种架构的优势在于可维护性和可扩展性——新增能力只需开发新的Skill插件并在index中注册路由规则,无需重新训练主模型,与微服务架构中「API网关+专用微服务」的设计哲学高度一致,也与软件工程中的「单一职责原则」异曲同工,是当前Agent系统从「万能大模型」向「专家团队协作」演进的缩影。这套插件设计被UP主评价为「非常到位」,可见GPT-5.6的强大不仅在于模型本身,更在于其工具链与技能路由的精心设计。
复杂任务与3D建模实测

在更复杂的场景中,5.6 Sol同样表现亮眼:
- 桌面行星仪:地球质感真实细腻
- 清明上河图:整体效果远优于GPT-5.5,船只搭建和店铺招牌仍有瑕疵
- 苏州博物馆:耗时约30分钟,盆景质感出色,但画面存在一定闪烁
在3D建模环节,UP主要求模型基于参考图生成OpenSCAD建模。OpenSCAD是一款基于脚本的开源3D建模软件,通过CSG(构造实体几何,Constructive Solid Geometry)操作——union(并集)、difference(差集)、intersection(交集)——组合基本几何体来构建复杂模型,用代码而非鼠标拖拽来描述几何体形状,广泛用于工程零件的参数化设计。与Blender等可视化建模工具不同,OpenSCAD要求以纯数学语言描述三维形态,对AI构成极具挑战性的测试场景——模型不仅需要将图像中的视觉特征「翻译」为精确的数值参数(如半径、高度、旋转角度),还需理解各几何体间的拓扑关系和遮挡层次,同时具备空间几何推理能力和精确的代码生成能力。
从认知科学角度看,这类任务要求模型完成「视觉-空间-符号」三重编码的跨模态转换:首先将二维图像解析为三维空间结构(视觉→空间),再将空间结构映射为数学参数(空间→符号),最后生成语法正确的OpenSCAD代码(符号→代码)。每一步转换都存在信息损失风险,这也是为何该任务对AI而言比编写普通代码难度高出数个量级。测试中暴露了一个实际问题:模型最初未识别出本地安装的是开发版,尝试下载旧版正式版,被打断后才切换为本地版本。渲染结果与原图仍有差距,但相比5.5已消除了表盘表带分离、多余凸起等典型问题,直接体现了其三维空间推理能力的提升。
财报分析与数据可视化
特斯拉财报分析任务耗时约40分钟,所有数据均由模型自行获取。交付的Excel表格样式明显优于5.5,包含多个表单、Dashboard季度可视化、财务图表,并附有官方财报原始文件来源。这充分体现了GPT-5.6将搜索、分析、文档生成整合为完整工作流的能力。
Worker模式与开发者升级

新的Worker模式在手机端和Web端均以Tab页形式呈现。计算机使用功能获得全新交互设计:原Codex的「宠物」形象迁移至ChatGPT App,执行任务时宠物旁会弹出小窗口,靠近即可查看进度;多个App被调用时则显示多个小窗口并排呈现。
应用内浏览器也得到强化,支持已认证站点、多标签页和文件下载。新增的Chrome扩展让GPT能在浏览器中与用户协同完成任务。这类浏览器扩展的技术核心是将AI的「感知-决策-行动」循环嵌入浏览器环境——扩展通过Chrome DevTools Protocol(CDP)读取当前页面DOM结构、模拟用户点击和输入操作,使模型能够感知页面状态并实时干预,真正实现人机协同而非单纯的对话交互。CDP本质上是一套基于WebSocket的调试接口,最初为开发者工具设计,如今已成为浏览器自动化(Playwright、Puppeteer等)和AI Agent操控浏览器的标准通道——这意味着GPT的浏览器扩展与Selenium等传统自动化工具共享同一底层协议,但在意图理解和动态决策层面实现了质的飞跃。
面向开发者,Codex升级亮点包括:可直接编辑文件、无需离开应用即可查看和审查PR,以及在Chat界面调用Pro模型(点开聊天右侧弹框即可切换)。
应用开发全流程实测

最能体现GPT-5.6生产力的,是完整的App改进与开发流程。在优化一个此前用5.5生成的App时,5.6 Sol先调用auditor skill检查视觉、交互和信息结构,甚至通过无线调试模式自动连接手机、对App截图,随后输出详尽的问题清单(如首页健康度不足、设置页需重构、深色阅读绿配色影响体验等)。「无线调试模式」即ADB over Wi-Fi(Android Debug Bridge)——ADB是Android开发生态中的核心调试协议,支持应用安装、日志读取、截图、模拟输入等数十种操作,在Android 11后成为系统内置功能,无需ROOT即可在同一局域网内实现无线调试。模型能自动识别本地开发环境中已启用的ADB无线连接、主动获取设备IP并建立连接,说明其对开发者工具链具备深度的上下文感知能力——这不仅是代码知识,更标志着AI辅助开发从「代码补全」向「环境感知型开发伙伴」的质的飞跃。
在开发水印应用时,5.6耗时约19分钟,构建中遇到bug会自动循环修复,UI质量明显优于5.5,头像与名字可一次性正确渲染。最后模型还主动检查了性能与隐私泄露问题,并通过洋红色背景转透明alpha的技巧生成了美观的应用图标。这里的「洋红色背景转透明alpha」是图标设计中的经典抠图技术:洋红色(#FF00FF)在自然场景中极少出现,将其设为背景色后,抠图算法可以精确识别并剔除背景像素,生成带有平滑透明通道的PNG图标,避免了复杂背景带来的边缘锯齿问题——模型自主选用这一专业技巧,体现了其对视觉工程细节的深度掌握。
安全防护与综合评价
能力跃升的同时,OpenAI也同步强化了安全防护。据官方信息,GPT-5.6结合了人工红队测试、大规模自动化测试和分层实时监控,并投入约70万A100 GPU小时进行黑盒红队评估。红队测试(Red Teaming)源于军事对抗演练概念,在AI安全领域特指通过模拟恶意用户行为系统性发现模型的安全漏洞、价值观偏移和有害输出倾向,覆盖越狱提示、有害内容诱导、隐私泄露、虚假信息生成等数百个风险类别。70万A100 GPU小时是一个相当可观的计算量——单张A100云端租用约每小时3-4美元,这意味着仅红队评估的算力成本就超过200万美元,侧面说明OpenAI在安全评估上的投入规模已与模型训练本身处于同一量级。「分层实时监控」则指在模型推理阶段部署多个独立的安全过滤层,使恶意请求在不同检测维度均需突破防护才能成功,大幅提高攻击成本。这种「能力评估与安全评估同步迭代」的开发模式,正在成为负责任AI开发的行业标准实践。
综合来看,GPT-5.6的核心设计理念是「让效率成为默认,让最高能力在需要时随时可达」。通过ChatGPT与Codex合并、Chat/Worker/Codex三种使用形态,以及Sol/Terra/Luna三级模型体系,OpenAI在能力、成本与易用性之间找到了新的平衡点。从UP主的16项实测结果来看,这一代在设计生成和端到端工作流上的进步是实质性的,尽管3D还原和复杂场景细节仍有提升空间。
核心要点
相关推荐

Codex从入门到精通:全能AI智能体使用指南
深入解析OpenAI Codex的完整使用方法,涵盖四个版本选择、项目与对话区别、权限模式、技能插件系统及办公实战技巧,帮你从零掌握这款超越编程的AI智能体工具。

Buzz共享算力实测:让AI Agent免费跑在社区闲置电脑上
详细实测Buzz Shared Compute共享算力功能,基于MeshLM开源项目实现社区成员间点对点借用闲置电脑运行AI Agent,无需API密钥,附完整配置教程及避坑指南。

AI编程进阶:从Vibe Coding到工程化开发的完整路径
深入解析AI编程从Vibe Coding到工程化开发的进阶方法,涵盖Brainstorming、SubAgent协同、插件定制三大核心技能,以及如何搭建可部署的完整项目,帮助零基础用户和开发者掌握人机协同的AI编程工作流。