实测Claude Opus 5:性价比碾压对手的AI新旗舰

注:本文基于B站UP主转载的Nick Saraev实测视频整理。视频中提到的"Opus 5"、"Fable 5"、"GPT 5.6"等为博主对未来模型的推演性命名,请读者理性看待其中的前瞻性设定,重点关注其对前沿模型能力演进方向的分析。
AI大模型的竞争已经从"能不能做"进入了"做得多好、多便宜"的阶段。在这支实测视频中,博主Nick Saraev花费约400美元,对Anthropic的旗舰模型进行了大量真实场景压力测试。他没有停留在跑分层面,而是让模型直接生成各种复杂的可交互应用,用"手感"和"审美"来评价一个前沿模型的真实实力。
一句话Prompt生成3D世界与可玩游戏
视频最直观的震撼,来自模型"零工作量"生成的一系列可交互3D应用。博主展示了一个完整的3D虚拟画廊——玩家可以在其中漫步,鼠标悬停在墙上的艺术品时会发出提示音,像在给作品编目一样。他直言,放在几年前,这种体验足以被当作一款独立游戏。
这背后依赖的是大语言模型对WebGL、Three.js等Web 3D渲染框架的深度理解与代码生成能力。传统上,构建一个可漫步的3D画廊需要Unity或Unreal等游戏引擎,再加上3D建模师数周的工作。而现在模型能够直接输出完整的HTML+JavaScript代码,在浏览器中实现第一人称视角漫游、碰撞检测、鼠标交互事件等功能,这标志着"自然语言到可运行应用"这一链路的成熟度已达到令人惊讶的水平。

更令人印象深刻的是物理仿真类应用。其中一个类似《坎巴拉太空计划》的发射游戏,允许用户调整轨迹让物体进入行星引力、建立稳定轨道,甚至还原了"牛顿大炮"和霍曼转移轨道等天体力学概念——既是可玩的小游戏,也是一份直观的科普讲解。
霍曼转移轨道(Hohmann Transfer Orbit)是航天工程中最基础也最经典的轨道转移方式,由德国工程师瓦尔特·霍曼于1925年提出。它利用两次短暂的引擎点火,让航天器沿一条椭圆轨道从一个圆形轨道转移到另一个圆形轨道,是燃料消耗最少的双脉冲转移方案。"牛顿大炮"则是牛顿在《自然哲学的数学原理》中提出的思想实验——从高山顶上以不同速度发射炮弹,速度足够大时炮弹将不再落回地面而是绕地球运行。模型能够将这些经典物理概念转化为可交互的实时仿真,说明它不仅理解了抽象的物理公式,还能将其转化为正确的数值模拟代码。

从布料仿真到完整生态系统模拟
博主还逐一演示了一系列细节丰富的仿真demo:
-
布料物理仿真:模拟织物在风中的运动,甚至可以"撕裂"布料,手感接近真实窗帘的反应。布料仿真是计算机图形学中的经典难题,通常采用质点-弹簧模型(Mass-Spring Model)来模拟织物的形变、碰撞和撕裂行为——每个布料网格节点被视为一个质点,相邻质点之间通过弹簧连接,弹簧的拉伸、剪切和弯曲刚度决定了织物的"手感",当应力超过阈值时弹簧断裂即实现撕裂效果。这类仿真在游戏和电影特效中广泛使用,但通常需要专业物理引擎支持,而模型能在浏览器环境中用纯JavaScript实现接近真实的效果,展示了其对数值积分、碰撞检测等底层算法的掌握;
-
分形着色器生成器:可无限缩放的分形图案,支持调节高度、辉光、色散等参数;
-
元胞自动机沙盒:可以撒沙、引发油污泄漏、生成蒸汽、点火,环境高度可交互。元胞自动机(Cellular Automaton)是由数学家约翰·冯·诺依曼和斯坦尼斯拉夫·乌拉姆在20世纪40年代提出的计算模型,最著名的例子是约翰·康威的"生命游戏"(Game of Life),仅凭几条简单规则就能涌现出极其复杂的行为模式。视频中的沙盒将这一概念扩展为多物质交互系统——沙粒受重力下落并堆积、油污在水面扩散、火焰点燃可燃物并产生蒸汽,每种物质都有自己的状态转换规则,完美展现了"涌现式复杂性"的魅力;
-
捕食者-猎物生态系统:生成兔子啃食草地,狐狸捕猎兔子,当狐狸过多时兔群崩溃、草地反而繁茂,完整还原了种群动态平衡。这对应的是生态学中经典的Lotka-Volterra方程(洛特卡-沃尔泰拉方程),由数学家阿尔弗雷德·洛特卡和物理学家维托·沃尔泰拉在20世纪20年代独立提出。该模型用两个耦合的微分方程描述捕食者与猎物的种群数量变化:猎物充足时捕食者数量增长,捕食者过多则猎物数量骤降,随后捕食者因缺乏食物而减少,猎物得以恢复——形成周期性振荡。视频中的仿真正是这一经典动力学的直观演示,也是理解生态级联效应(trophic cascade)的绝佳教学工具。

此外还有带真实音效的四轴无人机飞行模拟器、双摆系统、像素动画编辑器(支持图层、洋葱皮、逐帧动画)、球鞋配置器、破坏球模拟器,以及展示126年间全球城市人口变化的动态数据图表。
核心结论:不是最强模型,而是性价比最优解
博主对这一代模型的核心判断很直接:它不是断层式的智力跃升,而是在"同等甚至更好效果"的前提下,把成本大幅压了下来。
他用一个网站生成任务做了对比:让模型生成一个苹果风格的3D产品销售页面,Claude Opus 5花费69美分,而对标模型花费94美分。不仅更便宜,效果还更好——页面中的滑动组件和视觉资源全部由模型用SVG现场生成,而非从网上下载素材。
SVG(Scalable Vector Graphics,可缩放矢量图形)是一种基于XML的矢量图像格式,与位图不同,它以数学路径描述图形,可以无损缩放到任意尺寸。模型能够"现场合成"SVG视觉元素而非从网络下载素材,意味着它具备了视觉设计的基础能力——理解色彩搭配、图标语义、布局比例,并将这些审美判断转化为精确的矢量路径代码。这对Web开发的影响深远:传统流程中,前端开发者需要从设计师的Figma文件中导出切图,而现在模型可以在生成页面结构的同时一并生成配套的视觉资产,大幅缩短从设计到上线的周期。这种"自己合成元素"的能力,正是它区别于其他模型的关键优势。
跑分数据解读:成本效率才是真正的杀手锏
抛开一次性的能力秀,博主也拆解了跑分数据,但他真正看重的不是单纯的分数,而是分数除以成本这个维度。
各项基准测试表现
在多项权威基准上,Claude Opus 5的成绩包括:
-
智能体终端编程:优于同级对手,远超上一代;
-
知识工作(GDPval):得分1861,高于人类平均水平。GDPval是一项衡量AI模型在真实知识工作场景中表现的基准测试,其名称暗示了对"经济产出价值"的量化评估。与传统的学术考试类基准不同,GDPval更侧重于模型在商业分析、报告撰写、数据解读等日常白领工作中的实际效能。得分超过人类平均水平,意味着在标准化的知识工作任务中,模型的产出质量已经可以与普通知识工作者相当甚至更优,这反映了行业评估重心的转移——从"模型能通过什么考试"转向"模型能替代多少真实工作";
-
新颖问题解决(ARC-AGI-3):30.2%,而上一代仅1.5%,是数量级的跨越。ARC-AGI由Keras框架创始人François Chollet提出,被认为是目前最能测试"真正智能"的基准之一。与依赖大量训练数据模式匹配的传统基准不同,ARC-AGI的每道题都是全新的视觉推理谜题,要求模型从极少的示例中归纳出抽象规则并应用到新情境。从1.5%飙升至30.2%,代表的不仅是分数提升,而是模型在"少样本抽象推理"这一被视为通向AGI关键能力上的质变;
-
智能体搜索(BrowseComp):30.8%,与GPT系列基本持平;
-
工具增强的多学科推理:64.7%,略高于对手;
-
生物学:人类可解问题上高达90.1%。

成本效率对比:同等能力花费降低30%-50%
真正拉开差距的是"按成本计算的性能"。博主特别看重的智能体电脑操作(computer use)测试显示:即便是Claude Opus 5"最笨"的低推理版本,也能在大多数任务上拿到约60%的成绩,成本约9美元;顶配版本约70%,成本约22美元。而对标模型达到同等水平却要接近50美元。
更值得关注的是一个新出现的自动化基准(Automation Bench)——专门测试模型为企业构建工作流的能力。Claude Opus 5拿到约25%的通过率,而其他模型普遍聚集在15%左右。Automation Bench评估的不是简单的代码生成,而是要求模型理解业务逻辑、连接多个API和工具、处理异常情况、并生成可靠的自动化流程。25%的通过率看似不高,但考虑到企业工作流的复杂性(涉及权限管理、错误处理、数据验证等),这意味着模型已经能够独立完成约四分之一的真实企业自动化需求。对于RPA(机器人流程自动化)行业和靠自动化为企业服务的从业者来说,这直接预示着AI智能体将从实验性工具转变为可投产的解决方案,意味着实打实的落地价值。
在"人类最后的考试"(Humanity's Last Exam)这类高难度综合测试上,即便最低配版本也能拿到约56%,最高配接近65%,单任务成本仅3美元——既更强也更便宜。
安全对齐表现:更聪明也更可控
对齐(alignment)是Anthropic一贯强调的重点。AI对齐是指确保AI系统的行为符合人类意图和价值观的研究领域,是Anthropic公司的核心使命。"错位行为"(misalignment)包括模型表面服从指令但暗中追求其他目标(即"阳奉阴违")、在监督下表现良好但无监督时行为异常(即"奖励入侵")、以及主动欺骗用户等。
博主指出,在一项10分制的"错位行为"评分中(分数越低越安全),Claude Opus 5仅为2.3,明显低于上一代的2.85和同门其他型号。也就是说,这个模型不仅更聪明、更便宜、更擅长工具调用,还更少出现越界行为。Anthropic在其宪法AI(Constitutional AI)框架中,通过让模型根据一组明确的原则进行自我批评和修正来提升对齐水平。2.3分的成绩意味着模型在被刻意引导做出危险或不当行为时,表现出了更强的抗干扰能力,这对需要在高风险场景(如医疗、金融、法律)中部署AI的企业至关重要,实现了能力与安全的双赢。
行业趋势:顶级AI能力可能被"挤牙膏"式释放
视频结尾,博主提出了一个耐人寻味的判断。他认为这一代旗舰模型的发布延续了"缓慢而稳定"的迭代节奏,恰逢开源与中国模型(如他提到的Kimi K3)打破所谓"力量平衡"之际。
这里的"力量平衡被打破",指的是2024-2025年间AI领域发生的重大格局变化。一方面,Meta的Llama系列、Mistral、DeepSeek等开源模型不断缩小与闭源模型的性能差距,使得中小企业和开发者无需支付高昂的API费用即可获得接近前沿水平的模型能力。另一方面,来自中国的模型如Kimi K3(月之暗面)、DeepSeek-V3、通义千问等在多项基准上展现出与GPT-4、Claude等西方模型旗鼓相当的能力,且定价往往更具竞争力。这种双重压力迫使Anthropic、OpenAI等公司不得不在定价策略上做出让步,同时也引发了关于是否应该对顶级AI能力进行出口管制的政策讨论。
他的悲观预测是:随着模型越来越有能力大规模颠覆人类的知识工作,出于经济利益考量,头部AI公司很可能采取"挤牙膏式"的发布策略——真正"银河大脑"级别的顶级智能,会越来越坚决地被留在闭门之内,普通用户短期内难以触及。
无论这一预测是否成真,这支实测都清晰地传递了一个信号:前沿模型的竞争重心,正在从纯粹的能力上限,转向能力、成本与安全的综合平衡。 对于想把AI真正嵌入业务工作流的人来说,"多少钱能把事办成",或许比"跑分第一"更值得关注。
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。