[控场AI]
模型

Claude Opus 5

Anthropic即将发布的旗舰模型,能力接近上一代旗舰水平,但推理成本显著降低,预计发布时间为2025年7月

核心事实

时间轴 (近 90 天)

8月23日

在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平

待验证50%
8月23日

在Automation Bench自动化基准上Claude Opus 5拿到约25%通过率,其他模型普遍聚集在15%左右

待验证50%
8月23日

博主判断该代模型不是断层式智力跃升,而是在同等或更好效果下大幅降低成本

待验证50%
8月23日

在GDPval知识工作基准上模型得分1861,高于人类平均水平

待验证50%
8月23日

在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%

待验证50%
8月23日

Theo认为Claude Opus 5可能是唯一需要的编码模型,成为其日常编码首选

待验证50%
8月23日

Theo实测发现一整天重度工作只消耗周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度

待验证50%
8月23日

Opus 5擅长发现漏洞但利用漏洞的能力被大幅削弱,属于内化式对齐

待验证50%
8月23日

Anthropic称Opus 5是迄今最对齐的模型,遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低

待验证50%
8月23日

折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

Anthropic称Opus 5是迄今最对齐的模型,遵守宪法程度超过Sonnet 5和Fable,欺骗行为率最低

85%
已验证

Claude Opus 4.7的定价为输入$5.00/百万token,输出$25.00/百万token

80%
已验证

Claude Opus 4.8's price is unchanged compared to Claude Opus 4.7

70%
已验证

本次对 Claude Opus 4.8 的多场景深度测试总计花费约 50 美元 Token 费用

70%
已验证

Claude 3.5 Sonnet在多数基准测试中已接近甚至超越早期Claude 3 Opus的表现

65%
已验证

Claude Opus 5是Anthropic于2025年发布的旗舰级大语言模型,代表Claude系列最高能力层级

60%
待验证

Claude Opus 5 approaches Fable-level performance on the FrontierCode 1.1 benchmark while costing only half as much

80%
待验证

任何大模型的输出Token都比输入Token贵很多,输出价格通常是输入的5倍

65%
待验证

Opus 5依然擅长发现漏洞,但利用漏洞的能力被大幅削弱

60%
待验证

在Automation Bench自动化基准上Claude Opus 5拿到约25%通过率,其他模型普遍聚集在15%左右

50%
待验证

博主判断该代模型不是断层式智力跃升,而是在同等或更好效果下大幅降低成本

50%
待验证

在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平

50%
待验证

在GDPval知识工作基准上模型得分1861,高于人类平均水平

50%
待验证

在ARC-AGI-3新颖问题解决基准上模型得分30.2%,而上一代仅1.5%

50%
待验证

Theo认为Claude Opus 5可能是唯一需要的编码模型,成为其日常编码首选

50%
待验证

Anthropic称Opus 5是迄今最对齐的模型,遵守宪法的程度超过4.8、Sonnet 5和Fable,欺骗行为率最低

50%
待验证

Opus 5擅长发现漏洞但利用漏洞的能力被大幅削弱,属于内化式对齐

50%
待验证

折算真实使用场景,Opus 5相对Fable的实际成本优势约为20%到25%,Fable单任务约2.75美元,Opus 5约2.03美元

50%
待验证

Theo实测发现一整天重度工作只消耗周额度的12%,而同样强度用Fable一天能烧掉一个半周的额度

50%
待验证

Claude Opus 5的API定价与上一代Opus 4.8完全相同

50%

来源文章