待验证50% 置信基准精确时间
在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/13
首次发现
有效期至:2026/10/11
来源
GPT-5.6发布:三款模型对标Claude,ChatGPT Work超级应用全解析
bilibiliAI-seeker2026/7/9
相关事实
待验证GPT 5.2在前沿科学基准的竞赛题中得分约77%,但在开放式研究任务中表现下降到约25%73% 相似待验证在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象72% 相似待验证用 Opus 5 在 Medium 设置下配合 Ponytail 运行基准测试,输出 Token 明显减少,成本实际便宜约 22%72% 相似待验证通过一系列策略调整,Opus 5 的使用成本最多可降低 80%,且在部分基准测试中仍能跑赢 Opus 4.872% 相似待验证Claude Opus 4.8's most significant advancement is a dramatically lower error rate during actual use rather than improved benchmark scores71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/501554API
curl https://kongchang.com/api/v1/knowledge/claims/501554MCP
get_claim(id=501554)