部分验证65% 置信基准精确时间
OpenAI 称 GPT-5.6 在 Terminal Bench 2.1 上达到当前最强水平
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8
来源
GPT-5.6三模型实测:Sol/Terra/Luna与Claude差距还有多远?
bilibili烟神殿副殿主2026/7/9
相关事实
待验证GPT 5.5 leads on TerminalBench 2.0 with a score of 87%, surpassing even Anthropic's unreleased Mythos model80% 相似待验证6月26日OpenAI发布GPT-5.6系列,首次采用旗舰、平衡、快速、廉价四档分层策略,旗舰版本在Terminal Bench 2.1基准测试中以91.9%成绩登顶80% 相似待验证OpenAI称GPT-5.6 Sol在Terminal-Bench 2.0上达到了新水平79% 相似待验证OpenAI在GPT-5.6发布材料中回避了SWE Bench Pro的分数78% 相似待验证在OpenAI官方公布的基准测试中,GPT-5.6在编程领域Terminal Bench拿下新的最高分,生物学基准测试比GPT-5.5更省Token(成绩为OpenAI自行披露,尚未独立验证)77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/452863API
curl https://kongchang.com/api/v1/knowledge/claims/452863MCP
get_claim(id=452863)