待验证50% 置信事实时间未知
GPT 5.5 leads on TerminalBench 2.0 with a score of 87%, surpassing even Anthropic's unreleased Mythos model
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证GPT 5.5在TerminalBench 2.0基准测试中以87%的成绩大幅领先,超过了Anthropic尚未发布的Mythos模型84% 相似待验证GPT-5.5 与 Claude Mythos 5 在 Terminal Bench 2.1 上均停留在 88% 左右81% 相似部分验证OpenAI 称 GPT-5.6 在 Terminal Bench 2.1 上达到当前最强水平80% 相似待验证GPT-5.2 Codex scores slightly higher than GPT-5.2 on SWBench Pro and about 2 percentage points higher on Terminal Bench.76% 相似已验证GPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/57265API
curl https://kongchang.com/api/v1/knowledge/claims/57265MCP
get_claim(id=57265)