待验证90% 置信事实时间未知
OpenAI o4在ARC-AGI-2测试中得分68.8%,GPT-5.2得分52.9%
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Gemini 3.1 Pro深度横评:ARC-AGI-2得分77.1%,真的最强吗?
bilibili锋芒AI
涉及实体
相关事实
待验证在Terminal Bench 2.0基准测试中,OpenAI 4.6得分为58%,GPT 5.4得分为75.1%71% 相似待验证o3模型在2024年12月的ARC-AGI测试中达到87.5%,同期在Codeforces的评分达到2727(超越99.95%的人类参赛者)70% 相似待验证Fable 5在SWE Bench Pro编程测试上得分80.3分,而OpenAI的GPT 5.5仅为58.6分69% 相似待验证Opus 5在ARC-AGI 3上的得分是次优模型的三倍65% 相似待验证Codex One在SWE-bench上的表现略优于O3 High,在OpenAI内部软件工程任务上准确率达到75%,而O3 High为70%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/12518API
curl https://kongchang.com/api/v1/knowledge/claims/12518MCP
get_claim(id=12518)