待验证50% 置信基准精确时间
GPT-6 Astra在低于max的推理级别时仍无法可靠地将鹈鹕的腿绘制在车架两侧,该问题仅在max级别得到解决
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证在Terminal Bench 2.1基准测试上,GPT-5.6 Sol的Ultra模式接近92%,超越竞品的88%表现65% 相似待验证在长周期智能体工作流测试(Engines Last Exam)中,GPT-5.6 Sol 得分 53.6,比 Faber-5 高出 13.1 分61% 相似待验证四轮测试中Astra拿下三胜、动态图形打平,测评者判定GPT-6整体领先60% 相似待验证在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分60% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/914514API
curl https://kongchang.com/api/v1/knowledge/claims/914514MCP
get_claim(id=914514)