待验证50% 置信基准精确时间
与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/13
首次发现
有效期至:2026/12/12
来源
涉及实体
相关事实
待验证SWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%79% 相似待验证GPT-6 Astra在低于max的推理级别时仍无法可靠地将鹈鹕的腿绘制在车架两侧,该问题仅在max级别得到解决70% 相似待验证GPT-5.6 Extreme High档位约需63美元获得53.6%得分,而Claude Sonnet自适应模式耗费约2000美元得分仅40.5%70% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%69% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/918911API
curl https://kongchang.com/api/v1/knowledge/claims/918911MCP
get_claim(id=918911)