[控场AI]
基准SWE-bench Pro

SWE-Bench Pro

SWE-Bench Pro是一个用于评估AI模型软件工程能力的基准测试,是SWE-Bench系列的进阶版本。该测试通过提供真实的代码仓库问题与缺陷修复任务,考察AI系统在代码理解、问题定位与补丁生成等方面的实际工程能力,旨在更严格、全面地衡量AI模型解决真实世界软件开发任务的水平。

时间轴 (近 90 天)

6月1日

M2.7在SWE-bench Pro基准测试中得分56.22%,超过了Gemini 3.1 Pro

待验证85%
5月31日

GPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%

已验证80%
5月31日

Kimi K2.6在SWE-Bench Pro测试中获得58.6%的分数,位居开源模型第一

待验证60%
5月31日

Claude Opus 4.6在SWE-Bench Pro测试中得分为53.4%

待验证60%
5月31日

Step 3.7 Flash 在 SWE-Bench PRO 基准测试中以 56.3 分排名第二

待验证85%

来源文章