基准SWE-bench Pro
SWE-Bench Pro
SWE-Bench Pro是一个用于评估AI模型软件工程能力的基准测试,是SWE-Bench系列的进阶版本。该测试通过提供真实的代码仓库问题与缺陷修复任务,考察AI系统在代码理解、问题定位与补丁生成等方面的实际工程能力,旨在更严格、全面地衡量AI模型解决真实世界软件开发任务的水平。
时间轴 (近 90 天)
6月1日
M2.7在SWE-bench Pro基准测试中得分56.22%,超过了Gemini 3.1 Pro
待验证85%
5月31日
GPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%
已验证80%
5月31日
Kimi K2.6在SWE-Bench Pro测试中获得58.6%的分数,位居开源模型第一
待验证60%
5月31日
Claude Opus 4.6在SWE-Bench Pro测试中得分为53.4%
待验证60%
5月31日
Step 3.7 Flash 在 SWE-Bench PRO 基准测试中以 56.3 分排名第二
待验证85%