[控场AI]
基准SWE-bench Pro

SWE-Bench Pro

SWE-Bench Pro是一个用于评估AI模型软件工程能力的基准测试,是SWE-Bench系列的进阶版本。该测试通过提供真实的代码仓库问题与缺陷修复任务,考察AI系统在代码理解、问题定位与补丁生成等方面的实际工程能力,旨在更严格、全面地衡量AI模型解决真实世界软件开发任务的水平。

时间轴 (近 90 天)

8月23日

Muse Glimmer在DeepSearch QA得分74.6,SWE-Bench Pro得分51.2

待验证50%

全部知识事实 (1)

来源文章