[控场AI]
基准Senior Engineer Benchmark

SABench

SABench是由EVERY团队开发的面向大型语言模型的高级软件工程能力基准测试。该基准通过要求模型对低质量代码库进行系统性重构或重写,评估模型在真实工程场景中的代码理解、架构设计与代码质量改善能力,以人类高级工程师的表现作为参照标准,旨在衡量模型处理复杂软件工程任务的综合水平。

来源文章