待验证50% 置信观点时间未知
SWE-bench因贴近真实工程场景被业界认为是最具实际参考价值的代码基准测试
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证SWE-bench 涉及跨文件依赖分析、版本兼容性判断、回归测试通过等高阶能力,难度比 HumanEval 等写函数类基准更贴近真实工程场景75% 相似待验证编程能力的评估通常参考HumanEval、MBPP、SWE-bench等标准化基准测试,但实际工程场景表现与基准测试结果存在差异73% 相似待验证SWE-bench Verified由人工标注者筛除描述模糊或测试不稳定的样本,是业界权威的AI编程能力排行榜之一71% 相似待验证代码基准测试主要覆盖算法题与函数级代码生成,评测分数高并不直接等同于工程实战能力强71% 相似待验证SWE-bench测试样本取自真实GitHub仓库的历史Issue,评分标准是能否通过仓库原有的完整测试套件70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/56714API
curl https://kongchang.com/api/v1/knowledge/claims/56714MCP
get_claim(id=56714)