共 1 篇相关文章
SWE-bench团队公开作弊检测方法,通过逐Hunk精确匹配分析提交方案与标准补丁的相似度。结果显示大多数模型精确匹配率仅2%-7%,但发现一个匹配率高达87%的异常案例。详解检测原理、分析结果及对AI基准测试的行业意义。