已过期50% 置信事实精确时间
该 Terminal-Bench 2.1 成绩使用的是公开评测框架(public harness)
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/8/11
首次发现
有效期至:2026/8/25(已过期)
来源
相关事实
待验证官方给出了针对Terminal Bench 2.1、SWE Bench Verified/Pro以及CLAW Eval等多个基准的评测数据65% 相似待验证公开评测框架通过标准化评测流程、固定超参数配置、提供可复现代码仓库来缓解基准测试可信度问题55% 相似待验证学术界发展出G-Eval、MT-Bench等评测方法,LLM-as-Judge已成为自动化Agent评测的主流技术路线之一52% 相似已验证Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景51% 相似待验证评估智能体编程能力的主流基准包括SWE-bench、SWE-bench Verified和HumanEval50% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/732401API
curl https://kongchang.com/api/v1/knowledge/claims/732401MCP
get_claim(id=732401)