[控场AI]
基准Terminal Bench 2.1

Terminal Bench

专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度

核心事实

时间轴 (近 90 天)

8月26日

DeepSeek官方公布V4 Pro在Terminal Bench基准测试中得分高达87.9

待验证50%
8月26日

GLM-5.3发布,基于743B底座模型后训练,在Terminal Bench上超越对标产品,定价约为上一代的一半成本

待验证50%
8月25日

Divergence-300使用了来自Terminal Bench和DeepSWE等基准的300个未见过(unseen)样例

待验证50%
8月24日

Unsloth引入了全新评测指标Divergence-300,将评估范围扩展到32个token乃至更长的生成序列,使用来自Terminal Bench、DeepSWE等基准的300个未见过样例

待验证50%
8月23日

在Terminal Bench跑分上,DeepSeek V4 Pro得87.9分,Claude Opus 4.8得85分

待验证50%
8月22日

AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景

待验证50%
7月13日

基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象

待验证50%
6月1日

DeepSeek V4 Pro在本次测评中总分691分,排名第一

待验证85%
6月1日

Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景

已验证90%

全部知识事实 (9)

来源文章