Terminal Bench
专门评估AI在命令行环境中执行复杂任务能力的基准测试,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,2.1版本引入多工具协同维度
核心事实
时间轴 (近 90 天)
DeepSeek官方公布V4 Pro在Terminal Bench基准测试中得分高达87.9
GLM-5.3发布,基于743B底座模型后训练,在Terminal Bench上超越对标产品,定价约为上一代的一半成本
Divergence-300使用了来自Terminal Bench和DeepSWE等基准的300个未见过(unseen)样例
Unsloth引入了全新评测指标Divergence-300,将评估范围扩展到32个token乃至更长的生成序列,使用来自Terminal Bench、DeepSWE等基准的300个未见过样例
在Terminal Bench跑分上,DeepSeek V4 Pro得87.9分,Claude Opus 4.8得85分
AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景
基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象
DeepSeek V4 Pro在本次测评中总分691分,排名第一
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
全部知识事实 (9)
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
90%待验证DeepSeek V4 Pro在本次测评中总分691分,排名第一
85%待验证DeepSeek官方公布V4 Pro在Terminal Bench基准测试中得分高达87.9
50%待验证Divergence-300使用了来自Terminal Bench和DeepSWE等基准的300个未见过(unseen)样例
50%待验证在Terminal Bench跑分上,DeepSeek V4 Pro得87.9分,Claude Opus 4.8得85分
50%待验证AI评测正从纯语言能力转向真实任务执行能力,特别是终端操作、表格分析这类可量化的办公与工程场景
50%待验证基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象
50%待验证GLM-5.3发布,基于743B底座模型后训练,在Terminal Bench上超越对标产品,定价约为上一代的一半成本
50%待验证Unsloth引入了全新评测指标Divergence-300,将评估范围扩展到32个token乃至更长的生成序列,使用来自Terminal Bench、DeepSWE等基准的300个未见过样例
50%