已验证90% 置信事实时间未知
Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景
6
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
Gemini 3.5 Flash深度解析:Google打造的AI Agent执行引擎
twitterJeffDean
涉及实体
相关事实
待验证测试 Skill 由一个目录结构、一份描述文件以及具体的执行脚本组成70% 相似已验证SWE Bench是由普林斯顿大学提出的软件工程基准测试,专门评估AI模型解决真实GitHub Issue的能力69% 相似待验证Claude Code的架构天然适合自动化程度要求较高的测试场景,因为测试工作大量依赖命令行工具、脚本执行和跨系统数据流转66% 相似待验证适合Loop Engineering的场景包括有明确测试用例的编程任务、有benchmark的模型训练、可自动评估的任务、数据清洗和超参调优66% 相似待验证鸿蒙自动化测试是典型长链路任务,涉及跨领域知识融合、强依赖性和反馈循环,链路从读取需求到测试用例设计、脚本执行、输出测试报告66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/17832API
curl https://kongchang.com/api/v1/knowledge/claims/17832MCP
get_claim(id=17832)