待验证50% 置信事实精确时间
智能体评估基准测试套件包括GAIA、AgentBench和SWE-bench
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/5
首次发现
有效期至:2026/12/4
来源
涉及实体
相关事实
待验证本次评估框架包含 ARC-AGI-V2、SWE-Bench、Terminal Bench 2.0、GPQA 和 MMLU 五项基准测试74% 相似待验证评估智能体编程能力的主流基准包括SWE-bench、SWE-bench Verified和HumanEval73% 相似待验证HumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试72% 相似待验证Agentic基准评测通常涉及SWE-bench、WebArena、GAIA等多个子基准的加权综合71% 相似待验证SWE-bench Verified由人工标注者筛除描述模糊或测试不稳定的样本,是业界权威的AI编程能力排行榜之一70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/861580API
curl https://kongchang.com/api/v1/knowledge/claims/861580MCP
get_claim(id=861580)