待验证50% 置信基准精确时间
2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上
1
来源数
50%
置信度
长期有效
时效性
2026/8/23
首次发现
来源
涉及实体
相关事实
已验证2024年Claude 3.5 Sonnet等模型在SWE-bench Verified子集上已超过50%75% 相似待验证Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%74% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%73% 相似待验证Claude Sonnet 4.6在OS World(智能体计算机使用)测试中从61.4%提升至72.5%70% 相似待验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/789977API
curl https://kongchang.com/api/v1/knowledge/claims/789977MCP
get_claim(id=789977)