待验证50% 置信基准精确时间
代码大语言模型在HumanEval基准测试上的通过率从2022年OpenAI Codex的约47%提升到2024年顶级模型(GPT-4o、Claude 3.5 Sonnet)超过90%
1
来源数
50%
置信度
长期有效
时效性
2026/8/25
首次发现
来源
涉及实体
相关事实
待验证2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上70% 相似待验证Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%70% 相似待验证早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平65% 相似待验证Codex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%65% 相似已验证Claude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/798861API
curl https://kongchang.com/api/v1/knowledge/claims/798861MCP
get_claim(id=798861)