OpenAI发布的代码生成能力基准测试,用于评估模型根据函数签名和文档字符串生成正确代码的能力
业界常用的AI评测包括MMLU(大规模多任务语言理解)、HumanEval(代码生成)、GSM8K(数学推理)等,但每个基准只能衡量特定维度的能力
代码大语言模型在HumanEval基准测试上的通过率从2022年OpenAI Codex的约47%提升到2024年顶级模型(GPT-4o、Claude 3.5 Sonnet)超过90%
众包式盲测评测被认为比传统学术基准测试(如MMLU、HumanEval)更能反映模型在开放式对话中的综合表现
早期的Codex模型在HumanEval上的通过率约为28.8%,而到2024-2025年GPT-4级别的模型已达到90%以上的通过率
早期的Codex模型在HumanEval测试上的通过率约为28.8%
到2024-2025年,GPT-4级别的模型在HumanEval上已能达到90%以上的通过率
冻结基准的设计针对AI评测领域的数据污染问题,MMLU、HumanEval等知名基准都面临数据污染困境
2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上
Qwen3 27B在OpenAI HumanEval 164道Python题上取得85%通过率和99%应答率
FrontierCode places greater emphasis on a model's ability to function as an autonomous Agent compared to benchmarks like HumanEval and SWE-bench
还有 8 条时间轴事件
HumanEval由OpenAI提出,包含164道Python编程题,主要测试函数级别的代码生成能力
90%已验证HumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题
80%已验证代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)
65%待验证Codex模型的评估通常使用HumanEval和MBPP等编码基准测试
85%待验证FrontierCode places greater emphasis on a model's ability to function as an autonomous Agent compared to benchmarks like HumanEval and SWE-bench
70%待验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点
70%待验证业界常用的AI评测包括MMLU(大规模多任务语言理解)、HumanEval(代码生成)、GSM8K(数学推理)等,但每个基准只能衡量特定维度的能力
50%待验证代码大语言模型在HumanEval基准测试上的通过率从2022年OpenAI Codex的约47%提升到2024年顶级模型(GPT-4o、Claude 3.5 Sonnet)超过90%
50%待验证众包式盲测评测被认为比传统学术基准测试(如MMLU、HumanEval)更能反映模型在开放式对话中的综合表现
50%待验证早期的Codex模型在HumanEval上的通过率约为28.8%,而到2024-2025年GPT-4级别的模型已达到90%以上的通过率
50%待验证早期的Codex模型在HumanEval测试上的通过率约为28.8%
50%待验证到2024-2025年,GPT-4级别的模型在HumanEval上已能达到90%以上的通过率
50%待验证冻结基准的设计针对AI评测领域的数据污染问题,MMLU、HumanEval等知名基准都面临数据污染困境
50%待验证2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上
50%待验证Qwen3 27B在OpenAI HumanEval 164道Python题上取得85%通过率和99%应答率
50%待验证2025年的顶尖模型在HumanEval基准测试中的通过率已突破90%
50%待验证MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架
50%待验证MMLU包含57个学科领域约1.5万道选择题,HumanEval由OpenAI设计包含164道Python编程题,MATH包含12,500道竞赛数学题,GPQA收录研究生级别科学问题
50%