已验证90% 置信事实时间未知
HumanEval由OpenAI提出,包含164道Python编程题,主要测试函数级别的代码生成能力
19
来源数
90%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Gemini 3.1 Pro编程实测:跑分第一实战第三,与Claude和GPT真实对比
bilibili程序员阿江-Relakkes
涉及实体
相关事实
待验证HumanEval由OpenAI设计,包含164道代码补全题目,考察模型将自然语言转化为可运行代码的能力85% 相似已验证HumanEval由OpenAI设计,包含164道Python编程题;GSM8K包含8500道小学数学应用题;MMLU涵盖57个学科领域的选择题75% 相似待验证OpenAI的Evals框架和PromptFlow提供了Prompt的自动化测试能力70% 相似待验证测试使用 OpenCode 作为 AI 编程代理工具,该工具能理解完整项目上下文、自主规划开发步骤、生成多文件代码并根据错误反馈自我修正68% 相似待验证OpenAI曾用Codex做内部实验,目标是人类不手写任何代码只负责架构设计,编码全部交给智能体完成68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/9580API
curl https://kongchang.com/api/v1/knowledge/claims/9580MCP
get_claim(id=9580)