[控场AI]
基准

GPQA

GPQA(Graduate-Level Google-Proof Q&A)是一个面向研究生水平的专业知识问答基准测试,旨在评估大型语言模型在生物学、化学、物理学等自然科学领域的深度推理与专业知识掌握能力。题目由领域专家设计,难度较高,即使借助搜索引擎也难以轻易作答,常被用于衡量模型在专业领域的极限推理表现。

核心事实

时间轴 (近 90 天)

8月26日

Mythos Preview比Mythos 5早发布两个多月,但在UK AISI cyber ranges、GPQA、HLE+tools、OSWorld及多数病毒学任务等多项基准测试上超越了Mythos 5

待验证50%
8月4日

The industry has begun shifting toward more challenging benchmarks like GPQA and MATH as older benchmarks lose discriminative power

待验证80%
7月24日

GPQA(研究生级别专业问答)专注于需要博士级专业知识的问题

已验证65%
6月3日

GPT-5.5在GPQA博士级科学推理基准上从78.5%提升到85.6%

待验证70%

全部知识事实 (4)

来源文章