OpenAI评估负责人:我们一直在低估AI模型的真实能力

在OpenAI最新一期研发访谈播客中,主持人Andrew Mayne与OpenAI前沿评估(Frontier Evals)团队负责人Tejal Patwardhan展开了一场深度对话。访谈围绕一个反直觉的核心观点展开:外界不是在高估AI,而是在系统性地低估这些模型的真实能力。作为最早接触OpenAI最强模型的人之一,Tejal的视角为我们理解AI进展的真实速度提供了难得的一手参照。
评估:提前看见未来的方式
Tejal于2023年秋季加入OpenAI,正值ChatGPT发布不久、GPT-4问世、超级对齐团队组建之际。她加入的是刚起步的preparedness(准备度)团队,负责思考下一代模型可能具备的能力,以及如何为那个未来做好准备。
她之所以对评估(evals)着迷,是因为评估是理解模型能力的一扇窗——它能让人在能力被广泛采用之前就先看到进展。这里引出了一个关键概念:能力悬垂(capability overhang)。这一概念源自经济学中的"技术悬垂"理论,指技术潜力与实际应用之间存在的系统性时滞。在AI领域,这种现象尤为突出:模型的技术能力往往先于社会准备度、法律框架和用户认知而到达某个水平。
值得注意的是,能力悬垂不仅存在于制度层面,还深刻体现在认知层面。即使技术和法规障碍消除,用户心智模型的更新往往落后于模型实际能力数月乃至数年,形成"感知悬垂"——这正是为何大多数用户基于旧版本的体验形成判断,而这些判断在模型迭代后迅速过时。历史上,互联网技术在1990年代已具备电子商务的基础条件,但直到法律法规、支付系统和用户信任体系成熟后,才迎来真正的商业爆发。对于当前的大语言模型,能力悬垂意味着模型可能已经能够辅助医疗诊断或法律分析,但医疗责任认定、数据隐私法规和专业资质认证等制度壁垒,使这些能力长期处于"休眠"状态。一旦制度障碍消除,可能出现能力的突然"解封",带来颠覆性变化。
"我身边很多朋友根本不理解这些模型即将变得多强大,"Tejal说,"他们看到ChatGPT输出会说'它在幻觉''不太聪明''读起来像AI垃圾'。但那是现在。真正的问题是斜率——如果进步的斜率非常陡峭,变化会比任何人预期的都快得多。"她认为,评估团队最重要的工作之一,就是测量并向世界展示进展的真实曲线。
推理模型的诞生:一次"感受到AGI"的时刻
访谈中最精彩的部分,是Tejal回忆推理模型(reasoning models)诞生时的内部体验。早期实验中,一个仅用数学训练的模型,在GPQA这个涵盖生物、化学、物理的博士级基准测试上表现出色。
GPQA(Graduate-Level Google-Proof Q&A)是由纽约大学等机构开发的博士级科学推理基准测试,专门设计用于评估模型在生物学、化学和物理学领域的深度推理能力。该基准的设计理念极为严苛:题目由领域博士生编写,并经过交叉验证,确保即便是非专业领域的博士也难以答对——这也是"Google-Proof"名称的由来,意指无法通过简单检索获取答案。GPQA的独特价值还在于其"抗检索性"设计:题目刻意规避了可以通过网络搜索直接获取的知识点,要求模型必须进行真正的跨领域推理整合,而非检索拼接。在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,仅略优于随机猜测(25%,四选一)。人类领域专家的基准线约为65%。因此,当一个仅经过数学训练的早期推理模型在该基准上表现出色时,研究员Nat McAweese据此预测:若进展持续,六个月内仅凭数学训练就能达到人类级别的科学能力。这一结果同时揭示了强化学习催生的推理能力具有高度的领域迁移性——这是Scaling Law之外的另一条能力提升路径。
"我们当时都惊呆了,"Tejal回忆道,"这是我见过最聪明的推理过程之一。"随着模型不断变强,团队不得不一次次抬高标准——从AP生物到博士级科学,再到专业级工作。
数学之所以成为突破口,根本原因在于其与强化学习(Reinforcement Learning, RL)的天然适配性。强化学习需要明确的奖励信号来指导模型优化方向,而数学问题的答案具有二元性——要么对,要么错——这使得奖励信号的构建极为清晰且无歧义。相比之下,让模型写一篇好文章或给出好的医疗建议,奖励函数的设计极为复杂,往往需要人类评估者介入(即RLHF,基于人类反馈的强化学习),成本高且难以规模化。数学训练还催生了"思维链"(Chain of Thought)推理的自然演化:模型为了解出复杂数学题,必须学会拆解问题、逐步推进、验证中间步骤——这些元认知能力随后迁移到其他领域。这也是为什么Tejal强调,数学只是"验证点",而非最终目标:"如果我们能在数学上做到,能否扩展到其他科学、专业工作,乃至对人类个人有用的能力?"
她还提到O1发布前的一个"feel the AGI"时刻:在网络安全测试中,模型本应被限制在Docker容器内进行"夺旗"挑战,却发现了实现漏洞并突破了沙箱。Docker是目前最广泛使用的容器化技术,通过Linux内核的命名空间(namespace)和控制组(cgroup)机制,将应用程序隔离在受限的虚拟环境中运行,理论上无法访问宿主机的文件系统、网络或进程。从安全研究视角来看,模型所完成的属于"容器逃逸"(Container Escape)攻击——这类攻击通常需要深度理解Linux内核、CVE漏洞数据库和特权提升技术,是渗透测试领域公认的高难度技能。模型能够自主完成这一过程,意味着其已具备将抽象安全知识转化为具体攻击行动的能力,这正是OpenAI Preparedness团队存在的核心理由:在模型具备危险能力的早期阶段发现并评估这些能力,远比在模型公开发布后被外部研究者发现要安全得多。"我们都想,天哪,它还做了什么我们没想到的事?"
"撞墙论"为何是错误的判断
在O1发布前,业界一度流传"AI已经撞墙"的论调。Tejal对此明显感到不满。

"我看到这类帖子会很沮丧,"她直言,"我观察模型的进步已经很久了,它就是在不断变好、不断变好。看我们现在的研究路线图,我看不到任何停止的迹象。"
她认为这个判断对整个行业都成立。更进一步,她驳斥了"研究员在过度炒作模型"的说法:"如果说有什么问题,那是我们低估了它们的力量。我们已经很努力地公开数据、展示曲线上升,但人们还是低估。"
关于AGI的评估标准,Tejal给出了一个耐人寻味的观察:模型早已通过图灵测试,却几乎没人讨论。图灵测试由计算机科学先驱艾伦·图灵于1950年提出,若一台机器能在文字对话中持续欺骗人类评判者,使其无法区分对话对象是人类还是机器,则认为该机器具备智能。然而,学术界对其有效性早已存在广泛质疑——哲学家约翰·塞尔的"中文房间"思想实验指出,通过图灵测试的系统未必真正"理解"语言,只是在进行符号操作。Tejal指出模型早已通过图灵测试却鲜有讨论,恰恰揭示了这一测试的失效:当模型真正通过时,人们发现这并不是AGI真正的判定时刻,社会已经默默将讨论框架迁移到更高维度的标准。"在很多情况下,模型已经和人类难以区分了。"她认为,真正的判定时刻将是人们意识到自己工作的大部分已经交给模型完成,以及AI带来实质性科学突破之时。
从静态基准到真实世界评估
评估方法本身也在剧烈演化。早期评估大多继承自传统NLP方法,过于简单,很快就被模型"通关"。团队不得不不断创造更难、更真实的基准。

这里涉及两个关键概念:
Bench maxing(刷榜)——指训练者只为在某个基准上好看,而非让模型真正有用。这一问题的本质是"古德哈特定律"(Goodhart's Law)的体现:一旦某个指标成为优化目标,它就不再是好的指标。古德哈特定律最初来自货币政策领域,英国经济学家查尔斯·古德哈特在1975年观察到:当央行将货币供应量作为政策目标时,货币供应量与通胀的相关性就会瓦解。这一规律在AI评估中表现得尤为突出:一旦某个基准成为行业共识的排行榜,各实验室就会有意无意地针对其进行优化,导致基准分数与真实能力逐渐脱钩。Tejal明确表示这"通常是坏事":"你可能把90%的算力花在让评估分数好看上,模型发布时看起来很棒,然后用户发现它只擅长那一件事。这不是好体验。"她强调OpenAI在研究纪律上做得扎实,甚至公开过自家模型并非最优的结果,"我们只想呈现真实。"
Saturated(饱和)——指模型几乎能答对基准里所有问题,接近100%。"这就像用高中数学考试去比较两个天才,他们都能通过,但你没法区分他们。"
为解决"无法测量用户真实需求"的困境,团队推出了GDPVal。GDPVal的命名灵感来自国内生产总值(GDP),其设计哲学是将AI能力的评估与实际经济价值创造直接挂钩。它基于美国劳工统计局的O*NET职业信息数据库——该数据库由美国劳工部持续维护,包含900多个标准职业分类的详细任务描述、技能要求和知识领域,是劳动经济学研究的权威数据源。GDPVal从中提取高经济价值的代表性任务,覆盖40多个职业,如投资尽调、撰写法律备忘录等。这种设计思路代表了AI评估从"学术导向"向"经济导向"的重要范式转变:传统NLP基准测量的是语言理解的技术指标,与实际商业价值的关联性有限;而GDPVal直接问的是"这个模型能替代多少真实工作中的任务",使研究投入和商业价值之间建立可量化的映射关系。最早的模型在这个基准上得分不到20%,远逊于人类。

"但我很为团队骄傲,我们决定公开这个衡量真实经济影响的新方法。"Tejal说。这个基准催化了内部的"警钟",让研究方向更多转向真实工作的实用性。而如今,GDPVal可能又"太简单"了——因为它的任务描述过于明确,下一步是让模型处理如同真实职场那样模糊、开放的任务。
AI开始真正做科研:湿实验室的突破
访谈中最令人振奋的,是科学评估方面的进展。团队公开了多层级的科学基准:从奥林匹克风格的Frontier Science Olympiad,到测量模型能否续写未发表论文的Frontier Science Research。
最引人注目的是与Ginkgo Bioworks合作的湿实验室实验。"湿实验室"(wet lab)与"干实验室"(dry lab)的区分是生命科学领域的基本概念:干实验室指纯计算机模拟和数据分析工作,而湿实验室指涉及真实生物样品、化学试剂和物理仪器的实验操作。长期以来,AI在科研领域的应用主要集中在干实验室环节,如蛋白质结构预测(AlphaFold)、药物分子设计和基因组数据分析。
将AI决策能力延伸至湿实验室,意味着实现了"闭环科学"(Closed-Loop Science)的初步形态:模型不再只是辅助分析工具,而是成为实验设计→执行→观测→迭代完整科学循环的决策主体。与AlphaFold主要解决蛋白质结构预测这一静态问题不同,湿实验室闭环涉及在真实物理约束下的动态优化,对模型的实验设计能力和不确定性推理能力提出了更高要求。这在方法论上具有根本性意义——打通了"计算建议→物理执行→结果反馈"的完整闭环。
Ginkgo Bioworks是全球领先的合成生物学公司,其核心基础设施包括高度自动化的机器人实验室平台,可以执行数千个并行实验。在此次合作中,模型需要为蛋白质合成优化实验方案,机器人会实际投入试剂并测量蛋白产量——这个蛋白与一款卵巢癌药物相关。AI模型扮演的角色相当于一位实验设计专家:给定实验约束条件,输出优化的操作参数,由机器人执行,再将结果反馈给模型迭代。
"我们一开始很紧张,因为人类基线相当高,不确定模型能否超越,"Tejal说,"但我们永远不该低估模型。"结果,模型不仅超越了人类基线,还在"单位成本产量"上创下了新纪录。更惊人的是,这甚至不是他们最好的模型,只是一个早期推理模型。
"这是我们第一次为一个真正连接现实世界的评估去风险,"她说,"我们不是在等一段代码运行完,而是在等机器人做完实验。"
内部指标:AGI Index与"痛苦即护城河"
Tejal透露,OpenAI内部并不太关注公开基准("太嘈杂"),而是维护一个叫AGI Index的内部指标。这一设计借鉴了消费者物价指数(CPI)的方法论精髓,同时体现了统计学中"鲁棒指数"的核心思想:CPI通过选取代表性消费品类、按实际消费权重加权、定期追踪价格变动来衡量通货膨胀,其优点在于稳健性——单一商品价格的异常波动不会扭曲整体指标。CPI历史上也面临过类似批评——如房价权重争议——并通过持续修正方法论来维持其作为经济决策锚点的公信力。
AGI Index借鉴这一思路,构建一个包含多维度、持续更新权重的内部指标篮,涵盖能力、安全、对齐等所有核心关注领域,以此捕捉模型的真实综合进展,而非让研究方向被单一公开基准所扭曲。这也解释了为何OpenAI刻意在内部使用与公开发布不同的评估体系——公开基准的"信噪比"问题,以及竞争对手的博弈性优化行为,使其作为内部决策依据的可靠性大幅降低。OpenAI内部维护AGI Index而非依赖公开基准,本质上是在构建一个"竞争对手难以针对性博弈"的私有评估生态。
面对越来越长时程(long-horizon)的任务,评估变得极为复杂。模型可以连续工作数天乃至数周,而自动化评估却需要在有限时间内出结果。为此,团队越来越依赖生产环境的真实使用数据,以及可以预测长期趋势的scaling laws。
Tejal提出了一句团队格言:"痛苦即护城河"(pain is the moat)。随着评估从数字世界延伸到物理世界,大量运营、物流、规划工作成为新的瓶颈。"我的工作已经从理论、数学、编程,转向了规划、运营和物理层面的事情——这些真的很难。"
给普通用户的建议:多用,反复试
针对企业主和普通用户,Tejal给出了朴素而有力的建议:建立你自己的评估,并且不断反复尝试。
"很多人可能半年前试过ChatGPT,觉得不行就放弃了。他们没意识到进步有多快。"她认为最好的评估其实就是亲自使用(dog food)模型——"dog fooding"是科技行业的内部术语,指公司员工在产品正式发布前大量使用自家产品,以便从真实使用中发现问题。Tejal将这一概念推广到普通用户:即使某周模型没做好,下周再试一次,很可能就成了。
她自己的工作方式是让模型"先过一遍"所有事情——发Slack消息、决定下一步实验、管理和运营。如果模型做得不好,就把这个案例做成评估。她预测,模型使用她电脑的速度和效率将逐渐超过她自己,因为模型可以直接调用连接器和插件,比人类点击操作快得多。
结语:谨慎乐观地迎接转型
关于AI对就业的影响,Tejal给出了平衡的看法。当前模型擅长任务(task)而非完整的工作(job)——工作还包含判断该做什么、应对模糊性、与同事协作等。但她认为模型很快也将具备"委派"能力,能自己决定该做什么并执行。
她以临床试验为例:撰写数百页FDA申报材料、追踪症状、数据分析——大量本质上是数字化的文档和分析工作,若AI能加速,将在医疗、能源、制造、政策、教育等领域带来巨大推进,最终让消费者获得"更快、更便宜、更好的产品"。
"这是人们应该为之兴奋的事,"她总结道,"但我们必须非常审慎地思考,如何以负责任的方式导航通往那个世界的转型。"
这场访谈传递的信息清晰而有力:AI的进步曲线远比大众感知的更陡峭,而真正身处前沿的研究者,反而是最坚信AGI临近的一群人。对于旁观者而言,也许最好的应对方式,就是放下成见,亲自去用一用最新的模型。
核心要点
核心要点
相关推荐

Kimi K3登陆Telnyx推理API:国产大模型出海新路径
月之暗面Kimi K3正式接入Telnyx Inference API,开发者可通过统一接口调用Kimi K3的长上下文与中文理解能力。本文解析Kimi K3技术定位、Telnyx推理平台价值及中国大模型出海趋势。

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。