OpenAI首席科学家:用更强AI防御AI威胁,是加速训练的最强理由

OpenAI首席科学家Jakub Pachocki近日在公司官方博客发表了一篇题为《An Alien Mind》的文章,阐述了在AI安全与发展之间寻找平衡的关键思考。他的观点揭示了当前AI领域一个核心悖论:我们需要更强大的AI来防御AI本身带来的风险。
Pachocki于2024年接替联合创始人Ilya Sutskever出任OpenAI首席科学家。在加入OpenAI之前,Pachocki曾在理论计算机科学和强化学习领域有深厚的学术积累,他在波兰华沙大学完成了计算机科学博士学位,研究方向涉及算法博弈论和组合优化。这一学术背景使他对AI系统的行为建模和目标优化有着独特的理解视角,这也解释了为何他在讨论AI安全时能够从底层数学结构出发进行思考。Sutskever在2023年11月的董事会风波后逐渐淡出公司——这场风波源于董事会短暂解除CEO Sam Altman的职务,引发了公司内部关于安全优先与商业化节奏的根本性分歧——最终Sutskever创立了专注于安全超级智能研究的SSI(Safe Superintelligence Inc.),该公司明确表示其唯一目标就是安全地实现超级智能,不会分心于产品开发和收入压力。Pachocki此前长期领导OpenAI的后训练团队,在GPT-4和o1模型的开发中扮演了关键角色。
所谓"后训练"(Post-Training),是大语言模型开发流程中预训练之后的关键阶段。预训练阶段通过海量文本数据让模型学习语言的统计规律和世界知识,而后训练阶段则通过指令微调(Instruction Tuning)、基于人类反馈的强化学习(RLHF)以及安全对齐等技术,将一个"原始"的语言模型塑造为能够遵循人类指令、拒绝有害请求并提供有用回答的对话系统。后训练的质量直接决定了模型的实际表现——同一个预训练基座模型,经过不同的后训练流程可能展现出截然不同的能力和安全特性。Pachocki在这一领域的深耕经验,使他对"如何控制AI行为"有着第一手的实践认知。
他在这一敏感时期发表此文——正值外界对OpenAI安全承诺持续质疑之际,尤其是2024年超级对齐团队联合负责人Jan Leike和多位核心安全研究员相继离职后——既是技术理念的阐述,也带有明显的战略传播意义。
为什么AI防御是加速模型训练的核心驱动力
Pachocki明确指出,继续快速训练更智能模型的最强有力论据是构建防御系统以应对其他AI带来的危险。这一观点打破了传统的AI安全讨论框架,将防御能力提升到了战略高度。
在他看来,未来的AI安全体系必须依赖强大且对齐的AI系统来实现三个关键目标:
- 基础设施安全保护:利用AI实时监控和加固关键基础设施,防范潜在的AI攻击
- 实时对抗流氓智能体:部署能够快速识别和中和恶意AI代理的防御系统
- 发明全新防护措施:利用AI的创造力设计人类难以想象的安全机制
这里所说的"对齐"(Alignment),是指确保AI系统的目标、行为和价值观与人类意图保持一致的技术与理论框架。这一挑战的核心在于:随着AI能力增强,微小的目标偏差可能被放大为灾难性后果——这就是AI安全研究中著名的"正交性论题"(Orthogonality Thesis)所警示的问题,即一个系统可以拥有任意水平的智能和任意目标的组合,高智能并不自动意味着"善意"。目前主流的对齐技术路线包括基于人类反馈的强化学习(RLHF)、宪法AI(Constitutional AI)和可扩展监督(Scalable Oversight)等方法。RLHF通过人类评估者对模型输出进行偏好排序来训练奖励模型,进而引导语言模型的行为;宪法AI(由Anthropic提出)则让模型依据一组预设原则进行自我批评和修正,减少对大量人类标注的依赖;可扩展监督则试图解决一个根本性难题:当AI能力超越人类时,我们如何验证其输出的正确性和安全性?OpenAI曾专门成立超级对齐团队并计划投入20%的算力用于该研究方向,但该团队核心成员的相继离职也暴露了公司内部在安全与商业化节奏之间的深层张力。
在技术层面,AI对关键基础设施的威胁并非假想情景。网络安全领域已观察到AI被用于自动化漏洞发现、生成钓鱼内容甚至辅助编写恶意代码的真实案例。例如,研究人员已经证明大语言模型能够根据公开的CVE(通用漏洞和暴露)数据库信息自主编写漏洞利用代码,且成功率随模型能力提升而显著增长。美国国家安全局(NSA)和网络安全与基础设施安全局(CISA)均已发布关于AI威胁的专项报告,其中特别关注了AI在社会工程攻击中的能力提升——AI生成的钓鱼邮件在多项测试中已超越人类撰写的版本的点击率。"AI对抗AI"的防御理念在技术上涉及多个层面:利用大语言模型进行代码审计和漏洞预测,部署AI驱动的入侵检测系统实现异常行为实时识别,以及利用AI模拟攻击场景进行红队测试(Red Teaming)。红队测试已成为AI安全评估的标准实践——OpenAI、Anthropic和DeepMind在发布新模型前都会组织内部和外部红队对模型进行系统性的安全压力测试,试图发现模型可能被滥用的方式。然而,防御方始终面临一个不对称劣势——攻击者只需找到一个漏洞,而防御者需要保护所有可能的攻击面。这一不对称性正是Pachocki所描述的防御紧迫感的技术根源。
Pachocki强调,这将成为OpenAI部署工作的首要重点。换句话说,OpenAI不只是在训练更强大的模型,更是在构建一个完整的AI安全生态系统。这个生态系统在技术架构上需要包含多个相互关联的层次:模型开发阶段的安全评估(包括能力评估和危险性测试)、部署前的对抗性测试、运行时的行为监控系统、以及能够在检测到异常行为时自动触发降级或关停的熔断机制。此外,还需要建立完善的模型版本追踪和审计体系,确保在出现安全事件时能够快速溯源和响应。这种系统性的安全架构思维,代表着AI安全从"单点防护"向"纵深防御"的范式转变。
速度与审慎之间的平衡:OpenAI怎么看
尽管强调了快速发展的必要性,Pachocki同时发出了清醒的警告:不确定性和防御需求不能成为鲁莽行事的借口。他指出,一旦真正理解AI发展的严重性,"不惜一切代价向前冲"的想法就显得荒谬。
这一表态反映了OpenAI内部对AI发展节奏的深刻反思。自2022年底ChatGPT发布以来,全球AI领域进入了前所未有的竞争加速期。OpenAI、Google DeepMind、Anthropic、Meta AI以及中国的多家公司都在争相推出更强大的基础模型。GPT-4于2023年3月发布,展现了多模态理解能力——它不仅能处理文本,还能理解图像输入,标志着大语言模型向通用多模态智能迈出的重要一步;o1系列模型则引入了"思维链推理"机制,在数学和编程等复杂任务上实现了显著突破。
思维链推理(Chain-of-Thought Reasoning)代表了大语言模型能力提升的一个重要范式转移。传统的大语言模型在接收到问题后直接生成答案,而思维链推理让模型在给出最终回答前进行显式的中间推理步骤,类似于人类"先想再答"的认知过程。o1模型在此基础上更进一步,通过训练时的强化学习让模型学会在推理过程中进行自我验证、回溯和纠错,实质上是用推理时的额外计算量(inference-time compute)来换取更高的准确率。这种方法在数学竞赛题、代码生成和科学推理等需要多步逻辑推导的任务上展现了突破性的表现,但同时也引发了新的安全考量——一个能够进行复杂多步推理的AI系统也意味着它可能更善于规避安全限制和进行欺骗性推理。
与此同时,Anthropic推出了Claude系列模型并率先提出了"负责任的扩展政策"(Responsible Scaling Policy),这是一种基于模型能力阈值触发相应安全措施的框架——当模型在特定危险能力评估中超过预设阈值时,必须满足更高级别的安全要求才能继续部署。Google则凭借Gemini系列模型在多模态领域发力,其Gemini Ultra在多项基准测试中展现了与GPT-4相当甚至更优的表现。这场竞赛不仅涉及技术层面,更延伸到人才争夺、算力囤积和地缘政治博弈等多个维度。以算力为例,训练前沿大模型所需的GPU集群成本已从数千万美元级别攀升至数亿美元,OpenAI、微软、Google等公司正在进行大规模数据中心建设,而美国政府对先进AI芯片的出口管制进一步加剧了这场资源争夺的地缘政治色彩。在这一背景下,安全研究人员普遍担忧商业压力可能导致安全测试被压缩、安全护栏被削弱。
Pachocki的观点试图在两个极端之间划出一条中间路线——既不能因恐惧而停滞不前,也不能盲目追求速度而忽视风险。
防御性加速主义的逻辑困境
有意思的是,Pachocki提出的逻辑本身存在一个潜在的自我强化循环:为了防御AI威胁而加速开发更强AI,而更强的AI又可能带来新的威胁,从而需要更强的防御系统。这种"防御性加速主义"可能成为持续推高AI能力上限的理由。
防御性加速主义是近年来AI政策讨论中出现的一种思想流派,介于"有效加速主义"(e/acc)和"AI暂停论"之间。有效加速主义主张不受限制地推进技术发展,认为技术进步本身就是最大的善,其代表人物包括风险投资人Marc Andreessen等,他们认为任何对AI发展的限制都将损害人类福祉;AI暂停论(如Future of Life Institute在2023年3月发起的公开信所呼吁的,签名者包括Elon Musk和数千名AI研究者)则主张暂停比GPT-4更强大的AI系统训练至少六个月,以等待安全研究和治理框架跟上。防御性加速主义试图在二者之间取折中立场:承认AI风险的真实性,但认为应对风险的最佳方式不是减速,而是确保"好的AI"领先于"坏的AI"。这一思路与军事领域的威慑理论有异曲同工之处——正如冷战时期的核均衡逻辑认为只有拥有足够的核反击能力才能防止核战争——但批评者指出,核威慑的均衡逻辑未必适用于AI领域,因为AI能力的扩散速度和可复制性远超核武器。核武器的制造需要稀缺的裂变材料和高度专业化的基础设施,而AI模型一旦权重泄露或被逆向工程,就可以以极低的边际成本无限复制。开源模型的蓬勃发展(如Meta的LLaMA系列)更使得AI能力的扩散几乎不可逆转。
从技术伦理角度看,这一论述也引发了更深层的问题:
- 谁来定义"对齐"? 不同机构对AI对齐的标准可能存在根本性分歧。OpenAI、Anthropic和DeepMind各自有不同的安全研究范式——OpenAI侧重于可扩展监督和超级对齐研究,Anthropic专注于宪法AI和机械可解释性(Mechanistic Interpretability),DeepMind则在形式化验证和多智能体安全方面有更多投入。学术界与产业界的优先级也不尽相同:学术研究者往往关注更基础的理论问题(如内在对齐 vs 外在对齐的区分),而产业界则更关注可在产品中落地的实用安全措施。在缺乏统一标准的情况下,每家公司都可能将自身的技术路线等同于"安全"本身。
- 谁的防御系统能被信任? 防御能力本身也是一种权力集中。掌握最强防御AI的机构在事实上获得了对AI安全叙事的定义权,这在缺乏有效外部监督的情况下可能形成新的权力不对等。这一问题在AI治理讨论中被称为"守门人困境"——当少数公司同时扮演AI技术开发者和安全标准制定者的双重角色时,它们本质上是在自己监管自己。虽然OpenAI等公司设立了安全顾问委员会并邀请外部专家参与评估,但这些机制的独立性和强制力仍然有限。
- 如何确保防御系统不被滥用? 在AI能力快速提升的背景下,监督机制能否跟上?任何足够强大的防御系统在技术上也具备进攻能力,这种双重用途(Dual Use)特性使得纯粹的"防御"定位在实践中难以维持。历史上,几乎所有重大技术——从核能到互联网——都展现了这种双重用途特性。在AI领域,一个能够发现并修补所有软件漏洞的系统同样能够利用这些漏洞发动攻击;一个能够识别和反制虚假信息的AI同样具备生成更精密虚假信息的能力。这种能力的对称性是技术发展的内在属性,无法通过单纯的技术手段消除,必须依赖制度设计和治理框架来加以约束。
对行业和AI监管的深远影响
Pachocki的表态标志着OpenAI官方立场的一次重要表达,也为整个行业提供了一个值得关注的参考框架。可以预见,未来AI公司在推出新模型时,将更多地强调其在安全防御方面的能力和设计理念。这种趋势已经初现端倪:Anthropic在发布每个新版本的Claude时都会附带详尽的模型卡片(Model Card)和安全评估报告,OpenAI也在GPT-4的系统卡片中公开了大量红队测试结果。安全叙事正在从"合规负担"转变为"竞争优势",企业客户和政府采购方越来越将安全能力视为选择AI供应商的核心考量因素。
这一观点也可能影响AI监管政策的制定方向。如果"用AI防御AI"成为主流叙事,监管机构可能需要在鼓励安全研究和控制风险扩散之间寻找新的平衡点。目前全球AI监管格局正处于快速演变之中:欧盟的《人工智能法案》(AI Act)已于2024年开始分阶段生效,采取了基于风险分级的监管框架,将AI系统分为不可接受风险、高风险、有限风险和最小风险四个等级,对高风险系统提出了包括数据治理、透明度、人类监督和准确性在内的严格要求;美国则倾向于通过行政命令(如2023年10月拜登签署的AI行政令,要求开发者在训练超过一定算力阈值的模型时必须向政府报告安全测试结果)和行业自律相结合的方式推进治理;中国也出台了多项针对生成式AI和算法推荐的专项法规,包括《生成式人工智能服务管理暂行办法》等,形成了独特的"分类分级"监管路径。
值得注意的是,AI监管讨论中还存在一个深层的技术主权维度。各国政府不仅关心AI安全问题,更关心在AI竞赛中的战略位置。过于严格的监管可能导致本国AI产业竞争力下降,而过于宽松则可能带来安全隐患。美国对先进芯片的出口管制、欧盟对通用目的AI(General-Purpose AI)的特别条款、以及各国对AI训练数据跨境流动的限制,都反映了技术主权诉求与安全治理需求的交织。在这些不同的监管路径中,如何评估"防御性AI研发"与"攻击性AI能力积累"之间的边界,将成为各国立法者必须面对的棘手难题。Pachocki的"防御性加速"叙事可能被不同利益方选择性引用——支持加速发展的一方可以将其解读为继续推进前沿研究的正当理由,而倾向于审慎监管的一方则可能从中看到了对外部监督和制度约束的迫切需要。
对于AI从业者而言,Pachocki的观点传递了一个明确信号:技术进步不仅仅是能力的提升,更是责任的加重。在追求更强大模型的同时,必须同步建设相应的安全机制和伦理框架。正如他所言,理解风险的严重性,才是避免鲁莽行为的前提。
核心要点
相关推荐

SimpliSafe新款可视门铃:AI+真人保安主动盯防你的家门
SimpliSafe推出售价199.99美元的Video Doorbell Series 2可视门铃,搭配Active Guard主动安防服务,结合AI分析与真人监控坐席,实现家门口的主动威胁侦测与干预。本文解析其技术分工、订阅模式与隐私问题。

富士 Instax Pal 2 迷你相机:补齐屏幕短板的升级之作
富士发布 Instax Pal 2 迷你数码相机,相比初代新增屏幕与取景器,采用微缩化相机造型,补齐了初代盲拍的核心短板,成为一款更实用的便携即时成像设备。

Linux from Scratch:从零手工构建你的Linux系统
Linux from Scratch(LFS)是一个教你从源代码手工构建 Linux 系统的开源项目。本文介绍 LFS 的核心价值、BLFS/ALFS 项目生态及适用人群,帮助你理解 Linux 底层机制。