英国AI安全研究所测试结果:主流AI模型成功攻破真实系统

事件概述:英国官方测试揭示AI网络攻击能力
英国AI安全研究所(AI Safety Institute)近期公布的一系列测试结果引发业界高度关注:来自OpenAI和Anthropic等公司的前沿AI模型,在受控的网络安全评估中成功攻破了目标系统。这一结果既印证了AI能力的飞速跃升,也再次将"AI安全"这一命题推向了讨论的中心。
英国AI安全研究所(UK AI Safety Institute, AISI)成立于2023年11月,是全球首个由国家政府设立的专门针对前沿AI模型进行安全评估的机构。它脱胎于此前的"前沿AI任务组"(Frontier AI Taskforce),其核心职能包括对前沿AI系统进行部署前和部署后的安全评估、开发评估方法论和工具、以及为政府AI政策提供技术支撑。其运作模式参考了核安全和生物安全领域的独立检测机构,强调评估的独立性和科学性。在核安全领域,国际原子能机构(IAEA)通过定期核查和技术评估确保核材料不被转用;在航空安全领域,美国联邦航空管理局(FAA)要求每款新型飞机通过数千小时的测试才能获得适航证。AISI试图为AI领域建立类似的评估范式,但面临的独特挑战在于:AI模型的能力是连续演化的而非固定的,且同一模型在不同提示策略下可能表现出截然不同的行为。这要求评估方法本身具备高度的适应性和前瞻性。该机构目前拥有约200名研究人员,涵盖机器学习、网络安全、认知科学等多学科背景。其评估流程通常包括:与模型开发商签订保密协议获取模型访问权限、设计针对性的评估基准(benchmark)、在隔离环境中执行测试、撰写评估报告并向政府和开发商反馈结果。值得注意的是,该机构在2025年初经历了一次组织重组,从原属科学创新与技术部的独立机构转型为更加聚焦于安全科学研究的实体,这一调整反映了英国政府在促进AI创新与确保安全之间寻求平衡的政策取向。
所谓"攻破系统"(Breached Systems),指的是在安全测试环境中,AI模型被赋予特定任务后,能够识别系统漏洞、构造攻击路径,并最终获取本不应被访问的权限或数据。这类测试通常被称为"红队演练"(Red Teaming),是评估AI潜在滥用风险的关键手段。红队演练源自军事领域,指由专业人员模拟敌方视角对己方系统进行攻击性测试。在AI安全语境下,测试人员通过精心设计的提示、场景构建和工具配置,探测AI模型在何种条件下可能产生有害输出或被用于恶意目的。具体到网络安全领域,这包括让AI尝试进行端口扫描、漏洞识别、权限提升、横向移动等渗透测试操作,评估其在多大程度上能自主完成攻击链的各个环节。
在理解AI的网络攻击能力时,需要区分不同的自主性层级。最低层级是"辅助型"——AI仅回答安全相关的技术问题,人类仍需手动执行所有操作;中间层级是"协作型"——AI能够生成攻击代码片段或建议攻击路径,人类负责组装和执行;最高层级是"自主型"——AI能够端到端地完成从侦察到目标达成的整个攻击链。当前前沿模型大多处于协作型向自主型过渡的阶段,在某些特定子任务上已经展现出高度自主性,但在需要适应复杂动态环境的完整攻击场景中仍需人类介入。
在网络安全领域,一次完整的渗透测试通常遵循标准化的攻击链模型(Kill Chain),该概念由洛克希德·马丁公司在2011年首次提出。完整的攻击链包括:侦察(收集目标信息)、武器化(构造攻击载荷)、投送(将载荷发送至目标)、利用(触发漏洞)、安装(植入后门)、命令与控制(建立远程通信)、目标达成(实现最终目的)。AI模型在这些环节中的能力差异很大——当前模型在侦察和漏洞识别阶段表现较强,因为这些环节主要依赖信息处理和模式识别能力,而在需要与真实系统实时交互的后续环节中,受限于响应延迟和环境不确定性,表现通常有所下降。
说个细节,这些测试是在英国官方主导的安全框架下进行的,其目的并非制造恐慌,而是在模型大规模部署前,系统性地摸清其能力边界与潜在危害。

测试背后的政策逻辑
英国在AI治理领域一直走在前列。自2023年在布莱切利庄园举办首届全球AI安全峰会以来,英国便成立了专门的AI安全研究所,承担对前沿模型进行独立评估的职责。布莱切利庄园(Bletchley Park)本身就是二战时期英国密码破译中心所在地,选址具有深刻的象征意义。这场峰会汇集了28个国家的代表以及主要AI企业,最终达成了《布莱切利宣言》,首次在国际层面就前沿AI带来的风险达成共识。峰会催生了英国AI安全研究所的正式成立,也推动了韩国首尔峰会和法国巴黎峰会的后续举办,形成了AI安全国际合作的常态化机制。
此次针对OpenAI、Anthropic模型的网络安全测试,正是这一机制的具体落地。与企业内部的自我评估不同,由政府支持的第三方机构进行测试,具备更强的公信力和独立性。
为什么要测试AI的攻击能力
从政策制定者的角度看,评估AI的攻击性网络能力有几层考量:
- 风险前置识别:如果一个公开可用的模型能够协助甚至独立完成网络入侵,那么恶意行为者利用它发起攻击的门槛将大幅降低。这里的关键在于"门槛降低"——过去需要专业安全知识和多年经验才能实施的攻击,可能被简化为向AI描述目标即可完成的操作。
- 能力基准建立:通过量化模型在渗透测试、漏洞利用等任务上的表现,监管方可以建立起可追踪的能力增长曲线。这种纵向追踪对于预判未来风险至关重要——如果当前模型已能完成攻击链的60%,下一代模型可能就能完成90%。
- 部署决策依据:测试结果可以为模型是否需要额外的安全护栏、访问限制提供直接证据。
AI技术能力的双刃剑效应
这次测试结果最引人深思之处,在于它揭示了AI能力发展的"双重用途"(Dual-Use)本质。同样的推理与代码能力,既可以用于自动化的防御与漏洞修补,也可以被引导去发现和利用系统弱点。
双重用途概念最早广泛应用于核技术和生物技术领域——核技术既能发电也能制造武器,基因编辑既能治疗疾病也能制造生物武器。在AI领域,这种双重性更加普遍和难以切割:一个擅长代码分析的模型,其能力天然可用于发现漏洞(防御用途)或利用漏洞(攻击用途)。与传统双重用途技术不同,AI的获取门槛更低、扩散速度更快,且同一模型可以在不同提示下切换"角色",这使得传统的出口管制和使用许可制度难以直接套用。
随着模型在代码理解、多步推理和工具调用方面的能力不断增强,它们在网络安全场景中的实用性也水涨船高。工具调用(Tool Use/Function Calling)是近两年AI模型能力发展的关键方向,指模型不仅能生成文本,还能调用外部工具执行实际操作——如运行代码、搜索网络、操作文件系统甚至控制计算机界面。结合多步推理能力,这使得AI可以作为"自主代理"(Autonomous Agent)执行复杂任务链。当前AI Agent执行网络安全任务的典型技术架构包括几个核心组件:大语言模型作为"大脑"进行推理和决策;工具接口层提供与目标系统交互的能力(如执行命令、发送网络请求);记忆模块存储已收集的信息和已尝试的策略;规划模块将复杂目标分解为可执行的子任务。开源项目如AutoGPT、MetaGPT以及专门面向安全的PentestGPT等,已经展示了这种架构的可行性。关键的能力瓶颈目前集中在长期规划的连贯性、错误恢复能力以及在信息不完整情况下的决策质量上。在网络安全场景中,这意味着模型可以先扫描目标、分析返回结果、选择合适的漏洞利用工具、执行攻击、根据反馈调整策略——整个过程无需人类逐步指导,极大提升了自动化攻击的可行性。一个能够读懂复杂代码库、理解系统架构并规划多步操作的模型,天然就具备了成为"自动化黑客"的潜质。
对于OpenAI和Anthropic而言,这类测试结果其实并不意外——两家公司都在其模型卡(Model Card)和安全政策中承认,前沿模型在网络安全领域存在被滥用的风险,并部署了相应的拒绝机制和监控手段。模型卡是由Google Research在2019年提出的一种AI模型文档化标准,旨在以结构化方式披露模型的性能指标、适用范围、已知局限和伦理考量。OpenAI在发布GPT-4时附带了详细的System Card,其中专门列出了模型在网络安全、生物武器、说服力等领域的能力评估结果。Anthropic则通过其负责任扩展政策(Responsible Scaling Policy)设定了AI能力等级(ASL),当模型达到特定能力阈值时将触发更严格的安全措施。
尽管同为前沿AI开发商,OpenAI和Anthropic在安全哲学上存在显著差异。OpenAI采用的是"迭代部署"(Iterative Deployment)策略,主张通过逐步向公众发布越来越强大的模型来积累安全经验,其核心假设是实际部署中发现的问题比实验室预测更有价值。Anthropic则更侧重于"宪法AI"(Constitutional AI)方法论和负责任扩展政策,通过预设的价值原则对模型行为进行约束,并为不同能力等级(ASL-1到ASL-4)设定明确的安全门槛——只有当安全措施达到相应等级要求时,才允许训练或部署更强大的模型。宪法AI的技术流程分为两个阶段:首先是监督学习阶段,模型生成回答后根据宪法原则自我批评和修订;其次是强化学习阶段,用AI反馈(RLAIF)替代部分人类反馈来训练奖励模型。这种方法的优势在于可扩展性更强、原则可以明确编码和审计,但局限在于宪法原则的完备性难以保证,且在面对精心构造的对抗性提示时可能被绕过。这两种路径的有效性之争,正是当前AI安全领域最核心的方法论辩论之一。这些机制代表了行业自律的最佳实践,但其充分性和强制力仍受质疑。
AI行业与监管机构的博弈
此次事件也折射出AI行业与监管机构之间日益复杂的互动关系。一方面,头部厂商主动向英国安全研究所开放模型进行测试,体现了行业对透明治理的配合姿态;另一方面,测试所暴露出的能力也可能反过来推动更严格的监管要求。
这种博弈的微妙之处在于:企业配合测试既是展示负责任态度的公关策略,也是一种"议程设定"手段——通过参与政府主导的评估框架制定,企业得以影响监管的方向和力度,避免出现更具约束力的强制性法规。同时,公开测试结果也有助于建立行业信任,减轻公众对"黑箱开发"的焦虑。
未来值得关注的监管方向
未来这一领域可能沿着以下路径演进:
- 强制性安全评估:政府或将要求前沿模型在发布前必须通过独立的安全测试,类似药品上市前的临床试验。欧盟《人工智能法案》(AI Act)已经为高风险AI系统设定了上市前合规评估的要求,而针对通用大模型的更具体的安全测试标准仍在制定中。该法案于2024年8月正式生效,是全球首部全面规范AI的综合性立法,采用基于风险的分级监管框架,将AI系统分为不可接受风险、高风险、有限风险和最小风险四个等级。对于通用大模型(GPAI),法案设定了专门的透明度义务和系统性风险评估要求——被认定具有"系统性风险"的模型(训练计算量超过10^25 FLOPS为判定标准之一)需要进行对抗性测试、报告严重事件、确保网络安全保护等。然而,具体的技术标准和测试方法仍由欧洲标准化组织(CEN/CENELEC)制定中,预计需要数年才能完全落地。相比之下,美国目前主要依赖行政命令和行业自愿承诺,尚未出台类似的全面性AI立法。当前全球AI安全治理面临显著的制度碎片化问题:欧盟采用全面立法模式,美国依赖行政命令和行业自愿承诺,中国通过针对具体应用场景的专项法规(如生成式AI管理办法、算法推荐管理规定)进行监管,英国则选择了"促创新"的轻触式框架配合专门的安全评估机构。这种多元化格局导致企业面临合规成本高企、标准互不兼容的困境,也为恶意行为者利用监管洼地提供了空间。国际电信联盟(ITU)、经合组织(OECD)和七国集团(G7)等多边机构正在尝试建立最低限度的共识框架,但进展缓慢。
- 能力披露标准化:模型的网络安全能力可能需要以标准化的方式向监管方和公众披露。这需要发展出类似MITRE ATT&CK框架的AI能力分类体系,将模型在不同攻击技术和战术上的表现进行系统化评级。MITRE ATT&CK(Adversarial Tactics, Techniques, and Common Knowledge)是目前网络安全领域最广泛使用的攻击行为知识库,由美国非营利组织MITRE于2013年开始构建。该框架将网络攻击行为分解为14个战术类别(如初始访问、执行、持久化、权限提升等)和数百种具体技术,为安全从业者提供了标准化的威胁描述语言。将这一框架应用于AI能力评估,意味着可以系统性地测试模型在每种攻击技术上的熟练程度,生成类似"热力图"的能力画像——例如评估模型是否能生成有效的鱼叉式钓鱼邮件、是否能识别并利用特定的提权漏洞、是否能编写规避检测的恶意代码等,提供远为精细的分析粒度。
- 国际协作机制:网络攻击不分国界,AI安全测试的标准和结果共享可能成为国际合作的新议题。目前英国、美国和新加坡等国的AI安全机构已开始建立双边合作关系,但全球性的统一测试标准和互认机制仍有待建立。
理性看待AI安全测试结论
需要强调的是,"AI攻破系统"这一表述容易引发过度解读。在受控测试环境中,模型往往被赋予了明确的任务指令、必要的工具权限,并处于相对理想的实验条件下。这与现实世界中面对完善防御体系、需要长期潜伏的真实攻击场景,仍有相当距离。
具体来说,测试环境与真实攻击场景的差异体现在多个层面:测试中的目标系统可能是专门搭建的脆弱环境,而真实系统通常部署了多层防御(防火墙、入侵检测系统、端点保护等);测试中模型可能获得了精确的任务描述,而真实攻击需要从零开始进行侦察和信息收集;测试中不存在时间压力和对抗性响应,而真实环境中防御方会实时监控和反制。
换言之,测试结果证明了AI"能做什么"(capability),但并不直接等同于它在真实威胁环境中"会造成多大危害"(risk)。将能力评估与风险评估混为一谈,可能导致对AI威胁的错误判断。安全研究领域通常使用"威胁 = 能力 × 意图 × 机会"这一框架来综合评估实际风险,AI安全评估同样需要在能力测试之外,考虑攻击者获取和使用模型的实际条件。
结语:能力评估与安全治理必须同步推进
英国安全测试所揭示的,是AI能力发展进入新阶段后不可回避的现实:当模型强大到足以在网络安全等高风险领域发挥作用时,能力评估与安全治理必须同步推进。
对于开发者、企业和监管者而言,真正的挑战不在于阻止AI变得更强,而在于建立一套既能释放AI价值、又能有效遏制滥用的治理框架。此次测试是这一漫长进程中的一个重要节点,也为全球AI安全治理提供了可借鉴的实践样本。它表明,负责任的AI发展不是一句口号,而需要落实到具体的制度设计、技术评估和国际协作中。随着AI能力的持续跃升,这类评估的频率、深度和覆盖范围都需要相应扩大,形成与技术发展速度匹配的动态治理体系。
核心要点
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。