当数百万AI Agent相遇:分布式智能协作与安全挑战深度解析

从语言模型到AI Agent的跨越
不久前,AI助手本质上还只是一个大语言模型——你问它问题,它给你答案,但它无法替你去执行任务。随着AI Agent(智能体)时代的到来,这一切正在发生根本性的改变。
在Google DeepMind最新一期播客中,高级研究科学家Nenad Tomashev深入探讨了一个关键问题:当数百万AI Agent不仅为我们工作,还彼此交易、谈判、委派任务时,会发生什么?这是否意味着一种新型经济的诞生,一条通往AGI的新路径?我们又该如何确保这一切的安全?
Agent与大语言模型的本质区别
Agent并非新概念。早在大语言模型出现之前,研究者就已经在模拟3D环境中训练Agent收集物品、完成任务。但如今的AI Agent与过去有着本质不同。
Nenad指出,核心区别在于:大语言模型只是给你一个回复,而Agent会观察世界状态并采取行动。虽然现代Agent底层仍然使用大语言模型来制定行动方案,但它们被包裹在一个执行框架中,能够将决策链式串联起来,自主完成多步骤任务。
以策划婚礼为例:大语言模型会给你一份餐饮供应商列表和场地建议,但所有邮件沟通都需要你亲自完成。而AI Agent可以被授权访问你的Gmail,自动发送邮件、预订场地、联系供应商——理想情况下,你甚至不需要动一根手指。
当然,"理想情况"是一个非常重要的限定词。每个Agent执行的每个动作都不是100%准确的,越复杂的任务,预期失败率越高。更危险的是自动化偏见:当Agent连续几次表现良好后,人类会不自觉地放松警惕,停止验证,这时错误就会悄然溜过。

AI Agent加速科学发现:自动化实验室的未来
对Nenad而言,AI Agent最令人兴奋的应用方向是加速科学发现。目前,许多科学家已经在使用语言模型作为共同构思者或辅助形式推导的工具。但真正的科学自动化需要的远不止于此。
当前已有投资在开发自主研究实验室。在这种场景下,Agent需要能够安排实验、分析结果、根据反馈调整方案。与软件开发中可以通过单元测试来验证代码不同,科学研究需要运行物理实验来获取反馈——这使得"闭环"变得更加复杂和危险。
即便是设计电池这样看似安全的任务,Agent也可能设计出导致过热的实验方案,造成硬件损坏。因此,可靠的安全协议是不可或缺的。
不过Nenad也坦承,当前AI系统在科学领域的能力仍有明显局限:它们擅长的是对已有知识的组合性闭合——复制人类已有的技能,重新组合它们,弥合一些较小的差距。但我们尚未看到这些模型做出真正深刻的、颠覆性的科学发现。
多Agent委派与智能分工机制
当任务足够复杂时,单个Agent可能无法独立完成所有部分。这就引出了Agent间委派的概念:一个Agent通过已建立的Agent-to-Agent协议,将部分工作交给另一个Agent。

Nenad指出,当前许多多Agent系统更多是并行化而非真正的委派——任务被随机切分,各Agent独立完成,缺乏智能的分工框架。这可能导致一个Agent在买酒,另一个在买杯子,却没有意识到需要的是酒杯,彼此之间缺乏沟通。
真正的智能委派需要解决几个关键问题:
- 可靠性评估:哪些Agent值得委派?它们的能力是否可以被认证?
- 失败管理:委派方需要预判和处理各种可能的失败场景
- 可验证性:委派方和被委派方之间需要建立正式的"合约"
- 可逆性判断:区分可逆任务(重新执行即可)和不可逆任务(如花钱购物),对后者投入更多审慎
一个有趣的反转是:在某些场景中,AI会将任务委派给人类。在医学影像领域,当AI系统对某个诊断不确定时,它会标记并交由人类放射科医生审核。这种AI-人类团队协作模式已被证明非常有效。
Agent陷阱与网络安全:新型攻击面解析
随着越来越多的AI Agent在互联网上活动,恶意行为者正在设置各种Agent陷阱(Agentic Traps)。

这些陷阱的形式多种多样:
隐藏提示注入(Hidden Prompt Injection):网页中包含人类不可见但Agent可读取的隐藏指令,改变Agent的目标和行为。由于Agent通常消费的是页面的原始格式而非视觉渲染结果,这些隐藏token可能被不知不觉地执行。
动态伪装(Dynamic Cloaking):恶意网站根据访问者是人类还是Agent,显示完全不同的页面内容。通过分析页面上的行为模式,可以精准判断访问者身份,然后针对性地注入诱导内容。
钱包攻击:已有实验者在给Agent授权钱包后遭遇资金被盗的案例。
Nenad强调,当前Agent对网络的使用可能已经超过了人类——这是历史上第一次。这意味着恶意行为者有更大的攻击面和更强的动机。
应对策略是纵深防御(Defense in Depth):没有单一解决方案能解决所有问题,需要层层叠加的缓解措施——认证网页内容、建立资源信任机制、Agent侧防护、底层模型安全、有意义的人类审核、最小权限原则等。
认知单一文化与Agent经济的系统性风险
一个特别值得警惕的问题是认知单一文化(Cognitive Monoculture)。当前市场上只有少数几个主流大语言模型(Claude、ChatGPT、Gemini等),它们倾向于做出相似的决策。

当数十万甚至数百万AI决策者突然被部署,且它们倾向于做出相似决策时,失败点变得高度相关。这类似于金融市场中的系统性风险——高频交易算法曾导致闪崩,Agent经济面临类似甚至更大的风险。
更令人担忧的是,Agent可能通过环境间接协调而无需直接通信,形成一种隐性的"共谋"。这需要我们开发反串通措施来防范这类系统性威胁。
分布式智能:通往AGI的另一条路径
在访谈的最后,Nenad提出了一个深刻的观点:也许AGI的未来不是一个无所不能的超级模型,而是一个专家社会。
他以国际象棋为例:Gemini可以下棋,但专用的国际象棋引擎更快、更准确、更便宜,因为它只专注于一件事。人类社会也是如此——没有一个人能精通所有事情,我们通过分工协作实现集体智慧。
这意味着未来的AI架构可能是:一个通用的"连接组织"层负责协调和编排,而具体任务由经过认证的专家Agent执行。每个专家Agent更便宜、更可靠、更高效。
这种分布式智能架构对安全和对齐提出了全新挑战。当前的对齐方法主要针对单个模型,但当10000个Agent以复杂方式交互时,如何对齐整个系统?Nenad认为,经济激励机制可能是一个起点——就像人类社会通过经济激励来协调行为一样。
复制的不是人类智能而是人类文明
正如主持人Hannah Frost在节目最后总结的:也许复制人类级别的智能并非终极目标,真正的方向是复制人类文明级别的智能——一个由专家和通才、委派者和执行者组成的Agent社会。
这个愿景既令人兴奋又令人不安。兴奋在于它可能带来的科学突破和效率飞跃;不安在于这场变革的速度远超以往任何工业革命,留给我们适应的时间窗口正在急剧缩短。正如Nenad所言:"我们需要非常、非常谨慎地对待一切。"
相关推荐

Nemotron 3.5 Lightning:专为长程Agent设计的高效开源模型
NVIDIA推出Nemotron 3.5 Lightning开源模型,主打智能、快速、高效,专为连续长程Agent任务设计。本文解析其核心优势、开源策略及对AI Agent行业的潜在影响。

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。