托管Agent时代来临:Anthropic与Google的两条路线之争

2025年,AI Agent的基础设施正在经历一场深刻变革。Google在Gemini API中推出了托管Agent(Managed Agents),紧随Anthropic之后入局。这标志着一个新的产品品类正在成型——Agent不再只是模型调用,而是一整套托管运行时。如果你还在自己搭建Agent循环来处理长时间运行的任务,是时候关注这个趋势了。
什么是托管Agent?
简单来说,托管Agent是一个由云服务商托管的运行时环境,它替你执行Agent循环。你只需要定义三样东西:模型、系统提示词和工具。然后发送消息,平台帮你处理所有剩下的事情。
所谓Agent循环,是指AI Agent在执行任务时反复进行"思考-行动-观察"的迭代过程。与传统的单次API调用不同,Agent需要根据上一步的执行结果决定下一步行动,这个循环可能重复数十甚至数百次才能完成一个复杂任务。在自建方案中,开发者需要自己管理这个循环的状态、错误处理和超时机制——而当任务运行时间从秒级延长到分钟甚至小时级别,你需要面对的挑战呈指数增长:
- 沙箱环境:为每个会话启动容器,管理文件系统和包管理器
- 持久化状态:跨工具调用保持状态,管理上下文窗口
- 故障恢复:处理网络抖动、内存溢出、速率限制等异常
- 凭证管理:安全地管理OAuth令牌,防止提示注入泄露
- 容器隔离:确保多租户环境下的安全性
其中,容器编排是指自动化管理大量容器(如Docker容器)的创建、调度、扩缩容和销毁的技术,Kubernetes是该领域最知名的开源平台。在托管Agent场景中,每个用户会话可能需要独立的容器实例来执行代码、操作文件系统,这要求平台能够快速启动和回收容器。多租户隔离则确保不同用户的Agent实例之间完全隔离——一个用户的Agent不能访问另一个用户的文件、环境变量或网络资源。这在传统云计算中已是成熟技术,但Agent的动态性和不可预测性(模型可能尝试突破沙箱边界)为隔离带来了新的安全挑战。
托管Agent的三层架构模型
Anthropic提出了一个非常有用的架构框架,将Agent分解为三个解耦的组件:
- 大脑(Brain):模型及其决策循环,无状态设计,可随时重启
- 双手(Hands):沙箱和工具,短暂且可丢弃,一个失败就启动新的
- 会话(Session):持久化的、仅追加的事件日志,存在于模型上下文窗口之外
这种解耦设计的关键价值在于:如果大脑崩溃,你可以唤醒一个新的大脑,把会话日志交给它,它就能从最后记录的事件继续执行。这对长时间运行的工作负载至关重要。这种架构思想与分布式系统中的"事件溯源"(Event Sourcing)模式高度一致——系统的状态不是通过快照保存,而是通过重放完整的事件序列来重建,这使得故障恢复变得天然可靠。

为什么托管Agent是一个真正的产品品类?
值得强调的是,这些基础设施工作——容器编排、状态持久化、故障恢复、凭证管理——没有一项是构建Agent的有趣部分。它们全是基础设施。而每家公司都在重复构建同样的管道工程。
这正是为什么云服务商要吸收这些工作。托管Agent之所以成为一个真正的产品品类而非仅仅是一个功能,是因为提供商现在交付的不再只是模型——而是运行时和你在模型之上构建的产品。这种演进路径与云计算的历史惊人地相似:从IaaS(基础设施即服务)到PaaS(平台即服务)再到SaaS(软件即服务),每一次抽象层级的提升都意味着开发者可以将更多的基础设施工作交给平台,专注于业务逻辑本身。
以凭证管理为例:如果Agent代表用户执行操作,比如发送Slack消息或读取GitHub仓库,你需要OAuth令牌、令牌刷新机制,还要确保令牌不进入沙箱环境。OAuth(Open Authorization)是互联网上最广泛使用的授权框架,允许第三方应用在不暴露用户密码的情况下访问用户资源。在Agent场景中,凭证管理面临独特挑战:Agent需要代表用户访问多个服务,每个服务都有独立的OAuth令牌,这些令牌有过期时间需要自动刷新。更关键的是,令牌绝不能进入Agent的沙箱环境或上下文窗口,否则可能通过提示注入攻击被恶意提取——攻击者可以构造特殊输入,诱导模型在输出中泄露上下文中的敏感信息。这类系统要正确构建需要数周,要加固则需要数月。

Anthropic vs Google:两种截然不同的托管Agent哲学
两家公司都推出了托管Agent,但实现方式差异巨大,反映了对"托管Agent应该是什么样"的根本分歧。
Anthropic:深度优先的Agent平台
Anthropic的API设计暴露了完整的机制。你需要分别创建Agent、环境、会话,然后向特定会话发送事件——四个资源对应四个不同的端点。
核心优势:
- Agent本身是版本化的,可以滚动更新
- 会话流式返回类型化事件(message、tool_use、status等)
- 支持中途中断、注入新消息、更新工具或MCP服务器
- 完整的预构建工具集:Bash、文件操作、Web搜索、MCP支持
- Vaults:为每个终端用户管理和刷新凭证
- Memory Stores:跨会话持久化,每次写入都有版本记录
- Outcomes:给Agent一个评分标准,平台启动独立的评分器来评估工作质量
- Dream:异步任务,读取历史会话并将记忆整合为更清晰的存储
其中MCP(Model Context Protocol,模型上下文协议)是Anthropic于2024年底推出的开放协议,它定义了AI模型与外部工具、数据源之间的标准化通信方式,类似于USB-C为硬件设备提供统一接口。通过MCP,开发者可以将任意外部服务(如数据库、API、文件系统)以标准化方式暴露给AI Agent,而无需为每个工具编写定制的集成代码。MCP的出现正在成为Agent工具生态的事实标准,其重要性在于它让Agent的工具能力变得可组合、可复用。
Anthropic本质上是在将Agent运行时当作操作系统来构建——虚拟化组件、暴露稳定接口、吸收整个运维层。这种类比并非修辞:就像操作系统抽象了硬件差异、提供进程管理和文件系统一样,Anthropic的托管Agent平台抽象了模型推理、工具执行和状态管理的复杂性,让开发者在一个稳定的抽象层上构建应用。
Google:简洁优先的Agent方案
Google的方案极其简洁。你只需一个调用:interaction.create,传入Agent ID、输入和环境参数。Agent规划、执行、观察结果、循环,直到完成,然后返回最终输出。

当前状态:
- 工具集仅包含代码执行、Google搜索、URL获取和文件系统
- 没有MCP支持、没有自定义函数调用、没有凭证保险库
- 定制通过Markdown文件而非JSON完成
但这里有个重要细节:Google实际上还有第二个托管Agent产品——Gemini企业级Agent平台。它使用相同的底层引擎,但功能集更接近Anthropic:支持MCP服务器、OAuth认证管理器、Memory Bank、技能注册表,甚至还有Agent间协调框架。不过这个版本目前处于私有预览阶段,Google明确表示不要用于机密数据。
Google的双产品策略反映了其一贯的市场打法:用简洁的开发者API快速获取开发者心智,同时用企业级产品锁定大客户。这与Google Cloud在数据库(Firestore vs Spanner)、容器(Cloud Run vs GKE)等领域的产品分层策略如出一辙。

托管Agent的定价陷阱
Anthropic收取标准Token费率加上每个活跃会话8美分。Google在预览期间仅收取Token费率,沙箱计算免费。
表面上Google更便宜,但实际情况更复杂。虽然Flash模型的单Token价格低于Opus,但Gemini 3.5 Flash的单Token价格是上一代Flash的数倍。而Agent循环在单次运行中可能消耗300万到500万Token。这个数字之所以如此惊人,是因为Agent循环中的每一轮迭代都需要将完整的上下文(包括之前所有的思考过程、工具调用结果和观察)重新发送给模型,Token消耗随循环次数呈近似线性甚至超线性增长。Google自己的测试显示,在这个规模下每次交互成本约为5美元。
便宜的单Token价格不等于便宜的单次运行成本。 这是选型时容易被忽视的关键点。对于构建者而言,在评估成本时应该关注的核心指标是"每次任务完成成本"(Cost per Task Completion),而非单Token价格。这需要在真实工作负载上进行基准测试,而不是简单地比较价格表。
构建者需要警惕的风险
供应商锁定风险
显而易见的锁定是API不兼容——Anthropic的API无法与Gemini互通。但更隐蔽的锁定才是真正会搞垮生产系统的:
这些系统本质上是非确定性的。非确定性(Non-deterministic)是指相同的输入不一定产生相同的输出。大语言模型天然具有非确定性——即使温度参数设为0,不同硬件、不同批次的推理结果也可能存在微小差异。在托管Agent场景中,这个问题被急剧放大:即使在同一个提供商内部,底层模型也会在你不知情的情况下发生变化——系统提示词被修改、模型被量化(将模型权重从高精度如FP16压缩为低精度如INT8以降低推理成本和延迟)、安全行为被重新调优。每一次变化都可能改变Agent的行为方式,而且这些变化不会出现在更新日志中。
你发现问题的方式通常是:评估指标开始漂移,或者用户开始投诉。工具调用变差了,推理链变短了,上周还能完成的任务突然开始失败。这种"静默漂移"对依赖Agent稳定行为的生产系统构成严重威胁,因为传统的版本控制和回归测试方法在这里几乎失效——你无法pin住一个你不控制的模型版本。
合规限制
两个产品都是有状态设计,这意味着它们目前都不符合零数据保留或HIPAA商业伙伴协议的要求。HIPAA(Health Insurance Portability and Accountability Act)是美国的医疗信息隐私保护法案,要求处理受保护健康信息(PHI)的技术供应商签署商业伙伴协议(BAA),承诺对数据的存储、传输和访问实施严格控制。零数据保留(Zero Data Retention)则是指服务商承诺不在其服务器上保留任何用户数据。由于托管Agent本质上是有状态服务——它需要持久化会话日志、工具调用结果和中间状态——这与零数据保留的要求存在根本矛盾。对于医疗、金融等受监管行业的企业而言,在合规框架明确之前,托管Agent可能无法用于处理敏感数据。两者都仍处于预览或测试阶段,定价和功能集随时可能变化。
如何选择托管Agent平台?
总结来看,选择取决于你的差异化来源:
- 如果你的差异化在于Agent如何工作——它使用的工具、携带的凭证、迭代达成目标的方式——Anthropic是目前为此而构建的平台
- 如果你的差异化在于Agent产出什么,而你想要最简单的路径快速上线——Google是更合适的选择
无论选择哪条路线,都要投资于评估体系,持续跟踪输出质量,不要将对模型行为的假设硬编码到系统的关键部分中。构建一个与提供商无关的评估层(包括任务成功率、工具调用准确率、成本效率等指标)是在这个快速变化的领域中保持灵活性的关键策略。
这个品类正在成为前沿AI提供商交付Agent能力的默认方式。Anthropic先发,Google跟进,AWS和OpenAI也在路上。如果你正在构建任何运行时间超过单次API调用的应用,下一个要回答的问题是:这个Agent循环是你自己运行,还是交给提供商?
核心要点
相关推荐

用Claude Code为老打印机写驱动:AI逆向工程实战
开发者用Claude Code为无macOS驱动的HP Laser 1008a打印机逆向工程编写原生CUPS驱动,实现从数据抓包、协议解析到C语言过滤器开发的全流程。深入分析AI辅助底层系统编程的能力边界与实际价值。

AI网络攻防能力逼近临界点:模型研发该踩刹车吗
AI模型的网络攻防能力正逼近关键阈值,能自主发现漏洞、编写exploit甚至执行完整攻击链。本文深入分析放慢研发与加速防御两派观点,探讨能力封锁的博弈困境及系统性治理路径。
fx:极简开源原生编码智能体深度解析
fx:极简开源原生编码智能体深度解析
深度解析fx开源编码智能体,探讨其Tiny、Open、Native三大核心理念,分析极简AI编程工具在可控性、隐私保护和模型无关性方面的独特价值与局限。