Perplexity Comet代理能力退化:AI浏览器为何变得畏手畏脚

从"全能助手"到"处处推诿"
近日,一位在Reddit上分享经历的Perplexity付费用户引发了广泛讨论。这位用户表示,自己订阅Perplexity已有两年之久,并深度使用其AI浏览器产品Comet来完成各种任务——填写表单、完成合规培训、浏览Facebook Marketplace商品等。然而在最近几周,这些曾经运转良好的功能突然"失灵"了。
Perplexity AI成立于2022年,由前Google和OpenAI研究员创办,最初以"AI搜索引擎"的定位切入市场,主打通过大语言模型直接生成带引用来源的答案,而非传统搜索引擎的链接列表形式。公司在2024年估值突破90亿美元,付费用户(Pro订阅,月费20美元)超过百万。Comet浏览器是Perplexity在2025年推出的战略性产品,试图将AI能力从"搜索框"延展到"整个浏览体验",本质上是将AI代理能力嵌入浏览器这一用户每天使用时间最长的软件之中。
"每次我要求它使用代理(agentic)能力时,它都会给我一些含糊其辞的借口,解释为什么做不到。"
这种从"全能助手"到"处处推诿"的转变,让不少重度用户感到困惑和沮丧。这背后究竟发生了什么?是产品退化,还是行业趋势使然?

什么是Comet的代理能力
对于不熟悉的读者,先简单介绍一下背景。Comet是Perplexity推出的AI浏览器,其核心卖点之一就是所谓的代理能力(agentic capabilities)——即AI不仅能回答问题,还能像人类一样自主操作网页:点击按钮、填写表单、翻页浏览、提交信息等。
Agentic AI这一概念源自计算机科学中的智能代理(Intelligent Agent)理论,最早可追溯到1990年代Stuart Russell和Peter Norvig在《Artificial Intelligence: A Modern Approach》中的形式化定义。一个智能代理需要具备感知环境(Perception)、制定计划(Planning)、执行行动(Action)和学习反馈(Learning)四个核心循环。2024-2025年间,随着大语言模型具备了足够的推理和工具调用能力,这一理论概念终于在商业产品中找到了落地场景,催生了所谓的"Agentic AI"浪潮。
这类"AI自动化操作浏览器"的能力,代表了近两年AI产品的一个重要方向。从技术实现角度看,代理能力要求AI系统具备多层次的复合能力:首先需要通过计算机视觉或DOM解析理解网页结构,识别按钮、输入框、下拉菜单等可交互元素的位置和功能;其次需要自然语言理解能力来解析用户的高层指令并将其分解为具体操作步骤;最后还需要类似强化学习的反馈机制,根据操作结果动态调整后续行为。这与传统的"问答式"AI助手有着本质区别——代理AI需要在开放环境中进行多步骤的自主决策。
从行业格局来看,这一方向已成为兵家必争之地。OpenAI于2025年初推出Operator,允许用户通过自然语言指令完成网页操作;Anthropic的Computer Use功能让Claude能够直接操控桌面环境;Google的Project Mariner专注于Chrome浏览器内的代理操作;微软则通过Copilot Actions整合办公场景。此外还有Adept AI、Rabbit R1等众多创业公司在探索不同路径。Comet正是这一浪潮中的代表产品之一,试图通过"AI原生浏览器"的产品形态,将代理能力无缝嵌入用户的日常浏览体验中。
正因如此,当这项核心能力出现明显退化时,用户的失望是可以理解的。
四种可能的原因剖析
发帖用户提出了几种假设,我们不妨结合行业现状逐一分析。
网站部署了反AI代理机制
用户特别提到,在填写调查问卷时明显感觉到阻力。这一猜测颇有道理。随着AI代理工具的普及,越来越多的网站开始部署反自动化检测机制——包括更严格的验证码(CAPTCHA)、行为分析、鼠标轨迹检测等。
CAPTCHA(全自动区分计算机和人类的图灵测试)由卡内基梅隆大学在2000年代初提出,最初是简单的扭曲文字识别。随着OCR技术的进步,CAPTCHA经历了从文字到图像选择(如reCAPTCHA v2的"选择所有包含红绿灯的图片")、再到无感验证(reCAPTCHA v3通过行为评分静默判断)的三代演进。当前最先进的反bot系统已从单点验证转向持续性行为监控,在用户整个会话期间持续收集和分析数百个信号维度,形成实时风险评分。
值得注意的是,现代反bot系统的复杂程度远超普通用户的想象。以Cloudflare Turnstile、PerimeterX、DataDome等主流解决方案为例,它们不仅检测请求频率,还会深度分析鼠标移动轨迹的自然度(真实人类的鼠标路径具有微小的抖动和加速度变化)、键盘输入的时间间隔分布、浏览器指纹(包括WebGL渲染结果、Canvas指纹、安装字体列表、屏幕分辨率等数十个维度),以及JavaScript执行环境的完整性。部分高级系统甚至部署了机器学习模型,通过对比海量真实用户的行为基线来识别异常模式。这意味着,即便AI代理能够模拟人类操作的表面行为(如移动鼠标、逐字输入),仍可能在更底层的行为特征上暴露"非人类"身份。
对于问卷调查、社交平台这类特别在意数据真实性的网站而言,识别并拦截"非人类操作"是刚需。Facebook等平台历来对自动化行为高度敏感,其反爬虫和反机器人系统经过十余年的迭代已相当成熟,能够检测到自动化工具的细微特征。因此,Comet在这些网站上碰壁,很可能与目标网站的主动防御升级直接相关。AI代理与反自动化系统之间正在形成一场持续的技术对抗。
厂商出于责任规避收紧了能力
这是一个容易被忽视但非常现实的因素。当AI代理"代替用户"完成操作时,一旦出错——比如填错表单、提交了错误的合规培训答案、或在交易平台上做出不当操作——责任归属会变得非常模糊。
对于Perplexity这样的商业公司而言,法律与合规风险是必须考虑的。目前全球范围内尚无专门针对AI代理行为责任归属的成熟法律框架。欧盟《人工智能法案》(AI Act)虽然建立了AI系统的风险分级体系,但对AI代理"代替用户行事"时的责任分配缺乏具体规定。在美国,FTC(联邦贸易委员会)已开始关注AI代理可能引发的消费者权益问题。核心争议在于:当AI代理执行操作导致经济损失或法律后果时,责任应归属于AI开发商、下达指令的用户本人、还是被操作的第三方平台?这种法律不确定性本身就构成了巨大的商业风险。
让AI替用户完成"合规培训"本身就存在争议:如果培训是为了确保用户真正掌握某些知识(如安全规范、职业道德),由AI代劳显然违背了培训初衷,甚至可能使雇主面临监管处罚。厂商主动限制这类场景,既是规避法律风险,也可能是应对来自企业客户或监管方的压力。在责任框架明确之前,"宁可少做不做错"可能是商业上最理性的选择。
底层模型能力或策略调整
用户还猜测是否"模型本身变差了"。这种"模型偷偷降级"的怀疑在AI社区中相当常见——许多用户都曾抱怨某些AI产品在更新后"变笨了"。
这类讨论在AI社区中由来已久。2023年斯坦福大学的一项研究曾引发广泛关注,声称GPT-4在数月间的数学推理能力出现显著下降(尽管OpenAI对此提出异议,认为是评测方法的问题)。这类"隐性降级"的可能机制包括多种:厂商为控制日益增长的推理计算成本,将部分请求路由到参数更少的轻量模型;通过RLHF(基于人类反馈的强化学习)持续训练使模型在安全性上更加保守,副作用是降低了任务执行的"果断性";调整温度参数或top-p采样策略以减少输出的不确定性;以及最直接的——修改系统提示词(system prompt),增加更多关于拒绝执行的指令条件。
AI模型的"过度拒绝"(over-refusal)是当前安全对齐研究中的已知问题。在通过RLHF和Constitutional AI等方法训练模型拒绝有害请求的过程中,模型往往会产生"宁杀错不放过"的倾向,将无害请求也错误归类为需要拒绝的类别。Anthropic在2024年的研究论文中量化了这一现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判。这一问题在代理场景中尤为突出,因为代理操作涉及的网页交互种类繁多,模型难以准确判断每个操作是否"安全"。
不过提一嘴,这类感知往往难以客观验证。对用户而言,这些后端变化完全不透明,他们只能感受到结果层面的差异。相比模型能力的真实下降,更可能的是安全策略的收紧——即模型被指示在面对代理任务时更倾向于拒绝或给出"我无法完成此操作"的回复,而非底层推理和操作能力本身的退化。本质上,这是一种"人为设限"而非"能力衰退"。
多重因素叠加
实际情况很可能是多种因素的叠加。产品迭代过程中的策略调整、成本优化、合规考量、以及外部网站环境的变化,共同导致了用户体验的明显下滑。
值得一提的是成本因素在其中扮演的角色。AI代理操作的计算成本远高于普通问答。一次典型的网页代理任务可能需要数十次模型推理调用(每一步操作都需要理解当前页面状态并决策下一步),加上视觉模型处理截图的成本,单次任务的推理费用可能是普通对话的10-50倍。对于月费20美元的订阅用户,如果频繁使用代理功能,平台很可能处于亏损状态。这种经济压力可能促使厂商通过技术手段(如限制代理调用频率或降低复杂场景的可用性)来控制成本。
这些因素之间还可能存在相互强化的关系——例如,当反自动化检测导致操作失败率上升时,厂商可能选择主动限制这些场景以避免用户遭遇更糟糕的体验(如操作到一半失败或提交了错误数据),从而进一步收紧了可用功能的范围。
AI代理产品面临的结构性困境
这起个案实际上折射出当前AI代理类产品面临的结构性矛盾。
一方面,"让AI自主操作网页"是极具吸引力的产品愿景,代表着生产力工具的未来方向。另一方面,这条路径充满了现实障碍:
- 技术对抗:网站方与AI代理之间正在形成一场"猫鼠游戏",反自动化检测会持续升级。这类对抗在互联网历史上并非新鲜事——从早期的搜索引擎爬虫与robots.txt协议,到广告屏蔽插件与反屏蔽技术,再到如今的AI代理与反bot系统,每一轮技术对抗都会推动双方能力的螺旋式提升,最终形成新的均衡态。
- 责任边界:AI代替人类操作带来的法律和伦理责任,至今没有清晰的界定框架。这不仅涉及直接的经济损失赔偿,还包括隐私合规(AI代理在操作过程中可能接触到用户的敏感信息)、合同效力(AI代替用户点击"同意"是否具有法律约束力)等复杂问题。
- 可靠性与安全的权衡:厂商要么让AI更"大胆"从而承担出错风险,要么让它更"谨慎"从而牺牲实用性。这是一个典型的产品设计两难——在缺乏完善的错误恢复机制和责任保险体系之前,商业理性几乎必然推动厂商选择更保守的路线。
- 经济可持续性:代理操作的高计算成本与固定订阅费之间的矛盾,使得厂商在用户规模扩大后面临巨大的边际成本压力。与传统SaaS产品"用户越多成本越低"的规模效应不同,AI代理产品可能呈现"用户越多亏损越大"的反向效应,除非能找到新的定价模式或显著降低推理成本。
对于Comet这类产品来说,最初为了展示能力而放开的场景,随着用户规模扩大和风险暴露,被逐步收紧几乎是必然的。这也解释了为何早期尝鲜的重度用户会感受到最强烈的"落差"——他们的使用习惯建立在产品"激进期"的能力边界上,而产品正在向"稳健期"过渡。
给用户的实用建议
如果你也是Comet或类似AI代理产品的用户,可以从以下几个角度理性看待:
首先,明确产品的能力边界正在动态变化。今天能用的功能明天可能受限,这是当前AI代理产品的常态,不宜将关键工作流程完全依赖于此。建议为重要任务保留人工操作的备选方案,将AI代理定位为"加速器"而非"替代者"。
其次,对于合规培训、正式表单提交等涉及责任的严肃场景,即便技术上可行,让AI代劳也存在风险,建议谨慎使用。特别是在职场环境中,如果被发现使用AI代完成合规培训,可能面临纪律处分甚至法律后果。
最后,关注官方的更新说明和社区反馈。很多能力变化厂商并不会主动公告,通过社区(如Reddit相关板块)交流往往能第一时间了解真实情况。同时也可以关注竞品动态——如果多家AI代理产品同时收紧某类功能,通常意味着这是行业层面的合规调整而非单一产品的问题。
Comet的这次"变胆小",与其说是单一产品的失误,不如说是整个AI代理赛道在走向成熟过程中必然要经历的阵痛。如何在实用性、安全性与合规性之间找到平衡,将是所有AI代理产品面临的长期课题。这一过程可能需要技术突破(如更可靠的错误恢复机制)、制度创新(如AI操作保险、明确的责任分担框架)、以及行业标准的建立(如AI代理的行为规范协议)共同推动。
核心要点
核心要点
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。