Perplexity Pro服务缩水?老用户吐槽模型降级与审查收紧

一位老用户的失望:从惊艳到失望的Perplexity
近日,一位几乎从Perplexity创立初期就开始使用、并持有Pro订阅近一年的老用户在Reddit上发表了长篇吐槽。这条帖子引发了不少共鸣,核心指向一个越来越普遍的现象:AI搜索产品在规模化扩张的过程中,服务质量出现了肉眼可见的滑坡。
Perplexity AI成立于2022年,由前OpenAI研究员Aravind Srinivas联合创立,定位为「AI原生的答案引擎」,试图挑战Google在搜索市场的统治地位。其核心产品理念是将传统搜索引擎的「返回链接列表」模式,转变为「直接给出经过综合分析的答案」模式。这种范式转变建立在检索增强生成(Retrieval-Augmented Generation, RAG)技术之上——模型不仅依赖训练数据,还会实时检索互联网信息并将其作为上下文注入推理过程,从而大幅降低幻觉率并提供可溯源的回答。
从技术层面来看,RAG是当前AI搜索产品的技术基石。传统大语言模型的知识截止于训练数据的时间点,且无法验证自身输出的事实准确性。RAG通过在推理阶段引入外部知识检索环节来解决这一问题:模型先将用户查询转化为搜索请求,从互联网或私有知识库中检索相关文档,再将这些文档作为上下文与原始问题一起输入模型进行生成。这一过程涉及向量嵌入(将文本转化为高维向量以进行语义匹配)、重排序(对检索结果按相关性重新排列)、以及上下文窗口管理(在有限的token预算内选择最有价值的信息片段)等多项关键技术。
向量嵌入是RAG管线中的关键环节。传统关键词搜索依赖精确的字符串匹配,无法理解语义相似性(例如,搜索「心脏病」不会返回关于「冠状动脉疾病」的结果)。向量嵌入通过将文本映射到高维向量空间(通常为768到4096维),使语义相近的文本在空间中距离更近。这一过程通常使用专门训练的嵌入模型(如OpenAI的text-embedding-3、Cohere的Embed等)完成。检索时,系统将用户查询也转化为向量,然后在向量数据库(如Pinecone、Weaviate、FAISS等)中进行近似最近邻(ANN)搜索,找到与查询语义最相关的文档片段。这种基于语义相似度的检索方式是AI搜索区别于传统搜索的技术根基。
RAG的优势在于既能利用模型的推理能力,又能锚定于实时、可溯源的外部信息,但其质量高度依赖检索阶段的精准度——如果检索到的信息质量低或不相关,模型可能会基于错误前提生成看似合理但实际有误的回答。
截至2024年底,Perplexity的估值已超过90亿美元,月活用户突破1500万,Pro订阅定价为每月20美元,提供更高级模型的访问权限和更多的Deep Research次数。Perplexity AI的商业模式建立在「免费增值」(Freemium)策略之上:免费用户可以使用基础搜索功能,但受到每日查询次数和可用模型的限制;Pro订阅用户则可以访问Claude、GPT-4等顶级模型,并享有更多的Deep Research配额。这一模式的核心挑战在于,AI推理的边际成本远高于传统SaaS产品——每一次用户请求都会产生实际的GPU计算开销,不像传统软件那样可以近乎零成本地服务更多用户。这意味着高频使用的Pro用户在经济上可能是「亏损用户」,公司需要通过广告收入、低频用户的订阅费用以及不断优化的推理效率来交叉补贴。
然而,在融资高估值与竞争白热化的双重压力下,Perplexity正面临严峻的市场挤压。Google于2024年大规模推出的AI Overviews功能直接在搜索结果页顶部展示AI生成的摘要,本质上是将Perplexity的核心价值主张内化为自身功能;而OpenAI的ChatGPT搜索(原Browse with Bing)则凭借其庞大的用户基础和品牌认知度构成另一路包夹。雪上加霜的是,《纽约时报》、《福布斯》等多家主流媒体对其内容抓取行为提起版权诉讼,指控Perplexity在未经授权的情况下抓取并近乎逐字复述其付费内容。
AI搜索市场的版权争议不仅是Perplexity一家的问题,而是整个行业面临的结构性法律风险。核心争议在于「合理使用」(Fair Use)原则的边界:传统搜索引擎通过展示简短摘要和链接将流量导向原始网站,出版商因此容忍甚至欢迎被爬取;但AI搜索引擎直接综合信息给出完整答案,用户无需点击原始链接,这就切断了出版商的流量和广告收入链条。2024年,美国版权局启动了针对AI生成内容的专项调查,但尚未出台明确的监管框架。与此同时,一些出版商开始通过robots.txt协议和技术手段主动屏蔽AI爬虫,而Perplexity被指控无视这些屏蔽指令继续抓取内容,这使其法律处境更加复杂。这场版权博弈的结果将深刻影响AI搜索产品能够获取的信息范围和回答质量——这一法律风险可能迫使平台限制信息源的使用范围,进而影响回答的全面性和深度。在多重压力下,Perplexity正面临着同时扩大用户规模和控制推理成本的两难抉择。
这位用户直言不讳地表示,公司刚起步时体验极佳——回答质量高、可用模型范围广。但随着时间推移,「即便是Pro订阅,也会被快速降级到更差的模型」。他还特别提到,Deep Research(深度研究)模式的能力「在过去6到7个月里似乎被削弱了约10倍」。
Deep Research是Perplexity的核心高级功能之一,旨在模拟人类研究员的工作流程。其背后的技术本质是一种AI Agent(智能体)架构——与单轮问答不同,Agent具备规划、执行、观察、反思的循环能力:它会先将用户的研究问题分解为多个子问题,然后依次执行搜索、阅读网页内容、评估信息可信度、发现信息缺口后再发起新一轮搜索,最终综合分析并生成结构化报告。
AI Agent的核心理论框架源于ReAct(Reasoning + Acting)范式,由普林斯顿大学于2022年提出——模型在每一步都先进行推理(思考下一步应该做什么),然后执行动作(如搜索、阅读、计算),再观察结果并据此调整后续策略。Deep Research正是这一架构的典型应用:它不是一次性搜索后生成答案,而是模拟人类研究员的迭代探索过程。
AI Agent架构经历了从简单的链式调用(Chain)到复杂的自主规划(Autonomous Planning)的快速演进。2023年,AutoGPT和BabyAGI等开源项目首次展示了LLM驱动的自主Agent的可能性,但也暴露了效率低下和目标漂移的问题。2024年,业界转向更实用的Agent框架,如LangGraph、CrewAI和Microsoft的AutoGen,它们通过预定义的工作流图和人机协作检查点来平衡自主性与可控性。Deep Research类产品通常采用的是「半自主」模式——执行流程大致确定(分解问题→检索→分析→综合),但在每一步的具体执行中赋予模型自主决策权。这种设计在可控性和灵活性之间取得了较好的平衡。
这种架构的计算成本呈指数级增长——每增加一轮迭代,就意味着额外的搜索请求、网页内容解析、以及数千token的推理计算。此外,Agent架构还面临「规划漂移」的技术挑战,即在多轮执行过程中逐渐偏离原始目标,这要求更强大的长程上下文管理能力。
这个过程可能涉及数十次网页检索和数万token的上下文处理,需要模型进行多步推理并调用大量计算资源。从成本角度看,一次Deep Research请求的计算开销可能相当于50-100次普通搜索请求。当Perplexity需要为1500万月活用户中的大量Pro订阅者提供这一功能时,即便只有少数用户频繁使用,累计的推理成本也极为可观。
正因其计算密集的特性,Deep Research也是最容易受到成本压力影响的功能——服务商有动机减少搜索迭代轮次、缩短每轮的阅读深度、用较小的模型替代旗舰模型来执行部分子任务,或限制单次研究的深度,这与用户感知到的「能力被大幅削弱」高度吻合。

系统提示词失效:个性化设置形同虚设
用户最不满的一点,并非模型降级本身,而是对系统提示词(System Prompt / 个性化设置)的漠视。
在大语言模型的交互架构中,系统提示词是一个核心概念。主流API的消息格式通常由三类角色组成:system(系统)、user(用户)和assistant(助手)。系统提示词作为对话的「元指令」,在用户输入之前被注入,用于定义模型的行为边界、语气风格和回答逻辑。Perplexity将这一能力以「个性化设置」的形式开放给终端用户,本质上是让用户参与系统提示词的编写。
然而,在技术实现层面,系统提示词的优先级涉及多层指令堆叠的复杂问题。一个典型的Perplexity请求可能包含至少三层指令:最底层是平台注入的安全与合规指令(如「不得生成有害内容」「回答需包含引用来源」);中间层是用户的个性化设置;最上层是当次查询的具体指令。当这些层级发生冲突时,模型需要依据注意力机制来决定遵循哪一层——而平台通常会通过技术手段来确保自身指令的绝对优先。
从Transformer架构的底层机制来看,这一现象与注意力权重的分配规律密切相关。研究发现,处于上下文开头和结尾位置的信息(即「首因效应」和「近因效应」)往往获得更高的注意力权重,而中间位置的信息更容易被「遗忘」——这就是所谓的「Lost in the Middle」现象(Liu et al., 2023)。平台运营商可以利用这一特性,将最关键的安全指令放置在上下文的首尾位置以确保其被优先执行。此外,通过指令微调(Instruction Fine-tuning)和RLHF训练,平台可以在模型权重层面「硬编码」某些行为规则,使其即使面对用户的显式覆盖指令也难以违反——这相当于将安全行为从「软约束」升级为「硬约束」,代价是牺牲了用户自定义指令的灵活性。
值得深入理解的是,指令微调(Instruction Fine-tuning)是将预训练的基础模型转变为能够遵循人类指令的对话模型的关键步骤。然而,业界已经注意到一个被称为「对齐税」(Alignment Tax)的现象:经过RLHF等对齐训练的模型,虽然在安全性和有用性上有所提升,但在某些基准测试上的原始能力可能会下降。换言之,使模型更「听话」和更「安全」的过程可能会以牺牲部分推理能力和创造力为代价。这解释了为什么一些用户会感觉经过多轮对齐更新后的模型变得更加「平庸」——不是因为底层模型能力下降了,而是对齐过程抑制了某些高风险但高价值的输出模式。
这意味着,即使用户在个性化设置中写下「回答要简洁幽默」,一旦平台的安全指令中包含「保持专业、正式的语气」或「对敏感话题给出全面的免责声明」,后者几乎必然会覆盖前者——这就是用户感受到「设置失效」的技术根源。
这位用户从一开始就设置了一套自定义提示词,希望获得简洁、有趣、直击要点的回答。然而随着产品迭代:
- 大约6-7个月前,官方移除了允许模型使用略带随意语气、加入玩笑以增强趣味性的能力;
- 而在最近的一次「护栏(Guardrails)」更新后,系统提示词几乎完全不再被遵守。
这里的「护栏」是AI安全领域的核心概念,指一系列用于约束模型输出的技术与策略机制,包括输入过滤(拦截有害提示词)、输出审查(检测并屏蔽不当内容)、RLHF对齐训练(通过人类反馈强化学习使模型拒绝危险请求),以及运行时的规则引擎。随着AI产品走向大众市场,护栏的收紧几乎是行业必然——2023年以来,多家AI公司因模型输出不当内容而面临公关危机和法律诉讼,Meta、Google、OpenAI等公司都在持续加强护栏力度。
RLHF(基于人类反馈的强化学习)是当前主流的模型对齐技术,也是护栏体系的核心组成部分。其流程大致为:先收集人类对模型不同输出的偏好排序,训练一个奖励模型(Reward Model)来预测人类偏好分数,再用近端策略优化(PPO)等强化学习算法微调语言模型以最大化奖励。然而,RLHF存在一个被称为「奖励黑客」(Reward Hacking)的系统性问题——模型可能学会通过表面模式(如添加免责声明、使用谨慎措辞、拒绝回答边缘案例)来获取高奖励分数,而非真正理解何时应该拒绝。这导致模型在面对模糊请求时倾向于「宁可错杀不可放过」。2024年,DPO(Direct Preference Optimization,直接偏好优化)等替代方法的出现试图缓解这一问题,但过度拒绝仍然是业界的普遍现象。
但过度收紧的护栏会导致「过度拒绝」(Over-refusal)现象:模型对完全无害的请求也给出回避性或模板化的回答。过度拒绝已成为AI行业公认的用户体验痛点——研究表明,经过严格RLHF对齐训练的模型,其拒绝率可能比实际需要高出3-5倍。典型表现包括:用户询问历史事件中的暴力细节时被拒绝回答、请求创意写作中的冲突场景时收到安全警告、甚至在讨论医学症状时被建议「咨询专业医生」而不提供任何信息。2024年,Anthropic发布了专门针对过度拒绝问题的研究论文,承认在安全与实用性之间存在尚未解决的张力。这一现象的根本原因在于,对AI公司而言,「该拒绝时没拒绝」的后果(媒体负面报道、法律诉讼)远大于「不该拒绝时拒绝了」的后果(用户不满),这种不对称的激励结构导致了安全策略的系统性偏保守。
结果就是,他设置的「简洁、有趣、直奔主题」被系统性地覆盖,取而代之的是「冗长、公式化、充满说教味的企业式回答」。对于依赖个性化配置来提升效率的深度用户而言,这种变化几乎抹杀了付费的核心价值。
现象背后:AI产品主流化的代价
这位用户的抱怨,实际上揭示了当前AI应用领域一个值得警惕的趋势。
安全护栏与用户自由度的冲突
随着用户基数扩大、公司走向主流,服务商往往会收紧内容护栏,以规避法律与舆论风险。这在客观上导致了两个后果:一是回答趋于保守、模板化;二是用户自定义指令的优先级被降低,甚至被强制覆盖。
对普通用户来说,这或许影响不大;但对付费的高级用户而言,「个性化设置无法生效」意味着他们为之付费的差异化体验被抹平。这本质上是平台风控逻辑与个体用户需求之间的结构性矛盾。值得注意的是,一些竞争对手已开始尝试差异化策略来缓解这一矛盾——例如为企业用户提供可调节的安全阈值、或通过身份验证为成年用户解锁更宽松的内容策略。但对面向大众市场的消费级产品而言,实施精细化的分层安全策略在工程和法律层面都面临巨大挑战。
模型降级与成本控制
用户提到「被快速降级到更差的模型」,这也指向了AI服务商普遍面临的成本压力。模型路由(Model Routing)是AI服务商在生产环境中广泛使用的成本优化策略——其核心思想是并非所有用户请求都需要最强大的模型来处理。通过一个轻量级的分类器或规则引擎,系统会根据查询的复杂度、用户的订阅等级、当前服务器负载等因素,将请求动态分配到不同能力(和成本)的模型上。例如,一个简单的天气查询可能被路由到GPT-3.5级别的模型,而复杂的研究问题则分配给GPT-4级别。以GPT-4级别模型为例,单次复杂推理的成本可能是轻量模型的10-50倍,当用户量从数万激增到数百万时,全面使用顶级模型在经济上几乎不可持续。
在工程实践中,成熟的路由架构通常包含多个维度的决策逻辑:语义复杂度评估(通过一个轻量级分类器判断查询是否需要深度推理)、用户画像分析(订阅等级、历史使用频率、是否接近配额上限)、实时负载均衡(高峰时段更积极地将请求路由到小模型)、以及成本预算控制(当月推理支出接近预算时自动调低模型等级)。一些服务商还会采用「投机解码」(Speculative Decoding)等技术来进一步优化成本。投机解码由Google DeepMind于2023年提出并推广,其原理是利用一个参数量远小于目标模型的「草稿模型」(Draft Model)快速生成多个候选token,然后由大模型并行验证这些token是否符合其自身的概率分布。如果草稿模型的预测与大模型一致(对于简单的文本片段,一致率可达70-90%),则直接采纳,从而跳过大模型逐token生成的昂贵计算过程。这一技术使得推理速度可提升2-3倍而不显著损失输出质量。
在模型路由的实践中,更精细的方案还包括MoE(Mixture of Experts,混合专家)架构,即模型内部根据输入的类型激活不同的专家子网络,使得单次推理只使用模型总参数的一部分,从而在保持模型整体能力的同时大幅降低每次推理的计算开销。MoE架构已成为2024年大模型设计的主流趋势——DeepSeek-V2、Mixtral 8x7B、GPT-4(据推测)等模型均采用了MoE设计。在MoE架构中,模型包含多个「专家」子网络,每次推理时通过一个门控网络(Gating Network)选择性地激活其中少数几个。例如,一个拥有万亿参数的MoE模型在每次推理时可能只激活其中10-20%的参数,从而将计算量压缩到与一个小得多的密集模型相当的水平。这使得模型可以在保持巨大知识容量的同时控制推理成本,但也引入了新的挑战:不同专家之间的知识可能存在不一致性,且路由决策的质量直接影响输出效果。
然而,这种「暗降级」如果缺乏透明度,很容易让付费用户产生被欺骗的感受。大多数服务商不会明确告知用户当前请求由哪个模型处理,用户只能通过回答质量的变化来间接感知——而这些路由优化对用户完全不可见,且服务商通常将其视为商业机密而不予披露,这就造成了严重的信息不对称:用户支付的是「访问GPT-4级别模型」的费用,但实际获得的可能是经过多层路由优化后的混合服务。这种信息不对称进一步加剧了信任危机。
对新功能的抵触
帖子结尾,用户以近乎愤怒的口吻拒绝了官方力推的「Computer模式」,并明确表示不愿为200美元/月的订阅买单。这反映出另一个产品运营层面的问题:当核心体验退步时,强行推广新功能反而会激化用户的负面情绪。用户想要的是原有承诺的兑现,而非被引导去为新的付费项目付费。
这一现象在SaaS(软件即服务)行业中并不罕见——当公司的增长战略从深耕现有用户转向拓展新市场和推出高价产品线时,原有用户群体的需求往往被边缘化。在AI行业,这一矛盾因产品迭代速度极快、用户对质量变化高度敏感而被进一步放大。经典的SaaS增长理论强调「净收入留存率」(Net Revenue Retention, NRR)的重要性——即现有用户群体在续费和升级中贡献的收入增长。当NRR低于100%时,意味着用户流失和降级的收入超过了扩展收入,即使获取新用户也难以维持健康增长。对Perplexity而言,如果大量忠诚的Pro用户因体验下降而取消订阅或降级,推出更高价位的新产品可能无法弥补这一损失。
对AI产品的启示
这条单一来源的用户反馈虽属个人观点,无法代表全体用户,但它提出的几个问题具有普遍参考意义:
- 透明度:模型路由和降级策略是否应向付费用户公开?至少应告知用户当前请求由哪一级别的模型处理,让用户在知情状态下评估回答质量。
- 可控性:安全护栏是否应保留一定的用户自主调节空间,而非一刀切覆盖?例如,允许经过身份验证的Pro用户在合理范围内自定义内容策略的宽松程度。
- 付费价值一致性:随着产品迭代,是否维持了订阅初期承诺的服务水平?当底层模型能力或功能范围发生实质性变化时,服务商是否有义务主动告知用户?
对于Perplexity这类快速成长的AI搜索产品而言,如何在合规风控、成本控制与用户体验之间找到平衡,将是决定其能否留住核心付费群体的关键。规模化不应以牺牲忠实用户的体验为代价——这条帖子背后的不满,或许正是许多沉默用户的共同心声。
需要说明的是,本文基于Reddit单一用户的主观体验,相关「服务降级」的说法未经官方证实,也可能因使用场景、地区、时间段不同而有所差异。
相关推荐

LangChain 1.3 入门指南:大模型与Agent核心概念解析
LangChain 1.3入门教程:解析大语言模型的三大局限、框架的统一接口与模块化架构,以及LLM、Agent、DeepAgent与Harness架构的层级关系,助你理解大模型应用开发核心概念。

Python 零基础入门:从安装到 print 打印实战
Python 零基础入门教程:手把手教你安装 Python 环境、使用 print 函数打印信息、添加代码注释和理解缩进规则,并附带实战练习,适合编程新手快速上手。

tiun.:为AI开发者打造的一站式认证与支付系统
登顶 Product Hunt 的 tiun. 为 AI 开发者提供认证、支付、账单、客户数据与分析的一体化系统,一条命令即可安装,帮助开发者当天上线付费产品。本文解析其定位、卖点与竞争格局。