持续学习:通往AGI路上被忽视的核心瓶颈
持续学习:通往AGI路上被忽视的核心瓶颈
引言:AGI真的近在咫尺吗?
关于通用人工智能(AGI)何时到来的讨论,近年来从未平息。乐观派认为AGI已触手可及,而更审慎的声音则直指当前大模型的根本性缺陷。科技播客主持人 Dwarkesh Patel 在访谈中抛出了一个颇具分量的论断:持续学习(Continual Learning)是通往AGI的核心瓶颈,也正因如此,他对"AGI即将到来"持明显保留态度。
这一话题在 Reddit 社区引发了广泛讨论。距离 Ilya Sutskever 在 Dwarkesh Patel 播客上的相关表态已过去数月,业界在持续学习方向的实质进展究竟如何?本文将围绕这一议题,梳理技术现状与行业分歧。
什么是持续学习,为何如此关键
从"一次训练"到"终身学习"
当前主流大语言模型的运作方式,本质上是"一次性"的:模型在海量数据上完成预训练后进入部署阶段,权重随之基本冻结。这意味着模型无法像人类一样,在与世界的持续交互中不断积累新知、修正旧认知。
持续学习(Continual Learning,简称 CL)正是为了破解这一困局——让 AI 模型能够在部署后持续、增量地学习新任务和新知识,同时**不会灾难性遗忘(catastrophic forgetting)**已掌握的能力。
灾难性遗忘的技术本质
灾难性遗忘是神经网络在学习新任务时系统性丢失旧知识的现象,最早由McCloskey和Cohen于1989年正式描述。其根本原因在于神经网络的权重是共享的——当模型针对新任务调整参数时,原有任务所依赖的权重分布被覆盖。这与人类大脑的学习机制形成鲜明对比:神经科学研究表明,人脑通过海马体与新皮层的协同机制(互补学习系统理论),实现了快速学习新知与长期记忆巩固的分离。目前学术界应对灾难性遗忘的主流策略分为三类:正则化方法(如EWC弹性权重巩固)、动态架构方法(为新任务扩展网络结构)和回放方法(保留旧数据样本混合训练)。每种方法都有其局限性,尚无一种方案能在大规模语言模型上实现真正稳健的持续学习。
为什么持续学习是AGI的必要条件
正如研究者所言:"要实现超级智能或AGI,我们需要能够快速学习新事物的 AI 模型,而这正是持续学习的用武之地。"
人类智能的核心特征之一,是能在有限样本下快速习得新知,并将其无缝融入已有的认知体系。一个真正意义上的通用智能,不应该每学一项新技能就需要重头训练整个模型。从这个角度来看,持续学习不只是一个工程优化问题,它直接触及了智能本质的核心。
行业进展:研究火热,落地稀缺
谁在推进持续学习
尽管持续学习在学术界备受关注,真正实现规模化部署的案例依然寥寥。根据业界讨论梳理,目前在这一方向有所布局的机构包括:
- Google DeepMind —— 提出了 Nested Learning(嵌套学习)相关方法
- Skyfall AI —— 旗下 Morpheus 项目探索持续学习能力
- IBM —— 在 Sequential Learning(序列学习)方向持续投入
Google DeepMind嵌套学习与序列学习背景
Google DeepMind在持续学习领域的探索可追溯至其早期的Progress & Compress框架,而近年提出的Nested Learning思路进一步尝试构建层次化的学习结构,使内层模型专注快速适应,外层模型负责知识蒸馏与长期保留。IBM在序列学习方向的投入则更多源于其企业级AI应用需求——在金融、医疗等场景中,模型必须在不重新部署的前提下适应数据分布漂移。值得注意的是,这些研究机构面临的共同挑战是:学术论文中的持续学习基准(如Split-MNIST、Permuted-MNIST)与真实生产环境的复杂度之间存在巨大鸿沟。真实场景中的任务边界模糊、数据流非平稳、安全合规约束等因素,使得实验室成果的工程化落地远比论文呈现的更为艰难。
然而,这些成果大多仍停留在研究阶段,缺乏真实的生产环境部署。这也从侧面印证了持续学习作为"瓶颈"的现实——它绝非可以轻松攻克的问题。
落地难在哪里
持续学习的工程化面临多重挑战:如何在引入新知识的同时避免遗忘旧能力、如何控制持续训练的算力与成本、如何保证模型增量更新后的稳定性与安全性。这些问题至今缺乏成熟的通用解法,导致大量研究成果难以转化为可靠的产品。
争议焦点:AGI一定需要持续学习吗?
Dario Amodei 的不同判断
你可能没注意到,业界对这一问题存在明显分歧。Anthropic CEO Dario Amodei 曾公开表达过相反的立场——他认为实现 AGI 并不需要持续学习。
这一观点背后的逻辑或许在于:只要模型足够强大,配合超长上下文窗口、外部记忆系统(如 RAG 检索增强)及工具调用能力,便可以在不修改核心权重的前提下"模拟"出学习新知识的效果。换言之,学习可以外置化,而无需内化到模型参数之中。
RAG检索增强生成的技术原理与局限
检索增强生成(Retrieval-Augmented Generation,RAG)是由Meta AI于2020年提出的技术框架,其核心思路是将外部知识库与生成模型解耦:模型在推理时动态检索相关文档片段,将其注入上下文窗口,从而"借用"外部知识而无需将其编码进模型权重。这一方案在知识时效性和可更新性上具有明显优势——只需更新向量数据库,无需重新训练模型。然而RAG也存在固有局限:检索质量依赖向量相似度,复杂推理链条难以通过单次检索完成,且检索到的知识无法真正被模型"内化"形成泛化能力。这正是"外置路线"支持者与"内化路线"支持者争论的核心:RAG能够模拟知识更新的表象,但它究竟是真正的学习,还是精巧的信息检索?
上下文窗口扩展与外置记忆的技术进展
近两年,大语言模型的上下文窗口已从GPT-3时代的4K tokens急剧扩展至百万级别(如Google Gemini 1.5 Pro支持100万tokens)。超长上下文的支持为"外置路线"提供了重要技术支撑:理论上,足够长的上下文可以将对话历史、检索文档、工具调用结果全部纳入单次推理,形成"会话级记忆"。与此同时,以MemGPT为代表的外置记忆架构尝试为LLM构建类操作系统的分级记忆管理,模拟人类工作记忆与长期记忆的分层结构。然而,超长上下文并不等同于真正的学习:模型对上下文中信息的利用效率随距离增加而显著下降(Lost in the Middle现象),且每次推理都需重新处理全部上下文,计算成本呈二次方增长。这些局限使得"外置路线"在规模化应用时同样面临不可忽视的工程瓶颈。
内化 vs 外置:两条技术路线的博弈
这场争论实际上代表了两条截然不同的技术路径:
- 内化路线:主张真正的智能必须能够更新自身,持续学习不可绕行;
- 外置路线:主张通过上下文、记忆与工具的组合,绕开权重更新的难题。
Dwarkesh Patel 明确支持前者,认为持续学习是值得聚焦的核心方向;而 Amodei 的表态则代表了另一种务实思路。孰优孰劣,目前尚无定论。但这场争论本身,已经揭示了 AGI 实现路径的高度不确定性。
深度思考:瓶颈背后的真正启示
持续学习之所以被视为瓶颈,恰恰是因为它暴露了当前技术范式的根本局限。今天的大模型在"静态知识调用"上已近乎超越人类,但在"动态知识获取"上依然笨拙。这种能力的不对称,正是"AGI感觉很近又很远"的深层原因。
对于关注 AI 前沿的从业者,这一讨论带来几点值得记住的判断:
- 警惕单一维度的进展叙事。模型规模和基准分数的提升,不等于通用智能的实质性突破。
- 持续学习值得长期关注。即便短期难以商业化,攻克它很可能是解锁下一代 AI 的关键所在。
- 对技术路线保持开放。内化与外置之争尚未收敛,多路径探索才是理性选择。
结语
Dwarkesh Patel 的观点,为过热的 AGI 讨论注入了一剂理性的冷静。持续学习这一"隐形瓶颈",或许比参数规模、算力堆叠更能决定 AGI 的真实时间表。无论你更认同哪一方的判断,正视这一瓶颈的存在,本身就是对 AI 发展保持清醒认知的重要一步。
相关播客:Why I don't think AGI is right around the corner — Dwarkesh Patel
相关推荐

挪威主权基金收购OpenAI:一场关于AI治理与所有权的思想实验
挪威1.7万亿美元主权财富基金能否收购OpenAI?本文深入分析这一大胆设想背后的AI治理困境、地缘政治障碍,以及谁应该拥有前沿人工智能技术的根本性追问。

120万人数据泄露:第三方供应商为何成为安全黑洞
Heights Finance因第三方供应商漏洞导致120万人敏感数据泄露。本文深入分析供应链攻击模式、AI Agent时代数据交接风险激增的趋势,以及企业如何通过数据脱敏、令牌化和最小化暴露策略防范供应商安全风险。

美国全民医保研究:每年或省1万亿美元、挽救11.4万人
一项关于美国全民医保的研究引发Hacker News热议:推行全民医疗覆盖每年或可节省1万亿美元并挽救11.4万人生命。本文解析研究核心逻辑、行政成本黑洞、预防性医疗价值,以及社区对模型假设和政治可行性的争论。