RSI短期不会发生?新论文用NeurIPS实验给出否定答案

新论文用AI能否独立完成NeurIPS级研究来检验RSI门槛,实验表明当前智能体尚无此能力。
一篇在机器学习社区引发讨论的论文,通过实证方法对递归自我改进(RSI)的近期可行性提出质疑。论文的核心逻辑是:RSI 的前提是AI能够自主开展开放式机器学习研究,而实验证明当前主流智能体无法做到这一点。研究者让AI智能体重做尚未公开发表的NeurIPS接收论文,由原作者评分,结果显示智能体均无法达到同等研究水平。该论证基于能力实证而非纯粹理论推演,比抽象争论更具说服力。不过结论也存在局限:AI能力迭代极快,当前快照不代表长期判断;且"开放式研究能力"是否等同于RSI的唯一门槛,仍有逻辑讨论空间。文章同时触及了科研社区中严肃讨论被投票行为淹没的现象。
递归自我改进(Recursive Self-Improvement,简称 RSI)一直是 AI 安全与能力讨论中最具想象力、也最令人不安的话题之一。它描述的场景是:AI 系统能够自主改进自身,并在每一轮改进后变得更强,从而形成一个指数级加速的能力螺旋。一篇在 Reddit 机器学习板块引发讨论的新论文,却给这个设想泼了一盆冷水——研究者认为,以当前 AI 智能体的能力,RSI 并不在眼前。

论文的核心论证:从开放式研究能力反推 RSI
这篇论文的论证链条相当直接:递归自我改进的前提,是 AI 能够独立开展开放式的机器学习研究(open-ended ML research)。如果一个系统连自主设计实验、提出新方法、验证假设都做不到,那它就无法真正改进自己,更谈不上一轮又一轮地自我迭代。
换句话说,作者把"能否做开放式 ML 研究"当作 RSI 的必要门槛。这个逻辑的关键在于:RSI 不是简单地调参或复现,而是要在没有明确路径的前提下创造出新的、有价值的研究成果。如果连这一步都跨不过去,那么关于 RSI"即将到来"的担忧就缺乏现实基础。
值得关注的是,发帖者特别强调自己并非论文作者,只是觉得研究角度有趣。这种"用可验证的能力边界去检验宏大叙事"的思路,本身就比空泛的乐观或悲观预测更有讨论价值。
实验设计:让 AI 智能体重做 NeurIPS 论文
论文采用了一个颇为巧妙的评测方法。研究者选取了一批已被 NeurIPS 接收、但尚未正式发表的论文,然后要求 AI 智能体去完成与原论文相同的研究工作。最终的成果,由这些论文的原始作者亲自打分评判。
这种设计有几个明显优点:
- 避免数据污染:使用尚未发表的论文,可以有效降低模型在训练数据中"见过答案"的风险,这是评测前沿模型时的一大痛点。
- 真实的研究难度:NeurIPS 级别的工作代表了机器学习领域相对高质量的原创研究,而非教科书式的标准任务。
- 权威的评判标准:由原作者评分,比自动化指标更能反映研究成果的实际质量与创新性。
参与测试的是两类代表性的智能体系统(帖子中以 Codex/GPT 系列和 Opus 系列的代号描述)。实验结果是:这些智能体无法完成同等水平的研究工作。
结论的含义与局限
基于智能体无法胜任开放式 ML 研究这一事实,作者推导出 RSI 在当前阶段不会发生的结论。这是一个基于能力实证的判断,而非纯粹的理论推演,因此更具说服力。
不过,这类论证也存在需要审慎看待的地方。首个问题是时效性:论文测试的是研究进行时的模型版本,AI 能力迭代速度极快,今天的"做不到"未必等于明年的"做不到"。作者的结论严格来说是"截至测试时"的快照,而非永久性判断。
第二个问题是必要条件的等价性:能否做开放式研究,是否真的等同于能否递归自我改进?RSI 可能存在其他实现路径,比如在特定狭窄领域内的自我优化,而不必先具备通用的科研创造力。把"开放式研究"设为唯一门槛,逻辑上仍有讨论空间。
第三,重做已有论文的"研究"与真正无人区的"开放式探索"之间,仍有微妙差别——有明确答案的复现任务,与从零提出问题相比,难度维度并不完全一致。
一个关于科研社区讨论质量的插曲
除了论文本身,发帖者的一段感慨也颇值得玩味。他表示自己"过去十来次在这个板块发研究内容都后悔了"——要么被踩,要么虽然获得点赞却没有任何有意义的讨论,并说这可能是最后一次尝试。
这反映出一个真实存在的现象:在信息过载的社区环境中,严肃的研究讨论往往被情绪化的投票行为淹没。一篇挑战主流叙事、方法论扎实的论文,理应引发关于"RSI 门槛究竟该如何定义""实验能否推广到更强模型"这类深入对话,而不是简单的点赞或反对。
写在最后
这篇论文的价值,不在于它给出了 RSI"永远不会发生"的断言,而在于它提供了一种可操作、可验证的检验框架:用真实的前沿研究任务,去测量 AI 智能体的能力上限。对于关心 AI 发展节奏的人来说,这类基于实证的降温,比任何一方的情绪化预测都更有参考意义。
无论你站在"AI 即将失控"还是"AI 被高估"的哪一端,用"AI 能不能真正做出一篇 NeurIPS 论文"来校准自己的判断,都是一个务实的起点。
相关推荐

SimpliSafe新款可视门铃:AI+真人保安主动盯防你的家门
SimpliSafe推出售价199.99美元的Video Doorbell Series 2可视门铃,搭配Active Guard主动安防服务,结合AI分析与真人监控坐席,实现家门口的主动威胁侦测与干预。本文解析其技术分工、订阅模式与隐私问题。

富士 Instax Pal 2 迷你相机:补齐屏幕短板的升级之作
富士发布 Instax Pal 2 迷你数码相机,相比初代新增屏幕与取景器,采用微缩化相机造型,补齐了初代盲拍的核心短板,成为一款更实用的便携即时成像设备。

Linux from Scratch:从零手工构建你的Linux系统
Linux from Scratch(LFS)是一个教你从源代码手工构建 Linux 系统的开源项目。本文介绍 LFS 的核心价值、BLFS/ALFS 项目生态及适用人群,帮助你理解 Linux 底层机制。