无需MLP与注意力机制:点吸引子动力学如何学习词嵌入

一个反常识的实验
在Transformer和注意力机制主导的今天,一位开发者提出了一个近乎逆潮流的问题:能否用一个极简的动力学系统学到有用的词表示,而完全不使用MLP、Transformer、注意力层,甚至连独立的输出矩阵都不要?
**动力学系统(Dynamical Systems)**是数学与物理学中研究状态随时间演化规律的框架,起源于庞加莱对天体力学的研究,后经李雅普诺夫等人发展为现代非线性动力学。将动力学框架引入机器学习并非全新尝试:循环神经网络(RNN)本质上就是离散时间动力学系统,储池计算(Reservoir Computing)和回声状态网络(Echo State Networks)则明确借用了混沌动力学思想。将其引入词表示学习,意味着用「状态轨迹」替代「静态映射」来编码语义信息——传统词嵌入方法如word2vec和GloVe将词映射为固定向量,而动力学视角则关注状态向量在词序列中的连续演化过程,这一思路与主流神经网络范式形成了鲜明对比。
这个名为「Collapse / noun-collapse」的实验给出了一个耐人寻味的答案。在SimLex-999名词子集上,它取得了 Spearman ρ = 0.3616 的相似度相关性,覆盖了 662/666 的名词对。
SimLex-999是自然语言处理中评估词语相似度的标准基准数据集,由Hill等人于2015年提出,包含999对英文词对,每对词由人类标注者打出0-10的相似度分数。词语相似度评估基准经历了从WordSim-353(Finkelstein等,2001)到MEN(Bruni等,2012)的演进。早期基准混淆了相似性(similarity)与相关性(relatedness)两个概念——「医生」与「护士」高度相关但不完全相似,「咖啡」与「杯子」相关但不相似。SimLex-999通过明确指令要求标注者严格区分这两个概念,使「猫」与「狗」的高相似度得分与「咖啡」与「杯子」的低相似度得分形成对比,成为评估真正语义相似性的更严格基准。Spearman ρ(斯皮尔曼秩相关系数)衡量模型预测排名与人类判断排名之间的单调相关性,取值范围-1到1,越高表示模型与人类语义直觉越吻合。
这个数字本身不算惊艳,但考虑到模型结构之简单,它的意义在于证明了一种可能性:仅靠原始的共现压力,有序的点吸引子动力学就能自发学出有用的语义几何。

模型结构:极简设计的三重角色
全部可学习参数
整个模型只包含四类参数:
- 每个词表 token 对应一个 256 维的可学习向量;
- 一个可学习的起始状态(start state);
- 一个「拉力强度」标量(pull-strength);
- 一个「读出温度」标量(readout-temperature)。
最关键的设计是:每个 token 向量同时扮演三重角色——它既是词的表示(representation),又是点吸引子(point-attractor),还是几何读出(geometric readout)。这意味着没有额外的解码器,也没有单独的输出矩阵,所有功能都压缩进了这张共享的「井表」(well table)中。
轨迹即编码:状态向量如何感知词序
要编码一段上下文,系统让状态向量依次「穿过」有序的 token。核心更新公式为:
h ← h − strength · (1 − cos(h, W)) · normalize(h − W)
这一公式有清晰的几何解读:(1 − cos(h, W)) 是角距离的单调函数,当h与W方向完全一致时为零(无拉力),方向完全相反时为最大值2(最强拉力);normalize(h − W) 给出从当前状态指向吸引子的单位方向向量。整个更新因此是「沿连线方向、以角距离加权的步进」——远则拉力强,近则拉力弱,具备自然的软约束性质。
这里的「点吸引子」借鉴了动力学系统中的经典概念:在相空间(phase space)中,吸引子是使邻近轨迹随时间收敛的不变集合。点吸引子是最简单的类型,对应系统的稳定平衡点,其吸引域内的所有初始状态最终都收敛至同一点(更复杂的类型包括极限环和混沌吸引子)。每个词向量在256维空间中定义了一口「引力井」,状态向量沿上下文序列移动时,依次被每个词的引力井拉扯——这与物理学中质点在势场中的运动有深刻类比。
值得注意的是,作者诚实指出模型所用的「弦导向力」(chord-directed force)并非保守力场,不存在精确的全局标量势能,因此与严格的哈密顿动力学有本质区别。这种非保守性实际上赋予了系统对词序的路径依赖性,使得轨迹终点携带了序列信息。由于这是一条轨迹,改变 token 顺序就会改变终点——这天然赋予了模型对词序的敏感性,这正是它区别于简单向量平均(如原始 CBOW 求和)的地方。
训练方法与硬件门槛
类 CBOW 的填空训练
训练方式借鉴了 CBOW 的完形填空思路。CBOW(Continuous Bag of Words)是word2vec中的经典训练架构之一,由Mikolov等人于2013年提出,核心思想是给定上下文窗口预测中心词。传统CBOW将上下文词向量简单求平均,天然丢失了词序信息——Collapse模型正是通过动力学轨迹来弥补这一缺陷。
具体而言:对于每一个符合条件的名词 token,模型读取其前后各 5 个 token 的上下文(±5 窗口),要求状态最终停在缺失名词对应的「井」附近。预测时直接用余弦相似度与这些井比较,无需任何独立解码器。
训练规模并不小:
- 约 500 万行英文维基百科语料,约 3 亿 token;
- 9475 万次 WordNet 名词候选 token 出现;
- 10 万上下文词表,23,758 个名词目标;
- 约 2560 万参数,几乎全部集中在共享井表中;
- 单次流式遍历(one streaming pass)即完成训练。
最令人印象深刻的是硬件门槛:整个训练在一台 Apple Silicon MacBook 上通过 MPS 完成,耗时约 3.2 小时。Apple Silicon是苹果自2020年起推出的ARM架构自研芯片系列(M1/M2/M3/M4),其统一内存架构(Unified Memory Architecture,UMA)让CPU、GPU和神经网络引擎共享同一内存池,消除了传统异构计算中CPU-GPU数据传输的瓶颈。MPS(Metal Performance Shaders)是苹果为GPU计算提供的底层框架,PyTorch自1.12版本起正式支持MPS后端。在此之前,个人研究者若无NVIDIA GPU,往往面临高昂的云计算费用或漫长的CPU训练等待。这对个人研究者的可复现性极为友好,也呼应了近年来「民主化AI研究」的社区理念——它隐性地对学术界日益依赖超大规模计算的趋势提出了反思。
推理速度
编码器的推理速度同样出色:单条已分词的 10-token 上下文在 CPU 上约 0.23 毫秒;MPS 批量吞吐在 batch 1024 下约 230 万 token/秒;在 23,758 个名词中做最近邻查询约 0.48 毫秒。这种轻量特性使其在资源受限场景下具备实际吸引力。
模型学到了哪些语义结构
从最近邻示例可以看出,模型确实捕捉到了合理的语义结构:
- physics → chemistry, mathematics, astronomy, quantum, mechanics
- cat → tabby, dog, pet, felis, mouse, stray, feline
- pakistan → karachi, punjab, lahore, peshawar, bangladesh, india
- apple → macintosh, ipod, blackberry, android, pc, cherry
这些结果表明,仅靠共现压力驱动的动力学,就能自发组织出学科聚类、动物类别、地理关联乃至品牌语境。尤其「apple」的结果颇具说明性:模型同时关联到了macintosh、ipod等科技词(品牌义),又出现了cherry这一水果义——这种「主导义为主、次要义残留」的现象,恰恰反映了静态单向量表示在多义词上的固有局限:每个词只能拥有一个位置,只能编码其在整个训练语料中的「平均语义重心」。
诚实的局限性
作者对模型缺陷的坦诚值得称道:
- 这是相似度,不是推理或事实记忆——不要期待它做逻辑或知识问答。
- 每词单向量只能捕捉主导词义,多义词(polysemy)处理能力有限。
多义词问题在表示学习领域由来已久,是静态词嵌入的根本局限。在word2vec和GloVe的框架下,「bank」这个词的银行义和河岸义被强制压缩进同一个向量,其最终位置取决于两种语义在训练语料中的相对频率加权平均。这一局限直接催生了上下文相关词表示的研究路线:CoVe(McCann等,2017)使用机器翻译编码器生成上下文向量;ELMo(Peters等,2018)通过双向LSTM的层级表示捕捉多义性;BERT(Devlin等,2019)则通过Transformer的自注意力机制,使每个词的表示完全取决于其出现的整个句子语境。在几何动力学框架内引入多义性是一个开放问题——作者提出的「多井」方案,即为每个词设置多个上下文相关的吸引子,在概念上类似于将单高斯假设推广为高斯混合模型(GMM),但如何在不引入完整神经路由网络的前提下实现动态井选择,是连接极简主义与表达能力的核心张力,也是该研究方向的核心挑战。
其他局限包括:
- WordNet 名词判定基于词典,而非上下文 POS 标注。
- 整词词表意味着无法泛化到未登录词(OOV)。
- 当前的「弦导向力」(chord-directed force)虽指向吸引子,但非保守,不存在精确的全局标量势能,作者选择记录这一修正而非掩盖。
- 与已发表的 word2vec/GloVe 数字比较只是「暗示性」而非受控对比。作者已搭建了统一预处理、维度、词表、数据预算和评估的匹配语料测试框架,用于对比 Collapse、SGNS 与 PPMI+SVD。
SGNS(Skip-gram with Negative Sampling)是word2vec中最广泛使用的变体,引入负采样替代softmax计算,大幅提升训练效率;PPMI+SVD则是基于共现矩阵的传统方法,对逐点互信息矩阵做截断奇异值分解,在许多语义任务上与神经方法不相上下。值得关注的是,Levy和Goldberg(2014)的理论工作揭示了SGNS与PPMI+SVD的深层等价性:SGNS隐式地对移位逐点互信息矩阵进行低秩近似,这统一了神经词嵌入与分布语义学两个研究传统。在此背景下,如果动力学轨迹方法能接近甚至匹敌隐式矩阵分解方法的性能,将意味着共现统计的语义信息可以通过多条数学路径等价地提取——将Collapse与这两类方法进行受控比较,是验证其实际价值的必要步骤。
此外,已发布的 v1 checkpoint 早于采样 softmax 中一个假负例掩码修正,其评估结果不受影响,但修正后的 v2 重训练仍在进行中。
意义与开放问题
作者明确表示,其目的并非声称要取代标准嵌入方法。真正令人兴奋的是:一个没有任何常规编码器网络的有序点吸引子动力学系统,竟能从原始共现压力中学出有用的语义几何。这为「学习表示」这一问题提供了几何动力学的新视角——它提示我们,语义结构或许不是神经网络专有的涌现现象,而是任何能够稳定编码共现统计的有序系统都可能自发形成的性质。
作者向社区抛出了两个具体问题:一是在 SGNS 和 PPMI+SVD 之外,还有哪些更公平的匹配数据基线;二是如何用几何原生的方式引入多义性——即为每个词设置多个上下文相关的井,而不引入完整的神经路由网络。
代码与研究记录已开源在 GitHub(chetanxpatil/livnium),模型与独立加载器发布在 Hugging Face(chetanxpatil/noun-collapse)。对于关注表示学习本质、或希望在极简架构上探索的研究者,这是一个值得一试的实验样本。
核心要点
相关推荐

Nemotron 3.5 Lightning:专为长程Agent设计的高效开源模型
NVIDIA推出Nemotron 3.5 Lightning开源模型,主打智能、快速、高效,专为连续长程Agent任务设计。本文解析其核心优势、开源策略及对AI Agent行业的潜在影响。

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。