模拟存内计算:Mythic如何用物理定律突破AI芯片能效瓶颈

引言:AI算力的能效困境
随着大模型和边缘AI应用的爆发,传统计算架构正面临一堵难以逾越的"内存墙"。在冯·诺依曼架构下,数据需要在处理器和内存之间来回搬运,而这一过程消耗的能量往往远超实际计算本身。据业内多次测算,在深度学习推理任务中,数据搬运所消耗的能量可能占到总功耗的60%以上。
冯·诺依曼架构诞生于1945年,其核心特征是程序和数据共享同一存储空间,CPU通过总线从内存中取指令和数据。这一架构在过去数十年中支撑了整个计算机产业的发展,但随着处理器速度的提升远超内存带宽的增长(处理器性能年增长约60%,而DRAM带宽年增长仅约10%),两者之间形成了日益严重的性能鸿沟。事实上,内存墙问题并非一夜之间出现,而是经历了数十年的渐进恶化。1980年代,CPU和DRAM的性能增长基本同步,内存墙尚不明显。但从1990年代开始,随着超标量流水线、乱序执行等微架构技术的引入,CPU性能飙升,而DRAM受限于电容充放电的物理过程,带宽增长远远滞后。业界此前的应对策略包括引入多级缓存层次(L1/L2/L3 Cache)、预取机制、HBM高带宽存储器等,但这些方案本质上都是在缓解而非消除数据搬运问题。在深度学习工作负载中,这一矛盾被进一步放大:一个大型Transformer模型可能拥有数十亿参数,每次推理都需要将这些参数从DRAM搬运到计算单元,模型参数量的增长速度远超缓存容量的扩展,使得缓存命中率急剧下降,数据搬运的能耗可达计算本身的200倍。这就是为什么即便GPU拥有强大的算力,实际能效仍然受限于数据搬运的物理瓶颈。
正是在这样的背景下,Mythic公司提出的模拟存内计算(Analog Compute-in-Memory)架构引发了HackerNews社区的热烈讨论(获得47点赞、23条评论)。这一技术路线试图从根本上重构计算与存储的关系,将乘加运算直接搬进存储单元内部完成。

什么是模拟存内计算
打破"内存墙"的核心思路
传统数字芯片将数据从内存读取到计算单元,完成运算后再写回。存内计算(Compute-in-Memory, CIM)的核心理念是让存储器本身具备计算能力,从而消除大量数据搬运带来的能耗和延迟。
Mythic的独特之处在于选择了模拟计算这条路径。它利用闪存(Flash Memory)单元来同时存储神经网络的权重,并直接在存储阵列中执行模拟域的矩阵乘法运算。闪存最初被设计为非易失性数据存储器件,其基本单元是浮栅晶体管(Floating Gate Transistor)。浮栅晶体管的工作原理涉及量子力学中的Fowler-Nordheim隧穿效应:编程时,高电场驱动电子穿越薄氧化层注入浮栅,而浮栅被绝缘层完全包围,电荷可保持数年不变。通过向浮栅中注入不同量的电荷,可以改变晶体管的阈值电压,从而实现多比特存储。Mythic巧妙地利用了这一特性:浮栅中存储的电荷量决定了晶体管在特定栅压下的导通电流,这个电导值恰好可以被编程为神经网络的权重值。
关键的技术突破在于精确控制注入电荷量:传统Flash存储只需区分几个离散状态(如SLC的2态或MLC的4态),而存内计算需要64甚至256个可区分的电导级别。这要求编程电路具备极高的精度(通常采用增量步进脉冲编程,即ISPP方法),同时要求读取电路能够分辨微安级的电流差异。温度变化会导致阈值电压漂移约1-3mV/°C,累计使用会导致电荷泄漏,这些都是工程实践中必须通过校准算法来补偿的因素。与传统数字存储只区分0和1不同,模拟存内计算需要闪存单元提供多级、连续的电导状态,这对器件的编程精度和状态保持能力提出了更高要求。NOR Flash因其支持随机读取和较好的电流一致性,通常比NAND Flash更适合用于存内计算。
用物理定律完成计算
Mythic架构的精妙之处在于巧妙运用了两条基础物理定律:
- 欧姆定律(Ohm's Law):电流等于电压除以电阻。当输入信号以电压形式施加到存储单元时,通过控制闪存单元的电导(相当于权重),输出电流自然就等于"电压×电导",即完成了一次乘法运算。
- 基尔霍夫电流定律(Kirchhoff's Law):并联支路上的电流会自动求和。当同一列上的多个单元电流汇聚时,就天然实现了乘加(MAC)运算的累加部分。
在Mythic的交叉阵列(Crossbar Array)结构中,行线(Word Lines)承载输入电压信号,列线(Bit Lines)收集输出电流。每个交叉点处的闪存单元充当一个可编程电导(G=1/R),当行线施加电压V时,该单元产生电流I=V×G,这就是一次乘法。同一列线上所有单元的电流按基尔霍夫定律自动汇聚求和,完成累加操作。一个N×M的交叉阵列可以在一个时钟周期内完成N维输入向量与M个N维权重向量的点积,即同时输出M个结果。这种并行度是O(N×M)级别的,远超传统数字阵列的O(N)或O(√N)并行度。然而,阵列尺寸不能无限扩大,因为随着列线长度增加,寄生电阻和电容会导致信号衰减和串扰,实际工程中通常将阵列限制在256×256到1024×1024的规模。
这意味着,一个完整的向量-矩阵乘法可以在一个时钟周期内、以物理方式并行完成,无需逐个数字运算。MAC(Multiply-Accumulate,乘加)运算是深度学习推理中最基本也是计算量最大的操作。在一个典型的全连接层或卷积层中,需要将输入向量与权重矩阵进行点积运算,这本质上就是大量MAC操作的集合。以一个1024×1024的矩阵乘法为例,需要执行约100万次MAC运算。现代大语言模型(如GPT级别)中,每次推理可能涉及数万亿次MAC运算。传统数字芯片需要逐一或以有限并行度执行这些运算,而模拟存内计算的革命性在于:一个包含1024行的存储阵列可以在单个时钟周期内同时完成1024次乘法并自动累加,实现了真正意义上的大规模并行计算。对于神经网络推理这种以矩阵乘法为主的负载而言,这是一种极为契合的架构设计。
模拟存内计算的能效优势与技术亮点
权重常驻存储,彻底消除数据搬运
Mythic将神经网络权重直接存储在模拟闪存单元中,权重一旦写入便常驻不动。推理时,只有输入激活值在阵列中流动,避免了反复从DRAM加载权重的巨大开销。这对于参数量庞大的模型尤其有价值——权重不动,能耗自然大幅降低。
数字与模拟的混合信号设计
虽然核心计算发生在模拟域,但Mythic的架构并非纯模拟系统。它在阵列的输入端使用DAC(数模转换器)将数字激活值转为模拟电压,在输出端使用ADC(模数转换器)将累加电流转回数字信号。这种**混合信号(Mixed-Signal)**设计,让芯片既能享受模拟计算的能效优势,又能与外部数字系统无缝对接。
DAC和ADC是连接数字世界与模拟计算域的桥梁。ADC的设计是整个系统的关键瓶颈之一:高精度ADC(如12位以上)面积大、功耗高、速度慢;低精度ADC虽然高效,但会引入额外的量化噪声。在存内计算系统中,ADC架构的选择涉及多维度的工程权衡。SAR ADC(逐次逼近型)在中等精度(8-12位)和中等速度(数十MHz)场景下面积和功耗最优,是目前存内计算芯片中最常见的选择。Flash ADC速度极快但面积随精度指数增长,通常仅用于低精度(4-6位)场景。Sigma-Delta ADC精度最高但速度最慢,不适合高吞吐需求。一个创新方向是列级ADC共享,即多列共用一个ADC通过时分复用来减少面积开销,但代价是降低了有效吞吐率。另一种思路是在模拟域直接完成ReLU等非线性激活函数,减少ADC转换次数。据研究估算,在某些存内计算设计中,ADC可能占据芯片总面积的30-50%和总功耗的40-60%,因此ADC的优化设计直接决定了存内计算架构能否真正实现理论上的能效优势。Mythic等公司还探索了分段量化和动态精度调整技术,根据不同层的精度需求选择不同的ADC分辨率,以在系统层面优化整体能效。
面向边缘AI推理的精准定位
Mythic的这套架构主要瞄准边缘推理场景,如智能摄像头、AR/VR设备、工业视觉等对功耗和成本高度敏感的应用。在这些场景中,能效比往往比绝对算力更为关键。
边缘AI推理指的是在终端设备(而非云端数据中心)上直接运行AI模型进行推理。这类场景具有几个鲜明特征:首先是严格的功耗约束,电池供电设备可能只允许几百毫瓦到几瓦的功耗预算;其次是延迟敏感,实时视频分析、自动驾驶决策等应用要求毫秒级响应,无法承受云端往返的网络延迟;第三是成本敏感,消费级和工业级设备对芯片成本有严格限制。此外,边缘设备还面临隐私保护需求(数据不出设备)和断网环境下的独立运行能力要求。
边缘AI芯片市场正经历快速增长,据多家分析机构预测,到2028年市场规模可能超过500亿美元。这一市场的竞争者可分为几个阵营:传统芯片巨头如高通(骁龙系列NPU)、Intel(Movidius VPU)和联发科提供通用型边缘AI方案;专用AI加速器厂商如Hailo、Kneron和寒武纪则聚焦于特定场景的极致能效;而Mythic、Syntiant等采用新型计算范式的公司则试图通过架构创新实现颠覆性的能效突破。Google的Coral Edge TPU和NVIDIA的Jetson系列也在积极争夺市场份额。在这一竞争格局中,模拟存内计算的差异化优势主要体现在极低功耗(通常比同等算力的数字芯片低5-10倍)和高能效比(TOPS/W)上。这些约束条件和市场特征恰好与模拟存内计算的优势高度契合——低功耗、低延迟、高能效比,这也是Mythic选择首先瞄准边缘市场而非数据中心的战略逻辑。
技术挑战与社区讨论
模拟计算面临的固有难题
HackerNews社区的讨论中,不少工程师指出了模拟存内计算面临的现实挑战:
- 精度与噪声问题:模拟计算天然受到噪声、温度漂移和器件失配的影响,难以达到数字计算的确定性精度。虽然神经网络对低精度有一定容忍度,但如何保证跨批次、跨芯片的一致性仍是难题。
- ADC/DAC转换开销:转换器本身会占用大量面积和功耗。有观点认为,如果转换开销过大,可能会抵消掉存内计算节省的能量,这是评估此类架构真实收益的关键指标。
- 权重更新的灵活性受限:闪存写入速度慢、寿命有限(典型NOR Flash的擦写次数约10万-100万次),这使得该架构更适合权重固定的推理任务,而非需要频繁更新的训练场景。
编译器与工具链的成熟度
模拟架构对软件工具链提出了极高要求。开发者需要将标准神经网络模型"映射"到模拟阵列上,处理量化、校准和误差补偿等一系列问题。这涉及到将浮点权重量化到闪存单元支持的有限精度级别、对模拟计算引入的系统性误差进行建模和补偿、以及在编译时考虑阵列物理布局对计算精度的影响等复杂工程挑战。工具链的成熟度往往决定了这类新型架构能否被产业真正采纳。
存内计算的行业前景与发展方向
模拟存内计算并非Mythic一家的探索方向。近年来,学术界和产业界围绕基于闪存、ReRAM、相变存储器(PCM)等不同器件的存内计算方案展开了大量研究。
除闪存外,ReRAM(阻变存储器)通过在金属氧化物薄膜中形成或断开导电细丝来改变电阻值,具有写入速度快(纳秒级)、功耗低、尺寸可缩小至几纳米的优点,但面临器件间变异性大(变异系数通常在5-15%之间)和耐久性有限的问题。代表性研究机构包括TSMC、Crossbar Inc.和中国科学院微电子研究所,已在28nm和22nm节点实现流片验证。PCM(相变存储器)利用硫族化合物材料在晶态和非晶态之间的相变来实现不同电阻状态,具有多级存储能力强、保持特性好的优势,IBM和Intel等公司在此方向投入较多。IBM的研究团队发表的多篇Nature论文展示了百万级突触阵列的训练能力,但PCM的RESET操作功耗较高(约pJ/bit级),且drift效应会导致电阻随时间对数衰减。MRAM(磁阻存储器)则利用磁性隧道结的电阻变化,速度最快但模拟精度相对有限。国内方面,清华大学团队在2020年Nature上发表的基于忆阻器的通用存算一体芯片引起广泛关注。目前,Flash CIM因工艺成熟度最高,最接近量产;ReRAM CIM次之,预计2-3年内可能实现规模化;PCM CIM仍主要停留在研究阶段。每种器件都有其独特的精度-速度-耐久性权衡,目前尚未出现一种能在所有指标上胜出的方案。
这一赛道被普遍视为后摩尔时代提升AI能效的重要突破口之一。摩尔定律在过去半个世纪驱动了计算性能的指数级增长,但随着工艺节点逼近物理极限(原子尺度的量子隧穿效应、功耗密度的热极限等),单纯依靠制程缩小来提升性能已难以为继。后摩尔时代的计算发展呈现多条路径并行探索的格局:一是通过3D堆叠和先进封装(如Chiplet)突破面积限制;二是开发专用加速器(如TPU、NPU)提升特定工作负载效率;三是探索全新计算范式,包括模拟计算、量子计算、光子计算和神经形态计算等。存内计算属于第三类探索中最接近商用的方向之一,因为它可以利用成熟的半导体制造工艺,不需要像量子计算那样依赖全新的物理平台,这使其在工程可行性上具有显著优势。
然而,从技术演示到大规模商用,中间隔着可靠性、良率、工具链和生态等多重门槛。Mythic自身的发展也几经波折——公司成立于2012年(最初名为Isee),总部位于美国德克萨斯州奥斯汀,曾获得超过1.6亿美元的风险投资。公司于2022年推出了其首款商用产品M1076 AMP(Analog Matrix Processor),这是一颗在40nm工艺节点上制造的芯片,集成了约8000万个模拟闪存单元,可存储等效于25 TOPS算力的神经网络权重,典型功耗仅为3-4瓦。然而,Mythic的商业化之路并不平坦——公司在2022-2023年间经历了裁员和管理层变动,一度面临资金压力。这反映了前沿芯片创业公司普遍面临的挑战:从研发到量产需要巨额资金投入,而市场教育和生态建设又需要漫长的时间窗口。Mythic的经历为后来者提供了重要参考:技术领先并不直接等于商业成功,客户生态、软件支持和供应链管理同样关键。
对于关注AI硬件的从业者而言,Mythic的模拟存内计算提供了一个极具启发性的样本:它展示了跳出数字计算范式、用物理定律直接完成计算的可能性。无论最终这条路线能否成为主流,它所探索的"计算即存储"理念,都将持续影响下一代AI芯片的设计思路。
总结
Mythic的模拟存内计算架构,本质上是一次对计算根本范式的重新思考。通过将权重存储在闪存单元中,并利用欧姆定律和基尔霍夫定律在模拟域完成矩阵乘法,它有望在边缘AI推理场景中实现数量级的能效提升。
但正如社区讨论所揭示的,模拟计算的精度控制、ADC/DAC开销以及软件工具链的成熟度,仍是这条路线走向大规模落地必须跨越的关卡。在AI算力需求持续攀升而能效日益成为瓶颈的今天,这样的架构探索无疑值得整个行业密切关注。
核心要点
相关推荐

Shoggoth隐喻:AI对齐问题的深层焦虑与思考
Shoggoth(修格斯)隐喻将大语言模型比作戴着笑脸面具的克苏鲁怪物,精准揭示了AI对齐的核心难题。本文解析这一AI文化符号的由来、含义及其背后关于能力与理解鸿沟、RLHF对齐局限性的深层思考。

AI经济学研究入门指南:经济学博士生的系统路线图
面对AI经济学这个庞大领域,经济学博士生该如何系统入门?本文梳理AI经济学四大研究主线、文献阅读方法、技术学习优先级,提供从Acemoglu到Brynjolfsson的完整知识体系搭建路径。

自托管ASR模型vs云端API:成本与可靠性全面对比
深入分析自托管ASR开源模型与Google等云端语音识别API的成本差异、可靠性对比及盈亏平衡点计算,提供Whisper、IBM Granite等方案的实用选型建议,帮助团队做出最优技术决策。