在DRAM内部运行AI:突破DDR4时序规则的存内计算实验

引言:当内存本身成为计算单元
在传统的冯·诺依曼架构中,数据必须在CPU和内存之间来回搬运,这一过程被称为"内存墙"(Memory Wall)——它已经成为现代计算系统性能与能效的最大瓶颈之一。冯·诺依曼架构自1945年提出以来一直主导着计算机设计,其核心特征是将存储器与处理器分离,指令和数据共享同一总线。在摩尔定律驱动下,处理器性能以每年约60%的速度提升,而DRAM访问延迟的改善速度仅为每年约7%,这一差距在1990年代被正式命名为"内存墙"。到2020年代,一次片外DRAM访问消耗的能量约为一次浮点运算的200-1000倍,在大语言模型推理中,内存带宽而非算力往往是真正的瓶颈。尤其在AI推理场景下,大量的权重数据搬运消耗了远超实际计算本身的能量。
近期,一个名为「Running PrismML's Bonsai inside DRAM by breaking DDR4 timing rules」的Hacker News项目引发了技术圈的关注。该项目提出了一个大胆而反直觉的想法:通过故意违反DDR4内存的时序规则,让DRAM芯片本身承担计算任务,从而在内存内部直接运行PrismML的Bonsai轻量级机器学习模型。
这是一次典型的"存内计算"(Processing-in-Memory, PIM)的极客实践,其技术思路值得深入剖析。
什么是存内计算与Bonsai模型
存内计算:打破内存墙的核心思路
存内计算的核心理念是:既然数据搬运如此昂贵,那么不如让计算发生在数据所在的地方。DRAM作为存储密度极高的介质,本身具有大规模并行的行/列结构。DRAM的基本存储单元由一个晶体管和一个电容构成(1T1C结构),数据以电荷形式存储在电容中。整个存储阵列按行(Row/Wordline)和列(Column/Bitline)组织,每个Bank包含数万行,每行包含数千个存储单元。读取数据时,行解码器激活某一字线,该行所有单元的电荷同时流向各自的位线,经过灵敏放大器(Sense Amplifier)将微弱的电压差放大为完整的逻辑电平。这种大规模并行的物理结构天然适合批量操作,也为存内计算提供了物理基础。
研究者们发现,通过巧妙操纵DRAM的电气与时序特性,可以在读取或刷新过程中"顺便"完成某些逻辑运算,例如按位与、或、异或等操作。
近年来,学术界已有多个类似探索,例如著名的"Ambit"和"ComputeDRAM"研究,它们都尝试利用商用DRAM在违反标准时序的情况下触发行拷贝(RowClone)和批量位运算能力。Ambit(发表于2017年IEEE Micro)是卡内基梅隆大学Onur Mutlu团队的代表性工作,它通过同时激活三行来实现多数门(Majority Gate)运算,再结合NOT操作即可构建完整的布尔逻辑。ComputeDRAM(2019年)进一步证明了在未经修改的商用DRAM芯片上,通过降低tRAS和tRP参数,可以在不同行之间实现AND和OR运算。DRISA和Fulcrum等后续工作则探索了如何在灵敏放大器中集成更复杂的计算逻辑。这些研究共同构成了学术界"利用DRAM物理特性做计算"的完整图谱。
Bonsai:为极端受限环境设计的AI模型
PrismML的Bonsai是一种专为资源极度受限设备(如IoT传感器、微控制器)设计的轻量级树模型。Bonsai属于微软研究院和IIT等机构联合提出的EdgeML项目族,与ProtoNN、FastGRNN等模型并列。其核心思想是将传统决策树进行稀疏投影,使得模型参数可压缩至2-16KB范围内,同时保持在分类任务上接近随机森林或小型神经网络的精度。
它的特点是模型体积极小(可以压缩到几KB),且推理过程主要依赖简单的比较与加法运算。推理时,Bonsai主要执行向量内积和阈值比较操作,这些操作可以被分解为乘累加和符号判断,进一步简化后可映射为位运算和移位操作。这种计算模式的规则性和简洁性,使其成为PIM系统的理想工作负载。这种"小而美"的特性,恰恰使它成为在DRAM内部运行的理想候选——因为DRAM能提供的"计算能力"极其原始,只适合简单、并行度高的操作。
核心技术:故意违反DDR4时序规则实现计算
DDR4时序规则为何存在
DDR4内存的规格书中定义了严格的时序参数,例如tRCD(行地址到列地址延迟)、tRAS(行激活时间)、tRP(预充电时间)等。这些参数保证了在正常操作下,DRAM电容中的电荷能够被可靠地读取和刷新,从而保证数据的完整性。
DDR4标准由JEDEC(固态技术协会)定义,时序参数的设定包含了充分的安全裕量(Guard Band)。以tRCD为例,JEDEC规定的典型值为13.75ns,但实际研究表明许多DRAM芯片在7-10ns即可完成行激活。tRAS(最小行激活时间,典型值33ns)确保灵敏放大器有足够时间完成电荷恢复。tRP(预充电时间,典型值13.75ns)确保位线电压回到平衡状态。这些裕量的存在,正是"时序违规"技术得以存在的前提——芯片在违规状态下不会立即失效,而是表现出可观察、部分可预测的降级行为。
突破时序规则带来的可控"副作用"
本项目的关键洞察在于:当我们故意缩短这些时序间隔时,DRAM会产生可预测的、非标准的行为。例如:
- 在一个行还未完全激活时就触发另一个操作,可能导致多行同时被激活,进而产生电荷共享效应;
- 电荷共享的结果可以被解读为多个存储单元之间的逻辑运算结果(如多数表决/多数门)。
从物理机制上看,当两行被近乎同时激活时,两个存储单元的电荷会同时注入同一条位线。位线的最终电压取决于两个单元电荷的叠加结果:如果两个单元都存储"1"(高电荷),位线电压偏移量大,灵敏放大器判定为"1";如果一个"1"一个"0",偏移量处于中间地带,此时灵敏放大器的判定取决于其阈值设置,这本质上实现了AND或OR逻辑;三行同时激活则实现多数表决(MAJ3)。通过编排不同的激活序列和预置数据模式,可以系统性地构建布尔运算,这就是将模拟电气现象转化为数字计算原语的核心机制。
通过精心编排这些"违规"操作序列,开发者实际上把DRAM的模拟电气特性转化为了一种原始的计算原语。将Bonsai模型的推理逻辑映射到这些原语上,就能实现真正意义上的"内存内AI推理"。
技术意义与现实挑战
存内计算的潜在价值
这一实验的意义主要体现在几个方面:
- 能效潜力巨大:如果计算能够在数据所在处完成,将大幅减少数据搬运带来的能耗,对边缘AI设备尤其有吸引力。
- 硬件复用降低成本:无需专门的AI加速芯片,直接利用现成的商用DRAM实现计算,降低了硬件成本。
- 学术研究价值:它揭示了商用硬件在"规格之外"存在的巨大潜力空间,为未来PIM芯片的设计提供了实证参考。
当前面临的现实局限
然而,这类方法也面临明显的挑战:
- 可靠性问题:违反时序本质上是在利用"未定义行为",结果高度依赖具体芯片、温度、电压甚至个体差异,难以保证跨设备的一致性。
- 计算精度受限:DRAM能提供的运算原语非常有限,只适合Bonsai这类极简模型,无法承载复杂的神经网络推理。
- 数据破坏风险:违规操作可能破坏内存中的其他数据,需要严格隔离计算区域。
产业趋势:从实验室到商业化
值得注意的是,存内计算不仅是学术概念,产业界已有实质性布局。三星在2021年推出了集成PIM功能的HBM-PIM产品,将计算逻辑直接嵌入HBM内存堆栈中。SK海力士的AiM(Accelerator-in-Memory)芯片面向推荐系统的embedding查询场景。初创公司如Mythic使用Flash存储阵列进行模拟矩阵乘法,Untether AI则在SRAM旁放置计算单元。这些商业化尝试与本文讨论的DDR4 hack在思路上一脉相承,但采取了更工程化、可量产的路径。Gartner预测到2026年,超过10%的边缘AI芯片将集成某种形式的近存储或存内计算功能。
结语:极客精神与硬件的边界探索
尽管「在DRAM内运行Bonsai」目前仍是一个偏向研究性质的概念验证项目,但它体现了一种可贵的探索精神——不把硬件规格书当作绝对边界,而是主动去挖掘硬件在极限状态下的隐藏能力。
随着AI应用向边缘和终端设备下沉,能效和成本成为越来越关键的考量,存内计算这条路径可能会从学术实验逐步走向实用化。这个项目虽小,却是通往未来"计算无处不在"愿景的一块有趣拼图。对于关注硬件底层与AI效率的技术从业者而言,它提供了一个值得深入思考的另类视角。
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。