突破1.58比特极限:三元LLM如何逼近信息论边界

三元权重的真实信息量因稀疏性低于1.58比特理论上界,熵编码可在存储层面突破这一壁垒。
「1.58比特」源于三元权重在均匀分布假设下的理论熵 log₂(3)≈1.585,是 BitNet 等工作的标志性指标。然而真实模型的权重分布并不均匀,零值占主导的稀疏性使实际信息量可远低于这一上界。论文《Breaking the 1.58-bit Barrier for Ternary LLMs》正是利用这一点,结合算术编码、游程编码等熵编码方案,将平均每权重的存储成本压缩到 1.0~1.3 比特区间,从而在存储层面突破了名义壁垒。工程层面需注意:熵编码降低的是静态存储占用,推理时仍需解码,变长码流与硬件定长对齐的矛盾使解码开销成为落地的关键约束,需在压缩率、解码速度与硬件支持之间权衡。
三元大模型的量化前沿
大语言模型的推理成本很大程度上取决于权重的存储与计算方式。近年来,业界在极低比特量化领域不断探索,其中三元(ternary)权重方案——即把每个权重限制为 -1、0、+1 三个取值——成为一条颇具潜力的路线。
从信息论角度看,三种等概率取值的理论熵约为 log₂(3) ≈ 1.585 比特。这也是「1.58-bit」这个数字的由来:它代表了在均匀分布假设下,存储一个三元权重所需的理论下限。BitNet 等工作曾把这一数字作为标志性指标,展示三元模型可以在大幅压缩的同时保持接近全精度模型的表现。

量化(Quantization)是将模型权重从高精度浮点数(如 FP32、BF16)映射到低比特整数表示的技术。传统的 INT8 量化已被广泛应用于生产环境,而 INT4 乃至更低比特的量化则需要更精细的校准与补偿策略。三元量化是极低比特量化的极端情形:权重只有三个离散取值,矩阵乘法可以退化为加减法,理论上可完全绕开乘法器,这对硬件友好性有重要意义。BitNet b1.58 由微软研究院于2024年提出,其核心主张是从训练阶段就引入三元约束(而非训练后量化),使模型在保持竞争力的同时天然适配极低比特推理,由此引发了学界对「1.58比特」这一指标的广泛关注与讨论。
为什么1.58比特并非真正的下限
1.58 比特这个数值建立在一个隐含前提之上:三种取值出现的概率完全相等。但在真实训练出来的模型中,权重分布往往并不均匀——大量权重会趋向于 0,形成天然的稀疏性。
一旦分布偏离均匀,实际所需的信息量就会低于 log₂(3)。换句话说,1.58 比特只是「最坏情况」的熵上界,而非现实模型的必然成本。这篇标题为《Breaking the 1.58-bit Barrier for Ternary LLMs》的讨论正是抓住了这一点:如果能够利用权重分布的偏斜特性,并配合更高效的熵编码方案,就有机会把每权重的平均比特数压到 1.58 以下。
稀疏性带来的压缩空间
当模型中零值权重占比显著提升时,采用算术编码、游程编码或其他基于概率的压缩手段,可以让平均编码长度逼近该分布的真实熵。对于一个 0 值占主导的三元权重矩阵,其经验熵完全可能落在 1.0~1.3 比特区间,从而「突破」名义上的 1.58 比特壁垒。
算术编码(Arithmetic Coding)是一种接近理论熵极限的无损压缩方法,它将整个消息序列编码为一个区间内的小数,而非为每个符号分配固定长度的编码。与霍夫曼编码相比,算术编码能更精确地逼近信源的真实熵,尤其在符号概率极不均匀时优势显著。游程编码(Run-Length Encoding,RLE)则专门针对大量连续重复值的场景,对于零值聚集的稀疏权重矩阵尤为有效。两种方法结合使用时,可以先用 RLE 压缩零值连续段,再对非零符号序列施以算术编码,从而在零值占比较高的三元权重上取得接近经验熵的压缩率。
工程意义与现实约束
这类研究的价值不仅在于理论上的比特数字,更在于对端侧部署的直接影响。更低的平均比特数意味着更小的模型文件、更低的内存带宽压力,以及在移动设备、边缘硬件上运行大模型的可能性。
不过需要清醒看待的是:存储压缩与计算效率是两回事。熵编码降低的是磁盘或内存中的静态占用,而实际推理仍需将权重解码回可计算的形式。如果解码开销过大,反而可能抵消带宽节省带来的收益。真正的工程落地需要在压缩率、解码速度与硬件支持之间取得平衡。
内存带宽(Memory Bandwidth)是大模型推理延迟的主要瓶颈之一。在 GPU 或 NPU 上,计算单元往往处于等待数据加载的状态,而非受限于算术运算速度——这一现象称为「内存墙」(Memory Wall)。因此,降低权重的比特宽度可以减少每次推理需要从 HBM 或 DRAM 搬运的数据量,直接缩短访存延迟。然而,熵编码产生的变长码流与硬件 SIMD 指令所偏好的定长、对齐内存布局存在结构性冲突。当前主流的解决思路包括:将权重分块后独立编码以支持随机访问、使用专用解压硬件单元(如 NVIDIA 的 NVComp)或设计面向稀疏三元权重的定制推理核(Kernel),以在保持压缩收益的同时降低解码延迟。
一场关于「极限」的重新定义
这场讨论的核心启示在于:所谓「barrier(壁垒)」往往取决于我们设定的假设。当假设从「均匀分布」转向「真实的稀疏分布」,原本看似不可逾越的 1.58 比特就不再是硬性下限。
对于关注模型压缩与高效推理的研究者和工程师而言,这提醒我们在评估量化方案时,应当区分理论熵上界与经验分布的实际信息量,并把编码效率纳入整体系统设计的考量。
注:本文基于 Hacker News 上的一则讨论帖整理,原帖信息有限,具体技术细节与实验数据请以相关论文原文为准。
相关推荐

rag-eval:零依赖、无需API密钥的RAG评测工具
rag-eval 是一款零依赖、框架无关的开源RAG管线评测工具,支持本地免费的词法与检索指标,无需API密钥,并可选启用LLM Judge做语义验证,兼容Haystack、LangChain、LlamaIndex。

Vercel AI SDK 发布 workflow-harness 1.0.115 补丁更新
Vercel AI SDK 开源仓库发布 @ai-sdk/workflow-harness 1.0.115 补丁版本,同步升级 @ai-sdk/harness 依赖。本文解析该更新内容、发布机制与对开发者的意义。

用AI视频生成3D高斯泼溅模型:Minimax+COLMAP实战教程
一份实用教程:如何用AI视频生成工具Minimax拍摄360度环绕镜头,配合开源工具COLMAP进行相机位姿估计,最终生成高斯泼溅3D模型。含完整提示词、COLMAP参数设置与关键操作细节。