扩散以压缩:利用扩散语言模型实现无损压缩
摘要
本文介绍了扩散语言模型(DLMs)作为一种新的无损文本压缩推理范式,旨在克服基于自回归LLM的压缩器的吞吐量瓶颈,同时实现最先进的压缩率。
arXiv:2608.11249v1 公告类型:新
摘要:我们研究无损文本压缩问题,其动机源于数字文本数据(包括纯文本、源代码以及XML等结构化格式)的采集和存储快速增长,以及近期基于神经语言模型的压缩技术取得进展。特别是,近期基于LLM的方法,无论是建立在符号排序流水线上,还是与统计压缩器配对使用,在文本和代码上的压缩率都显著优于zstd、gzip或bzip等通用压缩器。然而,这些神经方法存在严重的吞吐量限制,尚无法实际使用。
在无损神经文本压缩的背景下,我们首次引入扩散语言模型(DLMs)作为自回归LLM方法之外的替代推理范式。我们认为,在同一压缩框架内用DLM取代自回归LLM,可以克服其每步仅编码一个符号的限制所导致的吞吐量瓶颈。然而,要实现这些改进,需要解决将DLM应用于无损压缩时带来的算法挑战——该架构允许每次前向传播所编码的符号数量和位置独立决定。我们设计了高效且有效的策略来解决这些挑战,并在公认的文本基准enwik8上,与基于LLM的压缩器和通用压缩器进行了实验对比。
我们的结果表明,新提出的基于DLM的框架推进了无损文本压缩的最先进水平。此外,由于DLM仍是一个相对年轻的范式,近期在模型能力和效率方面的进展表明其还有很大的进一步改进空间。
查看缓存全文
缓存时间: 2026/08/13 15:25
# 扩散以压缩:利用扩散语言模型进行无损压缩
来源:https://arxiv.org/html/2608.11249
###### 摘要
我们研究无损文本压缩问题,其动机源于数字文本数据——包括纯文本、源代码以及 XML 等结构化格式——在采集与存储上的快速增长,也源于近期基于神经语言模型的压缩技术进展。特别是,近期基于 LLM 的方法,无论是建立在符号排序流水线上,还是与统计压缩器配合使用,都已在文本和代码上展现出显著优于 zstd、gzip 或 bzip2 等通用压缩器的压缩比。然而,这些神经方法存在严重的吞吐量限制,尚无法真正投入使用。
在无损神经文本压缩的背景下,我们首次引入扩散语言模型(DLM),将其作为自回归 LLM 方法的一种替代推断范式。我们认为,在同一压缩框架内用 DLM 替换自回归 LLM,有望克服后者因“每步只能生成一个符号”而造成的吞吐瓶颈。然而,要实现这些改进,需要解决将 DLM 应用于无损压缩时带来的算法挑战——DLM 架构允许每次前向传播所编码符号的数量和位置被独立决定。我们设计了高效且有效的策略来解决这些挑战,并在广为认可的文本基准 enwik8 上,与基于 LLM 的压缩器及通用压缩器进行了实验对比。
我们的结果表明,新提出的基于 DLM 的压缩框架推进了无损文本压缩的最先进水平。此外,由于 DLM 仍是一个相对年轻的范式,近期在功能更强大、效率更高的模型上的进展表明,该系统还有相当大的进一步改进空间。
## 引言
数据压缩是计算机科学中最基本的问题之一,直接影响存储成本、数据传输速度、能耗以及 HPC 系统的可扩展性。数字数据的快速增长——在很大程度上由训练和部署 AI 模型所需的大规模数据集所推动——使这些问题日益紧迫。在增长最为迅猛的数据类型中,文本数据尤为突出:纯文本、源代码以及 XML 和 JSON 等结构化格式如今已遍布全球各大数字档案中。其中最突出的例子包括 [Common Crawl](https://arxiv.org/html/2608.11249#bib.bib53)(Common Crawl Foundation,2007)——最大的纯文本网络数据开放仓库之一,以及 [Software Heritage](https://arxiv.org/html/2608.11249#bib.bib13)(Software Heritage,2025)——最大的公共源代码档案库。
此类档案中的很大一部分属于冷存储范畴:这些系统针对海量数据集的长期低成本保存进行了优化,数据通常只写入一次,检索频率极低。在这种环境下,压缩比是最主要的关注点——即使以较慢的压缩速度为代价。通用压缩器(如 zstd 或 lzma)提供了良好的速度—压缩比权衡,却无法捕捉自然语言中固有的语法和词汇规律,从而留下了大量可观的压缩收益未能利用。
这一局限,再加上可以追溯到 [Shannon,1951](https://arxiv.org/html/2608.11249#bib.bib28) 的“准确语言预测与压缩效率密切相关”这一著名联系,催生了越来越多基于大型语言模型(LLM)的无损文本压缩研究工作,例如 [Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18)、[Valmeekam 等人,2023](https://arxiv.org/html/2608.11249#bib.bib17)、[Narashiman 与 Chandrachoodan,2024](https://arxiv.org/html/2608.11249#bib.bib19)、[Delétang 等人,2024](https://arxiv.org/html/2608.11249#bib.bib22)。这些方法已被证明非常有效,其压缩比远超通用工具,因此在冷存储档案中尤其具有应用前景。然而,即使在速度要求相对宽松的冷存储场景中,这些方法的吞吐量仍然低得无法实际使用;由于自回归 LLM 被限制为顺序生成符号,推理过程主导了计算成本。因此,我们需要新的基于神经网络的架构,在保持 LLM 压缩质量的同时提供更好的速度性能。
在这项工作中,我们首次在神经无损文本压缩领域引入扩散语言模型(DLM),将其作为自回归 LLM 方法的一种替代推断范式。与自回归 LLM 不同,DLM 将每次推断步骤中要编码哪些符号变成了一种设计选择,而非模型约束,从而可以独立控制编码符号的数量和位置。因此我们认为,DLM 每次前向传播可预测多个符号的能力,可被用来缓解“每步一个符号”推断带来的架构瓶颈。然而,这需要解决 DLM 架构带来的两个主要算法挑战:第一个涉及 DLM 在压缩过程中采用的符号确定调度;第二个则与如何构造有效的初始上下文有关,以便让 DLM 避免低效的首步预测,从而提升压缩质量。我们设计了解决这两个挑战的策略,并在 enwik8——该场景中一个广为接受的基准([Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18))——上与基于 LLM 的压缩器和通用压缩器进行了实验对比。我们基于 DLM 的压缩器在压缩率—吞吐量权衡上优于先前的神经方法,并为未来研究开辟了有前景的方向。
### 最新进展
利用神经网络进行无损数据压缩的想法并不新鲜([Mahoney,2000](https://arxiv.org/html/2608.11249#bib.bib14);[Schmidhuber 和 Heil,1996](https://arxiv.org/html/2608.11249#bib.bib15))。然而,神经语言模型的最新进展重新激发了人们的兴趣,形成了两条主要流水线:(i) 将神经模型作为概率估计器,与统计编码器(通常是算术编码,[Witten 等人,1987](https://arxiv.org/html/2608.11249#bib.bib23))配合使用;或者 (ii) 将神经模型作为符号排序流水线([Shannon,1951](https://arxiv.org/html/2608.11249#bib.bib28))中的预测器,与通用压缩器配合使用。
前一类方法包括 *DeepZip*([Goyal 等人,2018](https://arxiv.org/html/2608.11249#bib.bib16))和 *NNCP*([Bellard,2021](https://arxiv.org/html/2608.11249#bib.bib20)),它们将基于 RNN/LSTM 的预测器与算术编码相结合,以高昂的计算成本换取了颇具吸引力的压缩比。Transformer 架构([Vaswani 等人,2017](https://arxiv.org/html/2608.11249#bib.bib21))的引入标志着一个转折点,使基于 LLM 的方法成为设计概率估计器的最强候选者。*LLMZip*([Valmeekam 等人,2023](https://arxiv.org/html/2608.11249#bib.bib17))是最早将 LLM 与符号排序和算术编码相结合的方法之一。*FineZip*([Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18))随后通过 LoRA 对 *LLMZip* 进行了参数高效微调扩展;而 *AlphaZip*([Narashiman 和 Chandrachoodan,2024](https://arxiv.org/html/2608.11249#bib.bib19))则专注于将更小的模型与 gzip 或 Brotli([Alakuijala 等人,2018](https://arxiv.org/html/2608.11249#bib.bib24))搭配使用。最近,[Delétang 等人(2024)](https://arxiv.org/html/2608.11249#bib.bib22)研究了将算术编码与三种不同规模的基座模型结合使用,展示了预训练模型可以充当跨文本、视频和图像的压缩器。[Heurtel-Depeiges 等人(2024)](https://arxiv.org/html/2608.11249#bib.bib55)将这一分析扩展到字节级多模态压缩,表明即使考虑到模型大小,小型预训练模型也能胜过标准压缩器,尽管它们在未见过的模态上仍表现不佳。最后,[Nardone 和 Ferragina(2026)](https://arxiv.org/html/2608.11249#bib.bib58)研究了 30 个用于源代码压缩的预训练 LLM,表明压缩率—吞吐量权衡在很大程度上取决于模型规模和量化方式,小型模型可实现高吞吐量,并且源代码比普通文本更容易压缩。
尽管存在种种差异,所有这些方法都有一个共同的局限:尽管在压缩比上优于通用压缩器,但它们的吞吐量受到严重限制。由于 Transformer 的计算量随上下文长度呈二次方增长,近期工作([Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18);[Delétang 等人,2024](https://arxiv.org/html/2608.11249#bib.bib22))试图通过将输入划分为独立压缩的块来实现多 GPU 并行处理。这一策略会略微降低压缩质量,但并未在吞吐量上带来显著改进,吞吐量仍停留在每秒数千比特的量级([Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18)),因此即使采用多 GPU 并行化,这些方法也难以实用。
关键的是,在这种场景下,吞吐量很少被当作主要指标:事实上,[Delétang 等人(2024)](https://arxiv.org/html/2608.11249#bib.bib22)没有报告显式的时间数据,而解压时间在这些工作中从未被报告过。最近,[Nardone 和 Ferragina(2026)](https://arxiv.org/html/2608.11249#bib.bib58)首次系统性地研究了压缩率—吞吐量权衡,表明可以通过适当的算法选择同时改进这两个指标,但所有这些方法仍然受制于 LLM 所采用的自回归范式。因此,在保持压缩率优势的同时缩小神经压缩器与通用压缩器在吞吐量上的差距,是一个关键挑战。我们认为,实现这一目标需要压缩范式的改变:吞吐瓶颈是架构性的,其根源在于 LLM 被设计为每次前向传播只生成一个符号——这是自回归下一符号预测范式的直接后果,无法通过优化现有流水线来克服。
### 本文贡献
基于上述局限,我们在神经无损压缩方面做出了以下贡献。
1. 我们首次在文献中引入扩散语言模型(DLM)用于无损文本压缩,建立了一种新的非自回归压缩范式。与自回归 LLM 不同,DLM 将每次推断步骤中要编码哪些符号变成了一种设计选择,而非模型约束,从而可以独立控制编码符号的数量和位置。我们使用 *LLaDA*([Nie 等人,2025](https://arxiv.org/html/2608.11249#bib.bib29))对框架进行了实例化——这是 Hugging Face 上发布的首批掩码 DLM 之一,在语言建模方面与 LLaMA 3 8B([Grattafiori 等人,2024](https://arxiv.org/html/2608.11249#bib.bib30))等自回归 LLM 具有竞争力。
2. 我们的范式转变需要解决由 DLM 架构带来的两个新的算法挑战。第一个挑战涉及压缩过程中采用的符号确定调度;第二个挑战则依赖于提供任意初始上下文的能力,以避免低效的首步预测、减少符号生成阶段的数量,从而提升压缩性能。我们设计并评估了多种策略,以便高效(参照吞吐量)且有效(参照压缩比)地解决这两个挑战,从而在提升预测质量的同时避免浪费推理时间。
3. 我们在 enwik8——与先前工作共用的标准基准([Mittu 等人,2024](https://arxiv.org/html/2608.11249#bib.bib18))——上,将我们基于 DLM 的压缩框架与先前基于 LLM 的方法以及通用压缩器进行了实验对比。我们的结果验证了理论分析,并确认基于 DLM 的压缩器推进了神经无损压缩的最先进水平,更接近可实际使用的端到端神经压缩器。此外,DLM 仍是一个相对年轻的范式,近期进展已经表明未来还有相当大的改进空间。
## 理论基础
### 通用压缩器
现代通用压缩器遵循三种主要算法范式,区别在于它们如何识别并对冗余进行编码。统计压缩器先进行建模阶段,即预先估计或固定符号概率,然后使用哈夫曼编码([Huffman,1952](https://arxiv.org/html/2608.11249#bib.bib31))、算术编码([Rissanen 和 Langdon,1979](https://arxiv.org/html/2608.11249#bib.bib32))或非对称数字系统([Duda,2009](https://arxiv.org/html/2608.11249#bib.bib54))等熵编码器进行编码。我们采用区间非对称数字系统(rANS),它在接近最优的熵编码效率与高吞吐量之间取得了良好平衡。基于字典的压缩器通过字典引用来利用重复子串,通常基于 LZ77([Ziv 和 Lempel,1977](https://arxiv.org/html/2608.11249#bib.bib35))。我们考虑了三种代表性实现:gzip([Deutsch,1996](https://arxiv.org/html/2608.11249#bib.bib36))、lzma([Pavlov,2024](https://arxiv.org/html/2608.11249#bib.bib37))和 zstd([Collet 和 Kucherawy,2018](https://arxiv.org/html/2608.11249#bib.bib38))。最后,块排序压缩器先应用可逆的 Burrows-Wheeler 变换(BWT)([Burrows 和 Wheeler,1994](https://arxiv.org/html/2608.11249#bib.bib39)),再依次使用 Move-to-Front(移至前端)([Bentley 等人,1986](https://arxiv.org/html/2608.11249#bib.bib40))、游程编码([Ferragina,2023](https://arxiv.org/html/2608.11249#bib.bib41))和熵编码器。我们使用代表性实现 bzip2([Seward,1996](https://arxiv.org/html/2608.11249#bib.bib25))。
### 基于神经语言模型的压缩器
基于神经语言模型的压缩器专门针对文本数据,其压缩比远超通用工具。它们可集成到两条主要流水线中:将预测分布输入统计编码器,或将其用于符号排序流水线。
#### 预测式方法
这类方法属于统计方法,主要解决“下一符号预测”任务,其定义如下。
###### 定义 1.
设 \(S = s_1, \dots, s_n\) 是字母表 \(\Sigma\) 上的一个符号序列,并令 \(W_{t,k} = s_{t-k}, \dots, s_{t-1}\) 表示序列 \(S\) 中位置 \(t\) 之前的 \(k\) 个符号的窗口(上下文)。下一符号预测为每个 \(t\) 估计一个关于 \(\Sigma\) 的分布 \(p(\cdot \mid W_{t,k})\),以最大化 \(p(s_t \mid W_{t,k})\)。
这类方法的经典实例是 PPM([Cleary 和 Witten,1984](https://arxiv.org/html/2608.11249#bib.bib42);[Moffat,1990](https://arxiv.org/html/2608.11249#bib.bib43);[Cleary 和 Teahan,1997](https://arxiv.org/html/2608.11249#bib.bib45);[Ferragina,2023](https://arxiv.org/html/2608.11249#bib.bib41)),它在前缀 \(W_{t,t-1}\) 上使用显式的可变长度上下文匹配。大型语言模型(LLM)则是一种强大得多的实例化:它们通过链式法则为符号序列赋予联合概率分布,以优化语言建模目标:
\[
p_\theta(S) = \prod_{t=1}^n p_\theta(s_t \mid s_{<t})
\]相似文章
@_akhaliq: Unlocking Lossless Speedups in LLMs via Discrete Diffusion 论文: https://huggingface.co/papers/2609.04010…
本文提出了一种使用离散扩散的方法,以在大型语言模型中实现无损加速,旨在提高效率而不影响性能。
HyperZip:通过超网络实现基于个性化扩散大语言模型的高效数据压缩
HyperZip 提出了一种高效的基于大语言模型的无损数据压缩框架。该框架利用基于扩散的大语言模型、Multi-Token Prediction(多词元预测)以及超网络,无需微调即可让模型适配目标数据,从而在压缩率与吞吐量之间实现了优于自回归基线的权衡。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
@DailyDoseOfDS_: 将任意自回归LLM转换为扩散LM。dLLM是一个Python库,统一了扩散语言模型的训练与评估…
dLLM是一个开源Python库,能以极少的计算资源将任意自回归语言模型转换为扩散语言模型,统一训练和评估。
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。