AURORA-LM:用于连续潜空间扩散语言建模的自编码统一表示
摘要
AURORA-LM 提出了一种连续潜空间扩散语言模型,将可解码的文本表示与分布建模分离,在 OpenWebText 和 XSum 上取得了强劲性能,并扩展到 1B 参数规模。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - AURORA-LM:用于连续潜空间扩散语言建模的自编码统一表示
来源:https://huggingface.co/papers/2608.02602 发布于 8 月 3 日
#2 每日论文 (https://huggingface.co/papers/date/2026-08-05) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
语言在生成式建模中仍然是一个异类:虽然图像、视频和音频越来越多地在连续潜空间中进行建模,但文本生成仍然主要依赖离散 token。现有的连续语言模型要么继承了并非为联合生成和解码而设计的嵌入空间,要么压缩自编码潜变量以简化扩散过程,从而牺牲了 token 级别的保真度。我们没有简化表示来适应生成模型,而是保留了一个高容量、可解码的文本潜变量,并设计扩散模型直接学习其分布。我们引入了 AURORA-LM,一种连续潜空间扩散语言模型,它将可解码文本表示的构建与其分布的建模分离开来。基于查询的编码器-解码器(Query-based Encoder-Decoder)将文本组织成一个高容量、前缀对齐的潜变量序列,而块因果扩散 Transformer(Block-causal Diffusion Transformer)通过流匹配学习其分布,从左到右生成块,同时并行地对每个块内的位置进行去噪。由于这种潜变量对于扩散模型来说更难建模,AURORA-LM 仅限制噪声输入路径,同时保留完整的干净潜变量预测目标,从而在不降低解码器面向容量的情况下容纳全宽度潜变量。我们进一步将噪声级别分布校准到潜变量宽度,并引入自轨迹一致性(self-trajectory consistency),以弥合独立采样的训练噪声与推理时的迭代去噪之间的差距。AURORA-LM 在 OpenWebText 自由生成和 XSum 摘要任务上,在所有评估的连续和基于扩散的语言模型中取得了最强性能。将模型扩展到 1B 参数,总计算量约 1500 EFLOPs,带来了进一步提升,在匹配的评估协议下超越了更大的公开发布的潜空间扩散语言模型。所有实验均在昇腾 NPU 上进行。
查看 arXiv 页面 (https://arxiv.org/abs/2608.02602) 查看 PDF (https://arxiv.org/pdf/2608.02602) 项目页面 (https://aurora-lm-project.github.io/) GitHub7 (https://github.com/fyv587/AURORA-LM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02602)
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.02602 即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.02602 即可从此页面链接到该数据集。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2608.02602 即可从此页面链接到该 Space。
收录此论文的集合0
没有集合收录此论文
将此论文添加到集合 (https://huggingface.co/new-collection) 即可从此页面链接到该集合。
相似文章
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
通过熵门控连续比特流扩散缩小语言建模中的自回归差距
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。
连续潜在扩散语言模型
Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
LangFlow:连续扩散在语言建模中可与离散扩散相媲美
LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。