潜意识时钟:扩散语言模型中的潜在时间建模

arXiv cs.AI 论文

摘要

本文证明,扩散语言模型(DLM)在其残差流中内部将去噪进度表示为潜在时间步信号,可通过探针检测并引导来调节模型的置信度和熵。

arXiv:2607.01774v1 公告类型:新 摘要:扩散语言模型(DLM)近期已成为自回归模型的一种有前景的替代方案。与标准基于扩散的方法不同,DLM 并未显式地以时间步为条件,这引发了一个自然问题:这些模型是否在内部表示去噪进度,以及此类信息如何在后续中使用?在本文中,我们表明 DLM 确实在其残差流中编码了与扩散时间步相关的潜在表示。我们发现,这种信号可以通过跨层的探针可靠地提取,表明去噪进度可以从内部激活中解码。我们进一步证明,沿着与推断时间步相关的低维子空间引导模型,可以系统地调节其对去噪进度的感知,从而导致模型置信度和熵的可预测变化。最后,我们分析了所识别表示的几何结构,表明它在激活空间中具有结构化且可解释的特性,并揭示了这些模型如何处理此类信号。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# 扩散语言模型中的潜在时间建模
来源:https://arxiv.org/html/2607.01774
## 潜意识时钟:扩散语言模型中的潜在时间建模

Maximo Rulli¹  Thomas Fontanari\*,¹  Simone Petruzzi\*,¹  Federico Alvetreti¹  Giorgio Strano¹  Donato Crisostomi¹  Giorgos Nikolaou²  Tommaso Mencattini²  Andrea Santilli³  Emanuele Rodol๠ Simone Scardapane¹  Alessio Devoto³

###### 摘要

扩散语言模型(DLMs)最近已成为自回归模型的一个有前景的替代方案。与标准的基于扩散的方法不同,DLMs 并未显式地以时间步为条件,这引发了一个自然的问题:这些模型是否在内部表示去噪进度,以及这类信息在下游如何被利用?在这项工作中,我们表明 DLMs 确实在其残差流中编码了与扩散时间步相关的潜在表示。我们发现,通过跨层的探针可以可靠地提取该信号,这表明去噪进度可以从内部激活中解码。我们进一步证明,沿着与推断时间步相关的低维子空间引导模型,可以系统地调节其对去噪进度的概念,从而导致模型置信度和熵的可预测变化。最后,我们分析了所识别表示的几何结构,表明它在激活空间中展现出结构化和可解释的特性,并揭示了这些模型如何处理此类信号。

潜意识时钟:扩散语言模型中的潜在时间建模

††\* 同等贡献。¹ 罗马大学  ² 洛桑联邦理工学院  ³ 独立研究员
通信邮箱:[email protected]。

## 1 引言

大型语言模型(LLMs)(Anthropic, 2025 (https://arxiv.org/html/2607.01774#bib.bib33); Meta AI, 2025 (https://arxiv.org/html/2607.01774#bib.bib29); Achiam 等, 2023 (https://arxiv.org/html/2607.01774#bib.bib30); DeepSeek-AI, 2024 (https://arxiv.org/html/2607.01774#bib.bib34); Gemma Team, 2025 (https://arxiv.org/html/2607.01774#bib.bib32)) 正在推动各种科学和社会领域的范式转变。理解这些模型的能力仍然是一个活跃的研究领域。许多工作旨在描述这些模型激活特征所张成的流形和子空间 (Saglam 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib13); Tiblias 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib8); Joshi 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib7); Shai 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib9); Bhalla 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib14)),帮助解释它们如何在计算中表示和转换概念。

参考图示

图 1:LLaDA 潜在去噪步建模的 3D 投影。LLaDA 将其 τ 子空间表示为一个低维流形曲线,逐步对从全 [mask](红色)到无剩余 [mask](紫色)的去噪进度进行建模。

最近,大规模掩码扩散语言模型 (Nie 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib38); Zhu 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib40); Ye 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib39)) 已成为文本生成的另一种范式。它们不是严格从左到右生成,而是以 BERT 风格 (Devlin 等, 2019 (https://arxiv.org/html/2607.01774#bib.bib36)) 逐步去噪 [mask] 标记;在本文中,我们将这种掩码标记家族称为 DLMs。尽管对 DLMs 的兴趣日益增长,但大多数现有研究主要集中在提高其效率和生成质量上 (Wu 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib54); Arriola 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib49); Du 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib41); Zekri 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib42); Yu 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib52))。相比之下,它们的内部机制和表示仍然很大程度上未被探索。最近,少量但不断增长的工作开始研究这些模型的可解释性。例如,Wang 等人 (2026 (https://arxiv.org/html/2607.01774#bib.bib4)) 在 LLaDA 和 Dream 上训练稀疏自编码器 (Cunningham 等, 2023 (https://arxiv.org/html/2607.01774#bib.bib2)),以实现推理时的概念引导;Rulli 等人 (2025 (https://arxiv.org/html/2607.01774#bib.bib19)) 分析了注意力汇点在去噪步骤中的移动情况,以及 DLMs 对剪枝这些汇点的鲁棒性;Wen 等人 (2026 (https://arxiv.org/html/2607.01774#bib.bib5)) 展示了如何操纵 [mask] 标记以诱导有害或欺骗性的生成;Piskorz 等人 (2025 (https://arxiv.org/html/2607.01774#bib.bib6)) 表明 DLM 的性能受每个去噪步骤中 [mask] 标记数量的强烈影响。虽然这些工作提供了对 DLM 行为的有价值的见解,但去噪过程本身的内部动态仍然难以捉摸。特别是,目前尚不清楚 DLMs 是否在生成过程中内部表示去噪进度。先前的理论工作表明,吸收态 DLMs 的强大性能可能很大程度上归因于 [mask] 标记的特殊作用:逆向过程只需要去噪被掩码的位置,并且相应的分数可以表示为干净数据条件分布,直到一个解析的时间相关因子 (Ou 等, 2024 (https://arxiv.org/html/2607.01774#bib.bib1))。作为补充,掩码扩散目标可以重新表述为掩码标记数量的函数,使得连续去噪时间与掩码率的松弛密切相关,并将这些模型与时间无关的掩码模型联系起来 (Zheng 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib47))。这使得掩码标记的分数成为去噪进度的自然可观察代理,但模型中是否以及如何内部表示这样的信号仍是一个未解问题。

在这项工作中,我们通过以下三个研究问题来调查这一点:

RQ1 扩散语言模型是否内部表示与去噪步骤相关的信号?

RQ2 所识别的信号对生成过程是否重要?修改它如何影响模型的下游计算?

RQ3 该信号表现出什么特征?是否存在统一的模型级表示?

我们分三个阶段解决这些问题:首先探测去噪时间信息,然后因果性地引导恢复的信号,最后描述其跨层的几何结构。我们选择 LLaDA-1.5 (Zhu 等, 2026 (https://arxiv.org/html/2607.01774#bib.bib40))(以下简称 LLaDA)和 Dream (Ye 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib39)) 这两个代表性的大规模掩码扩散语言模型进行分析。

## 2 背景

DLMs 被训练来从一个干净序列 x₀ 的损坏版本中恢复它 (Li 等, 2022 (https://arxiv.org/html/2607.01774#bib.bib62); Sahoo 等, 2024 (https://arxiv.org/html/2607.01774#bib.bib43); Ou 等, 2024 (https://arxiv.org/html/2607.01774#bib.bib1); Shi 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib44))。在吸收态模型中,损坏序列 xₛ 通过将其一部分位置替换为特殊的 [mask] 标记从 x₀ 获得。我们定义:

M(xₛ) = {j : xₛʲ = [mask]}

为被掩码位置的集合。标量 s ∈ [0,1] 控制损坏程度:s=0 恢复干净序列,而 s=1 掩码所有位置。在训练期间,噪声水平 s ∼ U(0,1] 被采样,每个位置根据前向过程独立损坏:

xₛʲ ∼ Cat(· ; p = (1-s) x₀ʲ + s [mask])

因此位置 j 以概率 1-s 保留其原始标记,以概率 s 被替换为 [mask]。DLM pθ 将损坏序列 xₛ 作为输入,并在每个位置 j 预测一个在原始词汇表 V 上的分布 pθ(x₀ʲ | xₛ)。训练最小化仅在被掩码位置应用的交叉熵损失,并重新加权 1/s:

- E_{x₀, s, xₛ} [ (1/s) Σ_{j∈M(xₛ)} log pθ(x₀ʲ | xₛ) ]  (1)

推理通过 T 个去噪步骤的序列进行。生成在步骤 t=0 初始化,将 L 个 [mask] 标记附加到提示后,并在 t=T 结束,所有标记都未被掩码。在每个步骤 t,模型操作当前部分掩码的序列 xₜ 以获得每个被掩码位置的 pθ(· | xₜ),并根据一个解掩码策略选择 M(xₜ) 的一个子集来解掩码。该策略决定每步揭示多少标记。在推理时,我们将未掩码标记的比例测量为:

τₜ := 1 - |M(xₜ)| / L  (2)

在附录 A (https://arxiv.org/html/2607.01774#A1) 中,我们提供了关于 τₜ 如何期望上等价于连续扩散时间变量 s 的补集的更多细节。

参考图示

图 2:MLP 探针恢复 τ 信号。R² 系数(越高越好)随着我们深入模型而下降,到 MSE 几乎减少到 τ 方差的一半。此外,[mask] 和非 [mask] 标记似乎都携带此信息,达到同样高的系数。

因此,我们将 τₜ 解释为去噪进度的经验度量,并将其用作掩码扩散语言模型中去噪时间概念的代理。

## 3 恢复 τ

在本节中,我们通过尝试从模型的隐藏状态中恢复 τ 信号来解决 RQ1 (https://arxiv.org/html/2607.01774#S1)。为了测试 τ 是否可以从模型的残差流中恢复,我们训练 MLP 探针,通过使用残差流隐藏状态作为输入来预测给定序列的当前 τₜ。具体来说,我们为模型中的每一层 l 拟合一个 MLP(φₗ(·) : ℝᵈ → (0,1)),其中 d 是隐藏状态的维度(参见附录 B (https://arxiv.org/html/2607.01774#A2) 了解架构和训练细节)。每个 MLP 被训练来最小化回归损失:

L_MLP = E_{t,n,j} [ (τₜ - φₗ(h_{t,l,n}ʲ))² ]

其中 n 是样本索引,j 是样本序列中的标记索引,h_{t,l,n}ʲ 表示隐藏状态。在整个工作中,我们使用 E_r 来表示对相应量 r 的经验期望。我们为 LLaDA 和 Dream 的每一层拟合单独的探针。此外,我们改变用于训练的子集,仅考虑 [mask] 标记、非 [mask] 标记或所有标记。这使我们能够调查 τ 相关信息是否优先编码在特定类型的标记中。

图 2 (https://arxiv.org/html/2607.01774#S2.F2) 显示了 LLaDA 每一层获得的 R²。探针在模型的所有层上保持 R² > 0.5,表明关于 τ 的信息在网络的整个深度中一致地表示。性能在最早期和最晚期的层中略有下降,表明表示在计算的边界处变得不那么可访问。我们在 Dream 上观察到类似的趋势(参见附录 C (https://arxiv.org/html/2607.01774#A3))。

我们还发现,[mask] 标记对应的激活产生的预测略优于非 [mask] 标记,尽管两种标记类型都支持准确的恢复。这表明 τ 信息并非仅局限于被掩码位置,而是分布在整个残差流中。

重要的是,每个 MLP 探针独立操作于单个隐藏状态,无法访问任何序列级上下文或相邻激活,这暗示单个标记表示本身编码了大量关于 τ 的信息。因此,探针的高性能表明单个标记表示携带了序列级统计量 τ 的潜在表示。

因此,我们对 RQ1 (https://arxiv.org/html/2607.01774#S1) 给出肯定回答,并得出结论:DLMs 确实在内部建模与当前去噪步骤相关的信号。在下一节中,我们展示与 τ 相关的信号的自然构造,并利用它在推理时引导模型。

✓ RQ1 的结论 *扩散语言模型确实内部编码了与去噪步骤相关的信号,并且我们可以准确地恢复它。*

## 4 评估信号的重要性

在确定 DLMs 在其残差流中编码了去噪过程的信息后,我们现在研究该信号是否可以被明确提取并用于引导模型。具体来说,我们旨在识别激活空间中与去噪时间统计量 τ 相关的方向,并研究沿着这些方向进行引导是否会在推理过程中改变模型的行为。

### 4.1 近似 τ

为了表征和近似 τ 的内部表示,我们转向平均激活向量 (Gurnee 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib3); Wang 等, 2025 (https://arxiv.org/html/2607.01774#bib.bib25); Panickssery 等, 2024 (https://arxiv.org/html/2607.01774#bib.bib24))。这种方法的关键直觉是,对许多样本的激活进行平均会抑制具体实例的信息,同时保留在示例间共享的系统性信号,例如与 τ 相关的信号。

遵循 Wang 等人 (2025 (https://arxiv.org/html/2607.01774#bib.bib25)) 的方法,我们计算响应窗口内所有隐藏状态的平均激活向量,并根据其去噪步骤进行分组。更正式地,对于每个去噪步骤 t 和层 l,我们定义:

μ_{t,l} := E_{n,j} [ h_{t,l,n}ʲ ]  (3)

我们将去噪过程离散化为 100 个区间,每层产生 100 个平均向量。这为 LLaDA 产生 3200 个平均向量,为 Dream 产生 2800 个。

为了验证计算出的平均向量是否捕获了第 3 节 (https://arxiv.org/html/2607.01774#S3) 中探针识别的相同信号,我们评估探针预测 φₗ(μ_{t,l}) 与归一化时间步索引 t/100 之间的相关性。如果两种方法捕获了类似的潜在方向,那么探针应该随着平均向量索引的增加而表现单调。对于 LLaDA,相关性达到 Pearson 0.976 和 Spearman 0.980,而对于 Dream,分别达到 0.962 和 0.974。此外,如图 3 (https://arxiv.org/html/2607.01774#S4.F3) 所示,探针预测几乎与每个平均向量编码的去噪区间完美对齐。这些结果表明,探针识别的 τ 信息不仅可以在标记级别恢复,而且在跨示例平均后,在残差流中作为稳健的全局结构出现。在 o 我们

相似文章

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。

扩散模型的时间差分学习

arXiv cs.LG

本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。

连续潜在扩散语言模型

Hugging Face Daily Papers

Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。