如何引导您的语言流
摘要
本文介绍了探针引导,一种用于连续扩散语言模型中流匹配模型的新方法,该方法在无条件生成上实现了最先进的性能,并提升了多项选择问答基准,同时提供了对自引导的见解。
arXiv:2609.19356v1 公告类型:新
摘要:我们介绍了一种引导流匹配模型的新方法。我们的方法,我们称之为探针引导,使用现有扩散模型的冻结内部状态来构建引导信号。它的工作原理与自引导类似,但在推理时无需额外的前向传播,并提供了一条可靠的路径来确保弱模型和强模型共享相似的动态。我们将此方法应用于连续扩散语言模型并进行基准测试,其中探针引导在无条件生成上设立了新的最先进性能。当应用于一个1.7B的扩散语言模型时,探针引导持续改善多项选择问答基准。使用我们的探针,我们研究了传统的自引导设置,其中强模型是弱检查点,发现弱模型必须来自训练的低熵区域。这些发现不仅提供了改进扩散语言模型的实用方法,还揭示了自引导背后的实际机制,目前对此理解不足。
查看缓存全文
缓存时间: 2026/09/18 08:52
# 如何引导你的语言流
**来源:** https://arxiv.org/html/2609.19356
**作者:** Tianrong Chen, Yuyang Wang, David Van Valen, Josh Susskind, Miguel Angel Bautista
**日期:** 2026年9月16日
###### 摘要
我们引入了一种新的引导流匹配模型的方法。该方法我们称之为**探针引导**,它利用现有扩散模型的冻结内部状态来构建引导信号。其工作原理与自引导类似,但无需在推理时进行额外的前向传播,并提供了一条可靠的路径,以确保弱模型和强模型具有相似的动态特性。我们在连续扩散语言模型上应用并基准测试了这种方法,其中探针引导在无条件生成上建立了新的最先进性能。当应用于一个17亿参数的扩散语言模型时,探针引导在多项选择问答基准测试中持续带来提升。利用我们的探针,我们研究了传统的自引导设置(其中强模型是一个弱检查点),并发现弱模型必须来自训练的低熵区域。这些发现既为改进扩散语言模型提供了实用方法,也揭示了目前理解不足的自引导背后的实际机制。
††工作在R.D.担任Apple实习生期间完成。
## 1 引言
扩散和流匹配模型是连续空间(从图像到视频再到蛋白质)生成的主流范式(Esser et al., 2024;Ho et al., 2022;Lai et al., 2025;Wang et al., 2026;Abramson et al., 2024)。它们的成功启发了训练扩散语言模型(dLMs)的努力,这些模型将扩散原理应用于离散空间中的文本生成(Li et al., 2025;Shi et al., 2024;Sahoo et al., 2024)。这些方法与典型的自回归模型(Radford et al., 2019)形成对比,它们从一个受损状态同时生成标记,而不是按顺序一次生成一个。虽然大多数语言扩散模型是在离散空间上构建的,但最近的一系列工作研究了*连续*扩散模型,这些模型将高斯先验与数据之间的插值定义为连续随机变量(Chen et al., 2026;Lee et al., 2026;Davis et al., 2026;Roos et al., 2026;Hu et al., 2026)。这些模型继承了连续扩散的许多进展。一个特别强大的技术是引导,它在推理时调整扩散模型的输出,以更好地与给定奖励对齐。最广泛的引导方法是无分类器引导(CFG),其中引导信号来自类别条件模型与无条件模型之间的差异(Ho and Salimans, 2022;Chung et al., 2025)。最近的工作引入了自引导,其中引导信号来自主模型与较弱模型之间的差异(Karras et al., 2024)。
(a)无条件生成。(b)多项选择评估。
图1:探针引导改善了数据空间(FLM)和潜在空间(ELF)模型在(a)无条件生成和(b)多项选择评估上的性能。在无条件生成上,探针引导将ELF-L在OWT数据集熵为5.40时的genPPL分数降至23。在多项选择评估中,我们发现所有类别均有改善或持平。
尽管引导在扩散中至关重要,但将其应用于dLMs一直具有挑战性。一些dLMs,如ELF(Hu et al., 2026),使用带有自条件的CFG,其中条件信号是模型自身对后验均值的估计。这提供了一个权衡质量与多样性的调节旋钮。然而,尽管自条件显著提高了dLM质量(Chen et al., 2026),但其工作原理尚不清楚;正如我们在工作中展示的,探针引导一致地帕累托支配自条件。此外,由于自条件需要额外的无条件传播,它增加了训练成本并使扩展更加困难。FLM(Lee et al., 2026)使用自引导,其中弱模型是通过对强模型进行各向同性dropout获得的;尽管这略微提高了性能,但弱模型不与强模型共享动态特性,而这在自引导中已知很重要(Karras et al., 2024)。在这两种情况下,扫描引导强度都会在质量和多样性之间描绘出帕累托曲线。
这项工作引入了一种新的引导方法,我们称之为探针引导,并研究了其在扩散语言模型环境中的影响。引导信号来自一个轻量级的MLP探针(≈模型计算量的2%),该探针在dLM内的冻结隐藏状态上训练。在推理时,这些探针用于引导无条件生成。在本工作中,我们研究了以下场景:
**效率**
与自引导(需要对弱模型进行完整的额外传播)相比,探针引导所需FLOPs减少了1.4-2.0倍。这些探针可以使用≈1%的额外训练计算来训练。
**无条件生成:**
当前的连续dLMs使用带有自条件的CFG或自引导来引导生成。应用于像ELF这样的潜在模型,探针引导在熵为5.40时实现了最先进的GenPPL分数23。在像FLM这样的数据空间模型上,探针引导支配了自引导的帕累托前沿。
**多项选择问答:**
探针引导持续提升了一个17亿参数的连续dLM(Davis et al., 2026)在一系列似然评估上的性能。作为补充贡献,我们展示了如何调整似然估计器以使其适用于引导。
**引导动态:**
自引导在语言中一直难以实现。我们研究了dLMs的训练动态,发现潜在和数据空间的dLM训练都显示出熵快速增加的时期。我们证明自引导要求弱模型来自攀升前的低熵区域。实际上,探针引导提供了一种高效可靠的方法来改善连续扩散语言模型的性能。更普遍地说,使用冻结特征提供了一种简单的方法来控制弱模型的强度,并研究有效引导的要求。
## 2 背景与相关工作
**扩散语言模型。**
扩散和流匹配模型通过将ODE或SDE参数化为神经网络,将噪声推向数据。干净数据在不同噪声水平下被破坏,然后训练一个网络来估计在当前损坏水平和带噪数据条件下干净数据。早期工作(Ho et al., 2020)将此过程表述为一系列离散转换,而随后的得分匹配(Song et al., 2020)和流匹配(Lipman et al., 2022)工作将网络建模为分布之间的连续场。具体来说,流匹配通过采样ε∼p_prior和x∼p_data构造一个条件插值,并写出x_t=α_t x + σ_t ε,其中标准选择是线性插值α_t=t, σ_t=1−t。给定一个神经参数化的速度v=ẋ=x−ε,可以通过从x_0∼p_prior采样并运行ODE dx=v dt来从p_data采样。流匹配的完整介绍见附录B.1。我们遵循近期工作,通过后验均值参数化速度(Li and He, 2026)。
v = E[x|x_t, t] - x_t / (1−t) = (x_θ(x_t, t) - x_t) / (1−t) (2.1)
这个公式可以使用任何Bregman散度进行优化,这在离散设置中特别有用(见附录B)。
**扩散语言模型**
扩散模型通过离散状态转换被推广到离散空间(Austin et al., 2021)。最近,许多方法考虑了如何将流匹配等连续公式应用于离散设置。嵌入空间方法,如ELF、Diffusion-LM(Li et al., 2022)和CDCD(Dieleman et al., 2022),将高维词汇表编码在压缩嵌入中,并在嵌入空间中执行扩散。单纯形模型,如TESS(Mahabadi et al., 2024)和Bit-diffusion(Chen et al., 2022),直接在概率单纯形上形成扩散轨迹。
**引导**
引导可以广泛地表达为以下形式,其中引导的具体形式由引导向量D(x_t, t, c)决定。
v_guided(x_t, t, c) = v_θ(x_t, t, c) + λ D(x_t, t, c) (2.2)
例如,无分类器引导(Ho and Salimans, 2022)设置D(x_t, t, c)=v_θ(x_t, t, c)−v_θ(x_t, t, ∅)。自引导(Karras et al., 2024)允许无条件采样,设置D(x_t, t, c)=v_strong(x_t, t, c)−v_weak(x_t, t, c),其中v_strong和v_weak是强模型和弱模型。我们的工作受到自引导的启发,它要求强模型和弱模型具有相关的动态特性(例如,各向同性地破坏模型不足以产生良好的引导信号)。因此,自引导通常使用主模型的早期检查点来实现,这满足了该要求,但在推理时使FLOPs加倍。我们在附录A中讨论了类似的引导工作。
(a)(b)
无分类器引导 D = net(z_t, c) - net(z_t, 0)
自引导 D = net_strong(z_t, c) - net_weak(z_t, c)
探针引导 x_strong, h_l = net(z_t, c)
D = x_strong - probe(h_l)
图2:我们的方法概述。(a)训练我们的探针时,我们从冻结的主模型主干中分离隐藏状态,并使用MLP预测流目标。这可以在训练期间完成,也可以在冻结骨干网络上进行短时微调。(b)无分类器引导和自引导需要两次单独的评估,而探针引导只需要评估一个小型MLP,该MLP位于前向传播期间计算的隐藏状态之上。
## 3 方法
**使用冻结状态进行引导。**
给定一个预训练的dLM,我们提取隐藏状态h_ℓ,其中ℓ索引层。对于使用散度D(例如,FLM的交叉熵损失或ELF的MSE损失)训练的流模型,我们使用以下目标训练探针:
L = E_{x,t,ε} [ Σ_ℓ D( x^w_θ(x_t, t, ℓ), x ) ]
x^w_θ(x_t, t) = MLP[ sg(h_ℓ) ] (3.1)
其中x是干净数据。换句话说,我们使用来自主模型主干的隐藏状态训练我们的探针(即,模型的弱版本)。梯度停止消除了平衡多个损失的需要,并防止弱路径破坏主干的训练动态。它还允许我们在同一个主干上同时训练多个探针。
在推理时,我们使用引导速度进行积分。具体地,令x^{s,w}_θ表示模型的强(s)和弱(w)输出。则
x_guided = x^s_θ(x_t, t) + (λ−1)( x^s_θ(x_t, t) − x^w_θ(x_t, t) ) (3.2)
速度更新使用公式2.1获得。我们采用λ=1恢复无引导的强模型,λ>1沿引导方向x^s_θ−x^w_θ外推的约定;图2展示了我们的训练设置,并比较了探针引导与CFG和自引导的推理成本。
**训练与推理**
由于训练探针不会影响主模型主干的梯度,训练我们的探针引导模型的成本是无梯度运行模型主干到出口层的成本,加上训练MLP探针的无注意力成本。因此,通过训练步数和每步训练成本来衡量,训练这些探针的成本是最低的。在推理时,基础隐藏状态始终为模型主输出计算,因此额外的推理成本仅为额外的MLP传播。这与标准自引导形成对比,后者需要两次前向传播:一次用于强模型,一次用于弱模型(通常是强模型的等效计算版本)。我们所有的实验都在x空间中进行预测并转换为速度。
## 4 无条件探针引导实验
在本节中,我们展示探针引导如何改善潜在和数据空间语言扩散模型的无条件生成。我们考虑两个主要的代表性方法:ELF,一个在T5-潜在空间中训练的潜在空间模型,和FLM,一个直接处理原始标记的数据空间模型(Hu et al., 2026;Lee et al., 2026)。相似文章
LangFlow:连续扩散在语言建模中可与离散扩散相媲美
LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。
Flow-Direct: 通过非参数引导场实现高效反馈与可复用的流模型引导
Flow-Direct 提出了一种用于基于流的生成模型的非参数引导场,该引导场持续累积奖励反馈,提高了反馈效率,并使得收集的样本可重复用于引导多目标生成,无需额外的奖励评估。
生存引导的长度控制以实现高效扩散语言模型
该论文提出了一种针对扩散语言模型的生存引导长度预测器,在推理和代码生成基准测试中,将推理速度提升高达7倍,而不牺牲准确性。
PathGuide:通过在线策略传输对齐的动态无分类器引导
PathGuide 将无分类器引导的选择重新表述为基于流的生成模型中的在线策略传输问题,利用连续性方程的弱形式动态优化引导尺度,以提高样本保真度。
FlowLM: 基于扩散-流适配的少步语言建模
FlowLM 提出了一种流匹配语言模型,通过高效微调从预训练扩散模型衍生而来,能够实现高质量少步文本生成,其效果可与2000步扩散采样相媲美,而训练轮次更少。