Spec-AUF:掩码块草稿模型中训练-推理不一致下的“接受直到失败”训练

arXiv cs.AI 论文

摘要

本文提出AUF(接受直到失败),这是一种针对推测解码中掩码块草稿模型的交叉熵损失的简单修改,它将监督限制到第一个预测失败之前的词缀,在不改变推理的情况下提升了多个基准测试的平均生成长度。

arXiv:2607.01893v1 公告类型:新论文 摘要:推测解码通过草拟一个令牌块供目标模型从左到右验证,仅提交最长的接受前缀,从而加速自回归生成。块(DLM风格)草稿模型并行预测整个块,这速度很快,但使用完整块的交叉熵进行训练,该损失对每个位置与黄金续接进行监督——尽管推理会丢弃第一个拒绝之后的所有令牌。最近的接受感知目标通过重新加权完整块损失来修补这一问题;我们则使用教师强制学习作为动机,说明监督应集中于接受前缀。仅掩码的块草稿模型没有输入端通道用于黄金前缀条件化,因此AUF通过仅保留交叉熵支持直到草稿模型的第一个预测失败,在损失侧近似这种前缀敏感的监督。AUF是对CE支持的单一切换更改——无需辅助目标、无需验证器展开、也无需改变推理流程或精确性契约。在固定草稿模型骨干和服务设置下(基于Qwen3-8B),AUF将DFlash草稿模型的平均生成长度τ(在六个基准测试上取平均)从2.40提升到2.61,每个基准测试均有提升,并且该改进可迁移至Domino的双分支头(从2.56到2.68)。两项发现使情况更加清晰:仅衰减基线的共享块掩码上达到了更高的令牌准确率但解码效果更差;而在DFlash上,一旦AUF截断了支持,标准指数位置衰减加权在经验上变得无效。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:46

# Spec-AUF:掩码块草稿器在训练-推理不一致下的“接受直至失败”训练

来源:https://arxiv.org/html/2607.01893

###### 摘要

推测解码通过让草稿模型生成一个令牌块,再由目标模型从左到右验证,并只提交最长的可接受前缀,从而加速自回归生成。块级(DLM风格)草稿器并行预测整个块,虽然速度快,但训练时使用完整块的交叉熵损失,对每个位置都根据真实连续进行监督——尽管推理时会丢弃第一个被拒绝位置之后的所有令牌。最近的“接受感知”目标函数通过重新加权完整块的损失来弥补这一缺陷;我们则利用教师强制学习作为动机,说明监督应如何集中在被接受的前缀上。由于纯掩码块草稿器在输入侧没有接收真实前缀的通道,AUF通过在损失侧将交叉熵的支持范围仅保留到草稿器预测的首次失败为止,来近似那种对前缀敏感的监督。AUF是对交叉熵支持范围的单一、独立修改——无需辅助目标、无需验证器展开、也无需改变推理流程或精确性契约。在固定草稿器骨干网络和服务设置下,针对Qwen3-8B,AUF将DFlash草稿器在六个基准测试上的平均发射长度τ从2.40提升至2.61,且在每个基准上均有提升;该方案也能迁移到Domino的双分支头部(从2.56提升至2.68)。两个发现使情况更加清晰:仅用衰减的基线在共享块掩码上达到了*更高*的令牌准确率,但解码效果*更差*;而在DFlash上,一旦AUF截断了支持范围,标准的位置指数衰减加权在实验上就变得无效了。

## 1 引言

推测解码通过让一个轻量级草稿模型提出几个未来令牌,并让目标模型在一次并行传递中验证它们,从而加速自回归语言模型的推理(Leviathan等人,2023;Chen等人,2023)。由于验证只接受与目标一致的最长前缀,因此推测解码的实际加速效果更多地取决于草稿模型生成一个能被目标接受的连续前缀的能力,而不是孤立的令牌准确率。一个草稿器如果在早期出错后还能正确预测后面的令牌,这些预测仍然是浪费的:一旦前缀中断,验证器就会拒绝后续部分。这一观察结果改变了我们看待草稿模型训练的方式。

标准的对齐目标训练草稿器在一个完整块上匹配目标令牌,通常带有一个手工设计的位置先验——一个随块位置衰减的固定权重,编码了早期令牌更重要的归纳偏差(例如,DFlash使用指数衰减)。这些目标认识到早期位置更重要,但它们仍然监督那些其吞吐率贡献取决于所有先前草稿令牌都被接受的令牌。因此,草稿模型的训练不仅是一个令牌对齐问题;还必须反映验证器使用的从左到右前缀契约。

我们的出发点是类比于自回归草稿模型的训练。在教师强制最大似然估计下,自回归草稿器在输入侧接收真实前缀,因此位置i的损失是在条件事件“前缀正确”下计算的。相比之下,掩码块草稿器没有这样的输入通道,因此必须从损失侧进行补偿。

基于接受感知的损失函数首先尝试通过重新加权来解决这个问题。D-PACE为每个位置i分配一个信用值g_i,该值分解为前缀接受门(一个平滑估计,表示草稿前缀通过位置i被接受的概率)乘以一个后续值。这个门是主导因素:D-PACE报告称,仅使用累积权重与固定衰减相比就恢复了大半增益,而仅使用后续值的变体则弱得多。参考信号因此是:位置i的训练信用应与它的前缀被接受的概率成比例,任何忽略这个门的损失函数在结构上都与推理奖励不一致。SpecDiff-2通过沿验证器采样的教师连续优化一个软前缀乘积奖励来最直接地弥合这一差距,但代价是需要这些展开和一个蒸馏过程;本文则尝试用一个硬性的、单样本的插入来近似同一个门,相关开发在第4节进行。

图1:自回归草稿模型的教师强制训练。模型在输入侧接收真实前缀并预测移位后的目标令牌,因此每个交叉熵项都在“前缀正确”的条件下进行训练。

#### 教师强制作为设计的来源。

这样做之所以自然,是因为教师强制。在自回归训练中,模型在给定真实前缀y< i^*的条件下预测y_i,并用令牌级别的交叉熵进行监督。在验证时,如果草稿前缀在位置j被拒绝,则j之后的所有位置无论预测质量如何都不会被提交——因此托管的监督是浪费的。教师强制自动避免了这种浪费:通过构造,每个预测都是以之前的所有真实令牌为条件的,因此监督永远不会被浪费在之后会被拒绝的事件上。掩码草稿器的对称缺失是驱动本工作的核心训练-推理不一致:一个并行预测的块在位置i处接收监督,但该位置对解码的贡献条件性地取决于之前位置的预测被接受。AUF通过切断交叉熵在草稿器自身的贪婪预测与目标令牌首次不匹配之后所有位置的支持范围来近似这种条件。

与D-PACE和SpecDiff-2的对比。两者都停留在完整的块支持上并重新加权;AUF改为选择性地训练一个子块。D-PACE在每个训练步骤计算整个块的信用g_i,保持对所有n个位置的监督,但按g_i加权;AUF将交叉熵支持范围从n个位置减少到j^*个位置,使用一个硬截止而非软加权。SpecDiff-2优化一个精确的预期奖励,该奖励源于从目标中采样的教师连续;AUF使用接受性质量的硬性一次采样,在草稿器的贪婪解码下评估。

## 2 预备知识

#### 符号表示。

令θ表示草稿模型,φ表示目标模型。在块大小为B的掩码块解码中,草稿器并行预测B个令牌:对于每个块偏移k∈{1,…,B},它输出一个分布p_θ(y_k|x, y_1…y_{k-1}^mask),其中mask表示在输入侧遮蔽了未来令牌。由于没有自回归依赖,草稿器可以在单次前向传播中生成整个块。验证器从左到右检查,从提议令牌和目标令牌之间的第一个不匹配处截断。令A~=argmax_k(∏_{i=1}^k q_φ(y_i|x)=0)为第一个被拒绝的位置(其中q_φ是目标模型的接受概率,定义为采样令牌等于目标令牌的概率,或在贪婪解码下直接比较),则提交的块通过位置(1 ~ A~-1)。接受长度τ=A~-1通常称为草稿块的“接受长度”,我们使用的度量是平均接受长度,通过对覆盖所有推理步骤的分布的期望来定义。由于目标模型在验证步骤中至少生成一个令牌,每次推理迭代总共生成的令牌数为τ+1。

#### 加速比。

期望的块接受长度——这是一个量纲为一的标量,我们可以称之为加速因子——由每个块偏移处的条件接受概率决定:设α_k表示在草稿在位置k-1被接受的条件下位置k被接受的概率。那么E[τ]=1+∑_k∏_{i≤k}α_i。由于α_k是条件概率——它衡量的是给定之前的所有内容都被接受,位置k被接受的可能性——它直接对应于验证器的不中断检查。当这些概率高时,块往往会被完全接受,从而实现充分加速。当它们低时,块会被提前截断。α_k序列是衡量草稿器质量的最相关指标——比无条件令牌准确率更直接——而这个序列正是AUF的目标。

#### 训练-推理不一致。

掩码块草稿器通常使用交叉熵L_CE=−∑_{k=1}^B t_k log p_θ(y_k)进行训练,其中t_k是目标令牌(通常来自目标模型为标记x和监督前缀生成的分布)。该损失从位置无关的角度惩罚错误。它在所有B个位置上应用一个衰减权重D(k),例如DFlash中使用的指数衰减D(k)=γ^{k-1}。这并不能区分那些之前草稿令牌被接受的理想位置和那些在验证期间会因为早期错误而被忽略的位置。实际上,对于后缀位置,即使草稿器的错误是因为早期不一致造成的,损失仍然会惩罚它们。这里的关键不一致是:在训练期间,损失函数对前缀和解后缀一视同仁;在推理期间,验证器会在第一个错误处截断。当草稿器在早期出错但后来正确时,正确的后缀对解码毫无贡献,但负对数似然仍然会惩罚它。

## 3 相关方法

D-PACE和SpecDiff-2明确地将每个块位置的训练信号与通过该位置的草稿前缀的条件概率联系起来,从而解决了这种不一致。D-PACE在每个训练步骤中,基于目标模型对草稿令牌的接受概率对信用g_i进行软加权。该信用用于加权标签。该权重使得训练信号优先考虑最可能在推理时存活的位置,接受门是乘积中的主导因素。仍然训练整个块——加权。SpecDiff-2也训练整个块,但尝试通过一个包含自注意力修改的蒸馏程序和预测块长度的额外回归来优化预期接受长度,再次保留了完整的监督。AUF用硬截断取代了软加权,只训练草稿器自己的预测第一次与目标令牌不一致之前的那些位置。这是概念上的最小化变化:保持目标模型和训练目标不变,但限制监督的范围。这完全消除了对后缀位置的无用训练信号,这些信号在推理中被丢弃,同时在初始前缀上分配所有模型能力。

与其他草稿器训练方法的对比。各种方法都解决相同的训练-推理不一致,使用不同粒度的修正:

*   **EAGLE-3**:特征级块草稿器,使用自回归结构但没有输入侧的真实前缀条件化。训练整个块。与标准交叉熵相同的不一致。
*   **DFlash**:基于MLP的掩码块草稿器,使用基于位置衰减的加权交叉熵。衰减权重是固定的;没有对接受概率建模。训练-推理不一致仍然存在,因为衰减权重是固定的,并不考虑接受概率——后缀位置仍然被训练。
*   **BiTA**:使用双向注意力进行块并行预测;交叉熵训练。接受损失使用与AUF中一些辅助损失类比的目标函数,但没有解决主交叉熵问题。架构变化更大,但训练-推理不一致从主损失的角度看仍然存在。
*   **Domino**:掩码块草稿器,使用因果修正头进行改进。训练一个基分支和一个最终分支;交叉熵训练。不一致仍然存在:每个分支都交叉熵训练整个块。

与这些相比,AUF并不是通过修改架构或添加辅助目标来解决不一致;它直接改变交叉熵损失的支持范围,使其与验证时实际重要的内容一致。它消除的是后续块位置上的监督,而不是重新加权。我们的实验表明,这种简单的变化在两个最先进的块草稿器(DFlash和Domino)上带来了显著的解码改进。

## 4 AUF:接受直至失败训练

给定一个块大小为B的掩码块草稿器,让我们定义决策边界j^*为草稿器预测与目标令牌首次不一致的索引:

j^* = min{ k ∈ {1,...,B} : argmax p_θ(y_k|x) ≠ t_k }

(其中我们设如果j^* = B+1则首次不一致在块外)。目标令牌t_k是从目标模型对标记x和监督前缀的完成中采样得到的;对于训练数据,我们使用目标模型的自回归生成。AUF损失是通过将交叉熵支持范围限制到j^*而定义的:

L_AUF = −∑_{k=1}^{j^*} D(k) t_k log p_θ(y_k|x)

其中D(k)是一个位置权重(如指数衰减),AUF可选地保留它。对于j^* = B+1(即整个块一致)的情况,AUF退化为完整块的衰减交叉熵。关键的变化是,对于j^* < B+1,所有位置k > j^*上的监督被移除——这些位置既不贡献于解码加速,也不贡献于训练目标。从训练-推理不一致的角度来看,移除的部分正是那些在推理时由于第一个错误而会被丢弃的块部分。请注意AUF和教师强制训练之间的概念联系。在自回归草稿器中,预测y_i是以真实前缀y_{<i}^*为条件的;然后后缀预测y_{>j}只有在之前所有令牌都被接受的情况下才重要。AUF通过移除j^*之后的监督来模拟教师强制条件化——这恰好是在训练时已知会失败的后缀。教师强制的类比在此是密切的:教师强制在输入侧条件化于真实前缀,AUF在损失侧条件化于草稿器的成功前缀。

##### 实施细节。

AUF的实现方式如下:

1.  **生成草稿**:在训练时,当前草稿器对整个块进行前向传播,生成每个位置的logits。
2.  **定位首次错误**:将argmax预测与目标令牌进行比较。首次不匹配标记为j^*。
3.  **截断交叉熵**:计算从1到j^*的交叉熵损失,包括位置权重衰减。忽略位置>j^*的令牌。
4.  **保留权重衰减**:AUF保留每个位置的标准指数衰减权重。然而,这并不不同——在第5节中,我们看到一旦支持被截断,衰减权重就变得无效。

关键的设计选择是AUF是仅对基础分支、共享分支还是特定于分支应用。我们将在第5节中看到,每个选择在多分支设置下都会产生不同的结果。

##### 在推理期间工作。

由于AUF只改变损失的实现方式,而不改变前向传播,推理流程完全相同:草稿器生成一个完整块,验证器检查该块,提交最长的前缀。AUF不会改变接受机制或验证器。这与更改草稿器架构或推理接口的其他方法不同。

##### 支持交叉熵与标签。

一些草稿器(如Domino)使用代理令牌。在这种情况下,AUF选择性地监督每个分支。具体来说,对于每个分支i,AUF计算该分支各自的j_i^*。这种支持分离使AUF能够独立地处理每个分支。

##### 通过教师强制类比进行限制。

类似AUF的损失可以解释为对自回归草稿器中教师强制接收的真实前缀的模拟。自回归草稿器中的教师强制通过令牌级别的交叉熵产生条件化效果,通过输入侧序列的因果特性产生等效的n-gram精度。在掩码块解码中,其等效是一个块中的第一个正确预测。AUF近似了这个等价物:它在输入侧没有接收真实前缀,但*移除*了超过j^*的监督。类似教师强制的类比是普遍的动机,并非精确复制。

##### 将AUF应用于不同的草稿器。

对于DFlash,AUF直接应用于块logits。对于Domino,它有一个基础分支和一个最终修正分支,首次错误支持是针对每个输出分布单独计算的。该更改仅限于交叉熵支持范围,既不修改草稿器架构,也不修改推理时的验证器契约。

## 5 评估

#### 设置。

我们评估在ShareGPT上训练的Qwen3-8B草稿器。目标模型是Qwen3-8B。我们直接使用原始的ShareGPT训练对话,而不从目标模型重新生成助手回复。对于Qwen3,我们使用标准的qwenchat模板,而不是启用思考的qwen3-thinking模板,因此在格式化训练数据和渲染评估提示时,思考都被禁用。我们将启用思考的Qwen3视为不同的服务设置,这里不做变化。DFlash使用一个5层块草稿器,目标层为{1,9,17,25,33},块大小B=16;Domino使用相同的骨干网络及其GRU前缀基础/最终双分支头部。我们的基线是标准衰减CE配置(γ=7),这是SpecForge训练方案推荐的;这是DFlash和Domino都使用的默认配置,并再现了块草稿器文献中普遍采用的指数位置衰减(EAGLE-3、DFlash、Domino都手工设置了指数γ)。AUF保持架构和训练数据不变,只改变监督支持范围,用第4节中定义的首次错误支持取代完整块的衰减CE支持。所有解码数值均由我们的SGLang DFlash/Domino V2推测解码后端(单GPU,批大小1)在两种验证设置下生成:贪心(T=0)和采样(T=1);在这两种情况下,草稿提议都是贪心的(每个位置单一top-1候选)。由于本节中的每个比较都是在*固定*草稿器架构内进行的(AUF是一种训练方案,而不是一个新模型),我们比较的变体每次迭代的前向计算成本是相同的。因此,我们在本节中报告平均接受长度τ(平均接受的草稿令牌数加上每次推测迭代的一个修正令牌,由SGLang的内置指标报告)作为主要的解码度量。

#### 基准测试。

两个骨干网络都在六个相同的基准测试上进行评估:GSM8K、MATH-500、HumanEval、MBPP、MT-Bench和Alpaca,提示数量分别为200、200、164、200、80、200,所有方法和温度下设置统一的max_new_tokens=512上限。每个草稿器在ShareGPT上训练六个epoch;解码表报告epoch-6的检查点,训练动态图使用完整的epoch-1优化器步骤日志。我们将两个骨干网络分开到各自的子部分中,因为Domino的双分支头部允许更丰富的AUF变体家族。

### 5.1 DFlash

DFlash有一个单一的输出分布,因此AUF的设计空间很小。我们训练三个匹配的变体:官方风格的*仅衰减*参考(γ=7完整块CE)、*仅AUF*(首次错误截断CE,无衰减)和*AUF+衰减*(相同的指数衰减*应用于*AUF支持*内部*)。表2报告了epoch-6的解码结果。

表2:DFlash epoch-6在Qwen3-8B上六个基准测试的平均接受长度(τ),通过SGLang服务路径测量(批大小1)。每种温度设置下最佳结果以粗体显示。

两种AUF变体在贪心和采样解码下,六个基准测试中的每一个都相对于仅衰减的参考有所改进(表2),在更长、更结构化的代码和数学输出上增益最大;采样结果证实了增益不是训练期间使用的贪心验证匹配的伪影,并且在整个训练过程中都保持优势,而不仅仅是在收敛时(图4)。值得注意的是,*仅AUF和AUF+衰减无法区分*:一旦支持被截断在首次预测错误处,用指数衰减重新加权残存位置不会带来可测量的增量。我们在第6节中解读这个衰减惰性的结果。

#### 训练动态。

图4记录了每个优化器步骤的两个令牌准确率:*公共令牌准确率*,在固定公共掩码上测量(所有本地有效的块位置),因此三种方法共享一个分母;以及第4节的*支持准确率*,在每种方法实际训练的位置上测量(对于AUF,选定的首次错误支持)。两个事实引人注目。首先,在公共掩码上,*仅衰减*基线是*最*准确的,但它在解码时却是*最差*的。其次,AUF的活跃令牌比例从较低水平开始并随着训练而增长,而仅衰减训练了整个块,因此AUF支持诊断追踪的区域要短得多。这种公共掩码准确率反转——更准确但更慢——是我们在第6节中解释的经验标志。

图4:跨epoch的DFlash训练动态(3000步的滚动均值;τ来自六个基准测试的贪心SGLang解码)。面板:(1)支持准确率,在每种方法实际训练的位置上(对于AUF,选定的首次错误支持);(2)公共令牌准确率,在固定公共掩码上(所有本地有效的块位置);(3)活跃令牌比例,每种方法监督的块位置比例;(4)接受长度τ。参见正文进行解读。

#### 逐位置条件接受率。

对应的推理端度量是逐位置的*条件*接受率α_k——在草稿前缀通过位置k-1被完全接受的推测步骤中,位置k也被接受的比例,α_k = #{A≥k} / #{A≥k-1},从SGLang验证器每个请求记录的已接受草稿令牌直方图中读出。这正是E[τ]=1+∑_k∏_{i≤k}α_i中的逐位置因子:它消除了早期拒绝的复合惩罚,并隔离了每个块偏移处的条件预测质量。我们只绘制位置1到6,在这些位置上,在六个基准测试的平均值下,每条曲线在条件集中都保留了一个非平凡比例的推测步骤;更深的位置样本太少而不稳定。在DFlash上(图5,左),两种AUF变体都位于仅衰减基线上方,跨越整个块,且仅AUF和AUF+衰减再次几乎无法区分:解码增益是决定τ的条件接受率曲线的提升,而不是原始令牌准确率的全局变化。

图5:逐位置条件接受率α_k(epoch 6,贪心SGLang解码),在所有六个基准测试上平均。聚合时在每个基准测试内对提示进行等权加权,然后对六个基准测试进行等权加权;MT-Bench的两轮对话计为单独的提示。左:DFlash的仅衰减、AUF+衰减和仅AUF。右:Domino的仅衰减和两种基础分支AUF变体(B-AUF+D, B-AUF),使用相同的线型。AUF在两个骨干网络上均提高了六个基准测试的条件接受率分布。

### 5.2 Domino

Domino更难分析,因为它的头部不是单一分布:它混合了一个*基础*分支(草稿器自己的logits)和一个*最终*分支(基础加上因果修正),训练为L=λ_base L_base + (1-λ_base) L_final。因此,AUF需要选择*每个分支在哪个支持上训练*,并且没有先验的“主要”AUF方案——我们将分支支持分配视为一个实验变量,让测量的解码来决定。我们评估了涵盖该空间的七个训练变体(表3):三种支持分配(仅基础、基础共享、分支特定),每种在AUF支持内部应用或不应用γ=7衰减,再加上仅衰减的基线。

表3:Domino AUF变体。“支持”是每个分支使用的训练掩码:common=完整原始块,base-auf/final-auf=来自基础/最终分支的首次错误截断。衰减是应用于支持内部的γ=7位置权重。后续表格中使用短名称。B=仅基础(仅在基础分支上使用AUF);S=共享(两个分支共享base-auf支持);F=分支特定(最终分支使用自己的final-auf支持)。+D=在AUF支持内部应用衰减。

表4:Domino epoch-6在Qwen3-8B上六个基准测试的平均接受长度(τ),与表2相同的SGLang协议。每个温度块的最佳结果以粗体显示;所有AUF变体均优于仅衰减基线。短名称参见表3。

表4显示支持选择的想法是可行的:在贪心和采样解码下,每个AUF变体都优于仅衰减基线,无论两个分支如何分割其支持。三个观察结果使情况更清晰。首先,贪心解码下经验上最强的变体是B-AUF+D,它将AUF应用于基础分支,让*最终*分支保留在公共掩码上,并在AUF支持内部保留衰减;在采样下,B-AUF(无衰减)略强。增益局限于*基础*(提议者)分支:一旦应用AUF,其训练损失急剧下降,而将AUF推送到最终分支上并没有明显的额外收益——对最终分支应用AUF(F-variant)总体上并没有改善基础分支优化所在的解码结果。其次,抽样下的增益**在某种程度上显著于贪心**——最突出的改进是在6个基准测试中的4个上,采样下接受长度增加了接近2个令牌——这表明AUF在目标模型采样时对草稿质量的改善更大,可能是通过移除“干扰”令牌的训练信号。第三,应用衰减的方向现在很重要:在贪心下,保留衰减会得到更好的数值(B-AUF+D vs B-AUF),但在采样下,移除衰减会得到更好的数值;这一结果与衰减在支持的尾位置上是噪声的观点一致,但在贪心下衰减可以充当正则化器。最后,在AUF变体内部,活跃令牌比例与DFlash变体不同:B-AUF在第一个epoch中从约32%的块开始,然后攀升至约98%(在基础分支上),因为基础分支学会了完美地匹配基础分支的gold。相比之下,最终分支作为修正分支,自然在更长的范围内保持较高的准确率,因此其AUF支持在训练过程中保持较宽。与仅衰减基线(约41%)相比,所有AUF变体在训练过程中都表现出较高的活跃令牌比例,但B-AUF+D在贪心解码下仍然获得了最佳τ增益。

#### 训练诊断。

在Domino上,我们看到与DFlash相同的公共掩码准确率反转:在六个基准测试中接受长度较高的变体(B-AUF+D,贪心)在公共掩码上的准确率**低于**仅衰减基线,但从接受长度的角度来看,它仍然更有效。这种反转再次表明,与学习在完整块上匹配目标令牌相比,仅仅对关键位置进行注意力训练——即前缀——是对解码更有效的策略。

#### 贪婪解码与采样解码的事实。

一个显著的事实是,在Domino上,对于6个基准测试中的采样解码,接受长度的增益大于贪婪解码。对于贪婪解码,T=0时,目标模型是确定性的;然而,在采样(T=1)下,目标模型可能会以非零概率丢弃已接受的草稿令牌。AUF的更大增益源于:一旦支持被截断,对依赖性的学习就是整体的,而不仅仅是基于一致性的。给定条件,AUF可以有效地改进这些位置。

## 6 讨论和结论

我们介绍了AUF,一种用于训练掩码块草稿器的方法,通过直接将交叉熵支持范围限制在草稿器的预测首次与目标令牌不一致之前的点来解决训练-推理不一致问题。AUF是一个单一的变化——没有辅助目标,没有蒸馏,没有改变推理流程。对DFlash和Domino(两个最先进的块草稿器)的实验表明,AUF在六个基准测试中一致地提高了接受长度(平均从2.40到2.61或从2.56到2.68),并且不管衰减权重如何(一旦支持被截断,衰减在实验上就变得无效),这种增益都会发生。我们还观察到了准确率反转现象:在完整的公共块掩码下训练最准确令牌预测的基线,在解码时表现更差——这表明在完整块上训练准确地预测与优化实际生成的结构化前缀之间存在根本差异。

**为什么AUF有效?** AUF强制草稿器将其能力集中在一件事上:最大化前缀的接受长度。它消除了对后缀位置的监督——从解码的角度来看,这些是“浪费”的信号。通过仅训练与推理相关的令牌,AUF间接地将重点放在验证器实际检查的结构化前缀上。这自然解决了分布外问题:对于正确初始化的块,后期生成的令牌。现在,草稿器明确专注于一个任务:预测最多到自身首次错误的、与目标一致的令牌。

**为什么仅仅衰减是不够的?** 衰减权重的作用是降低训练后期令牌的梯度,但它并没有消除它们。从解码的角度来看,后期令牌的训练信号仍然是“噪声”。我们的“活性”实验表明,一旦支持被截断,衰减权重添加的方差超过了它们可能添加的任何现有结构,导致在AUF+衰减和仅AUF之间的匹配性能没有差异。这表明在DFlash中,衰减完全是“添加剂”的——它添加了没有额外贡献的梯度噪声——因此AUF的支持截断是改进的关键机制。

**为什么准确率反转了?** 公共令牌准确率在仅衰减基线中更高——它学会了在完整块上完美地预测令牌。但接受长度较低。为什么一个更准确的草稿器会得到更短的接受长度?当一个早期的令牌不正确时,完整的块将被截断——即使后来的令牌是正确的。因此,每个位置的条件正确率——α_k——决定了接受长度。AUF使α_k在早期位置更好,即使它可能降低后期位置的准确率。关键的时刻是k=1、k=2等的逐位置条件接受率。图5显示AUF改善了α_k。这解释了反转:AUF通过将所有能力集中在预测早期令牌上,即使后期准确率下降,也能改善条件接受率。这类似于目标检测中的精确率-召回率权衡:AUF通过精确对准草稿器,最大化接受长度,而完整的块训练即使整体令牌准确率提高,也会在前缀上产生更多错误。

**局限性。** AUF在共享块架构上表现出显著的收益,但它在多分支设置(如Domino)中的行为更为复杂。分支之间的最佳支持分配仍然是实验性的,并且衰减的影响很微妙。未来的工作应该探索自动学习AUF支持,也许使用学习到的接受阈值,并研究AUF与更广泛的训练目标(如细粒度目标模型蒸馏)的交互。此外,AUF是为使用单个top-1候选的草稿器设计的;它尚未在更复杂的草稿器(如使用树注意力或多候选采样的草稿器)上进行测试。在更一般的设置中,它可能具有不同的性质。

**结论。** AUF是一种新的训练方法,用于训练掩码块草稿器,以解决训练-推理不一致问题。它是一种简单、架构无关的方法,限制了交叉熵支持范围,只包括草稿器在第一次错误之前的位置。在DFlash和Domino上,它显著改善了接受长度,并且这种改进在所有基准测试中都是一致的,无论衰减权重如何。准确率反转和衰减惰性现象突出了在块草稿器训练中,对齐于训练目标与匹配推理指标之间的关键差异。AUF是一个单一的变化,可以应用于任何掩码块草稿器,并提供一个简单的基线来改进;我们希望在更多的架构和设置中看到它的应用。

相似文章

Speculative Refinement: 一种混合自回归扩散解码策略及其在不同基准测试中的行为表现

arXiv cs.AI

介绍了 Speculative Refinement (SpecRef),一种无需训练的混合解码策略,它通过熵引导的选择性掩码,从自回归草稿中热启动掩码扩散语言模型。在六个基准测试上的评估表明,代码基准测试混淆了结构发现与逻辑正确性,识别出了一种精炼张力现象,并显示评估协议可能产生不同的模型排名。

D-PACE: 面向并行推测草稿的动态位置感知交叉熵

arXiv cs.LG

本文介绍了D-PACE,一种用于训练推测解码草稿模型的动态位置感知交叉熵损失,该损失函数自适应地加权位置以提升接受长度和推理速度,在各基准测试中实现一致的加速比,且开销极低。

训练扩散模型进行从左到右推测

arXiv cs.CL

本文提出了三种训练时干预方法(位置加权、首次错误焦点损失和链损失),用于在推测解码中将基于扩散的草稿模型与自回归验证对齐,使接受前缀长度提升21-76%,且不增加推理开销。

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。