共识作为无标签自蒸馏的特权上下文

arXiv cs.LG 论文

摘要

一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。

arXiv:2607.13643v1 公告类型:新 摘要:对多个解进行采样并返回多数答案是在无标签情况下提升大型语言模型推理准确性的最可靠方法之一,且越来越多的方法将此共识信号转化为训练监督。然而,现有方法仅以受限形式使用共识:作为筛选解进行微调的过滤器、作为答案之间的偏好、或作为强化学习的标量奖励,从而丢弃了包含在一致解中的大部分信息。我们提出了CANON(共识锚定自蒸馏),一种无标签训练方法,将共识转化为密集的标记级监督。对于每个无标签提示,CANON采样多个解,提取多数答案,并将模型的冻结快照条件化于一个达到该答案的解;然后,这个共识锚定的教师在其自身展开的每个标记上监督模型。在数学和科学推理基准上的实验表明,CANON将pass@1提升最多12个百分点,以七分之一的计算量超越无标签强化学习6个百分点,并接近条件化于真值解的教师;在合并的无标签数据上训练后,它能迁移到未见基准,与使用真值标签的训练方法相匹配。分析表明,改进并非单纯的分布锐化:训练后,模型能够解决之前32次尝试从未解决的问题,并且其多数投票本身变得更加准确。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:23

# 共识作为无标签自蒸馏的特权上下文 来源:https://arxiv.org/html/2607.13643 John Gkountouras¹ Josip Jukić¹ Ivan Titov¹,² ¹ILLC, 阿姆斯特丹大学 ²ILCC, 爱丁堡大学 \{i\.gkountouras,j\.jukic\}@uva\.nlititov@inf\.ed\.ac\.uk ###### 摘要 采样多个解决方案并返回多数答案,是无需标签即可提高大型语言模型推理准确性的最可靠方法之一,并且一系列方法将此共识信号转化为训练监督信号。然而,现有方法仅以受限形式使用共识:作为选择解决方案进行微调的过滤器、作为答案之间的偏好、或作为强化学习的标量奖励,丢弃了这些一致解所包含的大部分信息。我们提出 **Canon**(Consensus-ANchored self-distillatiON,共识锚定的自蒸馏),一种无标签训练方法,将共识转化为密集的、令牌级别的监督信号。对于每个无标签提示,Canon 采样多个解决方案,提取多数答案,并将模型的冻结快照条件化于一个达成该答案的解;随后,这个以共识为锚定的教师在其自身的采样轨迹上,在每一个令牌处监督模型。在数学和科学推理基准上的实验表明,Canon 可将 pass@1 提升多达12个百分点,性能优于无标签强化学习6个百分点,而计算量仅为其七分之一,且接近以真实答案条件化的教师模型;在合并的无标签数据上训练后,其性能可迁移至未见的基准,其效果与使用真实标签的训练方法相当。分析表明,这些改进并非纯粹的概率分布锐化:训练后,模型能解决先前在32次尝试中从未解决的问题,并且其多数投票本身也变得更加准确。

## 1 引言

带有可验证奖励的强化学习已成为提升大型语言模型推理能力的标准方法 (Guo et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib11); Shao et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib10)),但其需要预设真实答案进行验证。在缺少标签的情况下,模型自身能产生的一个关于其正确性的信息信号就是一致性:采样多个解决方案并返回出现频率最高的答案,即自一致性 (Wang et al., 2022 (https://arxiv.org/html/2607.13643#bib.bib1)),其性能可靠地优于单次解码。由多个独立样本支持的答案更可能是正确的,因此一致性充当了准确性的无监督代理指标 (Wang et al., 2022 (https://arxiv.org/html/2607.13643#bib.bib1); Prasad et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib4))。一致性可以在任何无标签提示上获得,代价是额外的采样,并且它不仅能识出一个可能的答案,还能识别出达成该答案的整个解序列。本文研究如何将该信号转化为监督信号。

现有方法将共识用作:选择解决方案进行监督微调的过滤器 (Huang et al., 2023 (https://arxiv.org/html/2607.13643#bib.bib2))、成对偏好的来源 (Prasad et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib4)),或者最主要的,作为无标签数据强化学习的标量伪奖励 (Zuo et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib3))。在所有这些情况下,达成一致的解都被简化为一个选择或一个比特的反馈,而强化学习变体还需要数百次优化步骤,每次都需要新的生成。与此同时,在标签可用的情况下,在线自蒸馏已成为强化学习的一种密集替代方案:模型以标签派生的特权信息(即,真实答案或达成真实答案的推导过程)作为条件,充当其自身无条件策略的令牌级教师 (Zhao et al., 2026a (https://arxiv.org/html/2607.13643#bib.bib6); Hübotter et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib7))。难点在于,这种特权上下文依赖于真实标签,因此在无监督设置中不可用。这就引出了一个问题:*模型自身的共识能否扮演这个特权上下文的角色,从而在无需真实解的情况下实现密集自蒸馏?*

参见说明
图 1: Canon 训练框架。给定一个无标签提示,模型采样 N 个解并提取多数答案。模型的一个冻结快照,以共识解为条件,充当密集的逐令牌教师;学生在其自身采样轨迹上进行训练,以遵循其共识所设定的路线,而无需看到该共识。梯度从不流入教师网络。一次生成过程同时提供了共识和蒸馏素材。

我们提出 **Canon**(Consensus-ANchored self-distillatiON,共识锚定的自蒸馏),它将模型自身的一致性转化为密集的训练信号。对于每个无标签提示,Canon 采样 N 个解,提取多数答案,并从达成该答案的轨迹中选择一个共识解。模型的一个冻结快照,以此共识解为条件,然后充当教师:学生模型通过最小化其自身采样令牌上的完整词汇表的 Jensen–Shannon 散度,来向教师的下一个令牌分布学习。一次生成过程同时提供了共识和蒸馏素材,训练持续一个 epoch。

我们在两种模式下评估 Canon。在**直推式**模式下,我们直接在测试基准的无标签提示上训练,并在相同的提示上评估(这是测试时强化学习流行的设置 (Zuo et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib3)));标签仅用于评分。在**归纳式**模式下,我们在一个无标签提示集上训练,并在不重叠的基准上评估,测试模型是否真正得到了改进而不仅仅是为适应测试集。在两种模式下,我们与无标签替代方法(即自一致性微调 (Huang et al., 2023 (https://arxiv.org/html/2607.13643#bib.bib2)) 和测试时强化学习 (Zuo et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib3)))以及全标签方法(拒绝微调 (Yuan et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib21))、带真实奖励的 GRPO (Shao et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib10)) 和我们自身方法的一个 Oracle 变体,其教师以真实验证的解为条件,镜像了标签条件化自蒸馏所假设的特权上下文 (Zhao et al., 2026a (https://arxiv.org/html/2607.13643#bib.bib6); Hübotter et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib7)))进行比较。我们的评估包括竞赛数学和研究生级别的多项选择科学问题:该方法仅假设存在可抽取的最终答案和可靠的共识。第 5.2 节 (https://arxiv.org/html/2607.13643#S5.SS2) 描述了这种适用条件。我们的发现在不同模型和基准上是一致的。

在直推式模式下,Canon 是我们评估的无标签方法中最强的,在竞赛数学和研究生级别科学问题上将 pass@1 提升了多达十二个百分点,而 GPU 训练时间仅约一小时,相比之下,强化学习替代方法需要六到十小时。它还接近 Oracle 条件化教师,在 AMC 上落后半分,在 AIME 2024 上落后三分,在 GPQA 上落后八分:模型自身的共识捕捉到了真实解作为特权上下文的大部分价值。在归纳式模式下,改进转移到未见过的和更难的基准上,在这些基准上 Canon 与在同一提示上训练的标签条件化蒸馏和带真实奖励的强化学习表现相当。最后,这些增益不仅仅是概率质量集中在模型已经产生的答案上:训练后,模型解决了先前在 32 次尝试中从未解决的问题,并且在未饱和的基准上,其多数投票本身也变得更加准确。

我们的主要贡献如下。

*   • **Canon**,一种无标签的后训练方法,将共识锚定的教师蒸馏到模型自身采样轨迹上的模型中,将多数投票转化为密集的令牌级监督。
*   • 对无标签测试时训练中监督信号的受控比较,表明 Canon 在准确率-计算量边界上优于我们评估的无标签替代方法,并恢复了标签条件化教师的大部分收益。
*   • 证明改进具有可迁移性的证据:增益在更难的跨领域未见基准上持续存在,在这些基准上 Canon 与基于真实标签的训练表现相当。
*   • 分析共识监督何时有帮助:按提示的增益跟踪基础模型共识的状态,在多数正确但信心不足时增益最大,在饱和时接近零,在非常有信心但错误时为负。

## 2 相关工作

#### 测试时扩展与测试时训练。
采样多个解决方案并通过多数投票聚合,可以在没有任何训练的情况下提高推理准确性 (Wang et al., 2022 (https://arxiv.org/html/2607.13643#bib.bib1)),但代价是在每次查询时乘以推理计算量。测试时*训练*则是将计算量一次性投入,在测试分布本身上更新参数,这一思想在从视觉 (Sun et al., 2020 (https://arxiv.org/html/2607.13643#bib.bib20)) 到使用语言模型的抽象推理 (Akyürek et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib14)) 中都已被证明有效。Canon 属于这个家族,但其训练信号纯粹来源于模型自身的共识,并将投票的收益摊销到权重中:训练后,单次采样就能捕获先前需要集成才能实现的大部分效果。

#### 无标签强化学习。
最接近的训练范式是无标签强化学习。TTRL (Zuo et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib3)) 表明,多数投票答案可以作为无标签测试数据上可验证奖励强化学习的伪标签,大量后继工作改进了伪奖励或稳定了其优化(例如,Yan et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib28); Lin et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib19));我们在第 4.2 节 (https://arxiv.org/html/2607.13643#S4.SS2) 评估了该家族的三个成员作为基线。相关的内在信号包括语义熵和自确定性 (Zhang et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib17); Zhao et al., 2026b (https://arxiv.org/html/2607.13643#bib.bib18))。这些方法共享两个结构性成本:共识被压缩为每个轨迹的标量奖励,并且强化学习循环需要在许多优化步骤中重复生成。最近的分析进一步表明,所得增益的很大一部分反映的是对已可解决问题概率分布的锐化,而非新能力的获得 (Lin et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib19); Shafayat et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib16))。Canon 保留了共识信号,但摒弃了强化学习机制:投票条件化一个教师,而不是定义一个奖励,从而通过一次生成过程就在每个令牌处产生完整的词汇表目标。

#### 基于模型共识的自训练。
使用互补视图间的一致性来利用无标签数据的思想早于大型语言模型:协同训练 (Blum and Mitchell, 1998 (https://arxiv.org/html/2607.13643#bib.bib36)) 让两个具有不同数据视图的学习器通过彼此的预测相互监督,这种方法在自然语言处理中有着悠久的历史 (Collins and Singer, 1999 (https://arxiv.org/html/2607.13643#bib.bib35))。共识自训练将不同视图间的一致性替换为单个模型不同采样轨迹间的一致性。在基于强化学习的变体出现之前,共识已被用于过滤自生成解以进行监督微调 (Huang et al., 2023 (https://arxiv.org/html/2607.13643#bib.bib2)) 以及构建用于 DPO 风格训练的偏好对 (Prasad et al., 2025 (https://arxiv.org/html/2607.13643#bib.bib4));类似的全标签方法则根据真实正确性进行过滤 (Zelikman et al., 2022 (https://arxiv.org/html/2607.13643#bib.bib12); Singh et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib13); Yuan et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib21))。这些方法使用硬目标对选定的文本进行监督。Canon 在信号和机制上均有所不同:监督覆盖学生的所有采样轨迹,而不仅仅是与共识一致的轨迹,并且目标是教师的完整下一个令牌分布,而不是一个令牌身份,我们通过实验发现这个差异很重要(第 6 节 (https://arxiv.org/html/2607.13643#S6))。

#### 特权上下文自蒸馏。
将上下文的影响蒸馏到模型权重中可追溯到上下文蒸馏,它训练模型在没有该上下文的情况下,复现其在该上下文下的行为 (Snell et al., 2023 (https://arxiv.org/html/2607.13643#bib.bib37))。在线蒸馏将这一思想扩展到,在教师密集的令牌级反馈下,在学生的自身采样轨迹上训练 (Agarwal et al., 2024 (https://arxiv.org/html/2607.13643#bib.bib5); Song and Zheng, 2026 (https://arxiv.org/html/2607.13643#bib.bib9)),近期工作将教师实例化为同一模型以特权信息(通常是真实解或丰富的环境反馈)为条件,从而无需单独的教师网络 (Zhao et al., 2026a (https://arxiv.org/html/2607.13643#bib.bib6); Hübotter et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib7))。所有这些方法都假设特权上下文是给定的。与我们最接近的是 GATES (Stein et al., 2026 (https://arxiv.org/html/2607.13643#bib.bib8)),它在文档基础的问答中研究无标签自蒸馏,其中外部文档提供特权上下文,并且教师轨迹间的共识用于门控蒸馏信号。Canon 采取了互补的举措:共识不是外部特权信息的可靠性过滤器,它*就是*特权信息本身,由模型自身制造,无需文档、验证器或标签。我们的 oracle 恢复结果量化了这种替代带来的损失很小。

## 3 方法

### 3.1 设置

我们给定一个策略 πθ,从预训练模型 π₀ 初始化,以及一组*无标签*提示 D = {x₁, ..., x_M},这些提示具有可抽取的最终答案(框选的数学答案或多选题选项字母)。没有可用的真实答案、奖励模型或验证器。我们考虑两种模式。在**直推式**模式下,D 本身就是测试集:我们在其提示上进行适配,并在相同提示上进行评估,仅使用真实标签进行评分。在**归纳式**模式下,我们在 D 上训练,并在不重叠的提示集上评估,衡量无标签训练是否产生可迁移的改进。

### 3.2 Canon

Canon 分三步运行,如图 1 (https://arxiv.org/html/2607.13643#S1.F1) 所示:它从采样解中提取共识,构建以该共识为锚定的教师,然后将教师蒸馏回模型自身的采样轨迹中。
对于每个提示 x,我们采样 N 个轨迹 y^(1), ..., y^(N) ∼ π₀(·|x) 并提取它们的最终答案 a_i = ans(y^(i))。多数答案为
`â_x = argmax_a ∑_{i=1}^N 𝟙[a_i = a],` (1)
而*共识解*是多数集合 S_x = {y^(i): a_i = â_x} 中最有信心的成员,即具有最高平均令牌对数概率的轨迹。

相似文章

UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。

反馈对齐在自蒸馏中的作用

Hugging Face Daily Papers

本文研究了语言模型中自蒸馏的上下文设计,发现逐步对齐的批评反馈显著优于二元奖励或参考解条件,因为它只针对错误词元,同时保留正确行为。

TallyTrain: 通信高效的联邦蒸馏

arXiv cs.LG

本文介绍了TallyTrain,一种通信高效的联邦蒸馏方法,该方法仅传输每个探针的argmax类索引(硬标签共识),而非完整的softmax向量,从而将带宽减少多达三个数量级,同时匹配或超越软标签蒸馏的性能,并帕累托优于FedAvg、FedProx和FedDF等标准联邦学习基线。