Chopthin-共识功率采样:一种保持多样性的大语言模型解码方法
摘要
Chopthin-共识功率采样(CCPS)是一种用于大语言模型解码、保持多样性的方法,它通过保留不同的推理路径并采用语义多数选择,无需后训练即可提高推理准确性,这在基准测试中得到了验证。
arXiv:2609.12243v1 公告类型:新
摘要:通过顺序蒙特卡洛(SMC)进行推理时的功率采样,可以在不需要后训练的情况下,显著提升大语言模型(LLM)的推理能力。然而,许多现有的SMC方法依赖于等权重重采样,这可能会激进地剔除低权重轨迹,丢弃潜在的正确推理路径,并降低搜索空间的谱系多样性。为了解决这个问题,我们引入了Chopthin-共识功率采样(CCPS)。我们的方法将Chopthin重采样器应用于LLM解码:它不进行权重的均等化和强制不必要的粒子复制,而是对最大和最小权重之间的比率施加上限,并保留不相等的权重。这种有针对性的干预保留了更丰富的不同推理路径集,在条件期望下保持了加权SMC近似的不变性,并保证了重采样后有效样本量(ESS)的下界。为了充分利用这个丰富化的种群,我们采用了一种语义多数选择机制,该机制合并最终的令牌相同轨迹,聚类语义等效的答案,并返回得到最多不同轨迹支持的答案。在对三个开源模型和五个推理基准进行评估后,我们表明Chopthin在15种设置中有13种增加了Oracle覆盖率。结合语义多数选择,CCPS在15种设置中有14种达到或超过了功率-SMC基线的最终答案准确率,绝对增益最高可达10.6个百分点。这些发现表明,保持多样性的重采样和考虑多样性的选择是无需训练的LLM推理的互补机制。代码可在github.com/MinooAhmadii/chopthin-consensus-power-sampling获取。
查看缓存全文
缓存时间: 2026/09/14 08:30
# 基于Chopthin共识权力采样的多样性保持型大语言模型解码方法
来源:https://arxiv.org/html/2609.12243
赛义德·阿尔敏·阿齐兹 | 南加州大学,洛杉矶,美国
埃尔凡·巴盖伊·波特拉格卢
联系邮箱:\{minooahm, seyedarm, baghaeip, mehdi\.kamal, pedram\}@usc\.edu
###### 摘要
通过序列蒙特卡洛(SMC)进行的推理时权力采样,无需经过后训练即可显著提升大语言模型(LLM)的推理能力。然而,现有SMC方法大多依赖等权重重采样,这种方式会激进地剪除低权重轨迹,丢弃潜在正确的推理路径,从而降低搜索空间的谱系多样性。为此,我们提出Chopthin共识权力采样(CCPS)。该方法将Chopthin重采样器应用于LLM解码:它不追求权重均等化和强制不必要的粒子复制,而是设定最大与最小权重比值的上界,并携带不等权重继续后续解码。这种针对性干预保留了更丰富的独特推理路径,保持了加权SMC近似在条件期望下的无偏性,并保证了重采样后有效样本数(ESS)的下界。为充分利用这一增强的种群,我们采用语义多数选择机制:该机制合并最终轨迹中完全相同的token序列,聚类语义等效的答案,并返回由最多不同轨迹支持的答案。在三个开源模型和五个推理基准上的评估表明,在15项设置中Chopthin在13项中提升了预言机覆盖率。结合语义多数选择后,CCPS在15项设置中的14项里达到或超过了Power-SMC基线的最终答案准确率,绝对增益最高达10.6个百分点。这些发现证明,多样性保持重采样与多样性感知选择是相辅相成的无训练LLM推理机制。
代码已开源:github\.com/MinooAhmadii/chopthin\-consensus\-power\-sampling (https://github.com/MinooAhmadii/chopthin-consensus-power-sampling)
## 1 引言
强化学习(RL)后训练推动了近期大语言模型推理能力的重大进展(Shao等人,2024)。然而,这些性能提升代价高昂:后训练流程需要专用的训练管道、复杂的奖励信号或验证器以及大量的计算资源,最终将这些改进固化为一组静态的新模型参数。幸运的是,新兴研究表明,达到类似推理能力可能并非必须依赖这些资源密集型训练步骤。RL后训练所观察到的改进,实际上主要源于提高了基础模型输出分布中已存在的成功推理轨迹的概率(Yue等人,2025)。这一关键发现促使了*权力采样*技术的发展,这是一种完全绕过训练的推理时技术,通过放大这些有效路径来实现(Karan和Du,2026)。通过针对每个完整输出序列的概率与其基础模型概率的某个大于1的幂成正比的分布,权力采样恢复了RL后训练的大部分增益。我们将这种最终产生的完整序列分布称为*权力分布*。
精确权力采样在计算上不可行,因为它需要计算所有可能序列补全的概率(Karan和Du,2026;Azizi等人,2026)。为近似这一目标分布,初始方法依赖于马尔可夫链蒙特卡洛(MCMC)中的梅特罗波利斯-黑斯廷斯算法。该算法通过迭代提议完整序列,并根据目标比率概率性地接受或拒绝它们来运作;然而,这种重复的提议-拒绝循环造成了严重的序列化瓶颈,导致推理延迟高得令人望而却步(Karan和Du,2026)。为避免这种低效性,Power-SMC(Azizi等人,2026)使用序列蒙特卡洛(SMC)采样重新构建了问题。SMC不逐一生成和评估完整序列,而是通过维护一个包含N个并行*粒子*的种群来增量式构建解决方案,每个粒子代表一个部分token轨迹。在每个解码步骤中,算法从提议分布中采样token,并为每个粒子分配一个*重要性权重*。通过并行动态评估和加权这些部分路径,SMC成功地瞄准了序列级权力分布,消除了梅特罗波利斯-黑斯廷斯的延迟瓶颈,同时保持了具有竞争力的推理性能。
随着Power-SMC在解码步骤中推进,它面临一个主要挑战:*权重退化*(Liu和Chen,1998)。一些粒子不可避免地积累了大部分重要性权重,而其余粒子的权重则降至接近零。为抵消这种情况并恢复有效样本数(ESS),标准SMC采用等权重重采样,该方法移除低权重粒子,复制高权重粒子,并将所有存活粒子的权重重置为相等。然而,以这种方式缓解权重集中引入了一个独特的问题:*谱系多样性*的严重损失。通过激进地克隆最高权重的粒子并丢弃其余粒子,标准等权重重采样极大地减少了存活到解码过程结束的独特祖先路径数量。虽然基于权重的ESS得到恢复,但这种增加可能掩盖了谱系多样性的巨大损失。这种路径多样性的损失对语言模型解码尤其有害,因为重要性权重是最终正确性的不良代理。粒子的权重反映了其前缀在权力目标分布和提议分布下的相对质量;它并未评估该未完成的轨迹是否逻辑健全或是否会得出正确答案。因此,标准基于权重的重采样有永久删除实际上包含正确推理路径的低权重粒子的风险,仅仅因为它们目前携带的重要性质量很小。
为解决标准重采样的破坏性问题,我们用*Chopthin*(Gandy和Lau,2016)替代了它。Chopthin并不严格均等化种群中的权重,而是限制最大和最小输出权重之间的比率,并允许粒子在后续解码步骤中携带这些不等权重(图1)。通过根据当前质量对粒子进行分类,Chopthin应用了更为温和、有针对性的干预:轻粒子被概率性*稀疏化*,中等权重粒子完全不受扰动地通过,只有过重的粒子被*切割*为等权重的细分部分。这种方法旨在保留更多低权重(但可能正确)的轨迹,减轻谱系多样性损失,同时保持无偏性、精确的粒子数量和权重守恒(第4.1节)。保留更丰富的祖先种群可以增加至少一条完整轨迹成功导航至正确答案的概率。我们将此度量定义为预言机覆盖率,它表示最终种群中包含至少一个正确答案的问题比例。
虽然最大化预言机覆盖率为模型准确率建立了理论上限,但这一潜力只能通过最终选择机制在存活候选者中可靠识别正确答案来实现。不幸的是,标准选择规则在这方面常常失败(Brown等人,2024)。例如,Power-SMC默认依赖于*权重抽样*策略,该策略以与其累积权重成正比的概率选择最终粒子。在此规则下,Chopthin保留的低权重、高度多样化的轨迹最不可能被选中,突显了轨迹生成与最终答案选择之间的关键不匹配(第4.3节)。
为弥合轨迹生成与最终答案选择之间的这一关键差距,我们引入了一个新的解码框架:*Chopthin共识权力采样*(CCPS)。CCPS从根本上通过两项相互关联的创新升级了Power-SMC,这些创新有助于挖掘多样化推理路径的全部潜力。首先,它用Chopthin替代标准等权重重采样以保持谱系多样性。其次,为克服基于权重选择的局限性,CCPS引入了语义多数投票机制,以从增强的种群中提取正确答案。该机制首先合并最终轨迹中完全相同的token序列,使得每个精确的重复序列贡献一票,同时保留其合并的权重用于平局决胜。然后,它通过仅比较候选解决方案彼此之间的差异(不参考标准答案)来聚类语义等效的答案。最后,CCPS返回由最大*不同*推理轨迹联盟支持的答案。这种设计将自一致性(Wang等人,2023)扩展到了基于粒子的解码。此外,该框架具有高度适应性:对于代码生成任务,CCPS可以无缝地根据其在自生成测试输入上的功能执行来聚类答案(Chen等人,2023a),为LLM推理瓶颈提供了一个稳健且可泛化的解决方案。
图1:在相同的N=6个加权粒子示例种群上,系统性重采样与Chopthin重采样的示意图(圆形面积∝权重;颜色/字母==奠基祖先;×==被移除;R==存活的根谱系)。⋆粒子权重较低,但能达到正确答案a⋆;token相同的副本在投票前已合并。
(a) 在此实现中,系统性重采样将所有权重重置为1/N:⋆在第一次事件时死亡,R谱系从6→4→2(*粒子贫化*),即使种群中包含a⋆,多数投票仍失败。
(b) 在此实现中,Chopthin携带不等权重前进:⋆存活,R谱系仅降至4,投票正确。
重采样器均不保证保留最终能到达正确答案的轨迹;此图说明的是一种可能机制而非预期结果。此处η限定了最大与最小输出权重之间的比率(第4.1节),a1, a2, a3是不同的错误答案,相同标签表示相同答案。
我们的贡献如下:
- 我们将等权重重采样确定为基于SMC的推理中谱系多样性损失的来源,并将这种损失与ESS所概括的权重集中区分开来。
- 我们将Chopthin重采样器引入语言模型解码,限制最大与最小输出权重之间的比率,携带不等权重前进,同时保持SMC近似在条件期望下的无偏性并保证重采样后ESS的下界。
- 我们将其与先去重后聚类的语义多数选择器配对,该选择器防止最终轨迹中的精确重复获得重复计数票,并根据执行行为聚类程序(针对代码任务)。
- 我们在三个开源模型和五个推理基准上进行评估:Chopthin在15项设置中的13项中提升了预言机覆盖率,CCPS在15项设置中的14项中达到或改进了相对于Power-SMC的最终答案准确率,消融实验将覆盖率提升归因于保留的轨迹多样性,准确率提升归因于语义多数选择器。
## 2 背景:作为序列蒙特卡洛的权力采样
### 2.1 序列级权力分布
令pθ为在词表V上预训练的自回归语言模型。给定提示x,它为序列y=(y1,...,yT)分配概率,该序列以序列结束符(EOS)结尾:
pθ(y|x)=∏t=1^T pθ(yt|x,y1:t-1)。
对于任意指数α>1,*序列级权力分布*定义为:
πα(y|x) = pθ(y|x)^α / Zα(x),其中 Zα(x)=∑y pθ(y|x)^α。
指数作用于完整序列的概率,在不改变模型参数的情况下将质量向高似然序列移动。近期分析将RL后训练带来的大部分推理增益归因于这种锐化(Yue等人,2025)。精确采样不可行:公式(1)中的归一化常数需要对指数级数量的完整序列空间求和。在温度1/α下采样每个token会在每一步进行重新归一化,因此其诱导的序列分布并非πα(Karan和Du,2026)。
### 2.2 基于前缀的序列蒙特卡洛
权力采样可以改写为序列蒙特卡洛(SMC)(Azizi等人,2026),采用(Del Moral等人,2006)的标准构建方式。采样器保持N个粒子。粒子i持有前缀y1:t^(i)和一个权重,所有N个前缀作为一个批次一起解码。在t个token之后,未归一化的中间目标为:
γt(y1:t|x) = pθ(y1:t|x)^αt,其中 αt = 1 + (α-1) min(t/Tramp, 1),α0 := 1。
这里γt是t个token后的中间目标:对前t个token进行相同的权力构建,使用部分指数αt。该指数是α-斜坡:它在最初的Tramp个token内从1线性增长到α,然后保持为α。该斜坡缓解了解码早期的权重退化(权重集中在少数粒子上)(Azizi等人,2026)。在每一步,每个粒子从提议分布q(⋅|x,y1:t-1)中采样下一个token。在Power-SMC中,提议分布通常等于基础模型pθ(⋅|x,y1:t-1)。然后为每个粒子i计算重要性权重:
wt(i) ∝ γt(y1:t^(i)|x) / [q(y1:t^(i)|x) · W0^i],其中W0^i是初始权重。
粒子的未归一化权重更新反映了其路径相对于目标的似然度。
在解码结束时,粒子种群代表序列级权力分布πα的近似。然而,如引言所述,标准SMC的等权重重采样步骤会导致谱系多样性损失,这促使我们采用Chopthin重采样器。相似文章
采样更多,获得更少:校准是大语言模型多样性的瓶颈
本文引入了一种有效性-多样性框架,将大语言模型中的多样性崩溃归因于解码过程中的排序和形状校准偏差,并在 14 种语言模型上进行了验证。
CForce:通过一致性强制提升dLLMs的并行解码
本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。
解码阶段间歇性注入随机 token 可在无需微调的情况下提升 LLM 多样性
哈佛大学的一篇研究论文提出了 Recoding-Decoding (RD),这是一种新型解码方案,通过注入随机引导短语和偏转 token 来挖掘 LLM 的长尾知识,在无需微调的情况下显著提升输出多样性。该方法在保持高相关性的同时缓解了回复同质化问题,且模型能力越强,多样性提升越明显。
委托投票何时击败多数表决?一种基于委托的多样本LLM推理聚合器
论文提出了一种基于委托的聚合器,名为传播代理投票(PPV),它利用字母熵和推理几何改进多样本LLM推理中的多数投票,在MMLU-Pro上取得了收益,无需外部标签或辅助训练。
更深并不总是更好:通过置信层解码缓解对齐损失
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。