重采样不如精炼:LLM推理中的测试时自校正

arXiv cs.AI 论文

摘要

一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。

arXiv:2608.05643v1 公告类型:新 摘要:测试时扩展通过额外推理计算提升了LLM推理能力,但单纯扩大采样可能遭遇收益递减:新的轨迹往往重复已有的答案模式,而非增加有用的推理多样性。基于验证器的选择提供了一种替代方案,但其性能取决于外部奖励模型的校准质量。我们提出一种无需验证器的广度--深度精炼框架,利用测试时计算同时探索和改进候选解决方案。该方法采样多个独立的推理轨迹,通过迭代的自我批评与自我修正对每条轨迹进行精炼,并通过多数投票聚合精炼后的答案。广度保留了多样化的初始尝试,而深度则在聚合之前修复局部推理错误。在AIME24、AIME25、AMC、OlympiadBench和MATH500上,我们的方法在多个开放权重模型上持续优于贪心解码、多数投票、基于验证器的best-of-$N$、束搜索和前瞻解码。例如,使用Qwen2.5-1.5B,在MATH500上准确率从最强的基于验证器的基线提升至$58.0\%$,在AMC上从$25.0\%$提升至$32.5\%$。这些结果表明,将测试时计算用于精炼采样轨迹,而非仅仅采样更多候选或依赖验证器引导的选择,可以更加有效。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# 重采样之上,求精:LLM推理的测试时自我修正

Ahsan Bilal¹, Muhammad Ahmed Mohsin², Muhammad Umer², Lena Trigg¹, Ali Subhan³, Muhammad Ali⁴, Dean F. Hougen¹  
¹University of Oklahoma, ²Stanford University, ³Universitat Pompeu Fabra, ⁴Air University  
通讯:[email protected] (https://arxiv.org/html/2608.05643v1/mailto:[email protected])

###### 摘要

测试时扩展通过使用额外的推理计算来提升LLM推理能力,但仅靠更宽的采样可能遭遇收益递减:新的采样轨迹往往重复已有的答案模式,而不是增加有用的推理多样性。基于验证器的选择提供了一种替代方案,但其性能取决于外部奖励模型的校准质量。我们提出了一种无验证器的“广度–深度”求精框架,利用测试时计算同时探索和改进候选解决方案。该方法采样多个独立的推理轨迹,通过迭代的自我批判与自我修正对每条轨迹进行求精,并通过多数投票聚合求精后的答案。广度保留了多样化的初始尝试,而深度则在聚合前修复局部推理错误。在AIME24、AIME25、AMC、OlympiadBench和MATH500上,我们的方法在多个开放权重模型中始终优于贪心解码、多数投票、基于验证器的best-of-N、束搜索和前瞻解码。例如,使用Qwen2.5-1.5B时,在MATH500上的准确率从最强的基于验证器基线提升至58.0%,在AMC上从25.0%提升至32.5%。这些结果表明,测试时计算在用于求精采样轨迹时,比仅采样更多候选或依赖验证器引导的选择更加有效。

# 重采样之上,求精:LLM推理的测试时自我修正

Ahsan Bilal¹, Muhammad Ahmed Mohsin², Muhammad Umer², Lena Trigg¹, Ali Subhan³, Muhammad Ali⁴, Dean F. Hougen¹  
¹University of Oklahoma, ²Stanford University, ³Universitat Pompeu Fabra, ⁴Air University  
通讯:[email protected] (https://arxiv.org/html/2608.05643v1/mailto:[email protected])

## 1 引言

测试时扩展已成为提升大语言模型(LLM)推理能力的一种实用方式,无需增大模型规模或更新模型参数。这类方法不依赖单一回答,而是在生成最终答案前,将额外的推理计算分配给候选推理轨迹的生成、搜索、验证或求精过程(Beirami等,2024 (https://arxiv.org/html/2608.05643#bib.bib20);Zuo等,2025 (https://arxiv.org/html/2608.05643#bib.bib8);Inoue等,2026 (https://arxiv.org/html/2608.05643#bib.bib9);Wang等,2026 (https://arxiv.org/html/2608.05643#bib.bib10))。这一范式在数学推理中尤为重要,因为推理链上的早期错误会传播到最终答案,而额外的推理计算可以暴露单次贪心生成无法获得的替代解题路径。

一种常见策略是采样多条推理轨迹,并使用多数投票或基于验证器的选择进行聚合。自洽性通过选取采样推理路径中最频繁的答案来提高可靠性(Wang等,2022 (https://arxiv.org/html/2608.05643#bib.bib19)),而基于验证器的方法则使用结果级或过程级奖励模型对候选解答进行评分(Cobbe等,2021 (https://arxiv.org/html/2608.05643#bib.bib14);Lightman等,2023 (https://arxiv.org/html/2608.05643#bib.bib15);Li等,2023 (https://arxiv.org/html/2608.05643#bib.bib16);Wang等,2024a (https://arxiv.org/html/2608.05643#bib.bib29))。然而,这些方法有两个局限。第一,额外的样本并不总能提供真正新的推理证据;如图1 (https://arxiv.org/html/2608.05643#S1.F1)所示,更大的采样预算可能反复产生少数主导推理方向的各种变体。第二,基于验证器的选择引入了对奖励模型的依赖,而奖励模型的校准误差会直接影响最终答案的选择(Dorner等,2025 (https://arxiv.org/html/2608.05643#bib.bib13);Li等,2025b (https://arxiv.org/html/2608.05643#bib.bib18);Zhang等,2025 (https://arxiv.org/html/2608.05643#bib.bib17))。

自我批判与自我求精提供了另一个方向:与其仅采样更多候选或依赖外部评分器,模型可以利用额外的测试时计算来检查和改进自身的推理。先前工作已表明,迭代反馈与修订可以改进LLM输出(Madaan等,2023a (https://arxiv.org/html/2608.05643#bib.bib25)),后来的方法也探索了用于推理任务的自我修正、反思、渐进求精和蒙特卡洛求精(Shinn等,2024 (https://arxiv.org/html/2608.05643#bib.bib27);Zhang等,2024b (https://arxiv.org/html/2608.05643#bib.bib24);Du等,2025 (https://arxiv.org/html/2608.05643#bib.bib3);Yuan和Xie,2025 (https://arxiv.org/html/2608.05643#bib.bib1))。与此同时,内在自我修正仍然困难:LLM可能无法识别自身的推理错误,甚至在朴素地应用求精时会降低答案质量(Huang等,2024 (https://arxiv.org/html/2608.05643#bib.bib5))。这表明有效的求精不应依赖单次修正尝试,而应以结构化方式利用测试时计算。

最近的工作通过训练模型修正或验证自身输出来改进自我修正:SCoRe使用多轮强化学习来强化内在自我修正(Kumar等,2024 (https://arxiv.org/html/2608.05643#bib.bib6)),而ReVISE通过学习停止或求精策略,借助自我验证完成(Lee等,2025 (https://arxiv.org/html/2608.05643#bib.bib12))。然而,这两种方法都需要额外的训练、学习到的验证机制或奖励驱动的优化。这限制了它们作为简单、与模型无关的测试时方法的使用。

我们提出了一种无需训练、无需验证器的“广度–深度”求精框架,在推理时仅使用基础模型。它采样多个独立的采样轨迹,通过迭代的自我批判与自我修正对每条轨迹求精,并通过多数投票聚合求精后的答案。

#### 贡献。
我们的贡献有三方面。第一,我们指出了纯宽度测试时扩展的两个局限:多样性饱和(更大的采样预算会重新访问已有语义推理簇)和逐轨迹幻觉(每条i.i.d.采样轨迹仍暴露于相同的扰动机制)。第二,我们提出了一个“广度–深度”求精框架来解决这两个问题:广度通过\\(N\\)个独立采样轨迹保留多样化的初始推理路径,深度则应用\\(D\\)轮自我批判与自我修正,在多数投票聚合之前修复错误。该方法不需要外部验证器、PRM、学习到的停止策略或额外训练。第三,我们在五个数学推理基准和四个开放权重模型上评估该框架,表明其相较于贪心解码、多数投票、基于验证器的best-of-\\(N\\)、束搜索和前瞻解码基线具有一致的提升,同时还提供了计算归一化分析和求精动态诊断。

参考说明(a) 主导簇质量。参考说明(b) 多样性饱和。
图1:采样预算增加时的冗余情况。随着采样预算增长,采样轨迹仍集中在少数语义推理簇中,而每个样本对应的唯一推理方向数量在减少。

参考说明
图2:所提出的“广度–深度”求精框架概览。每条\\(N\\)采样轨迹都通过\\(D\\)个深度层进行求精,每一层包含三个阶段:(1)由\\(\\pi_{\\theta}^{\\mathsf{G}}\\)进行的*推理延续*(\\(g_{i}^{(d)}\\)),(2)由\\(\\pi_{\\theta}^{\\mathsf{C}}\\)进行的*自我批判*(\\(c_{i}^{(d)}\\)),以及(3)由\\(\\pi_{\\theta}^{\\mathsf{R}}\\)进行的*自我修正*(\\(r_{i}^{(d)}\\))。最终轨迹通过多数投票聚合得到最终答案\\(\\hat{a}\\)。无需验证器或额外训练。

## 2 问题动机

#### 固定预算采样下的多样性饱和。
设\\(\\pi_{\\theta}\\)表示语言模型策略,设\\(\\{r_{i}^{(0)}\\}_{i=1}^{N}\\stackrel{{\\scriptstyle\\text{i.i.d.}}}{{\\sim}}\\pi_{\\theta}(\\cdot\\mid x)\\) 是针对输入问题\\(x\\)独立采样的\\(N\\)条推理轨迹。重复采样后接多数投票是标准的测试时扩展策略(Wang等,2022 (https://arxiv.org/html/2608.05643#bib.bib19);Beirami等,2024 (https://arxiv.org/html/2608.05643#bib.bib20);Inoue等,2026 (https://arxiv.org/html/2608.05643#bib.bib9))。然而,其收益取决于额外样本是否提供真正新的推理证据,而非相同答案模式的变体。我们将初始采样轨迹按语义相似性分组为基于句子嵌入的簇。设\\(\\{\\mathcal{C}_{j}\\}_{j\\geq 1}\\)为这些簇,经验质量为\\(p_{j}(N)=N^{-1}\\sum_{i=1}^{N}\\mathds{1}[r_{i}^{(0)}\\in\\mathcal{C}_{j}]\\)。我们跟踪已实现的簇数量\\(\\mathcal{R}(N)\\)和熵\\(\\mathcal{H}(N)=-\\sum_{j}p_{j}(N)\\log_{2}p_{j}(N)\\)。它们衡量不同推理方向的数量以及样本在这些方向上的均匀程度。图1 (https://arxiv.org/html/2608.05643#S1.F1)显示,随着\\(N\\)增大,多样性增长缓慢;更多细节见附录A.6 (https://arxiv.org/html/2608.05643#A1.SS6)。

\\[
\\frac{\\mathcal{R}(N)}{N}\\xrightarrow{N\\to\\infty}{}0,\\qquad\\frac{\\mathrm{d}\\mathcal{H}(N)}{\\mathrm{d}N}\\xrightarrow{N\\to\\infty}{}0.
\\tag{1}
\\]

例如,在AIME-24上,唯一簇的数量仅从\\(N=2\\)时的大约1.2增加到\\(N=32\\)时的大约2.5,AIME-25上也呈现类似趋势。因此,更大的宽度预算会越来越多地重新访问已有的语义推理簇,而不是扩展推理方向的集合。这促使我们不仅使用额外的测试时计算来重采样,也要对已采样的轨迹进行求精。

#### 作为系统性准确率下限的幻觉。
纯宽度采样的另一个互补局限是,每条采样轨迹仍可能遭受相同的局部生成错误。考虑一个具有\\(k\\)种可能答案类别的问题。沿用Liu等 (2024 (https://arxiv.org/html/2608.05643#bib.bib34)) 的方法,设\\(\\lambda\\in(1/k,1]\\)为模型的潜在准确率,即其预期答案正确的概率;设\\(h\\in(0,1)\\)为真实答案被扰动偏离该预期答案、转而落入其余\\(k-1\\)个类别之一的概率。对于单次采样答案\\(\\hat{a}_{\\mathrm{single}}\\sim\\pi_{\\theta}(\\cdot\\mid x)\\)和黄金答案\\(a^{\\star}\\),期望的单轨迹准确率为

\\[
\\mathbb{E}\\!\\bigl[\\mathds{1}[\\hat{a}_{\\mathrm{single}}=a^{\\star}]\\bigr]
=\\lambda(1-h)+\\frac{h(1-\\lambda)}{k-1}
\\tag{2}
\\]
\\[
=\\lambda\\!\\left(1-\\frac{hk}{k-1}\\right)+\\frac{h}{k-1}<\\lambda.
\\]

该不等式成立是因为当\\(\\lambda>1/k\\)时,预期答案比随机猜测更可能正确。因此,扰动破坏正确预期答案的频率高于其偶然修复错误答案的频率。结果是,实际的首轮答案系统地低估了模型的潜在准确率。纯宽度扩展无法消除这一效应,因为每条i.i.d.采样轨迹都暴露于相同的扰动机制。这促使我们在聚合之前对每条采样轨迹进行求精,而不仅仅是采样更多样本。

#### 结构化求精作为原则性修复。
式(1) (https://arxiv.org/html/2608.05643#S2.E1)和(2) (https://arxiv.org/html/2608.05643#S2.E2)指出了纯宽度扩展的两个局限:样本空间的冗余性和逐轨迹幻觉偏差。这两者都支持加入结构化的深度。先前的自我求精方法表明,模型可以通过批判和修订自身响应来改进生成输出(Madaan等,2023a (https://arxiv.org/html/2608.05643#bib.bib25);Shinn等,2024 (https://arxiv.org/html/2608.05643#bib.bib27);Zhang等,2024b (https://arxiv.org/html/2608.05643#bib.bib24)),但朴素的自我修正也可能降低推理质量(Huang等,2024 (https://arxiv.org/html/2608.05643#bib.bib5))。Liu等 (2024 (https://arxiv.org/html/2608.05643#bib.bib34)) 表明,第二轮修正可以降低有效幻觉率,缩小式(2)中的差距。这促使我们为每条采样轨迹应用\\(D\\)轮求精深度,其中每一深度由一次自我批判和随后的自我修正组成。广度通过\\(N\\)个独立采样轨迹保留多样化的起始方向,从而解决式(1)的问题;深度则在聚合前对每条轨迹求精,从而解决式(2)的问题。对求精后的输出进行多数投票,可以避免对外部验证器或奖励模型校准的依赖(Cobbe等,2021 (https://arxiv.org/html/2608.05643#bib.bib14);Lightman等,2023 (https://arxiv.org/html/2608.05643#bib.bib15);Dorner等,2025 (https://arxiv.org/html/2608.05643#bib.bib13);Zhang等,2025 (https://arxiv.org/html/2608.05643#bib.bib17))。

**算法1** 广度–深度测试时求精

1: 问题\\(x\\); 策略\\(\\pi_{\\theta}\\),其生成器/批判者/修正者角色为\\(\\pi_{\\theta}^{\\mathsf{G}},\\pi_{\\theta}^{\\mathsf{C}},\\pi_{\\theta}^{\\mathsf{R}}\\); 采样轨迹数\\(N\\); 深度\\(D\\); 采样温度\\(\\tau>0\\)  
2: 最终预测\\(\\hat{a}\\)  
3: \# 初始化  
4: **for** \\(i=1\\) **to** \\(N\\) **do** ⊳ 并行/批处理  
5:   \\(r_{i}^{(0)}\\sim\\pi_{\\theta}^{\\mathsf{G}}(\\cdot\\mid x)\\) ⊳ 在温度\\(\\tau\\)下进行i.i.d.采样  
6: **end for**  
7: \# 迭代求精  
8: **for** \\(d=1\\) **to** \\(D\\) **do**  
9: **for** \\(i=1\\) **to** \\(N\\) **do** ⊳ 所有\\(N\\)条在一个批量调用中处理  
10:   \\(g_{i}^{(d)}\\sim\\pi_{\\theta}^{\\mathsf{G}}\\!\\bigl(\\cdot\\mid x,\\,r_{i}^{(d-1)}\\bigr)\\) ⊳ 式(3):推理延续  
11:   \\(c_{i}^{(d)}\\sim\\pi_{\\theta}^{\\mathsf{C}}\\!\\bigl(\\cdot\\mid x,\\,g_{i}^{(d)}\\bigr)\\) ⊳ 式(4):自我批判  
12:   \\(r_{i}^{(d)}\\sim\\pi_{\\theta}^{\\mathsf{R}}\\!\\bigl(\\cdot\\mid x,\\,g_{i}^{(d)},\\,c_{i}^{(d)}\\bigr)\\) ⊳ 式(5):自我修正  
13: **end for**  
14: **end for**  
15: \# 聚合  
16: **for** \\(i=1\\) **to** \\(N\\) **do**  
17:   \\(\\hat{a}_{i}\\leftarrow\\operatorname{\\Phi}\\!\\bigl(r_{i}^{(D)}\\bigr)\\) ⊳ 答案提取  
18: **end for**  
19: \\(\\hat{a}\\leftarrow V(\\hat{a}_{1},...,\\hat{a}_{N})\\) ⊳ 多数投票

相似文章

强化步骤级推理以实现LLM中的有效自我纠正

arXiv cs.CL

本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。