置信度感知对齐让推理型大语言模型更加可靠
摘要
本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。
arXiv:2605.07353v1 公告类型:new
摘要:大型推理模型常常通过存在缺陷的中间步骤得出正确答案,这导致最终准确率与推理可靠性之间存在差距。现有的对齐策略依赖外部验证器或大规模采样来解决这一问题,限制了可扩展性。在本文中,我们引入了CASPO(置信度感知逐步偏好优化),这是一个通过迭代直接偏好优化将token级别的置信度与逐步逻辑正确性进行对齐的框架,无需训练单独的奖励模型。在推理阶段,我们提出了置信度感知思考(CaT),利用经过校准的置信度动态剪枝不确定的推理分支,仅需O(V)的极低延迟。在十个基准测试和多个模型家族上的实验表明,CASPO一致性地提高了推理可靠性和推理效率。CASPO可缩放至Qwen3-8B-Base,并在未使用奖励模型数据的情况下,在AIME'24和AIME'25上超越了树搜索基线。我们还发布了一个带有置信度标注的逐步数据集,以支持对推理可靠性的细粒度分析。代码可在 https://github.com/Thecommonirin/CASPO 获取。
查看缓存全文
缓存时间: 2026/05/11 07:17
# 意识自信的对齐使推理大语言模型更加可靠
来源:https://arxiv.org/html/2605.07353
Kejia Chen1, Jiawen Zhang1, Yihong Wu2, Kewei Gao1, Jian Lou3, Zunlei Feng1, Mingli Song1, Ruoxi Jia4 1浙江大学 2蒙特利尔大学 3中山大学 4弗吉尼亚理工大学
###### 摘要
大型推理模型通常通过存在缺陷的中间步骤得出正确答案,这导致了最终准确率与推理可靠性之间的差距。现有的对齐策略通过外部验证器或大规模采样来解决这一问题,但限制了可扩展性。在本工作中,我们引入了 CASPO(Confidence-Aware Step-wise Preference Optimization,置信度感知逐步偏好优化),这是一个通过迭代直接偏好优化(Direct Preference Optimization, DPO)将标记级置信度与逐步逻辑正确性对齐的框架,无需训练独立的奖励模型。在推理阶段,我们提出了置信度感知思维(Confidence-aware Thought, CaT),它利用这种校准后的置信度以可忽略的 O(V) 延迟动态剪枝不确定的推理分支。在十个基准和多个模型族上的实验表明,CASPO consistently 提高了推理可靠性和推理效率。值得注意的是,CASPO 可扩展至 Qwen3-8B-Base,并在 AIME’24 和 AIME’25 上超越了树搜索基线,且未使用奖励模型数据。我们还发布了一个带有置信度注释的逐步数据集,以支持对推理可靠性的细粒度分析。代码可在 https://github.com/Thecommonirin/CASPO 获取。
## 1 引言
以 OpenAI-o1 (jaech2024openai, (https://arxiv.org/html/2605.07353#bib.bib20)) 和 Qwen-3 (yang2025qwen3, (https://arxiv.org/html/2605.07353#bib.bib49)) 为代表的大型推理模型(Large Reasoning Models, LRMs)通过详细的逐步生成,大幅推动了数学和科学问题解决能力的发展。然而,单纯为了最终答案的正确性优化这些模型掩盖了一个关键缺陷:它们经常通过逻辑上有缺陷的中间步骤得出正确的结论 (arcuschin2503chain, (https://arxiv.org/html/2605.07353#bib.bib1))。在医疗和金融等高利害领域 (fadeeva2024fact, (https://arxiv.org/html/2605.07353#bib.bib8); zhang2025towards, (https://arxiv.org/html/2605.07353#bib.bib57)),依赖无效的推理轨迹会带来重大风险。因此,可靠地部署 LRM 不仅需要准确的最终输出,还需要可验证的合理推理轨迹。
这一缺陷的根本原因在于模型内部置信度与逻辑正确性之间存在根本性的不对齐。在当前的大型推理模型中,标记级概率反映的是表面的字符串流畅度和模式频率,而非真正的演绎有效性 (arcuschin2503chain, (https://arxiv.org/html/2605.07353#bib.bib1); yang2025probability, (https://arxiv.org/html/2605.07353#bib.bib51))。因此,模型可能会自信地幻觉出一个语法正确但逻辑错误的步骤,而在执行严格但不熟悉的推导时却表现出低置信度。这种普遍的校准偏差阻止了内部置信度成为自我验证的可靠指标。
目前提高可靠性的努力主要在轨迹层面进行。思维链(Chain-of-Thought, CoT)(wei2022chain, (https://arxiv.org/html/2605.07353#bib.bib46)) 通过提示引发中间步骤,自我一致性(Self-Consistency)(wang2022self, (https://arxiv.org/html/2605.07353#bib.bib44)) 通过多数投票聚合多条路径,而诸如组相对策略优化(Group Relative Policy Optimization, GRPO)等强化学习框架则使用可验证的奖励将模型与首选轨迹对齐 (guo2025deepseek, (https://arxiv.org/html/2605.07353#bib.bib13))。即使像 rStar-Math (guan2025rstar, (https://arxiv.org/html/2605.07353#bib.bib12)) 这样的扩展方法,也主要将推理过程视为一个整体的输出。这种以轨迹为中心的范式提出了一个困境:轨迹级方法忽视了单个步骤的可靠性,而密集搜索的方法则产生了限制可扩展性的计算成本。
为了解决这一粒度差距,最近的工作引入了逐步监督以提高中间推理质量。逐步偏好优化 (razghandi2025cer, (https://arxiv.org/html/2605.07353#bib.bib38)) 和基于过程自我奖励框架 (tu2025enhancing, (https://arxiv.org/html/2605.07353#bib.bib42)) 将中间反馈整合到训练中,而如 SwS (liang2025sws, (https://arxiv.org/html/2605.07353#bib.bib29)) 等弱点驱动的增强策略则诊断系统性失败。然而,这些方法通常依赖于启发式反馈或外部验证器,并没有明确地对模型自身的不确定性进行建模。通过标记概率进行置信度估计的并行工作 (xu2024genarm, (https://arxiv.org/html/2605.07353#bib.bib48)) 面临另一个障碍:实证证据 (arcuschin2503chain, (https://arxiv.org/html/2605.07353#bib.bib1); yang2025probability, (https://arxiv.org/html/2605.07353#bib.bib51); hu2025open, (https://arxiv.org/html/2605.07353#bib.bib19)) 表明,标记级置信度反映的是表面流畅性或常见模式,而非推理可靠性。模型通常对语法正确但逻辑不相关的步骤赋予高概率,并低估复杂推导中的不确定性。缩小这一差距需要一种原则性的方法,将内部置信度与推理正确性同步。
我们的核心见解是,可靠的推理需要校准,即高预测置信度应保留给有效的逻辑步骤。将内部概率与外部正确性对齐,使得模型自身的熵可以作为高保真、零成本的信号来指导生成,从而在推理过程中消除对外部评估器的依赖。基于这一原则,我们提出了 CASPO(Confidence-Aware Step-wise Preference Optimization),一个在训练和推理中实现逐步置信度统一框架。
在训练期间,CASPO 通过构建对比“正确但不确定”的步骤与“自信但错误”的预测的偏好对来校准模型。这些对通过迭代 DPO 进行优化,使模型的概率分布与逻辑有效性对齐。在推理期间,我们引入了置信度感知思维(CaT)策略,它使用累积的逐步置信度来动态扩展有前景的路径并剪枝不确定的轨迹。这种两阶段设计以可忽略的计算开销将逐步改进传播到可信的最终答案中。
总之,我们的贡献如下:我们提出了 CASPO,一个利用模型内在置信度实现可靠推理而无需外部验证器的统一框架。通过在训练期间将标记级熵与逻辑正确性对齐,该方法实现了自我校准,并解决了探索与可靠性之间的张力。这种校准支持我们的 CaT 策略,该策略在推理时以 O(V) 的延迟开销剪枝不确定的推理分支。在十个基准上的广泛实验显示,该方法具有强劲的数据和计算效率:CASPO 将 Qwen2.5-7B-Instruct 的平均准确率从 44.4% 提高到 50.6%,并在推理时配合 CaT 达到 56.1%。在 Qwen3-8B-Base 上,它在不使用任何奖励模型数据的情况下,在 AIME2024 和 AIME2025 上超越了诸如 rStar-Math (guan2025rstar, (https://arxiv.org/html/2605.07353#bib.bib12)) 和 Satori (shen2025satori, (https://arxiv.org/html/2605.07353#bib.bib41)) 等树搜索基线。
## 2 相关工作
大型推理模型。大型推理模型的演进已从简单的提示发展到更复杂的策略。CoT 表明,显式的逐步推理可以提高复杂任务的性能,而自我一致性 (wang2022self, (https://arxiv.org/html/2605.07353#bib.bib44)) 通过聚合多条推理路径增强了鲁棒性。最近的系统如 OpenAI 的 o1 (jaech2024openai, (https://arxiv.org/html/2605.07353#bib.bib20)) 和 DeepSeek-R1 (guo2025deepseek, (https://arxiv.org/html/2605.07353#bib.bib13)) 现在利用后训练来引发扩展的推理轨迹,以实现更好的透明度和准确性。与此同时,蒸馏技术 (hsieh2023distilling, (https://arxiv.org/html/2605.07353#bib.bib17)) 将高质量的推理轨迹转移到较小的模型中以提高效率。例如,(guan2025rstar, (https://arxiv.org/html/2605.07353#bib.bib12)) 明确利用来自大型教师模型的推理来监督较小的学生模型,在保持性能的同时减少数据需求。诸如思维树(Tree-of-Thoughts)(yao2023tree, (https://arxiv.org/html/2605.07353#bib.bib52))、思维图(Graph-of-Thoughts)(besta2024graph, (https://arxiv.org/html/2605.07353#bib.bib2)) 以及强化学习 (zhang2024rest, (https://arxiv.org/html/2605.07353#bib.bib54); zhang2025process, (https://arxiv.org/html/2605.07353#bib.bib56); li2025treepo, (https://arxiv.org/html/2605.07353#bib.bib27)) 等结构化方法进一步扩展了推理空间,尽管这往往以牺牲相当大的计算效率为代价。
推理过程验证。随着推理轨迹的延长,确保其真实性变得至关重要。一个主要的方向涉及过程奖励模型(Process Reward Models, PRMs)(lightman2023let, (https://arxiv.org/html/2605.07353#bib.bib30); wang2023math, (https://arxiv.org/html/2605.07353#bib.bib43)),在诸如 PRM800K (lightman2023let, (https://arxiv.org/html/2605.07353#bib.bib30)) 的数据集上进行训练,以对中间推理步骤进行评分。后续工作如 PURE (cheng2025stop, (https://arxiv.org/html/2605.07353#bib.bib5)) 细化了强化学习中的逐步信用分配。除了直接评分外,协作审议 (patnaik2025helps, (https://arxiv.org/html/2605.07353#bib.bib35); patnaik2025learning, (https://arxiv.org/html/2605.07353#bib.bib36)) 和选择性推理优化 (lightman2023let, (https://arxiv.org/html/2605.07353#bib.bib30); du2023improving, (https://arxiv.org/html/2605.07353#bib.bib7); qu2024recursive, (https://arxiv.org/html/2605.07353#bib.bib37)) 表明,模型可以通过相互验证和偏好排名来增强可靠性。虽然自主自我纠正仍然困难,但将自我验证与轻量级外部监督结合,为在没有巨大奖励模型成本的情况下实现可靠性提供了一条有前景的途径。
验证增强推理。除了评估之外,最近的工作将验证直接整合到推理中。测试时缩放生成多个候选解决方案并选择最可靠的一个,以高计算成本提高准确性。在训练时,带有可验证奖励的强化学习(例如,SimpleRL (zeng2025simplerl, (https://arxiv.org/html/2605.07353#bib.bib53)),PURE (cheng2025stop, (https://arxiv.org/html/2605.07353#bib.bib5)))通过奖励真实轨迹迭代地改进推理。为了减少对外部奖励模型的依赖,基于 DPO 的方法通过似然估计近似奖励信号。虽然协同训练生成器和验证器 (ouyang2022training, (https://arxiv.org/html/2605.07353#bib.bib34)) 也已被探索,但可扩展性和稳定性问题依然存在。基于这些方向,CASPO 不同于这些协作或外部蒸馏方法:它不依赖多模型协作或模仿教师偏好,而是通过内在的逐步置信度校准统一训练和推理,利用学生模型自身的标记熵来指导可靠的推理路径。
## 3 方法
参见图 1 标题:图 1:CASPO 概览:一个用于校准推理的统一框架。CASPO 首先通过迭代偏好优化将内在不确定性与逐步正确性对齐,然后在推理期间利用这种校准后的置信度动态剪枝推理树。CASPO 将内在置信度估计整合到一个用于训练和推理的统一流程中。如图 1 (https://arxiv.org/html/2605.07353#S3.F1) 所示,我们的框架在两个相互连接的阶段运行:(i) 置信度感知偏好优化,通过迭代 DPO 将模型不确定性与逐步正确性对齐;(ii) 置信度感知思维(CaT)推理,利用这种校准后的不确定性来动态导航和剪枝推理树。
### 3.1 动机与问题表述
大型推理模型的最新进展 (li2025treepo, (https://arxiv.org/html/2605.07353#bib.bib27); wang2022self, (https://arxiv.org/html/2605.07353#bib.bib44); zuo2025ttrl, (https://arxiv.org/html/2605.07353#bib.bib59)) 突显了一个关键的张力:采样多条推理路径通过多样性提高了性能,但往往引入了看似合理但幻觉的步骤。现有范式主要依赖计算密集的外部验证器或大规模采样,这引入了巨大的推理开销,并对模型对其自身推理过程的内在评估提供了有限的见解。
我们的目标是使模型具备在给定当前上下文 $q_t$ 下**自我评估**每个推理步骤 $s_t$ 质量的能力。我们假设真正的推理能力不仅仅最终得到正确答案;它还应体现在模型采取有效推理步骤时的置信度中。换句话说,正确的推理应对应集中的概率质量,或者说,低预测熵。因此,CASPO 明确地将模型的预测概率分布与其推理步骤的正确性对齐,鼓励以高置信度生成有效步骤,同时抑制无效或不可靠的步骤。
### 3.2 CASPO:置信度感知逐步偏好优化
符号。我们考虑一个自回归语言模型 $\pi_\theta$,它定义了给定输入提示 $x$ 的下一个标记分布 $\pi_\theta(\cdot|x)$。对于数据集中的每个查询 $x$,我们将推理过程视为一系列 $m$ 个步骤 $s_{1:m} = (s_1, s_2, ..., s_m)$,最终得出答案 $a$。每个步骤 $s_j$ 是在特定上下文中生成的,我们将其定义为**子问题** $q_j$。此上下文连接了原始查询和先前的推理历史:
$$
q_j = [x, s_1, s_2, ..., s_{j-1}], \quad (1)
$$
然后模型生成当前步骤 $s_j \sim \pi_\theta(\cdot|q_j)$。这种公式允许我们以细粒度的方式评估中间推理的质量。
逐步置信度估计。为了在没有外部监督的情况下量化模型的内在不确定性,我们利用标记级熵。设模型生成的步骤答案 $s_j$ 由标记序列 $\{t_l\}_{l=1}^L$ 组成。给定上下文 $q_j$,此特定步骤 $s_j$ 的置信度计算为负平均熵:
$$
\text{confidence}(s_j|q_j) = -\frac{1}{L} \sum_{l=1}^{L} \sum_{v \in \mathcal{V}} \pi_\theta(v|q_j, t_{<l}) \log \pi_\theta(v|q_j, t_{<l}), \quad (2)
$$
其中 $L$ 是步骤答案的长度,$\mathcal{V}$ 是词汇表,$\pi_\theta(v|q_j)$ 表示标记 $v$ 上的预测分布。较高的累积熵表示较大的不确定性,因此生成的置信度较低。我们采用标记级熵作为不确定性指标,因为它捕捉了模型的内在不确...相似文章
CoRA: 面向可靠思维链推理的置信度-理由对齐
本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。
CASE: 因果对齐与结构强化以提升思维链忠实性
提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。
通过逐步置信归因诊断黑盒大语言模型中的多步推理失败
提出逐步置信归因(SCA),一个无需内部访问即可为黑盒大语言模型的推理轨迹分配逐步置信度的框架,利用信息瓶颈原理区分合法变异性与错误。实验表明,SCA能可靠地识别低置信度步骤,并将自纠正成功率相比答案级别反馈提升高达13.5%。
面向高效可控LLM推理的代理式思维链引导
ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。
基于约束锚定的推理轨迹
提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。