REIN:通过反思与弃权对齐弥合推理与可靠性之间的差距
摘要
本文介绍了REIN,一种对齐框架,通过训练大型推理模型在回答前进行明确反思,并在知识不足时主动弃权,从而减少幻觉。实验表明,REIN在多个基准上持续提升选择性准确率并减少幻觉。
arXiv:2608.07931v1 公告类型:新
摘要:大型推理模型(LRM)容易产生幻觉,这削弱了其可靠性,并给安全部署带来挑战。LRM中的幻觉源于两个不同的失败来源:推理幻觉,即错误的推理步骤传播到不正确的结论;以及知识幻觉,即模型缺乏回答查询所需的事实知识。为了解决推理幻觉,我们提出REIN,一种对齐框架,训练LRM生成结构化的推理序列,$\texttt{<think>} $$\rightarrow$ $\texttt{<reflection>} $$\rightarrow$ $\texttt{<answer>}$,从而在最终答案之前进行明确的自我反思。为了解决知识幻觉,REIN引入了一种奖励机制,当采样到的推理链均未产生正确答案时,鼓励模型明确弃权(例如“我不知道”),使模型避免做出没有依据的预测。在数学和常识推理基准上的广泛评估表明,REIN持续提高选择性准确率,减少错误但自我认可的响应,并在与竞争基线相比时保持高覆盖率。值得注意的是,REIN在单次前向传播中实现了这些增益,无需过程监督、推理时控制器、外部搜索或多轮批评。在多个骨干模型上的实验表明,REIN将幻觉代理指标相对基础模型降低了$58\sim72\%$,同时保持$86\sim91\%$的平均覆盖率,并在已尝试问题上的选择性准确率提高了$6.6\sim14.2\%$。
查看缓存全文
缓存时间: 2026/08/11 08:04
# 弥合推理与可靠性之间的鸿沟:通过反思与弃权对齐
来源:https://arxiv.org/html/2608.07931
Zhengze Huang1,\*Luyang Yu2,\*Di Hong1Xinzhe Huang1 Wanyu Lin3Zhixuan Chu1Zhan Qin1,†Tianhang Zheng1,†
1浙江大学区块链与数据安全全国重点实验室
2复旦大学
3香港理工大学
\*同等贡献
†通讯作者
###### 摘要
大型推理模型(LRMs)容易产生幻觉,这损害了其可靠性,并对安全部署构成挑战。LRMs中的幻觉源于两种不同的失败来源:推理幻觉,即存在缺陷的推理步骤传播到错误结论;以及知识幻觉,即模型缺乏回答查询所需的必要事实知识。为了解决推理幻觉,我们提出REIN,一种对齐框架,它训练LRMs生成结构化的推理序列,→\rightarrow→\rightarrow,从而在最终提交答案之前实现明确的自我反思。为了解决知识幻觉,REIN引入了一种奖励机制,当采样的推理链中没有任何一条产生正确答案时,鼓励模型明确弃权(例如,“我不知道”),从而使模型能够避免给出没有支持的预测。在数学和常识推理基准上的大量实验表明,与竞争性基线相比,REIN持续提高了选择准确性,减少了错误但自我认可的回答,并保持了高覆盖率。值得注意的是,REIN在单次前向传播中实现了这些收益,无需过程监督、推理时控制器、外部搜索或多轮批评。在多个主干网络上的实验表明,REIN将幻觉代理指标降低了58∼72%58\sim 72\%,相对基础模型,同时保持了86∼91%86\sim 91\%的平均覆盖率,并在已尝试问题上将选择准确性提高了6.6∼14.2%6.6\sim 14.2\%。参见图注图1:REIN训练流水线概述:反思增强的补全输入到带有反思和边界感知弃权奖励的GRPO中。
## 1 引言
大型推理模型(LRMs),如DeepSeek-R1(DeepSeek-AI,2025 (https://arxiv.org/html/2608.07931#bib.bib15))和Qwen3(Qwen团队,2025 (https://arxiv.org/html/2608.07931#bib.bib14)),通过引出显式的思维链(Wei等人,2022 (https://arxiv.org/html/2608.07931#bib.bib1)),在数学、科学推理和编程方面取得了实质性进展(Hendrycks等人,2021a (https://arxiv.org/html/2608.07931#bib.bib3);Zheng等人,2025 (https://arxiv.org/html/2608.07931#bib.bib19);Chen等人,2025 (https://arxiv.org/html/2608.07931#bib.bib18))。然而,显式推理并不能消除幻觉——它往往增加了无支持结论的表面合理性,产生看起来连贯且有说服力但仍然包含事实错误(Min等人,2023 (https://arxiv.org/html/2608.07931#bib.bib10))或内部不一致推理(Cheng等人,2025 (https://arxiv.org/html/2608.07931#bib.bib80))的输出。我们识别出幻觉的两种主要失败模式:推理级幻觉和知识级幻觉。在*推理级幻觉*中,模型拥有所需的知识,但特定的采样轨迹包含一个缺陷推理步骤,该步骤传播到错误答案。这种失败模式是可自我恢复的,因为不同的样本或经过验证的自我检查仍然可能产生正确答案。相比之下,在*知识级幻觉*中,模型在当前策略和采样预算下缺乏所需知识,任何额外的推理都只是为无支持的预测进行合理化。因此,额外的推理或反思无法挽救答案,唯一安全的行动是弃权。这两种模式需要根本不同的干预措施,将它们混为一谈是当前对齐方法中校准不良的核心来源。
现有方法最多只处理两种失败模式中的一种。结果级偏好对齐,如RLHF(Ouyang等人,2022 (https://arxiv.org/html/2608.07931#bib.bib4))和DPO(Rafailov等人,2023 (https://arxiv.org/html/2608.07931#bib.bib5)),优化最终响应,但对推理轨迹不提供显式监督,因此传播到最终答案的推理级错误仍然未被检测到。过程监督和自我修正方法,包括逐步过程奖励模型(Uesato等人,2022 (https://arxiv.org/html/2608.07931#bib.bib24);Lightman等人,2024 (https://arxiv.org/html/2608.07931#bib.bib25))、Self-Refine(Madaan等人,2023 (https://arxiv.org/html/2608.07931#bib.bib21))和Reflexion(Shinn等人,2023 (https://arxiv.org/html/2608.07931#bib.bib22)),专注于可靠性评估,但假设错误是可自我恢复的——它们没有机制区分可修复的推理失误与真正缺失的知识,最近证据表明,在没有外部反馈的情况下,模型往往无法检测到自己的错误,甚至可能推翻正确答案(Huang等人,2023 (https://arxiv.org/html/2608.07931#bib.bib30);Kamoi等人,2024 (https://arxiv.org/html/2608.07931#bib.bib31))。相反,弃权和不确定性校准方法,如拒绝微调(Xu等人,2024 (https://arxiv.org/html/2608.07931#bib.bib7))、R-Tuning(Zhang等人,2024 (https://arxiv.org/html/2608.07931#bib.bib37))和IDK令牌方法(Cohen等人,2024 (https://arxiv.org/html/2608.07931#bib.bib39);Cheng等人,2024 (https://arxiv.org/html/2608.07931#bib.bib8)),鼓励在不确定性下拒绝,但忽略了推理修复,因此每当可恢复的推理失败被误认为是不可恢复的知识缺口时,就会过度弃权。
如何建立一个统一的、以可靠性为导向的对齐框架,使模型能够在单次补全中决定当前推理是支持可靠答案还是应该弃权,这仍然是一个悬而未决的问题。我们提出REIN,一个对齐框架,它教导LRM在单次前向传播中,在提交答案之前反思自己的推理,并在答案未得到模型内部知识的充分支持时弃权。REIN训练模型生成结构化补全→\rightarrow→\rightarrow,其中span是一个可训练的可信度判断,其立场通过中心化的反思-真实性奖励与答案的已验证正确性对齐。为了处理知识级失败,REIN进一步从模型自身采样的补全中推导出组级边界指示器,并使用边界感知的IDK奖励,仅当组中没有样本产生(几乎)正确答案时才奖励弃权——从而在没有过程监督、外部检索或测试时控制器的情况下,将可恢复的推理失败与真正的知识缺口分开。
我们的贡献有三方面:
1. 我们提出REIN,一个统一的单次传递对齐框架,将生成结构化为→\rightarrow→\rightarrow,使LRM能够在一次前向传播中决定当前推理是否应被信任用于最终定稿,或者模型是否应该弃权,无需外部控制器或迭代循环。
2. 我们设计了一种中心化的反思-真实性奖励,将反思span与反思前草稿结论的正确性对齐,以及一种边界感知的IDK奖励,在模型缺乏足够知识时激励弃权。
3. 在多个主干网络和推理基准上的大量实验表明,REIN将幻觉代理指标降低了58–72%,同时保持了86–91%的平均覆盖率,并将已尝试问题的准确性提高了6.6–14.2%。
## 2 相关工作
##### 自我修正与反思。
自我修正方法推动LLM自我批评并修正其自身输出。Self-Refine是一个推理时框架,在模型生成的反馈与输出修订之间迭代交替(Madaan等人,2023 (https://arxiv.org/html/2608.07931#bib.bib21))。SCoRe则通过强化学习从策略内轨迹中学习多轮自我修正(Kumar等人,2025 (https://arxiv.org/html/2608.07931#bib.bib44))。然而,关于内在自我修正的证据表明,自生成的反馈并不总是能纠正错误,并且在没有可靠外部信号时可能推翻正确答案(Huang等人,2023 (https://arxiv.org/html/2608.07931#bib.bib30);Kamoi等人,2024 (https://arxiv.org/html/2608.07931#bib.bib31);Li等人,2024 (https://arxiv.org/html/2608.07931#bib.bib32))。REIN赋予反思不同的角色:span评估先前的推理轨迹是否支持可靠的草稿结论。其判断与反思前结论的已验证正确性对齐,并在同一结构化补全内指导最终定稿,无需单独的批评-修订循环。
##### 结果与过程对齐。
基于偏好的RL,如RLHF(Ouyang等人,2022 (https://arxiv.org/html/2608.07931#bib.bib4))、Safe RLHF(Dai等人,2023 (https://arxiv.org/html/2608.07931#bib.bib6))和DPO(Rafailov等人,2023 (https://arxiv.org/html/2608.07931#bib.bib5)),将模型行为与结果级偏好对齐,但对推理轨迹本身不提供监督。拒绝采样微调和验证器驱动的RL通过自动答案检查将这一方法扩展到可验证答案领域(Yuan等人,2023 (https://arxiv.org/html/2608.07931#bib.bib41);Shao等人,2024 (https://arxiv.org/html/2608.07931#bib.bib40);DeepSeek-AI,2025 (https://arxiv.org/html/2608.07931#bib.bib15)),而过程奖励模型以密集的人工或LLM标注为代价提供逐步信号(Uesato等人,2022 (https://arxiv.org/html/2608.07931#bib.bib24);Lightman等人,2024 (https://arxiv.org/html/2608.07931#bib.bib25);Huang等人,2025 (https://arxiv.org/html/2608.07931#bib.bib87))。与仅结果偏好RL(对推理轨迹保持沉默)和过程监督奖励模型(需要细粒度的步骤标签,且仍然无法决定何时弃权)不同,REIN保留GRPO外部循环,但围绕*可靠性*重新设计了奖励族:反思-真实性奖励将模型的自评估与答案正确性对齐,边界感知的IDK奖励注入弃权信号,所有这些都无需步骤级监督。
##### 不确定性与弃权。
R-Tuning和IDK令牌方法训练模型在不确定性下弃权(Zhang等人,2024 (https://arxiv.org/html/2608.07931#bib.bib37);Cohen等人,2024 (https://arxiv.org/html/2608.07931#bib.bib39);Cheng等人,2024 (https://arxiv.org/html/2608.07931#bib.bib8))。TruthRL则使用三元RL目标来区分正确答案、幻觉和弃权(Wei等人,2026 (https://arxiv.org/html/2608.07931#bib.bib83))。REIN的不同之处在于,它分别将最终定稿前的反思与推理轨迹所暗示的草稿结论的正确性对齐,并将最终的回答或弃权决定与采样知识边界对齐。KnowRL在推理轨迹中的原子声称上引入细粒度的事实监督(Ren等人,2026 (https://arxiv.org/html/2608.07931#bib.bib84);Wu等人,2026 (https://arxiv.org/html/2608.07931#bib.bib88)),而REIN仅需要任务答案验证。BAPO研究智能体搜索的边界感知奖励(Liu等人,2026 (https://arxiv.org/html/2608.07931#bib.bib86);Zhao等人,2025 (https://arxiv.org/html/2608.07931#bib.bib89)),而BARREL提倡简明、边界感知的推理以缓解过度思考(Yang等人,2026 (https://arxiv.org/html/2608.07931#bib.bib53);Xiu等人,2025 (https://arxiv.org/html/2608.07931#bib.bib90))。相比之下,REIN在单一结构化补全中联合对齐反思和弃权。
## 3 REIN框架
### 3.1 框架设置
给定提示x∈Xx\in\mathcal{X},策略πθ\pi_{\theta}生成结构化补全zz:
z∼πθ(⋅∣x).z\sim\pi_{\theta}(\cdot\mid x).(1)
每个补全都遵循顺序 →→。\text{⟨⟩}\rightarrow\text{⟨⟩}\rightarrow\text{⟨⟩}.(2)
确定性解析器从zz中提取三个span:(c,r,y1):=P(z).(c,r,y_1):=\mathcal{P}(z).(3)
推理轨迹可能在反思之前暗示一个初步结论。我们将从cc中提取的草稿结论记为
y0:=Dx(c),y_0:=\mathcal{D}_x(c),(4)
其中Dx\mathcal{D}_x是任务特定的确定性答案提取器。这里,cc是反思前的推理轨迹,y0y_0是该轨迹暗示的草稿结论,rr是模型基于先前轨迹的可信度评估,y1y_1是反思后生成的最终答案。反思评估先前推理所暗示的草稿答案y0y_0是否可靠。最终答案y1y_1是Y\mathcal{Y}中的实质性任务答案,或者是规范性弃权响应IDK。由于rr是在推理轨迹之后但在y1y_1之前生成的,它会影响后续的最终定稿决定。
对于任何候选答案yy,我们定义
T(x,y):={1,if y≠IDKand Vx(y,y⋆(x))=1,0,otherwise.T(x,y):=\begin{cases}1,&\text{if }y\neq\mathrm{IDK}\text{ and }\mathcal{V}_x(y,y^\star(x))=1,\\0,&\text{otherwise}.\end{cases}(5)
草稿答案y0y_0和最终答案y1y_1用于不同目的进行验证。反思-真实性奖励评估反思判断是否与T(x,y0)T(x,y_0)一致,而答案正确性和边界感知弃权奖励评估T(x,y1)T(x,y_1)。反思span中其他地方提到的答案不被视为任务答案。最终答案y1=IDKy_1=\texttt{IDK}不被计为正确的任务答案,而是由弃权奖励单独处理。格式错误的结构化输出由第3.4 (https://arxiv.org/html/2608.07931#S3.SS4)节中描述的格式奖励处理。
根据引言中描述的两种失败模式,REIN处理推理幻觉和知识幻觉。对于推理幻觉,反思对齐训练模型判断当前推理形成的草稿答案y0y_0是否可靠。这减少了错误认可,即错误的草稿答案y0y_0仍被判断为可靠的情况。对于知识幻觉,REIN从一组策略内补全中估计采样知识边界。如果组中没有包含经验证正确的最终答案y1y_1,则鼓励模型弃权,而不是产生无支持的最终答案。这两个信号共同指导模型在y1y_1中的最终回答或弃权决定。
### 3.2 针对推理幻觉的反思对齐
在生成最终答案之前,REIN使用span评估先前的推理轨迹是否支持可靠的草稿结论y0y_0。补全生成后,REIN验证草稿结论y0y_0,并在反思判断与T(x,y0)T(x,y_0)匹配时奖励反思。反思后的最终答案y1y_1不用作反思-真实性奖励的目标。这种区分防止了当模型随后修正其最终答案时,对不可靠草稿轨迹的正确评估受到惩罚。固定解析器将反思rr映射到
s(r)∈{correct,wrong,uncertain,⊥},s(r)\in\{\texttt{correct},\texttt{wrong}相似文章
从消费到反思:设计人机关系以实现稳定推理
本文引入了关系反思智能(RRI),这是一个推理时治理层,通过可审计的推理循环来稳定人机推理,解决了人类和大语言模型共有的认知弱点。
平衡思考的高效推理
本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。
推理降噪器:对推理轨迹进行降噪以检测大型推理模型中的幻觉
介绍了ReDe框架,该框架通过过滤无关和重复步骤来对推理轨迹进行降噪,从而改进大型推理模型中的幻觉检测,在TruthfulQA上达到了高达87.32的AUROC。
ReFlect:用于复杂长周期大语言模型推理的有效包装系统
本文介绍了 ReFlect,这是一种无需训练的包装系统,通过为大语言模型包裹确定性的错误检测与恢复逻辑,来提升其在复杂、长周期推理任务上的性能。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。