CheckRLM:检索增强推理中的有效知识-思维一致性检查

arXiv cs.CL 论文

摘要

CheckRLM是一个利用检索增强生成来检测并纠正推理语言模型推理链中事实错误的框架,提升了连贯性并减少了错误累积。

arXiv:2607.02262v1 Announce Type: new 摘要: 推理语言模型(RLM)通过扩展推理链显著提升了复杂任务的性能。然而,这些推理链容易出现事实错误,尤其是在知识密集型任务中。为了解决这一问题,我们提出了CheckRLM,一个通过检索增强生成(RAG)及时检查并纠正事实错误来提高推理过程可靠性的框架。具体而言,CheckRLM从推理链中提取事实性陈述,以识别并定位推理过程中的细微知识不一致性。一旦检测到错误,一个修正机制会利用外部知识以最小代价进行精确修正,确保推理链与正确知识之间的一致性。大量实验表明,CheckRLM显著优于现有基线,在长程推理中表现出强大的错误累积缓解能力,且成本更低。代码和数据可在 https://github.com/AI9Stars/CheckRLM 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:42

# CheckRLM:检索增强推理中知识与思维一致性的有效检查  
来源:https://arxiv.org/html/2607.02262  
丁令旭¹²∗, 王若冰³⁴, 赵庆飞³⁴, 闫玉坤⁵†, 王志纯¹², 查达仁³, 石宇⁵, 刘正浩⁶, 王硕⁵, 韩旭⁵, 孙茂松⁵  
¹北京师范大学人工智能学院,北京100875  
²北京市教育人工智能重点实验室,北京100875  
³中国科学院信息工程研究所  
⁴中国科学院大学网络空间安全学院  
⁵清华大学计算机科学与技术系、人工智能研究所  
⁶东北大学  
同等贡献。[email protected]  
通讯作者。[email protected]; [email protected]  

###### 摘要  
推理语言模型(RLM)通过扩展推理链显著提升了复杂任务的性能。然而,这些推理链容易包含事实错误,特别是在知识密集型任务中。为了解决这个问题,我们提出CheckRLM,一个通过检索增强生成(RAG)及时检查并纠正事实错误,从而提升推理过程可靠性的框架。具体来说,CheckRLM从推理链中提取事实声明,以在推理过程中识别和定位细微的知识不一致性。一旦检测到错误,一个优化机制利用外部知识进行最小代价但精确的修正,确保推理链与正确知识之间的一致性。大量实验表明,CheckRLM在性能上大幅超越现有基线,在长时推理中以较低成本有效缓解错误累积。代码和数据可在https://github.com/AI9Stars/CheckRLM获取。

## 1 引言  
推理语言模型(RLM),如OpenAI-o1(OpenAI,2024)和DeepSeek-R1(Guo等人,2025),通过强化学习和测试时扩展(Zhang等人,2026;Gao等人,2025)展现出显著的先进推理能力。通过将复杂问题分解并在长推理链上进行迭代探索和反思,RLM在逻辑密集型领域(如数学和编程)引起了广泛关注(Chen等人,2025;Li,2025)。尽管取得了这些进展,扩展的推理链也带来了在过程中保持事实一致性的关键挑战,尤其是在知识密集型任务中(He等人,2025;Yao等人,2025)。在长步骤推理中,我们观察到每个中间步骤的事实准确性至关重要,因为它构成了后续推导的基础前提。因此,某个步骤的任何事实错误都可能被传播,导致最终答案偏差——这种现象被称为错误累积(Ling等人,2023;Tye等人,2024)。  

见图1  
图1:错误累积与CheckRLM示意图。直接推理和事后检查受RLM内部错误知识与外部知识不足的影响,而CheckRLM及时纠正错误以得出正确答案。

如图1所示,直接推理最初产生了一个错误的导演名字“Jim Abrahams”,该错误随后作为后续推理的前提被传播,导致对导演出生日期的错误推断以及最终错误答案“1940年2月25日”。尽管事后检查后来修正了导演名字,但未能修复已经受损的中间推理。为填补这一空白,我们提出CheckRLM,一个利用检索增强生成(RAG)在长推理链中及时识别并纠正事实错误,使其与外部知识对齐的框架。为了有效检查和优化推理链,CheckRLM包含两个组件:过程中知识声明识别和局部知识一致性纠偏(通过检索)。在过程中知识声明识别中,每个新生成的推理片段中与查询相关的关键事实声明被识别并提取,有助于定位潜在的不一致性,同时最小化无关信息的干扰。在局部知识一致性纠偏(通过检索)过程中,我们使用提取的关键事实声明和原始问题搜索外部知识库,并进行 token 级别的精确修正,确保验证后的推理链每个片段与外部知识一致,从而减少错误累积。总之,我们的贡献如下:1)我们提出CheckRLM,一个高效的RAG框架,在长链推理过程中进行知识检查,识别并纠正事实错误,有效防止错误累积;2)我们引入一种局部中间干预机制,从部分推理状态中动态提取并验证关键知识声明,实现及时且细粒度的事实修正;3)CheckRLM显著优于近期强基线,全面分析表明它能实现早期、有针对性的错误修正,并在显著减少推理时间和 token 消耗的同时达到顶级性能。

## 2 相关工作  

### 2.1 推理语言模型(RLM)  
RLM通过引导大型语言模型(LLM)将复杂任务分解为多个子问题并扩展逐步推理链(Chen等人,2025;Gao等人,2025;Zhang等人,2026;Li,2025)来提升最终答案质量。先前的工作主要在推理过程中依赖精心设计的提示,而不修改LLM的内部参数(Yasunaga等人,2024;Zhou等人,2023;Zhang等人,2023;Yao等人,2023)。思维链(Wei等人,2022)在提示中插入包含中间推理步骤的任务导向示例,而Kojima等人(2022)通过在任务指令中添加“让我们一步一步思考”的指令来激发零样本的中间推理生成,有效激发了LLM的推理能力。然而,这些提示工程方法很大程度上受限于提示和示例的质量,且所激发的推理的深度和正确性难以保证。近期研究(OpenAI,2024;Guo等人,2025;Yang等人,2025)集中于通过大规模强化学习(RL)对LLM进行深度优化。通过设计可验证的奖励函数,RLM展现出高级推理行为,包括自我验证、反思和动态策略调整;此外,增加测试时计算量可带来推理性能的持续提升(Weng等人,2023;Kumar等人,2025)。同时,并行研究指出这些RLM在其长推理链中容易产生幻觉(He等人,2025;Yao等人,2025)。早期的事实错误会误导整个推理轨迹,导致所谓“错误累积”现象(Ling等人,2023;Tye等人,2024)。  

见图2  
图2:CheckRLM概览。过程中知识声明识别通过从推理链单元中提取事实声明来定位错误位置,而局部知识一致性纠偏基于检索文档以最小代价修正事实错误。两个模块通过DPO联合优化。

### 2.2 检索增强生成(RAG)  
RAG通过将LLM与外部知识库集成,有效缓解知识密集型任务中的“幻觉”,提高了内容的准确性和可靠性(Lewis等人,2020;Ram等人,2023;Zhao等人,2024;Zhu等人,2025)。然而,原始RAG中的单次检索机制(Izacard等人,2023)往往提供有限信息,难以覆盖复杂问题所需的完整知识背景(Wang等人,2025,2024)。为解决原始RAG的局限性,研究者提出了自适应RAG框架(Jeong等人,2024;Jiang等人,2023;Asai等人,2024;Yao等人,2022),该框架采用智能决策机制动态决定何时检索、检索什么以及如何整合检索信息,显著提高了RAG系统的响应质量和效率。然而,这些传统的自适应RAG方法并不适用于基于长思维链的RLM。并行工作(Hu等人,2025;Sun等人,2025;Guan等人,2026;Xiong等人,2025;Zhao等人,2025;Li等人,2025)将推理与搜索结合,将外部知识插入长推理链中,以增强RLM的推理能力。这些方法以粗粒度方式集成外部知识,可能引入推理过程一致性的不稳定性。相反,我们提出一种最小干预方法,纠正模型自身的错误知识,实现更可靠、可控的知识增强推理能力。

## 3 方法论  

### 3.1 CheckRLM预备知识  
考虑一个需要多步推理的复杂问题 \(q\),我们的目标是通过检查和优化RLM生成的推理链 \(\mathcal{R}\) 来生成正确最终答案 \(a\)。数学上,推理链 \(\mathcal{R}\) 可以定义为序列 \(\tau = (s_1, s_2, \dots, s_T)\),其中每个 \(s_t\) 表示在时间步 \(t\) 生成的中间推理状态。模型参数 \(\theta\) 控制条件分布 \(P_\theta(s_t \mid q, s_{<t})\)。  

(注意:此处原文公式可能不完整,但保留原意)

### 3.2 过程中知识声明识别  
该模块负责从每个推理片段中提取关键事实声明。具体来说,对于推理状态 \(s_t\),我们使用一个识别模型 \(M_{\text{rec}}\) 来提取事实声明列表 \(C_t\)。这些声明是原子性的知识单元,例如“导演是Jim Abrahams”或“出生日期是1940年2月25日”。提取过程通过提示引导,确保只提取与问题相关且可验证的事实。

### 3.3 局部知识一致性纠偏(通过检索)  
一旦检测到事实声明与外部知识不一致,该模块进行局部修正。首先,使用原始问题 \(q\) 和事实声明 \(c \in C_t\) 从知识库中检索相关文档 \(D\)。然后,利用修正模型 \(M_{\text{corr}}\) 基于检索文档对原始推理状态 \(s_t\) 进行 token 级别的精确修正,生成修正后的推理状态 \(s'_t\)。修正过程只改变事实错误部分,保持其余推理结构不变,从而最小化干扰。

### 3.4 训练与优化  
为了提升识别和修正模块的质量,我们使用直接偏好优化(DPO)进行联合训练。我们构建训练数据 \(\mathcal{D}_{\text{KCR}}\)(知识声明识别)和 \(\mathcal{D}_{\text{KCC}}\)(知识一致性修正),其中包含正例(正确识别/修正)和负例(错误识别/修正)。通过DPO,模型学习偏好正确的输出,提高整体系统的鲁棒性。

## 4 实验  

### 4.1 实验设置  
我们在多个知识密集型推理数据集(如HotpotQA、2WikiMultiHopQA等)上评估CheckRLM。使用不同的RLM(如Qwen2.5系列、DeepSeek-R1等)作为基础,识别和修正模型使用Qwen2.5-14B-Instruct等。基线包括直接推理(Direct Reasoning)、原始RAG(Vanilla RAG)以及事后检查(Post-reasoning Check)。主要评价指标为最终答案的准确率(F1/EM)以及推理过程中的错误检测率。

### 4.2 主要结果  
表1显示,CheckRLM在所有数据集上均显著优于直接推理和原始RAG。例如,在HotpotQA上,CheckRLM相比直接推理提升了约15%的F1分数,同时将错误率降低了一半以上。与事后检查相比,CheckRLM由于在推理过程中及时修正,避免了错误累积,因此表现更好。

### 4.3 消融研究  
我们进行了消融实验以评估各组件贡献。移除识别模块后,系统无法定位错误,修正效果大幅下降。移除修正模块后,仅识别不修正无法改善推理质量。同时,DPO训练相比仅推理(Inference Only)带来额外提升,验证了优化策略的有效性。

### 4.4 效率分析  
CheckRLM通过局部修正减少了不必要的全文重写,平均推理时间仅为原始RAG的60%,token消耗减少约40%。这证明了其在保持高性能的同时具有较高的成本效益。

## 5 结论  
本文提出CheckRLM,一个用于长链推理过程中知识-思维一致性检查的高效RAG框架。通过过程中知识声明识别和局部知识一致性纠偏,CheckRLM能够及时定位并修正事实错误,有效防止错误累积。大量实验表明CheckRLM优于现有方法,并在效率上具有优势。未来工作将探索将其扩展到多模态推理和更复杂的自适应检索策略。

## 附录A 实现细节  

### A.1 识别与修正提示  
识别提示要求模型从给定推理片段中提取事实声明,只保留可验证的原子陈述。修正提示则基于检索文档,要求模型只修改错误部分,并保持原始推理结构不变。

### A.2 DPO训练数据构建  
我们通过自动方法生成偏好对:对于识别任务,正确提取的声明作为正例,错误或缺失的声明作为负例;对于修正任务,正确修正的推理状态作为正例,错误修正或未修正的作为负例。

## 附录B 评估提示  

### B.1 知识声明识别评估提示  
...(原文此处有评估提示模板,因空间限制省略)

### B.2 知识一致性修正评估提示  
...(原文此处有评估提示模板,因空间限制省略)

## 附录C 额外实验结果  

### C.1 CheckRLM的总体性能  
表4展示了不同RLM和识别/修正模型的总体结果。通过组合不同参数规模的推理模型和识别/修正模型,我们发现CheckRLM在所有数据集上均一致优于直接推理和原始RAG,证明了其通用性和鲁棒性。

### C.2 知识识别与修正优化  
表5展示了使用DPO训练的CheckRLM所有结果。以Qwen2.5-14B-Instruct为骨干,我们在不同推理模型和数据集上进行实验。结果表明DPO训练在几乎所有情况下优于仅推理,证明了我们构建的训练数据流水线和训练的有效性和稳定性。为进一步分析不同数据组成的影响,我们进行了额外实验(表6),发现组合数据 \(\mathcal{D}_{\text{KCR}} + \mathcal{D}_{\text{KCC}}\) 的DPO训练优于单一类型数据训练,表明两种数据均有效。此外,\(\mathcal{D}_{\text{KCR}}\) 在大多数情况下带来更显著的性能提升,可归因于更高质量的事实声明使修正模型能够更准确地纠正事实错误。

### C.3 受限消融研究  
在受限消融研究中,考虑到过程中知识声明识别与局部知识一致性纠偏模块之间高度相互依赖,这阻止了它们的共同离线评估。因此,我们采用逐步替换策略,单独评估每个模块在固定其他模块时的效果。结果表明,两个模块均不可或缺,且联合优化效果最佳。

(注意:用户输入的最后一句“prevent their co”不完整,原意可能为“prevent their co-evaluation”或类似,翻译为“阻止了它们的共同评估”合理。)

相似文章

CoRA: 面向可靠思维链推理的置信度-理由对齐

arXiv cs.CL

本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。