已知事实导致的推理错误:Step-Level Self-Consistency Group Relative Policy Optimization for LLM
摘要
本文介绍了SSC-GRPO,一种步级奖励优化方法,通过多次 rollout 中的自一致性分数来减少大语言模型推理中上下文敏感的事实幻觉,在数学推理和幻觉基准测试上达到了最先进的性能。
arXiv:2607.18915v1 公告类型:新
摘要:随着大型语言模型(LLM)的快速发展,现代系统不仅具备强大的基础能力和广泛的知识,还能通过长篇多步推理解决复杂问题。然而,随着推理轨迹的延长,LLM 在推理过程中可能产生大量难以发现的幻觉内容。在本工作中,我们对 LLM 推理中出现的幻觉进行了细粒度分析,发现推理轨迹特别容易产生上下文敏感的事实幻觉:即模型实际上拥有相关知识,但由于推理过程中的上下文干扰而做出事实错误。为了解决这个问题,我们提出了 Step-level Self-Consistency Group Relative Policy Optimization (SSC-GRPO),通过计算多个 rollout 中各个步骤的自一致性分数来为推理轨迹分配步骤级奖励。与先前方法相比,SSC-GRPO 在数学推理基准和幻觉排行榜上都取得了最先进的性能。我们的结果为检测和缓解大型语言模型推理过程中的幻觉提供了新的视角。
查看缓存全文
缓存时间: 2026/07/22 08:24
# 面向大语言模型的步级自一致性组相对策略优化
来源:https://arxiv.org/html/2607.18915
## 已知事实导致的推理错误:面向大语言模型的步级自一致性组相对策略优化
胡晓萌,胡佳琪,陈浩,张琪,沈占明,叶文涛,赵俊博
浙江大学
\{xm.hu, j.zhao\}@zju.edu.cn
###### 摘要
随着大语言模型(LLM)的快速发展,现代系统不仅具备强大的基础能力和广泛的知识,还能通过长步骤、多步推理解决复杂问题。然而,随着推理链变长,LLM 在推理过程中可能产生大量幻觉内容,且这些内容往往难以检测。本文对 LLM 推理中出现的幻觉进行了细粒度分析,发现推理链特别容易产生*上下文敏感的事实幻觉*——即模型实际拥有相关知识,但由于推理过程中的上下文干扰而产生事实错误。为解决这一问题,我们提出**步级自一致性组相对策略优化**(SSC-GRPO),该方法通过在多次 rollout 中计算各步骤的自一致性分数,为推理链分配步级奖励。与之前的方法相比,SSC-GRPO 在数学推理基准和幻觉排行榜上均取得了最先进的性能。我们的结果为检测和缓解大语言模型推理过程中的幻觉提供了新视角。
## 1 引言
近年来,随着大语言模型(LLM)的不断进步,其在多个领域取得了显著成果(Achiam 等,2023 (https://arxiv.org/html/2607.18915#bib.bib41);Team 等,2024 (https://arxiv.org/html/2607.18915#bib.bib42);Grattafiori 等,2024 (https://arxiv.org/html/2607.18915#bib.bib43))。现有的通用模型具备强大的基础能力,其领域知识日益全面。此外,为了更好解决复杂问题,推理模型也迅速发展(Yang 等,2025 (https://arxiv.org/html/2607.18915#bib.bib44);Guo 等,2025 (https://arxiv.org/html/2607.18915#bib.bib45))。*测试时扩展*原则表明,模型可以通过长思维链逐步分析问题并最终得出答案(Wu 等,2024 (https://arxiv.org/html/2607.18915#bib.bib18))。然而,LLM 存在*幻觉*问题,即模型生成自信但不正确的陈述(Ji 等,2023 (https://arxiv.org/html/2607.18915#bib.bib46))。由于幻觉严重阻碍了 LLM 的开发与部署,幻觉的检测与缓解已成为近年来的核心研究课题(Zhang 等,2025b (https://arxiv.org/html/2607.18915#bib.bib34))。随着我们从通用任务转向推理模型,推理过程中出现的幻觉带来了根本不同的挑战(Li 等,2024 (https://arxiv.org/html/2607.18915#bib.bib50))。长推理链和复杂的上下文依赖使得传统的幻觉检测方法失效(Cheng 等,2025 (https://arxiv.org/html/2607.18915#bib.bib21)),因此有必要深入研究推理过程中的幻觉。
为了更好研究推理中的幻觉,我们对观察到的幻觉类型进行了细粒度分类。通过详细案例分析,我们发现当前模型频繁表现出*上下文敏感的事实幻觉*:即使在模型实际拥有相关知识的情况下,由于受周围推理上下文的影响,推理过程中仍会出现事实错误,如图 1 (https://arxiv.org/html/2607.18915#S1.F1) 所示。具体来说,如果我们将幻觉片段提取出来,改写为独立问题向同一模型查询,它可以正确回答;然而在原始推理上下文中,它却产生了事实错误。通过分析推理过程中的幻觉类别,我们发现上下文敏感幻觉占绝大多数,如图 2 (https://arxiv.org/html/2607.18915#S3.F2) 所示。
图 1:大语言模型中的上下文敏感事实幻觉。在推理过程中,大语言模型可能产生事实错误,进而导致最终答案错误,如场景 A 所示。然而,当将错误部分提取出来并改写成独立问题时,模型能够正确回答,如场景 B 所示。这一现象表明模型实际拥有相关事实知识,但由于推理上下文的影响而产生了幻觉。
为解决此问题,我们提出**步级自一致性组相对策略优化**(SSC-GRPO),一种基于强化学习的方法,用于缓解模型推理过程中的幻觉。在标准 GRPO 算法中,模型执行多次 rollout 并采样一组输出;类似地,基于自一致性的幻觉检测也依赖于多个样本。这表明 GRPO 天然适合自一致性幻觉检测。此外,由于推理过程中的幻觉内容是模型实际拥有的知识,因此自一致性检测可以在*无需外部知识*的情况下定位幻觉发生的位置,从而为 GRPO 提供步级奖励。遵循 SelfCheckGPT(Manakul 等,2023 (https://arxiv.org/html/2607.18915#bib.bib33))的思路,我们让被训练的模型判断自己的自一致性并获取一致性分数,作为每个推理步骤的奖励。然后,我们根据步级奖励将 rollout 级优势重新缩放为步级加权优势,在保持句子级总优势不变的情况下重新分配每步优势。最后,SSC-GRPO 使用这些重新分配的优势优化模型。
为了验证方法的有效性,我们在幻觉和数学任务上进行了详细实验。我们使用 SSC-GRPO 在 Qwen3-4B-Base、Qwen3-4B-Instruct 和 Llama3-8B-Instruct 上训练模型,并与 GRPO 基线及其他方法进行比较。结果表明,我们的方法在数学和幻觉任务上均达到了最先进的性能,比基线高出 1.8%。此外,我们分析了训练过程中的一致性动态,发现一致性稳步提高,而不一致步骤的数量减少,这为方法的有效性提供了额外证据。
总之,我们的贡献如下:
- • 我们识别了现有模型推理过程中的**上下文敏感事实幻觉**:即使模型知道相关事实,也可能受到上下文影响而在推理中产生事实错误。我们进一步实验证明这种幻觉在推理过程中占主导地位。
- • 我们提出 **SSC-GRPO**,利用自一致为推理步骤提供**步级奖励**,从而缓解上下文敏感事实幻觉。
- • 我们在数学和幻觉任务上设计了大量实验,以验证方法的有效性。
## 2 相关工作
### 2.1 大语言模型中的幻觉
随着大语言模型(LLM)的快速发展,幻觉——即生成流畅但事实无根据的内容——已成为主要问题,严重阻碍了这些系统的可靠性和实际部署(Zhang 等,2025b (https://arxiv.org/html/2607.18915#bib.bib34))。为了检测幻觉,基于自一致性的方法被提出。例如,SelfCheckGPT(Manakul 等,2023 (https://arxiv.org/html/2607.18915#bib.bib33))通过衡量多个采样响应之间的一致性来识别幻觉事实,无需外部知识。类似地,Farquhar 等(2024 (https://arxiv.org/html/2607.18915#bib.bib35))通过计算语义聚类输出的熵来量化不确定性,揭示不稳定的虚构生成。除此之外,基于验证的方法(如检索增强或事实分解方法)利用外部证据检测幻觉,取得了强劲性能,但需要额外的监督或工具(Heo 等,2025 (https://arxiv.org/html/2607.18915#bib.bib36))。然而,随着推理模型的出现,多步推理过程中出现的幻觉日益受到关注,因为传统的专注于最终输出的幻觉检测方法常常无法捕捉嵌入在长而复杂推理链中的错误(Cheng 等,2025 (https://arxiv.org/html/2607.18915#bib.bib21))。Yao 等(2025 (https://arxiv.org/html/2607.18915#bib.bib20))表明,在某些设置下,推理模型甚至更容易产生幻觉,尤其是由于校准不当的不确定性和后训练过程。其他机制视角分析了多步推理特有的幻觉模式,并提出了针对性的检测指标和推理路径的奖励整形框架(Sun 等,2025 (https://arxiv.org/html/2607.18915#bib.bib37))。
### 2.2 强化学习缓解幻觉
强化学习(RL)最近被探索为一种缓解幻觉的有效范式,通过显式优化模型使其行为更准确可靠。FSPO(Li and Ng,2025 (https://arxiv.org/html/2607.18915#bib.bib19))将步骤级事实性奖励引入策略优化,鼓励整个生成过程而非仅在最终输出中保持正确性。而 RFT(Song 等,2025 (https://arxiv.org/html/2607.18915#bib.bib39))利用强化学习训练模型在不确定时适当拒绝回答,从而通过鼓励校准的弃权来减少幻觉。RLFH(Wen 等,2025 (https://arxiv.org/html/2607.18915#bib.bib38))使用细粒度反馈进行在线策略自对齐,将响应分解为原子陈述并将真实性评估转换为密集奖励。此外,TruthRL(Wei 等,2025 (https://arxiv.org/html/2607.18915#bib.bib40))提出了一个三元奖励设计,明确区分正确答案、幻觉和不确定性,显著降低了各任务的幻觉率。然而,现有方法大多依赖外部知识进行检测,且对多步推理过程中幻觉如何产生的洞察有限。因此,我们的工作提供了对推理过程中幻觉的细粒度分析。
## 3 大语言模型推理过程中的幻觉分析
### 3.1 预备知识
对于大语言模型 \(\pi\) 和问题 \(q\),我们将 \(q\) 输入模型,得到包含 \(m\) 步的推理路径 \(\mathcal{O} = \{o_1, o_2, \ldots, o_m\}\) 和最终答案 \(A\)。我们假设一个幻觉检测器 \(H\),判断每个推理步骤 \(o\) 中是否出现幻觉:
\[
H(o) \in \{0, 1\} \qquad (1)
\]
这里,\(H(o)=0\) 表示出现幻觉,\(H(o)=1\) 表示没有幻觉。
### 3.2 推理过程中的幻觉:上下文敏感事实幻觉
近年来,随着大语言模型(LLM)的不断进步,模型展现出越来越强的基础能力;此外,在测试时扩展范式下,通过分配更多推理时间和遵循更长的推理轨迹,它们可以解决复杂问题(Wu 等,2024 (https://arxiv.org/html/2607.18915#bib.bib18))。然而,推理步骤中出现的幻觉可能很微妙,并可能跨步骤传播,使得比短形式响应中的错误更难定位(Yao 等,2025 (https://arxiv.org/html/2607.18915#bib.bib20);Li and Ng,2025 (https://arxiv.org/html/2607.18915#bib.bib19))。此外,虽然思维链提示在某些情况下可以减少幻觉频率,但它也可能模糊现有幻觉检测器所依赖的线索,从而降低长推理设置下的检测效果(Cheng 等,2025 (https://arxiv.org/html/2607.18915#bib.bib21))。
由于大语言模型的推理过程通常由多个步骤组成,我们对每个步骤是否出现幻觉进行细粒度分析。考虑一个推理路径 \(o_1, o_2, \ldots, o_m\);模型可能在步骤 \(o_k\) 处产生幻觉,该步骤包含事实错误。然而,如果我们将该幻觉步骤对应的知识点改写为独立问题并单独输入模型,如图 1 所示,模型实际上能够产生正确且无幻觉的输出:
\[
H\left(\pi\left(o_k \mid o_{1:k-1}\right)\right) = 0 \qquad H\left(\pi\left(\hat{o}_k\right)\right) = 1 . \qquad (2)
\]
这里,\(\hat{o}_k\) 表示将原始 \(o_k\) 改写为独立问题后单独输入模型。当 \(o_k\) 受上下文 \(o_{1:k-1}\) 影响时,模型产生幻觉;然而当 \(\hat{o}_k\) 独立提供而不受上下文影响时,模型输出正确答案。这一现象表明模型实际拥有相关知识,但由于推理上下文的影响,在推理过程中产生了幻觉。这一现象在推理模型的幻觉中非常普遍(参见第 3.3 节的详细实证分析)。因此,我们将这一现象定义如下:
#### 定义
上下文敏感事实幻觉:在模型推理过程中出现的事实幻觉,即模型实际拥有相关知识,但由于推理过程中的上下文影响,产生了事实错误的输出。
图 2:推理模型中幻觉类型的分析。在所有出现幻觉的案例中,上下文敏感事实幻觉占多数——接近 70%。其他类别的幻觉只占很小比例。随着模型能力的提升,知识缺失型幻觉越来越少,但仍有大量上下文敏感事实幻觉存在。
图 3:我们的方法概览。我们首先按照标准 GRPO 流程采样一组 rollout。然后,对于每个 rollout 中的每个推理步骤,SSC-GRPO 计算相对于其他 rollout 的一致性分数,作为步级奖励。基于这些步级奖励,我们通过分配更高优势给一致性分数更高的推理步骤来重新缩放 rollout 级优势。最后,SSC-GRPO 使用重新缩放的优势优化策略模型。
### 3.3 推理过程幻觉的实证分析相似文章
Mental-R1:对齐LLM推理用于心理健康评估
提出认知相对策略优化(CRPO),一种用于对齐大语言模型在心理健康评估中推理的强化学习框架,在加权F1分数上比现有基线平均提高10.4个百分点。
超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization
介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。