面向事实的推理学习
摘要
本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。
arXiv:2508.05618v2 公告类型:替换
摘要:推理大语言模型(R-LLMs)在复杂推理任务上取得了显著进展,但在长文本事实性基准上,它们往往比非推理模型产生更多的幻觉,事实准确性不足。然而,将在线强化学习(RL)——近期R-LLM进展的关键组成部分——扩展到长文本事实性场景,由于缺乏可靠的验证方法,面临若干独特挑战。以往工作利用FActScore等自动事实性评估框架在离线RL设置中整理偏好数据,但我们发现直接将这些方法作为在线RL的奖励会导致多种形式的奖励破解,例如生成细节不足或相关性较低的回答。我们提出了一种新颖的奖励函数,同时考虑事实精确性、回答细节水平和答案相关性,并应用在线RL来学习高质量的事实推理。在六个长文本事实性基准测试上,我们的事实推理模型平均将幻觉率降低了23.1个百分点,回答细节水平提升了23%,且整体回答有用性未见下降。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 学习为事实性进行推理 来源:https://arxiv.org/html/2508.05618 1\]FAIR at Meta 2\]华盛顿大学 Ilia KulikovVincent\-Pierre BergesBarlas OğuzRulin ShaoGargi GhoshJason WestonWen\-tau Yih\\[[[email protected] (https://arxiv.org/html/2508.05618v2/mailto:[email protected]) \(2026年7月24日\) ###### 摘要 推理型大型语言模型 \(R\-LLMs\) 在复杂推理任务上取得了显著进展,但在事实性方面往往表现不佳,在长篇事实性基准测试中,其生成的幻觉内容明显多于非推理型模型。然而,将在线强化学习 \(RL\)(近期R\-LLM进展的关键组成部分)扩展到长篇事实性场景面临诸多独特挑战,原因是缺乏可靠的验证方法。先前的工作已利用自动事实性评估框架(如FActScore)在离线RL环境中整理偏好数据,但我们发现,直接将这些方法作为在线RL的奖励会导致多种方式的奖励黑客行为,例如生成*细节较少*或*相关性较低*的回答。我们提出了一种新颖的奖励函数,该函数同时考虑事实精确度、回答细节程度和答案相关性,并应用在线RL来学习高质量的事实性推理。在六个长篇事实性基准测试上的评估显示,我们的事实性推理模型平均降低了23.1个百分点 的幻觉率,回答细节程度提高了23%,且整体回答有用性没有下降。 ## 1 引言 参考图注图1:长篇事实性任务的奖励设计(底部)。与其他任务(顶部)不同,长篇回答的事实性无法通过基于规则的启发式方法或LLM评判器可靠评估。仅依赖自动评估方法(如VeriScore)可能导致*细节较少*或*相关性较低*的回答。我们提出了一种新的奖励设计,同时考虑事实精确度、回答细节程度和答案相关性(第3.1节 (https://arxiv.org/html/2508.05618#S3.SS1))。 最近出现的推理型大型语言模型 \(R\-LLMs\),如 OpenAI\-o1\(OpenAI,2024 (https://arxiv.org/html/2508.05618#bib.bib26)\) 和 DeepSeek\-R1\(DeepSeek\-AI,2025b (https://arxiv.org/html/2508.05618#bib.bib7)\),通过在生成最终回答之前调用长思维链 \(Long CoT\) 思考过程,显著提升了LLM在数学和编程等复杂推理任务上的能力。在R\-LLM研究中,一个经常被忽视的领域是*factuality*(事实性)。随着R\-LLM能力的增强使其被委以更复杂和重要的任务,这一方面变得越来越关键。不幸的是,有研究表明,R\-LLMs往往比其非推理型对应模型*产生更多*幻觉\(Hughes et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib11)\)。我们在六个长篇事实性数据集上对两种流行的R\-LLM(DeepSeek\-R1和QwQ\-32B\(Qwen\-Team,2025 (https://arxiv.org/html/2508.05618#bib.bib31)\))进行了基准测试。我们的发现表明,它们的幻觉率平均比 DeepSeek\-V3\(DeepSeek\-AI,2025a (https://arxiv.org/html/2508.05618#bib.bib6)\) 和 Qwen\-2.5\-32B\(Yang et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib39)\) 分别高出10和13个百分点。我们假设这是因为现有的R\-LLM强化学习训练主要针对数学和编程等逻辑推理任务,往往忽略了像事实性这样的其他重要属性。这引出了以下研究问题: > RQ:*我们能否学习能够提高(R-)LLM事实性的推理策略?* 传统上,RL对齐优化的是数学和编程等领域的*可验证奖励* \(RLVR, Lambert et al.,2025 (https://arxiv.org/html/2508.05618#bib.bib16)\),或通用指令遵循的*人类偏好* \(RLHF, Ouyang et al.,2022 (https://arxiv.org/html/2508.05618#bib.bib27)\)。相比之下,事实性,尤其是在长篇生成中,并不适合这两种方法。目前没有可靠的方法可以确定性地准确验证长篇回答的事实性,而人工验证需要大量人工投入,既昂贵又耗时\(Min et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib23)\)。尽管存在长篇事实性的自动评估框架,如 FActScore\(Min et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib23)\),并已在先前的事实性对齐工作中得到应用\(Tian et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib36); Lin et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib20)\),但这些方法仅限于离线RL,用于为直接偏好优化 \(DPO, Rafailov et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib32)\) 创建成对偏好数据。相比之下,在线RL具有显著优势:它是近期R\-LLM进展的核心组成部分\(DeepSeek\-AI,2025b (https://arxiv.org/html/2508.05618#bib.bib7)\),且先前的工作一致证明了在*在策略*数据(例如自生成回答)上进行训练对提高事实准确性的益处\(Lin et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib20); Zhang et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib41), *等等*。\)。然而,应用在线RL来学习长篇回答中的*factual reasoning*(事实性推理)仍然是一个开放性问题,面临若干突出挑战。 第一个挑战在于奖励设计。在我们的实验中,我们发现仅优化事实性奖励可能导致意外结果。模型学会生成更短、细节更少的回答,以此作为实现更高事实精确度的捷径,因为让LLM生成一个单一正确事实比生成包含例如50个事实且无任何幻觉的详细回答要容易得多,尽管两者都能达到完美的事实精确度。此外,即使奖励设法同时考虑了事实性和回答的细节程度,仍然可能通过生成*不太相关*,或极端情况下*不相关*的回答来虚假地膨胀(黑客)奖励。考虑以下极端例子:一个模型在回答*每一个*问题时都背诵同一篇维基百科文章,该文章既事实又详细。这样的模型将毫无用处,却能在事实性和细节程度上都获得非常高的分数。最后但并非最不重要的是,现有的自动长篇事实性评估方法,通常涉及基于LLM的原子声明提取和验证,以及网络搜索以查找相关证据文档,非常耗时。这使得它们不适合在在线RL中用于实时奖励计算。例如,VeriScore\(Song et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib35)\),一种近期的长篇事实性评估方法,验证单个回答可能需要几分钟。 在这项工作中,我们提出了首个面向长篇事实性的在线RL方案,并设计了一个新颖的奖励函数来应对这些挑战。具体来说,我们的事实性推理奖励包含三个组成部分,以减轻上述描述的各种奖励黑客方式:它同时考虑 \(1\) 事实精确度,\(2\) 回答细节程度,以及 \(3\) 答案相关性。为了计算 \(1\) 和 \(2\),我们实现了一个优化且可扩展的VeriScore版本,实现了最高30倍的加速,使其适用于在线RL rollouts中的实时奖励计算。对于 \(3\),我们将这些奖励与使用LLM-as-a-Judge测量的回答整体质量相结合。我们在*六个*长篇事实性基准测试上评估了我们的方法,包括 LongFact\(Wei et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib38)\), FAVA\(Mishra et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib24)\), AlpacaFact\(Dubois et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib8); Lin et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib20)\), Biography\(Min et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib23)\), FactBench\(Bayat et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib2)\) 和 FACTORY\(Chen et al.,2025a (https://arxiv.org/html/2508.05618#bib.bib3)\),结果表明,我们使用 GRPO\(Shao et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib34)\) 通过在线RL训练的事实性推理模型,在回答中平均实现了23.1个百分点的更高事实性精确度,同时生成了23%更多的事实性表述,且整体回答有用性没有下降(LLM-as-a-judge胜率 >50% 相对于基础模型)。 ## 2 事实性推理的离线训练 在接下来两节中,我们将描述为给定*基础模型*111在本文中,我们将术语*基础模型*用于指代在我们的事实性推理训练中用作初始化的模型,无论它之前是否经过任何对齐训练。学习以事实性为重点的长思维链推理的方法。在本节中,我们首先介绍我们整理训练数据的方法,然后介绍监督微调和通过DPO进行离线RL的方案,这两者都将作为基线。接着,在下一节中,我们将介绍我们提出的在线RL设置,以直接对事实性奖励进行在策略优化。 ### 2.1 训练提示词 对于离线RL和在线RL,都需要一组多样且高质量的求知问题作为训练提示词。先前关于事实性对齐的工作要么专注于特定领域并使用领域内训练提示词\(Tian et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib36)\),要么依赖从现有数据集(如OpenAssistant\(Köpf et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib14)\))中进行过滤,如FLAME\(Lin et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib20)\)所做的那样。我们尝试了类似的方法,通过提示LLM从 WildChat提示词\(Zhao et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib42)\)(一个具有高度多样性的用户-聊天机器人对话大规模数据集)中识别求知问题。然而,我们观察到,LLM 很难可靠地从如此多样化的自然提示词集合中分类出求知问题,导致结果嘈杂,包含许多低质量提示词。因此,我们采用了一种新的方法来整理训练提示词集,该方法 i) 可能出现在现实世界场景中,并且 ii) 将事实性作为高质量回答的一个主要因素。具体来说,我们采用 Llama 4222Llama\-4\-Maverick\-17B\-128E\-Instruct\-FP8 通过提供两组*基础提示词*作为示范来生成合成提示词:一组来自 WildChat\(Zhao et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib42)\) 的多样化真实世界提示词,另一组来自 LongFact\(Wei et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib38)\) 非测试分区的求知提示词。目标是让模型生成多样且可能被真实人类提出的提示词,类似于第一组基础提示词中的例子,同时提供良好回答需要事实知识,如第二组基础提示词所示。完整的 Llama 4 提示词和生成问题的示例可以在附录9 (https://arxiv.org/html/2508.05618#S9) 中找到。我们总共生成了 7k 个合成提示词,划分为一个 3k 的 SFT 分区和一个 4k 的 RL 分区。 ### 2.2 监督微调 \(SFT\) 在初步实验中,我们发现应用RL算法之前先进行监督微调 \(SFT\) 是有益的。具体来说,在离线 DPO 实验中,模型在没有 SFT 的情况下难以一致地遵循长思维链推理格式,即使在添加了关于格式遵循的额外偏好数据之后也是如此。另一方面,SFT 有效地教会了模型遵循长思维链格式,在生成最终回答(包裹在 `和` 中)之前生成一个推理链(包裹在 `和` 中)。在在线RL实验中,虽然可以直接应用RL来生成正确格式的长思维链回答,但在种子事实性推理数据上进行 SFT 进一步为后续的RL阶段提供了有用的归纳偏差,这稳定了训练并在实践中产生了更高质量的响应。我们通过使用手动编写的 2-shot 示例(完整提示词见附录10 (https://arxiv.org/html/2508.05618#S10))提示基础模型来创建种子 SFT 数据,其中包含关注事实性的长思维链推理链,为 SFT 分区中的每个训练提示词生成 10 个回答。对每个回答运行 VeriScore,并选择具有最高事实精确度的回答作为 SFT 的目标。 ### 2.3 直接偏好优化 \(DPO\) 直接偏好优化 \(DPO, Rafailov et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib32)\) 已被用于提高模型回答中的事实性\(Tian et al.,2023 (https://arxiv.org/html/2508.05618#bib.bib36); Lin et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib20)\)。我们也将把它作为我们设置中的一个基线来考虑。DPO 是一种离线RL算法,它从偏好对 \(y_c \succ y_r\) 中学习,其中选中的回答 \(y_c\) 被认为对于给定提示词 \(x\) 比被拒绝的回答 \(y_r\) 更好,通过优化以下损失函数: \[ \mathcal{L}_{\text{DPO}}=-\log\sigma\left(\beta\log\frac{\pi_{\theta}(y_c|x)}{\pi_{\text{ref}}(y_c|x)}-\beta\log\frac{\pi_{\theta}(y_r|x)}{\pi_{\text{ref}}(y_r|x)}\right) \tag{1} \] 其中 \(\pi_{\theta}\) 是当前策略模型,\(\pi_{\text{ref}}\) 是参考模型(通常是种子模型),\(\beta\) 是控制与参考策略偏差的超参数,\(\sigma\) 是逻辑函数。为了形成用于学习事实性推理的偏好对,我们可以遵循类似于 SFT 数据整理的方法。具体来说,我们使用相同的 2-shot 提示模板(附录10 (https://arxiv.org/html/2508.05618#S10))为 RL 分区中的每个训练提示词采样 10 个回答,并运行 VeriScore 来评估回答的事实性。在所有可能的回答对中,我们选择在选中回答和被拒绝回答之间事实精确度差距最大的那一对,同时满足两个附加条件:i) 事实精确度差距应大于阈值 \(\tau_m\);且 ii) 选中回答和被拒绝回答的长度 \(l_c\) 和 \(l_r\) 差异不能太大,满足:\(\left|1-\frac{l_c}{l_r}\right| \leq \tau_l\)(在我们的实验中,\(\tau_m=\tau_l=0.1\))。条件 i) 确保对之间的事实精确度存在足够差异,以便 DPO 能够获得有意义的学习信号,而 ii) 要求 \(y_c\) 和 \(y_r\) 的长度相似,我们发现这有助于避免长度黑客行为\(Park et al.,2024 (https://arxiv.org/html/2508.05618#bib.bib29)\)。特别是,由于更事实性的回答往往由于去除非事实性陈述而更短,因此选中的回答更可能具有较短的长度,导致 DPO 在学习过程中利用这一事实并产生更短的答案。如果某个提示词没有一对满足所有条件,则从训练集中移除该提示词。这导致离线 DPO 训练总共得到 3.7k 个偏好对。 ## 3 事实性推理的在线训练 最近,像诸如……这样的在线RL方法
相似文章
超越推理:强化学习释放大型语言模型中的参数化知识
本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。
面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理
本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
通过混合模式优势正则化减轻大型推理模型中的事实幻觉
介绍了MARGO,一种强化学习框架,通过比较思考和非思考轨迹,使用混合模式优势正则化来减轻大型推理模型中由思考引发的幻觉。
REFACT:面向紧凑且忠实思维链的自适应事实重述
ReFact提出了一种自适应的事实重述引用框架,训练大语言模型自主决定推理步骤何时需要上下文支撑,从而在减少令牌消耗的同时提升思维链推理的忠实度和紧凑性。