REFACT:面向紧凑且忠实思维链的自适应事实重述
摘要
ReFact提出了一种自适应的事实重述引用框架,训练大语言模型自主决定推理步骤何时需要上下文支撑,从而在减少令牌消耗的同时提升思维链推理的忠实度和紧凑性。
arXiv:2607.20833v1 公告类型:新论文
摘要:大语言模型在处理复杂任务时越来越依赖长文本推理,但当提供的上下文证据稀疏、嘈杂或与参数化知识冲突时,其推理轨迹可能偏离原始语境。现有的接地方法要么在生成后附加引用,要么鼓励在推理轨迹内部检索证据,但往往无法确保引用的内容足以支撑局部推理和最终答案。我们提出REFACT,一种自适应的事实重述引用框架,训练模型自主决定推理步骤何时需要上下文接地以及应以何种粒度重述源事实。该设计通过将引用转化为支撑答案的中间状态,避免了无依据的推理和无差别的事实复制。REFACT通过两阶段SFT-to-RL流水线进行优化,其中引用效用奖励鼓励引用的事实格式规范、可追溯来源且足以支撑答案。在LongBench、LV-Eval和ConFiQA上的实验表明,REFACT在提升长上下文问答和反事实忠实度的同时大幅降低了令牌消耗。进一步分析表明,REFACT以更少的重述事实保留了更多含答案的证据,从而生成密度更高而非更长的推理轨迹。所有代码和数据均可在https://github.com/NEUIR/REFACT获取。
查看缓存全文
缓存时间: 2026/07/24 05:17
# ReFact:面向紧凑且忠实思维链推理的自适应事实重述 来源:https://arxiv.org/html/2607.20833 \\correspondingauthor \(2027\) ###### 摘要\. 大型语言模型越来越多地依赖长格式推理来处理复杂任务,然而当证据稀疏、有噪声或与参数化知识冲突时,其推理轨迹可能偏离所提供的上下文。现有的事实归因方法要么在生成后附加引文,要么鼓励在推理轨迹内部进行证据检索,但它们通常无法确保引用的内容足以支持局部推理和最终答案。我们提出 **ReFact**,一种自适应事实重述引文框架,它训练模型决定推理步骤何时需要上下文支撑,以及应以何种粒度重述源事实。这种设计通过将引文转化为支持答案的中间状态,既避免了无依据的推理,也避免了不加区分的事实复制。ReFact 采用两阶段 SFT 到 RL 的管道进行优化,其中引文效用奖励鼓励引用的事实格式良好、可溯源且足以回答问题。在 LongBench、LV-Eval 和 ConFiQA 上的实验表明,ReFact 在大幅减少词元消耗的同时,提升了长上下文问答和反事实忠实性。进一步分析显示,ReFact 用更少的重述事实保留了更多承载答案的证据,产生了更密集而非更长的推理轨迹。所有代码和数据可在 https://github.com/NEUIR/REFACT 获取。思维链推理、事实重述、长上下文问答、忠实性、引文归因††版权:ACM许可††期刊年份:2027††会议:第33届ACM SIGKDD知识发现与数据挖掘会议;2027年8月1–5日;美国加利福尼亚州圣何塞††doi:xxxxxxx.xxxxxxxx††ccs:计算方法 自然语言处理††ccs:计算方法 机器学习方法††ccs:计算方法 神经网络## 1\.引言 请参见图注图1\.面向证据支撑的长上下文推理的引文策略示意图。\(A\) 基于引文的生成方式附加事后引文,仅提升了归因可见性。\(B\) 事实复述推理在固定位置重述事实,产生过度引用的推理轨迹。\(C\) **ReFact** 自适应地引用答案充分的证据,产生更密集、忠实依托的推理轨迹。三面板图比较了事后引文、固定事实复述和自适应引用事实重述在长上下文推理中的表现。大型语言模型 \(LLMs\)\(Guoet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib8); Yanget al\.,2025a (https://arxiv.org/html/2607.20833#bib.bib9)\) 已越来越多地融入深度推理机制,使多步推理成为解决复杂任务的默认范式。在长上下文场景中,LLMs 通常需要整合并推理分散在长输入中的信息。然而,现有的 LLMs 并不总是将其推理忠实地基于所提供的上下文。它们可能引入无依据的假设,依赖与上下文证据冲突的参数化知识,或生成不确定、不忠实的思维链 \(CoT\)。此类偏差可能通过中间推理步骤传播,最终导致错误结论。因此,随着 LLMs 越来越多地部署于长上下文推理场景,确保其推理过程的忠实性和可信度已成为一项关键挑战\(Biet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib19); Liuet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib18)\)。现有研究尝试通过将模型输出明确基于外部证据来提高推理忠实性,主要方式包括基于引文的生成和事实复述推理。如图1 (https://arxiv.org/html/2607.20833#S1.F1) 所示,基于引文的生成方法\(Menicket al\.,2022 (https://arxiv.org/html/2607.20833#bib.bib23); Gaoet al\.,2023b (https://arxiv.org/html/2607.20833#bib.bib21),a (https://arxiv.org/html/2607.20833#bib.bib22); Fierroet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib25)\) 通常通过为生成的推理轨迹附加引文来增强证据的透明度和可追溯性。然而,这些方法主要改进的是知识归因和可解释性,而非为 LLM 推理定制类人引文。相比之下,事实复述方法\(asai2024self; Yanget al\.,2025b (https://arxiv.org/html/2607.20833#bib.bib3); Wanget al\.,2025b (https://arxiv.org/html/2607.20833#bib.bib1)\) 要求 LLM 在推理过程中明确重述来自所提供上下文的支撑事实。尽管这类方法鼓励模型将上下文证据融入推理过程,但在推理过程中强制显式引文或事实复述可能破坏推理轨迹的紧凑性和连贯性\(Wanget al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib24)\)。因此,仅仅复预先定义的事实并不一定有助于 LLM 的推理过程。为应对这一挑战,我们提出 **ReFact**,一种用于忠实长上下文推理的自适应事实重述框架。ReFact 教会模型推理步骤何时需要证据,以及如何以合适的粒度重述相关源内容。这些重述作为后续推理的紧凑中间状态。通过基于高质量引文支撑轨迹的 SFT 到 RL 管道,ReFact 针对源可追溯性和证据充分性优化引文,产生更忠实、紧凑且连贯的推理。我们的实验表明,ReFact 在 LongBench v1\(Baiet al\.,2024b (https://arxiv.org/html/2607.20833#bib.bib13)\) 和 LV-Eval\(Yuanet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib14)\) 上持续提升了长上下文推理性能,同时生成了显著更短的推理轨迹。这种缩减并非以牺牲有用的上下文事实为代价。ReFact 用更少的重述事实实现了更高的引文 F1,表明它移除了冗余重述,同时保留了引用内容的可回答性:所保留的上下文事实仍然足以推导出正确答案。在 ConFiQA 反事实问题\(Biet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib19)\) 中(提供的上下文与模型的记忆知识冲突),ReFact 实现了更高的源偏好 \(PS\)(衡量对上下文支撑答案的偏好)和更低的参数化覆盖 \(PO\)(衡量响应匹配原始事实答案或其别名的频率)。综合这些结果表明,ReFact 更一致地将所提供的上下文置于冲突的参数化知识之上,提供了上下文忠实性改善的直接行为证据。遵循以往将知识关键型 FFN 与对参数化记忆的不忠实依赖联系起来的研究\(Huanget al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib4)\),我们使用激活分析作为这种依赖减少的补充表征证据。 ## 2\.相关工作 大型语言模型越来越多地用于长上下文场景,在此类场景中,它们必须识别、整合并推理分散在长输入中的证据。尽管最近的基准测试和分析显示长上下文理解取得了快速进展\(Baiet al\.,2024b (https://arxiv.org/html/2607.20833#bib.bib13); Yuanet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib14); Hsiehet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib16)\),但它们也揭示了持续存在的失败,包括“迷失在中间”行为\(Liuet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib17)\) 和长上下文幻觉\(Liuet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib18)\)。这些失败对于推理任务尤其成问题:模型可能产生看似合理的思维链,同时悄然依赖无依据的假设、无关片段或与所提供的上下文冲突的参数化知识\(Lanhamet al\.,2023 (https://arxiv.org/html/2607.20833#bib.bib35); Radhakrishnanet al\.,2023 (https://arxiv.org/html/2607.20833#bib.bib36); Biet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib19)\)。这使得轨迹级别的忠实性成为比仅仅最终答案正确性更强的要求。因此,核心挑战不仅在于处理更多上下文,还在于将中间推理基于输入实际提供的证据。现有研究通过两大方向改进长上下文利用。第一个方向关注如何访问和处理长输入:检索增强生成 \(RAG\) 选择相关外部证据\(Xuet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib28); Jinet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib29)\),高效适配将模型扩展到更长输入\(Chenet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib30)\),多智能体框架在协作智能体之间划分长上下文\(Zhanget al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib31)\)。第二个方向关注长上下文对齐,通过 SFT 或 RL 在长输入指令或推理轨迹上训练模型\(Baiet al\.,2024a (https://arxiv.org/html/2607.20833#bib.bib2); Wanet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib32); Wanget al\.,2025a (https://arxiv.org/html/2607.20833#bib.bib34); Zhuet al\.,2025 (https://arxiv.org/html/2607.20833#bib.bib33)\)。然而,基于训练的方法可能过拟合特定训练分布,并产生不必要的长推理轨迹。尽管这两个方向都改善了上下文利用和任务性能,但各个推理步骤与其支撑源证据之间的联系仍然隐式。为显式建立这种联系,另一系列工作研究了多种设置下的引文和归因。基于引文的生成方法将支撑段落或引用附加到生成的答案中,提升了透明度和源可追溯性\(Menicket al\.,2022 (https://arxiv.org/html/2607.20833#bib.bib23); Gaoet al\.,2023b (https://arxiv.org/html/2607.20833#bib.bib21); Fierroet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib25)\),而基于检索的修订方法先生成响应,然后检索证据以修订无依据的声明\(Gaoet al\.,2023a (https://arxiv.org/html/2607.20833#bib.bib22)\)。更近期的轨迹内归因方法将文档索引、检索内容或重述的源事实直接纳入推理过程\(asai2024self; Yanget al\.,2025b (https://arxiv.org/html/2607.20833#bib.bib3); Wanget al\.,2025b (https://arxiv.org/html/2607.20833#bib.bib1),2024 (https://arxiv.org/html/2607.20833#bib.bib24)\)。然而,这些方法主要将引文用于归因或证据插入,而未显式优化引用内容对推理的效用。相比之下,ReFact 通过自适应事实重述优化引文效用,鼓励引用内容具有源可追溯性、答案充分性并适应当前推理步骤。请参见图注图2\.我们的 ReFact 框架概览。流程图展示了 ReFact 框架的数据构建、监督微调以及带有引文效用奖励的强化学习。 ## 3\.方法论 如图2 (https://arxiv.org/html/2607.20833#S2.F2) 所示,本节介绍用于忠实长上下文推理的 **ReFact** 框架。在3.1节 (https://arxiv.org/html/2607.20833#S3.SS1) 中,我们形式化定义了引文支撑推理任务,并介绍两阶段训练管道。在3.2节 (https://arxiv.org/html/2607.20833#S3.SS2) 中,我们描述如何构建驱动这两个阶段的自适应事实重述训练数据Dtraining\\mathcal\{D\}\_\\{\\text\{training\}\\}。 ### 3.1\.通过事实引文学习基于上下文知识进行推理 给定问题qq和上下文C=\\{c1,...,cN\\}C=\\\{c\_\{1\},\\dots,c\_\{N\}\\\},我们的目标是鼓励 LLM \\mathcal\{M\} 将其推理基于事实引文: \(1\)\(q,C\)↝\\mathcal\{M\}↝\(\\tau,y\),其中τ\\tau是引文支撑的推理轨迹,yy是从τ\\tau推导出的最终答案。将中间推理显式基于给定上下文中的事实可以减少认知负荷\(Sweller,1988 (https://arxiv.org/html/2607.20833#bib.bib37)\);然而,学习何时引用以及如何表达引用内容以支持局部推理仍然具有挑战性。为应对这些挑战,我们提出一个两阶段 ReFact 框架,将模型的引文支撑生成策略πθ\\pi\_\{\\theta\}视为可优化的。首先,我们在3.2节 (https://arxiv.org/html/2607.20833#S3.SS2) 中构建一个高质量的自适应事实重述训练数据集Dtraining\\mathcal\{D\}\_\\{\\text\{training\}\\}。接下来,我们利用该数据集通过两个互补阶段提升引文效用:\(1\) 冷启动监督微调 \(SFT\),它建立引文格式和推理风格;\(2\) 强化学习 \(RL\),它进一步优化πθ\\pi\_\{\\theta\}以有效使用引文。具体而言,我们采用分组相对策略优化 \(GRPO\)\(Shaoet al\.,2024 (https://arxiv.org/html/2607.20833#bib.bib12)\) 并使用四个关键组件定义奖励:格式 \(RformatR\_\{\\text\{format\}\}\) 该标准要求使用和标签将推理轨迹与最终答案分开。还要求每个引文遵循索引格式...,其中NN标识给定上下文中的一个证据片段,并检查所有引文标签是否格式正确且成对出现。准确率 \(RaccR\_\{\\text\{acc\}\}\) 生成的答案yy必须与标准答案y∗y^\{\*\}匹配。可追溯性 \(RtraceR\_\{\\text\{trace\}\}\) 该标准确保所有引用的内容都存在于其所在实例的支撑事实Fi\\mathcal\{F\}\_\{i\}中(对应 Doriginal\\mathcal\{D\}\_\\{\\text\{original\}\},参见3.2.1节 (https://arxiv.org/html/2607.20833#S3.SS2.SSS1)\)。这使得在推理生成过程中能够更忠实地重述上下文事实,同时避免幻觉出无依据的内容。可回答性 \(RansR\_\{\\text\{ans\}\}\) 该标准确保引用的内容足以回答问题qiq\_\{i\}。我们只保留那些仅使用引用内容即可通过固定验证模型恢复出正确答案的轨迹。因此,它排除了引用可追溯但不足以解决问题的轨迹。在数据构建过程中,该标准过滤Dinitial\\mathcal\{D\}\_\\{\\text\{initial\}\},因此只有包含答案充分引文的轨迹才被保留在Dtraining\\mathcal\{D\}\_\\{\\text\{training\}\}中。完整的验证模型提示见附录A.7 (https://arxiv.org/html/2607.20833#A1.SS7)。最终奖励计算为这些组件的加权组合: \(2\)R=λ1Rformat\+λ2Racc\+λ3Rtrace\+λ4Rans,R=\\lambda\_\{1\}R\_\{\\text\{format\}\}\+\\lambda\_\{2\}R\_\{\\text\{acc\}\}\+\\lambda\_\{3\}R\_\{\\text\{trace\}\}\+\\lambda\_\{4\}R\_\{\\text\{ans\}\},其中λ1,λ2,λ3,λ4\\lambda\_\{1\},\\lambda\_\{2\},\\lambda\_\{3\},\\lambda\_\{4\}是奖励权重系数。我们在实验中分配给这些系数的值在附录A.2 (https://arxiv.org/html/2607.20833#A1.SS2) 中报告。 ### 3.2\.面向自适应事实重述的训练数据构建 为激励 LLM 自适应地进行引文支撑推理,我们构建了事实重述训练数据 D相似文章
面向事实的推理学习
本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理
本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。
面向高效可控LLM推理的代理式思维链引导
ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。
ACIL: 用于上下文学习的自动Chain-of-Thought
本文介绍了ACIL,一种自动Chain-of-Thought框架,通过生成和修剪推理链来增强上下文学习,从而提升LLM在复杂任务上的表现。