ClueWeaver:基于奖励引导的双智能体证据推理,用于文学长篇叙事的紧凑型大语言模型

arXiv cs.CL 论文

摘要

ClueWeaver是一个奖励引导的双智能体框架,通过将证据选择和推理分解为通过强化学习优化的独立智能体,使用紧凑型本地语言模型改进长篇叙事问答。

arXiv:2608.25531v1 公告类型:新 摘要:人文与社会科学的研究需要对小说、剧本、档案和案例报告等长篇叙事材料进行细读,但许多用户访问昂贵的专有长上下文模型的机会有限。紧凑、可本地部署的语言模型是一种实用的替代方案,但直接输入整个长上下文仍然成本高昂、难以检查,并且容易遗漏稀疏的证据。我们提出ClueWeaver,一个用于紧凑本地模型长篇叙事问答的证据感知双智能体框架。Finder通过检索引导的分段识别包含答案关键线索的段落,而Interpreter从选定的证据中推导答案,生成带有段落ID引用的推理过程,并对高风险问题应用内部自校准步骤。两个智能体都通过奖励引导的强化学习进行优化:Finder奖励强调证据保留和忠实的段落ID引用,Interpreter奖励强调正确性、依据和简洁的解释。这种分解使得证据选择和推理比端到端提示更易于检查。在多个长上下文叙事问答和声明验证设置上的实验表明,ClueWeaver显著改进了本地端到端语言模型,同时提供了证据覆盖和段落引用的推理轨迹。代码可在https://github.com/Ameame1/ClueWeaver获取。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:21

# ClueWeaver:面向文学长篇叙事中紧凑型大语言模型的奖励引导双智能体证据推理  
来源:https://arxiv.org/html/2608.25531  
朱继浩,杨志伟\*,张文潇\*,赵俊谦,尤琦,方奇††(注:同等贡献。单位:中国科学院信息工程研究所,中国北京 邮箱:[[email protected]](mailto:[email protected]);单位:阿伯丁大学,英国阿伯丁;单位:西澳大学,澳大利亚珀斯 邮箱:[[email protected]](mailto:[email protected]))  
\[\-1pt\]王哲远,邓哲远,杨汉哲,刘宇\(🖂\),金炳\(🖂\)  
单位:中国科学院信息工程研究所,中国北京 邮箱:[[email protected]](mailto:[email protected]);单位:西澳大学,澳大利亚珀斯 邮箱:[[email protected]](mailto:[email protected]);单位:布朗大学,美国罗德岛州普罗维登斯  

#### 摘要  
人文与社会科学研究需要对小说、剧本、档案和案例报告等长篇叙事材料进行精读,但许多用户难以获得昂贵的专有长上下文模型。紧凑、可本地部署的语言模型是一种实用的替代方案,但直接向其输入完整长上下文仍成本高昂、难以检验,且容易遗漏稀疏证据。我们提出**ClueWeaver**,一个面向紧凑本地模型的、用于长篇叙事问答的证据感知双智能体框架。其中**查找器**通过检索引导的分段方法识别包含答案关键线索的段落,**解释器**则从选定证据中推导答案,生成带有段落ID引用的推理依据,并针对高风险问题应用内部自校正过程。两个智能体均通过奖励引导的强化学习进行优化:查找器的奖励侧重于证据保留和忠实的段落ID引用,解释器的奖励侧重于正确性、基于证据的推理和简洁解释。这种分解使得证据选择和推理过程比端到端提示更易于检验。在多个长上下文叙事问答与声明验证设置上的实验表明,ClueWeaver在提供证据覆盖和基于段落引用的推理轨迹的同时,显著提升了本地端到端语言模型的性能。  

#### 关键词  
长上下文问答 长篇叙事推理 证据选择 多智能体推理  

## 1 引言  
小说、剧本、调查记录和长篇案例报告需要对扩展叙事进行连贯阅读\[10, 23, 27, 9\]。其意义并非源于独立事实的集合,而是从分布在数百个段落中的人物、事件、动机、时间顺序和因果关系中涌现。这一场景对于资源受限的文学和人文研究尤为重要,因为学者可能需要在没有昂贵的专有长上下文模型或远程服务的情况下分析小说、剧本、档案或案例材料\[1, 26\]。因此,长篇叙事问答为增强可本地部署的紧凑模型的长上下文阅读能力提供了一个实用的测试平台\[touvron2023llama, jiang2023mistral, 28\]。  

近期的大语言模型不同于早期具有短上下文窗口的预训练模型,现在可以在单个提示中接受更长的输入\[4, 30, 5\]。然而,仅靠窗口大小并不能确保可靠的叙事理解\[13, li2024loogle\]:叙事性问题通常需要分散在远距离文本片段中的稀疏、间接线索\[17, 27\]。因此,模型必须识别出显著的故事证据。图1说明了这一困难。在长篇叙事中,答案关键线索往往稀疏且相距甚远,需要模型按照叙事顺序将它们连接起来。紧凑型本地模型可能依赖有限的上下文窗口,这可能会截断证据、分隔相关线索并掩盖证据使用。因此,失败可能源于遗漏或误用关键线索,而不仅仅是生成错误。  

图1:长篇叙事中的答案关键线索通常稀疏且相距遥远。长上下文模型可能直接连接它们,而在有限上下文窗口上操作的紧凑型本地模型则可能截断证据、分隔相关线索并掩盖证据使用。  

这一场景不同于标准的检索增强生成(RAG)\[11\]。典型的RAG从大型语料库中检索外部文档,而长篇叙事问答则假设源文本已给出,并要求模型在其中查找、保留和使用稀疏证据。直接全上下文提示是一种自然的基线方法,但它使证据选择保持隐式\[13, 5\]:失败可能源于遗漏相关线索、在无关细节中丢弃它们,或未能对可用证据进行推理。这引出了一个核心问题:**紧凑型本地模型如何在回答长篇叙事问题的同时,使其支持线索变得明确?**  

现有工作已使这一挑战可见,但未能完全回答上述问题。长篇叙事和长文档基准测试表明,关于书籍、剧本和段落的问题需要的不仅仅是局部短语匹配或浅层显著性\[10, 17\]。更广泛的长上下文评估进一步表明,仅仅增加输入长度并不能确保对相关信息的稳健利用,特别是当证据埋藏在上下文中时\[4, 13\]。  

RAG通过检索外部段落改进了知识密集型生成\[11\]。IRCoT将检索与思维链推理交错进行\[22\],Self-Ask将问题分解为后续查询\[18\],Chain-of-Agents将长上下文阅读分配给协作的智能体\[31\],RAG-DDR使用数据驱动奖励优化RAG模块\[12\]。然而,这些方法主要针对开放域检索、通用多跳问答或广泛的长上下文聚合。它们没有直接解决源叙事已给出、答案关键线索稀疏且分布分散、且证据选择本身应明确且可检验的场景。同时,全上下文提示和单阶段阅读器将证据选择隐式化,并将证据定位与答案生成耦合。因此,它们对模型是否基于正确证据进行推理提供的控制有限。  

一个更合适的框架应该将证据选择和基于证据的推理作为独立的、可检验的、可训练的步骤暴露出来。为此,我们提出了**ClueWeaver**,一个面向文学和人文导向长篇叙事阅读的、用于紧凑本地模型的双智能体流程。ClueWeaver不是将长文档压缩成单一的潜在状态,而是构建具有检索感知的叙事段落,并使用**查找器**选择包含答案关键线索的段落。这些段落连同段落ID和保留的叙事顺序一起打包,为**解释器**提供可读的证据,以便连接线索、回答问题,并在需要时应用**解释器自校正**作为最终的一致性检查。这种分离使得故障更容易在候选构建、线索选择、证据打包和最终推理各个阶段定位。  

我们进一步使用奖励引导训练优化两个智能体:查找器因保留支持线索和忠实的段落引用而获得奖励,而解释器因正确、基于证据且简洁的推理依据而获得奖励。在此场景中,奖励引导强化学习提供了一种实用的方法,将中间证据决策与任务级结果对齐,这与近期在基于反馈和奖励的后训练(用于指令遵循和推理)方面的进展一致\[21\]。  

我们的贡献有三点:  
1. 我们提出了ClueWeaver,一个证据感知的智能体流程,它将长篇叙事问答分解为明确的证据选择、自校正解释和基于证据的解释,适用于紧凑型本地模型。  
2. 我们使用奖励引导的强化学习优化了查找器和解释器,鼓励高召回率的证据保留、忠实的段落引用和可靠的答案生成。  
3. 在多个长上下文叙事理解设置上的实验表明,ClueWeaver在提供可检验的证据轨迹的同时,显著提升了可本地部署的紧凑语言模型的性能。  

## 2 相关工作  
### 2.1 智能体辅助的文学与长上下文阅读  
AI辅助的文学阅读针对其解释依赖于情节、人物、时间顺序和隐含因果关系的长篇叙事。NarrativeQA\[10\]和QuALITY\[17\]引入了对书籍、剧本和长上下文的问答;NovelQA\[23\]、DetectiveQA\[27\]和NoCha\[9\]进一步向小说规模的问答和声明验证迈进。更广泛的长上下文基准测试,包括LongBench\[4\]、∞Bench\[30\]、LooGLE\[li2024loogle\]和LongBench v2\[5\],表明更大的上下文窗口并不能确保稳健的长程理解,特别是当相关信息埋藏在上下文中时\[13\]。然而,这些研究评估最终答案,对线索发现和证据保留的关注较少。  

### 2.2 智能体RAG与LLM推理流程  
检索增强生成(RAG)\[11\]将生成建立在检索到的外部段落基础上。智能体变体增加了自适应控制:ReAct\[29\]结合推理和行动,FLARE\[8\]在生成过程中进行检索,Self-RAG\[3\]增加了检索和自我批评。多步骤流程如IRCoT\[22\]、Self-Ask\[18\]、Chain-of-Agents\[31\]和RAG-DDR\[12\]进一步将检索和推理组织成分阶段的流程。这些方法主要针对开放域检索、多跳问答或通用长上下文聚合:IRCoT和Self-Ask构建查询或子问题链,Chain-of-Agents通过运行的通信摘要压缩块,Self-RAG/RAG-DDR调节通用RAG行为。ClueWeaver则针对**封闭文档长篇叙事**,其中源文本已给出,核心问题是保留稀疏的故事线索。它训练一个用于段落级证据决策的**查找器**,按叙事顺序保留带有引用的选定线索,并优化线索保留、引用保真度和基于证据的最终答案,而不是引入新的检索原语。  

### 2.3 面向推理的奖励引导强化学习  
后训练方法可以改进模型行为。SFT\[25\]使模型适应指令格式,基于PPO的RLHF\[20\]优化偏好奖励,DPO\[19\]提供了一种更简单的偏好优化路径。DeepSeekMath\[21\]表明,基于GRPO的RL可以增强推理能力。与此同时,答案归因分析\[24\]表明,最终答案可能将显式推理与类似检索的记忆知识混合在一起。然而,奖励引导训练在长篇叙事阅读中,对证据选择、段落级归因和基于证据的解释的关注仍然不足。  

## 3 方法  
图2:ClueWeaver概述:查找器选择承载证据的叙事段落,解释器生成基于证据的答案并进行自校正。  
### 3.1 问题定义  
我们将面向资源受限人文场景的紧凑语言模型的长篇叙事阅读智能体支持,形式化为问答任务。设 \(X=\{p_1,p_2,...,p_m\}\) 为一个叙事,其中每个 \(p_i\) 是一个带索引的段落,\(m\) 为段落数量。给定一个问题或声明 \(q\),模型仅使用 \(X\) 预测答案 \(y\);\(y\) 可以是多选选项或二元验证标签。由于仅 \(X\) 的一小部分支持 \(y\),任务是从 \(X\) 中选择一个紧凑的证据集 \(E\),保留其叙事顺序,并生成 \(y\) 以及一个其陈述可追溯到 \(E\) 中段落引用证据的解释。  

### 3.2 概述  
图2展示了该流程,算法1给出了推理过程。ClueWeaver不要求紧凑模型一次性阅读整个叙事。它首先构建具有检索感知的段落,使用**查找器**保留带有段落ID的线索承载段落,按叙事顺序打包保留的证据,并让**解释器**生成基于段落的答案。对于二元声明和高风险问题形式,同一个**解释器**可选择性地运行 \(I_{\theta_i,\mathrm{self-cal}}\),这是一种自校正模式,它会对暂定答案使用相同的数据包进行重新检查。  

在算法1中,\(\mathcal{Y}\) 是答案空间,\(B\) 是证据预算,\(\theta_f\) 和 \(\theta_i\) 是两个智能体的参数,\(\mathcal{S}\) 是段落集,\(E\) 是最终证据包,\(\tau(q)\) 触发自校正。在实现中,两个智能体都使用一个紧凑的XML接口:`<rationale>` 包含带段落引用的解释,`<answer>` 包含是/否决策或最终答案。完整提示见附录E。  

算法1 ClueWeaver 推理  
1: 输入:叙事 \(X=\{p_i\}_{i=1}^m\),问题或声明 \(q\),答案空间 \(\mathcal{Y}\),证据预算 \(B\)  
2: 输出:XML格式输出 \(z^I=(r,y,\mathcal{C})\),其中 \(\mathcal{C}\) 是从 \(r\) 中提取的段落引用集合  
3: \( \mathcal{S}=\{s_j\}_{j=1}^n \leftarrow \mathrm{Segment}(X,q) \)

相似文章

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。

使用推理代理的大规模反例引导学习

arXiv cs.LG

本文提出将反例引导学习用于LLM执行正则表达式归纳,其中验证器提供反例以优化候选表达式。该方法显著提高了具有挑战性任务上的样本效率和成功率,表明LLM可以从结构化反馈中受益,而不仅仅是将其视为额外数据。

学习如何让大语言模型进行推理

OpenAI Blog

OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。