LongCrafter: 基于证据图指导的指令合成实现多样化长上下文理解

arXiv cs.CL 论文

摘要

LongCrafter 提出了一种结构化合成框架,利用分层任务分类法和证据图生成多样化、忠实的长上下文指令数据,显著提升了大语言模型的长上下文理解能力。

arXiv:2607.06160v1 公告类型:新论文 摘要:合成长上下文监督微调(SFT)数据是增强大语言模型(LLM)长上下文理解能力的一种可扩展方法,但现有方法存在三个局限性:任务覆盖范围窄、指令难度不足以及缺乏忠实性监督。我们提出 \textbf{LongCrafter},一种结构化合成框架,它将分层任务分类法与基于证据的流程相结合。该分类法将长上下文理解组织为局部/浅层和全局/深层级别,并产生32种细粒度任务类型作为全局生成先验。在此分类法的指导下,LongCrafter 构建与任务对齐的长上下文,将其分解为显式的证据图以建模跨段落依赖关系,并生成严格基于所定位证据跨度的指令-响应对,从而确保可控的难度与忠实、可追溯的推理。在 LongBench、LongBench~v2 和 LooGLE 上,基于 LongCrafter 数据微调的模型在 Qwen2.5-7B 和 LLaMA-3.1-8B 上均优于所有 SFT 基线甚至官方后训练模型,其中在高难度任务上提升最大。进一步分析表明,LongCrafter 数据更多样且在不同难度级别上分布更均匀,且训练后的模型无论证据位置如何都能稳健地定位证据,有效缓解了“中部迷失”问题。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:42

# LongCrafter: 通过证据图指导的指令合成实现多样化的长上下文理解
来源:https://arxiv.org/html/2607.06160

陈浩源1\equalcontrib, 尹浩徐1\equalcontrib, 树文徐1, 希智杨1, 佳翔刘2, 辰曦周2, 少平黄2, 浩林任1, 彭飞曹†\dagger2, 俊赵2, 康刘2

###### 摘要

合成长上下文监督微调(SFT)数据是增强大型语言模型(LLM)长上下文理解能力的一种可扩展方式,然而现有方法存在三个共同局限:任务覆盖范围狭窄、指令难度不足以及缺乏忠实度监督。我们提出**LongCrafter**,这是一个结构化合成框架,它将一个层次化任务分类体系与一个基于证据的流水线相结合。该分类体系将长上下文理解组织为局部/浅层和全局/深层两个层次,并产生32种细粒度任务类型,作为全局生成先验。在此分类体系的指导下,LongCrafter构建与任务对齐的长上下文,将其分解为显式建模跨段落依赖关系的证据图,并生成严格基于所定位证据跨度的指令-响应对,从而确保可控的难度和忠实、可追溯的推理。在LongBench、LongBench v2和LooGLE上,使用LongCrafter数据微调的模型在Qwen2.5-7B和LLaMA-3.1-8B两种基座上都优于所有SFT基线,甚至超过了官方后训练模型,在困难任务上提升最大。进一步分析表明,LongCrafter数据更具多样性,并在难度级别上分布更广,且训练后的模型无论证据位置如何都能稳健定位,有效缓解了“中间迷失”问题。

## 1 引言

长上下文理解已成为大型语言模型(LLM)的一项关键能力,因为现实世界中的应用如问答、摘要和复杂推理要求模型能够在数万或数十万个token中识别并利用相关证据(Bai et al. 2024b (https://arxiv.org/html/2607.06160#bib.bib2), 2025 (https://arxiv.org/html/2607.06160#bib.bib3); Li et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib18); Liu et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib20); Peng et al. 2026b (https://arxiv.org/html/2607.06160#bib.bib23))。在合成长上下文指令数据上进行监督微调(SFT)已成为一种有前景且可扩展的解决方案(Bai et al. 2024a (https://arxiv.org/html/2607.06160#bib.bib1); Chen et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib8); Yang et al. 2025b (https://arxiv.org/html/2607.06160#bib.bib30); Chen et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib7); Zhang et al. 2025b (https://arxiv.org/html/2607.06160#bib.bib33); Li et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib19); Gao et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib12))。然而,现有的长上下文SFT数据集存在三个相互叠加的限制。1)**任务覆盖范围有限**。由于缺乏系统性的任务分类体系来指导合成,先前的工作集中于狭窄的任务类型集(例如,多跳问答(Chen et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib7); Bai et al. 2024a (https://arxiv.org/html/2607.06160#bib.bib1); Yang et al. 2025b (https://arxiv.org/html/2607.06160#bib.bib30); Chen et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib8))),导致诸如时间推理、聚合和状态跟踪等多样化的现实世界能力未能得到充分监督。2)**指令难度不足**。先前的工作常常直接从原始文档生成问题,而没有对证据结构进行建模,其中证据跨度可能以链、树或图的形式相互依赖(Bai et al. 2024a (https://arxiv.org/html/2607.06160#bib.bib1); Gao et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib12); Li et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib19))。这种结构建模和难度分层的缺失自然会使生成的数据偏向简单、局部可回答的问题,从而使模型能够利用捷径而非学习真正的跨段落推理。3)**缺乏忠实度监督**。没有将每个推理步骤锚定到源证据的监督(Xu et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib27)),模型可能依赖于参数化知识而非源上下文,从而产生与文档不一致的不忠实推理。

为此,我们提出**LongCrafter**,一个数据合成框架,通过将一个全面的任务分类体系与一个结构化的、基于证据的流水线相结合来解决这些限制。与先前将数据合成视为纯文本生成任务的方法不同(Bai et al. 2024a (https://arxiv.org/html/2607.06160#bib.bib1); Gao et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib12); Li et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib19)),LongCrafter将其视为一个结构化的构建问题,确保指令和响应都围绕指定的任务类型精心设计,并基于显式定位的证据跨度,而不是依赖于表面层次的叙述模仿。

支撑该框架的是一个层次化任务分类体系,它在整个流水线中充当全局生成先验。如图1 (https://arxiv.org/html/2607.06160#S1.F1)所示,它将领上下文理解组织为局部/浅层和全局/深层两个层次,并根据所需能力(例如,检索、排序、跟踪和多证据推理)对任务进行分组,产生32种细粒度任务类型。基于此分类体系,LongCrafter通过三个阶段操作。

**(1) 长上下文构建:** 我们按来源对语料库进行分组,并将每个来源与候选任务类型配对。对于单文档任务,每个文档匹配到合适的任务。对于多文档任务,我们选择一个文档作为主要参考点,然后通过混合BM25-密集检索,基于语义相关性和任务对齐检索并过滤补充文档,以形成最终的长上下文输入。

**(2) 证据约束图构建:** 我们将每个文档解析成一个结构化的证据图,通过提取候选证据跨度,选择任务相关的跨度作为节点,并用捕捉跨段落关系的依赖边连接它们。生成的图为下游的指令和响应生成提供显式的证据锚点。

**(3) 指令-响应对合成:** 我们生成严格基于证据图的指令和响应,其中指令必须共同利用所有关键节点以防止捷径回答,而响应则逐步推导,每个推理步骤逐字引用源中的相应证据。

所提出的流水线确保了跨不同能力类型的广泛任务覆盖,特别强调那些需要整合多个分散证据跨度信息的稀缺但关键的任务,同时保证响应构成基于细粒度上下文证据的忠实且逻辑连贯的推理。

大量实验表明,在LongBench (Bai et al. 2024b (https://arxiv.org/html/2607.06160#bib.bib2))、LongBench v2 (Bai et al. 2025 (https://arxiv.org/html/2607.06160#bib.bib3))和LooGLE (Li et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib18))上,使用LongCrafter生成的数据训练的模型始终优于先前的长上下文SFT基线,在Qwen2.5-7B和LLaMA-3.1-8B基座上均取得了最高的All-Overall得分(分别为45.15%和45.71%),并分别比相应的官方后训练模型高出+2.41和+5.25个点。数据分析进一步表明,与现有数据集相比,LongCrafter生成的数据具有更优的任务多样性和难度分布。进一步分析显示,LongCrafter训练的模型在证据识别方面表现出很强的位置鲁棒性,并将注意力精确集中在真实的证据文档上,有效缓解了“中间迷失”现象(Liu et al. 2024 (https://arxiv.org/html/2607.06160#bib.bib20))。

本文的主要贡献如下:

- • 我们构建了一个包含32种细粒度任务类型的层次化任务分类体系,覆盖从局部/浅层到全局/深层的长上下文理解,为长上下文SFT数据构建提供了系统且全面的任务覆盖。
- • 我们提出了**LongCrafter**,它将文档分解为建模跨段落依赖关系的证据图,并生成严格基于定位证据跨度的指令-响应对,从而产生具有足够指令难度和忠实、基于证据的监督的数据。
- • 我们在全面的长上下文基准上验证了LongCrafter,LongCrafter训练的模型一致优于所有基线;进一步分析证实,合成的数据具有卓越的多样性和质量,并且训练后的模型能精确定位证据跨度,具有很强的位置鲁棒性。

参考图注
图1:**LongCrafter**的任务分类体系。内环区分局部/浅层与全局/深层设置,中环按能力对任务进行分组,外环列出细粒度任务类型。

参考图注
图2:LongCrafter流水线概述。(a) 长上下文构建:基于精选的网络语料库和32种细粒度任务类型,将每个文档与候选任务匹配,并构建单文档或多文档上下文;(b) 证据约束图构建:在任务特定引导下,从上下文中提取任务相关的证据节点及其依赖边;(c) 指令-响应对合成:从上下文和证据图生成基于证据的指令和逐步引用式响应。

## 2 方法论

本节详细描述LongCrafter,它结合了一个层次化任务分类体系和一个三阶段流水线。分类体系作为一个全局生成先验,约束整个构建过程,而长上下文构建、证据约束图构建和指令-响应对合成这三个阶段的流水线则以结构化和可追溯的方式生成训练样本。为了确保广泛的领域覆盖,我们从多样化的网络来源收集并预处理文档,形成一个丰富的语料库,更多细节见附录7.1 (https://arxiv.org/html/2607.06160#S7.SS1)。

### 2.1 任务分类体系

LongCrafter的基础是一个基于现实世界长上下文能力需求的任务分类体系,它充当整个流水线的全局生成先验。如表7.4 (https://arxiv.org/html/2607.06160#S7.SS4)所述,该分类体系将长上下文理解组织为两个层次:依赖局部证据的**局部/浅层**任务,和依赖多个相互依赖证据的**全局/深层**任务。任务进一步按其所需能力(例如,检索、排序、跟踪和多证据推理)进行分组,产生32种细粒度任务类型,涵盖单文档和多文档范围。每种细粒度任务类型指导LongCrafter的所有下游阶段,从证据图分解到指令生成和响应归因。

### 2.2 数据合成

在任务分类体系的指导下,LongCrafter流水线通过三个连续阶段生成训练样本:长上下文构建(阶段1)、证据约束图构建(阶段2)和指令-响应对合成(阶段3)。

#### 阶段1:长上下文构建

我们首先执行粗粒度匹配:按来源对语料库进行分组,并将每个来源与其候选的细粒度任务类型配对(例如,代码文档与代码理解任务匹配),缩小后续文档级匹配的搜索空间。然后我们执行以文档为中心的匹配,根据文档范围通过两条路径将每个文档与适用的任务类别关联起来。

##### 单文档匹配。
每个文档针对其候选任务中的所有单文档任务类别进行评估。可以从该文档本身有意义构建的任务——如全局摘要或文档内多跳推理——被记录为其候选任务,并且该文档被分割成大小相等的块作为阶段2的上下文。

##### 多文档匹配。
每个文档也被评估为多文档任务的根文档。如果合适,LLM会根据根文档和目标任务类型生成检索查询,然后通过混合BM25-密集策略从剩余语料库中检索补充文档。LLM随后进行联合相关性和多样性过滤,以根文档为基础组装最终的上下文,确保集合主题相关但不冗余——这是阶段2中构建有意义的跨文档证据图的先决条件。组装好的上下文随后被分割成大小相等的块并传递给阶段2。

参考图注
图3:数据集难度和响应质量分析。左:按得分区间划分的训练数据集难度分布。中:按依赖类型划分的LongCrafter样本难度分布。右:四个维度的答案质量。

#### 阶段2:证据约束图构建

阶段2是区分LongCrafter与现有方法的核心组件。LongCrafter首先将上下文分解为一个结构化的证据图,使跨段落依赖关系显式化,而不是直接从原始上下文生成问题。该图通过一个**先提取后构建**的过程构建:先进行穷举候选跨度提取,再进行任务驱动的图构建。

##### 步骤1:穷举跨度提取。
给定上下文\(\mathcal{C}=\{c_1, c_2, \ldots, c_n\}\)(其中\(c_i\)表示第\(i\)个块)和目标任务类型\(t\),LLM首先根据\(t\)生成任务特定的引导,然后从每个块\(c_i\)中参考完整上下文提取所有候选证据跨度。对于每个候选,模型记录:(1) 一个逐字文本片段及其块级来源位置;(2) 该跨度携带的任务必要关键信息(例如,时间线推理中的事件和日期)。这产生一个密集的候选节点集\(V^+=\bigcup_{i=1}^n V^+_i\),其中\(V^+_i\)表示来自块\(c_i\)的所有候选,避免过早丢弃那些在跨块推理中被证明至关重要的潜在必要证据。

##### 步骤2:任务驱动图构建。
给定完整的候选集\(V^+\),模型对整个上下文执行一次全局推理,以构建最小充分的证据图\(G=(V,E)\),其中\(V \subseteq V^+\),且:
- • 节点\(v_i \in V\):一个证据跨度,包含 (1) 精确位于特定段落的逐字引用片段,以及 (2) 其携带的任务必要关键信息(必要注释);
- • 边\(e_{ij} \in E\):一条有向边,编码节点\(v_i\)和\(v_j\)之间的跨段落依赖关系(例如,时间、因果或共指关系)。

具体来说,模型选择对于任务类型\(t\)共同必要且充分的候选跨度,并在所选节点之间建立有向依赖边\(E\),用其跨块关系类型注释每条边以捕捉它们的逻辑关系。一个有效的证据图必须满足两个条件:(1) 节点是

相似文章

基于代理上下文的链式思维微调长上下文推理

arXiv cs.CL

提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。

LiFT:指令微调能否提升大语言模型的纵向建模上下文学习能力?

arXiv cs.CL

## 指令微调能否提升大语言模型的纵向建模上下文学习能力? 来源:[https://arxiv.org/html/2604.16382](https://arxiv.org/html/2604.16382) Iqra Ali¹, Talia Tseriotou¹, Mahmud Elahi Akhter¹, Yuxiang Zhou¹, Maria Liakata¹,² ¹伦敦玛丽女王大学(英国),²艾伦·图灵研究所(英国) {iqra.ali,t.tseriotou,m.liakata}@qmul.ac.uk ###### 摘要 纵向NLP任务要求对时间有序的文本进行推理,以检测人类行为和观点的持续性和变化。然而,大语言模型的上下文学习在模型必须整合历史上下文、跟踪不断演变的交互,以及处理罕见变化事件的任务上存在困难。我们提出了LiFT,一个纵向指令微调框架,将多样化的纵向建模任务统一在共享的指令模式之下。LiFT采用课程式方法,在逐步增加时间难度的同时融入少样本结构和时间条件化,以鼓励有效利用过去上下文。我们在五个数据集上评估了LiFT。在不同时间粒度级别上针对纵向任务训练的模型,在两个独立数据集上进行了泛化能力测试。在不同参数规模的模型(OLMo(1B/7B)、LLaMA-8B和Qwen-14B)中,LiFT始终优于基线模型的上下文学习,在分布外数据和少数类变化事件上表现出显著的提升。

LongAct:利用内在激活模式进行长上下文强化学习

Hugging Face Daily Papers

LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。