超越奖励工程:长上下文强化学习的数据配方

arXiv cs.CL 论文

摘要

本文表明,通过精心设计的长上下文强化学习数据配方,结合基于结果的最小GRPO,能够显著提升多个模型和基准测试的推理能力,并迁移到GAIA和BrowseComp等智能体任务。

arXiv:2606.18831v1 公告类型: 新 摘要:长上下文推理是大语言模型的关键能力,尤其是在它们作为自主智能体需要处理长序列轨迹时。强化学习最近成为提升这一能力的主流范式,但现有工作主要关注奖励工程,而多样化训练数据仍然匮乏。我们从数据中心的视角重新审视这个问题,并表明一个简单而有效的数据配方,配合基于结果的最小GRPO设置,就足以大幅提升长上下文推理。我们的配方针对三类互补任务——检索、多证据合成与推理——为此我们构建并整理了八个数据集,总计约1.4万条示例。在三个模型(Qwen3-4B/8B/30B-A3B)上的实验表明,在七个长上下文基准测试上平均提升+7.2/+3.2/+6.4分,超越了之前的RL训练集。我们进一步证明这些收益可以迁移到智能体任务中,使用我们的数据配方在已针对智能体调整的模型上继续RL训练,可使GAIA提升+4.8分,BrowseComp提升+7.0分。我们将发布数据集以促进未来研究。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:46

# 超越奖励工程:长上下文强化学习的数据配方  
来源:https://arxiv.org/html/2606.18831  

Xiaoyue Xu¹, Sikui Zhang¹, Xiaorong Wang¹, Xu Han²¹¹, Chaojun Xiao²  
¹OpenBMB  
²清华大学  
[email protected], {han-xu, xcj}@tsinghua.edu.cn  

###### 摘要  

长上下文推理是大语言模型的一项关键能力,尤其是在它们作为自主智能体被部署、需要推理大规模轨迹时。强化学习(RL)近期已成为提升该能力的主流范式,但现有工作大多聚焦于奖励工程,而多样化的训练数据仍然稀缺。我们从数据中心的视角重新审视这一问题,并证明仅凭一套简单而有效的数据配方,配合最小化的基于结果的 GRPO 设置,就足以大幅提升长上下文推理能力。该配方针对三种互补的任务族——检索、多证据合成与推理——我们为此构建并筛选了共计约 14K 条示例。在三个模型(Qwen3-4B/8B/30B-A3B)上的实验表明,在七个长上下文基准上平均提升 +7.2/+3.2/+6.4 个百分点,超越了之前的 RL 训练集。我们进一步证明这些增益可迁移至智能体任务:在基于代理调优的模型上使用本数据配方继续 RL 训练,使 GAIA 提升 +4.8 分,BrowseComp 提升 +7.0 分。我们将发布我们的数据集以促进未来研究。

# 超越奖励工程:长上下文强化学习的数据配方  

Xiaoyue Xu¹, Sikui Zhang¹, Xiaorong Wang¹, Xu Han²¹¹, Chaojun Xiao²†† 通讯作者  
¹OpenBMB  
²清华大学  
[email protected], {han-xu, xcj}@tsinghua.edu.cn  

## 1 引言  

图 1:一个长上下文推理示例,需要三种能力(定义见 §3.1):检索、多证据合成和推理。  

大语言模型(LLMs)越来越多地被部署为自主智能体,成功应对复杂的现实世界任务,例如网络搜索 (Mialon et al., 2024; Wei et al., 2025)、软件工程 (Yang et al., 2024) 和 GUI 自动化 (Qin et al., 2025)。这些应用将 LLMs 暴露于大量网页、大规模代码仓库和庞大的动作历史中,任务相关的证据往往散布在冗长的输入中。LLMs 必须识别、整合并推理这些信息以作出正确决策。因此,长上下文推理已成为现代 LLMs 的一项核心能力。  

先前的工作已证明强化学习(RL)在增强 LLMs 推理能力方面的有效性 (OpenAI et al., 2026; Guo et al., 2025),但大多数研究聚焦于短上下文任务。将这些增益扩展到长上下文推理仍未被充分探索。近期研究表明,标准可验证奖励强化学习(RLVR)中仅基于结果的奖励提供的信号过于稀疏,无法指导模型在长输入中定位证据,导致上下文召回率停滞不前,以及绕过事实支撑的捷径推理 (Chen et al., 2026a; Guan et al., 2026)。为此,现有工作大多聚焦于长上下文 RL 的奖励设计 (Ping et al., 2026b; Chen et al., 2026a; Peng et al., 2026; Guan et al., 2026),在结果奖励之外补充明确评分证据支撑或中间推理过程的辅助信号。同时,高质量训练数据仍然稀缺:尽管已有若干合成数据管道被提出 (Shen et al., 2025; Wang et al., 2026; Xiao et al., 2026),但所生成的数据集要么任务覆盖范围狭窄,要么保持闭源。  

在本文中,我们从数据中心的视角重新审视长上下文 RL,并证明一套多样化的数据配方本身足以显著提升长上下文推理能力,无需特殊的奖励工程。我们假设长上下文推理可分解为一小组互补的核心能力,这些能力需要在训练中共同锻炼,这一观点与先前的实证分析一致 (Li et al., 2024a; Xiao et al., 2026)。例如,在回答一个类似 GAIA (Mialon et al., 2024) 的问题“德国三个最人口稠密的非欧盟创始成员国的陆地邻国的总人口是多少?”(图 1)时,模型必须:(1) 定位候选国家及其人口,(2) 整合边界关系和欧盟创始成员国信息以过滤掉创始成员国,(3) 对剩余三个最人口稠密国家进行数学推理以计算最终和。基于这一假设,我们的数据配方覆盖三个对应的任务类别:(i) **检索**:模型需从长输入中定位相关证据,尤其是当证据语义间接或信息分散在大量干扰项中;(ii) **多证据合成**:模型需整合输入不同部分的证据得出回答,而单个证据无法提供;(iii) **推理**:模型需在长输入上执行复杂的多步问题求解(如数学)。我们据此收集并构建覆盖这三个任务类别的训练数据,并开展全面的 RL 实验以评估本数据配方在长上下文基准上的有效性以及向智能体任务的迁移效果。  

我们在三个模型上训练:Qwen3-4B-Thinking-2507、Qwen3-8B 和 Qwen3-30B-A3B-Thinking-2507 (Qwen Team, 2025d),并在七个长上下文基准上进行评估。无需任何特殊奖励工程或分阶段 RL 训练,本配方即带来一致的增益:在三个模型上分别平均提升 +7.2、+3.2 和 +6.4 个百分点。在相同的 RL 设置下,它优于先前的两个长上下文 RL 训练集:DocQA-RL-1.6K (Wan et al., 2025) 和 KeyChain (Wang et al., 2026)。我们进一步证明这些长上下文增益可迁移至智能体任务:在基于代理调优的模型上继续使用本数据配方进行长上下文 RL 训练,使 GAIA 提升 4.8 分,BrowseComp 提升 7.0 分,这表明强化核心长上下文能力能有效提升长时域智能体能力。

## 2 相关工作  

##### 长上下文推理的后训练。  
越来越多的研究通过后训练来提升长上下文推理能力,其中核心挑战是筛选多样且高质量的长上下文监督数据。在 SFT 方面,LongAlign (Bai et al., 2024a) 构建了长指令遵循数据集并配合平衡训练策略;Li et al. (2024b) 允许模型生成自己的 SFT 示例进行自我改进;ACC (Su et al., 2026) 将长智能体轨迹编译成长上下文训练数据。强化学习近期已成为优化长上下文下推理行为的有效范式,我们接下来讨论这一点。  

##### 长上下文场景下的强化学习。  
现有长上下文 RL 工作大致可分为两类:**算法中心**和**数据中心**。算法中心路线改进 RL 训练过程。在奖励方面,近期工作通过辅助信号补充 RLVR 的仅结果奖励,明确对证据支撑 (Chen et al., 2026a; Guan et al., 2026; Whitecross and Rahimi, 2026) 或中间步骤质量 (Peng et al., 2026) 进行评分。在优化方面,包括改进的策略优化 (Shen et al., 2025) 和选择性权重更新 (Ping et al., 2026a)。数据中心路线构建高质量长上下文 RL 训练集,例如 DocQA-RL (Wan et al., 2025) 包含约 1.6K 个文档问答问题;LoongRL (Wang et al., 2026) 通过 KeyChain UUID 驱动的管道合成示例;Xiao et al. (2026) 通过原子技能分解构建数据集。然而,这些训练数据要么规模与多样性有限,要么局限于单一合成任务格式。我们的工作聚焦于数据中心路线。与这些先前工作不同,我们贡献了一个更统一的**配方**,锻炼长上下文推理的三种互补核心能力,在多个长上下文基准上实现一致的增益。

| 类别 | 数据集 | 描述 | 大小 | 长度 |
|------|--------|------|------|------|
| 检索 | FuzzyNeedle | IS-A 关系驱动的改写针,父类查询 | 1,500 | 0–32K |
| 检索 | MultiNeedle | 打乱的近重复多针检索 | 1,500 | 0–32K |
| 多证据合成 | CrossEntity | 跨实体派生属性聚合 | 3,521 | 0–64K |
| 多证据合成 | WebSearch | 伴随兄弟实体干扰项的桥接链 | 684 | 0–64K |
| 多证据合成 | MultiQuery | 按顺序回答的嵌入式查询 | 226 | 0–32K |
| 多证据合成 | KeyChain | 隐藏问题的 UUID 指针链 | 654 | 0–32K |
| 多证据合成 | LongDocQA | 由 HotpotQA / MuSiQue / Qasper 扩展 | 3,422 | 0–64K |
| 推理 | LongMath | 变量分散的数学问题 | 2,562 | 0–64K |

表 1:本长上下文训练混合数据集在三种能力类别下的组成。“长度”指估计的输入 token 范围。

## 3 方法论  

我们的方法论包含两部分:一个长上下文训练数据混合集,共同锻炼长上下文推理的三种核心能力(§3.1),以及一个最小化的 RL 设置,采用基于结果的奖励(§3.2)。

### 3.1 长上下文训练数据  

我们的训练混合集围绕 §1 中引入的三个任务类别组织——**检索**、**多证据合成**和**推理**——每个类别突显长上下文推理所必需的不同能力。对于每个类别,我们分析模型面临的主要困难,并介绍为解决这些困难所构建的数据集。最后总结整体数据配方并描述数据筛选过程。

#### 3.1.1 检索  

传统的“大海捞针” (Kamradt, 2023) 在近期长上下文模型上已基本饱和。然而,当前长上下文 LM 的信息检索仍严重依赖词汇模式匹配 (Modarressi et al., 2025; Xu et al., 2024),一旦相关信息变得丰富且分散在上下文中(例如随着针的数量增加),性能就会急剧下降 (Hsieh et al., 2024; Vodrahalli et al., 2024; Li et al., 2025)。为此,我们构建了两个轻量级数据集以应对这两个不足。

##### FuzzyNeedle。  
FuzzyNeedle 通过 Wikidata 的 *IS-A* 关系对针进行改写,去除词汇捷径,使得查询与证据之间没有关键词重叠,思路类似于 NoLiMa (Modarressi et al., 2025)。我们首先采样一个目标实体(如 `fish`)及其一个实例(如 `salmon`),并将该实例附加到一个虚构陈述中(如 *“Alice loves the texture of salmon”*)。然后额外采样兄弟实体(如 `vegetable`)并抽取若干实例,为每个兄弟实体形成类似的干扰陈述。所有陈述散布在一段无关的长段落中,模型被要求以目标实体层级查询(如 *“Who enjoys eating fish?”*)。正确回答需要解析“实例-所属”关系而非依赖关键字匹配,同时排除干扰陈述。

##### MultiNeedle。  
MultiNeedle 要求模型在众多近重复针中区分出目标针,并根据其出现顺序进行检索,遵循 MRCR (Vodrahalli et al., 2024)。我们准备一组多样化的主题,并提示 LLMs 为每个主题草拟多段用户-模型对话。来自不同主题的对话被随机打乱并连接成一个长上下文,模型被要求检索指定主题的第 *K* 段对话。模型因此需要穷举定位每个针,记录其出现顺序,并在相似候选项中进行区分。

#### 3.1.2 多证据合成  

多证据合成是现实长上下文任务中的常见模式 (Yang et al., 2018; Tang and Yang, 2024),需要将散布在输入不同部分的信息整合成连贯的答案。长上下文 LM 在此表现出若干不足:(i) **表面形式捷径**:仅利用逐字片段而非合成证据;(ii) **不完整覆盖**:模型跳过部分长输入,遗漏答案所需的信息 (Gupta et al., 2025);(iii) **干扰混淆**:主题相关的文档被误认为核心证据 (Vodrahalli et al., 2024)。针对此类任务,我们构建了新的合成数据集以应对这些不足,并改编了先前工作中的长上下文 QA 源。

##### CrossEntity。  
该数据集针对表面形式捷径和不完整覆盖,产生的问题答案需聚合多个实体的*派生属性*,而这些属性从未在文档中直接陈述。给定同一 Wikidata 类别(如 NBA 球员)的一组同级实体,我们提示 LLMs 识别实体页面中提及的*直接属性*(如 `birth_year`)以及仅通过合成才能获得的*派生属性*(如 `winning_age = winning_year - birth_year`)。然后我们生成关于派生属性的跨实体比较问题(如 *“这些球员中,谁在第一次夺冠时最年轻?”*)。

相似文章

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。