多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习

arXiv cs.CL 论文

摘要

本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。

arXiv:2606.12941v1 公告类型:新 摘要:当用户在多个对话轮次中逐步透露任务关键信息时,即使提供完整上下文,大语言模型的准确率也会下降高达65%。我们证明,通过训练模型维持紧凑的滚动记忆而非关注不断增长的历史,可以显著缓解这种“迷失在对话”中的退化。为实现可扩展的训练,我们引入了一种低成本的分片流水线,将单轮问答数据集转化为多轮碎片化信息片段,从而免去数小时的手动标注。仅基于分片后的GSM8K进行训练,我们的记忆增强策略大幅提升了多轮推理准确性,并零样本泛化到更难的数学题和域外长上下文问答。此外,即使测试时提供完整历史,经过记忆训练的模型仍优于全历史基线,这表明学习压缩比单纯暴露于完整上下文能激发更稳健的增量推理能力。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:51

# 多轮推理:当上下文分块到达时——可扩展的分片与记忆增强强化学习
来源:https://arxiv.org/html/2606.12941
Wenqin LiuRui Liu 墨尔本大学 \{shutong2,wenqinl,ruiliu2\}@student\.unimelb\.edu\.auMingming Gong 墨尔本大学 mingming\.gong@unimelb\.edu\.au &Jiaxian Guo 谷歌研究澳大利亚 jeffguo@google\.com

###### 摘要

当用户在多轮对话中逐步透露任务关键信息时,即使完整上下文可用,LLM 的准确率也会下降高达 65%。我们发现,这种“对话迷失”(Lost in Conversation)退化可以通过训练模型维护一个紧凑的滚动记忆(而非关注不断增长的历史记录)来显著缓解。为让此类训练可扩展,我们引入了一种低成本的分片流水线,将单轮问答数据集转换为多轮碎片化信息片段,从而消除数小时的人工标注需求。仅在分片后的 GSM8K 上训练,我们的记忆增强策略便能显著提升多轮准确率,并可零样本泛化到更难的数学题和跨领域的超长上下文问答。此外,即使测试时提供完整历史记录,记忆训练模型的表现也优于全历史基线,这表明学习压缩信息比单纯暴露完整上下文能诱发更稳健的增量推理能力。

## 1 引言

请参阅图注图 1:我们方法概览。我们将单轮问答问题分片为分片多轮片段,并使用 RLVR 通过多轮 DAPO 训练记忆增强策略。仅在分片 GSM8K 上训练的模型能够很好地泛化到领域内和跨领域的长上下文数据集。考虑一个用户与旅行规划助手交互的场景。用户并未一次性提供所有需求,而是通过在多个轮次中逐步透露约束条件,比如目的地、预算和旅行日期。成功完成此类任务要求模型持续积累并协调对话中分布的信息。然而,前沿 LLM 在此类场景中表现严重下滑,在 Laban 等人(2026 (https://arxiv.org/html/2606.12941#bib.bib1))的基准测试中平均任务准确率下降了 39%。这一现象被称为“对话迷失”(LiC)。由于增量式上下文对于人机对话和智能体工作流都至关重要,LiC 成为真实世界 LLM 应用的主要瓶颈。

带可验证奖励的强化学习(RLVR)推动了推理能力的最新进展(DeepSeek-AI, 2025 (https://arxiv.org/html/2606.12941#bib.bib17);Yu 等人,2025b (https://arxiv.org/html/2606.12941#bib.bib12)),但两个障碍阻碍了其直接应用于 LiC。首先,训练数据成本高昂:LiC 基准流水线每个任务需要 1 到 4 小时的人工审查,且每项指令需要 30 次 LLM 模拟,仅能产生 90 到 120 个经过验证的示例(Laban 等人,2026 (https://arxiv.org/html/2606.12941#bib.bib1)),不足以支撑大规模 RLVR。其次,模型默认基于完整聊天历史进行推理,而这种策略会随着长度增加而退化(Liu 等人,2023 (https://arxiv.org/html/2606.12941#bib.bib7)),缺乏稳健的跨轮积累机制。

我们用一个单一方案解决了这两个障碍。模型维护一个有限大小的自然语言记忆缓冲区,并在每个轮次重写该缓冲区,通过 RLVR 在廉价分片的多轮数据上进行训练。仅将缓冲区(而非原始历史记录)传递到下一轮。虽然这种记忆缓冲区已被证明能有效压缩单轮长文档(Yu 等人,2025a (https://arxiv.org/html/2606.12941#bib.bib2)),但相同机制是否能扩展到增量式对话(其中每一步信息都不完整,且必须在奖励信号下整合)仍属未知。我们在此给出肯定答案,并发现有限记忆不仅可作为完整历史的可行替代,还能提供更强的训练信号。

我们的贡献有三方面:(1) 一种廉价、可扩展的分片流水线,仅需 1 到 3 个少样本示例即可将任何单轮问答数据集转换为多轮碎片化片段,并提供噪声增强变体用于消融实验;(2) 一种记忆增强的多轮 RL 方案,在 GSM8K(Cobbe 等人,2021 (https://arxiv.org/html/2606.12941#bib.bib3))上可恢复高达 60 个百分点的 LiC 退化,并在所有评估条件下超越全历史训练;(3) 证据表明该能力具有领域通用性:仅在 GSM8K 上训练的模型可零样本泛化到 MATH500(Hendrycks 等人,2021 (https://arxiv.org/html/2606.12941#bib.bib4);Lightman 等人,2023 (https://arxiv.org/html/2606.12941#bib.bib5))和 LongBench(Bai 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib6))。

## 2 相关工作

#### “对话迷失”问题。

虽然大多数多轮基准将对话视为独立片段(Zheng 等人,2023 (https://arxiv.org/html/2606.12941#bib.bib13);Kwan 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib14)),但 Laban 等人(2026 (https://arxiv.org/html/2606.12941#bib.bib1))表明,在增量式上下文揭示场景下,前沿模型性能平均下降 39%,这一场景在训练中仍基本未被探索。同时期的工作(Li 等人,2026 (https://arxiv.org/html/2606.12941#bib.bib15))通过 RLVR 研究从不完整分片序列中检测可解性,但完整序列上的可扩展数据构建与积累可靠性仍待解决。

#### 记忆增强语言模型。

随着上下文增长,模型性能因“丢失在中间”现象而退化(Liu 等人,2023 (https://arxiv.org/html/2606.12941#bib.bib7)),这促使人们探索避免依赖完整历史的记忆机制。基于检索的方法(Lewis 等人,2021 (https://arxiv.org/html/2606.12941#bib.bib18);Gao 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib19))解决了这一问题,但需要显式的检索基础设施;一个吸引人的替代方案是由模型自身维护的上下文内记忆缓冲区。Yu 等人(2025a (https://arxiv.org/html/2606.12941#bib.bib2))通过训练模型将文档块迭代压缩到有限内存缓冲区中,展示了该方法的可行性,在长上下文问答上超越了全上下文方法。

#### RLVR。

RLVR 已成为激发 LLM 推理能力的强大训练范式(DeepSeek-AI, 2025 (https://arxiv.org/html/2606.12941#bib.bib17);Wen 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib21)),后续工作专注于稳定策略优化(Yu 等人,2025b (https://arxiv.org/html/2606.12941#bib.bib12);Yue 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib20);Liu 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib16))。MemAgent(Yu 等人,2025a (https://arxiv.org/html/2606.12941#bib.bib2))将此扩展到上下文无关的模型调用序列,将单一的结果奖励传播到所有中间记忆更新步骤,但该方法作用于文档块,尚未扩展到真正的多轮对话(其中信息不完整且需增量整合)。

## 3 方法

### 3.1 分片数据集构建

我们通过基于 LLM 的分片方法,从 GSM8K 和 MATH500 构建多轮分片数据集,该方法通过将每个问题分解为语义完整的单元来保留其逻辑结构。每个问题通过三步提示流水线处理:(1) 将问题陈述分割为最小逻辑单元;(2) 验证分割的完整性和非冗余性;(3) 提取核心问题并使其不包含在分片序列中,而是在每个轮次随当前分片一起呈现。该流水线仅需在提示中提供 1–3 个人工标注的少样本示例作为参考,从而显著减少人工工作量。

对于长上下文数据集(缺乏促使 LLM 分割的离散推理结构),LongBench 问答文档被切分为固定大小的令牌段(与句子边界对齐),每个文档平均包含 10 到 14 个分片。

为消融何种训练结构最能诱导记忆提取,我们训练了三种数据集变体:(1) **分片版**(Sharded),遵循上述流水线;(2) **完整问题版**(Full-question),其中随机位置的一个分片包含完整问题,其余分片包含随机采样的 Wikitext 段落(Merity 等人,2016 (https://arxiv.org/html/2606.12941#bib.bib24)),迫使模型区分相关内容和噪声;(3) **混合版**(Mixed),将分片版与 Wikitext 噪声分片交错排列,结合逻辑分解与干扰。此外,我们通过向 MATH500 的每个轮次之间注入 \( n \in \{2,4\} \) 个噪声分片来构建噪声增强集,以评估测试时的鲁棒性。

### 3.2 基于上下文内记忆的强化学习

训练模型跨碎片化轮次积累信息会引入一个信用分配问题:策略必须学会在每个中间轮次写入有用的记忆状态,但唯一的训练信号是最终答案是否正确。我们将多轮 DAPO 框架(Yu 等人,2025a (https://arxiv.org/html/2606.12941#bib.bib2))从单轮原生推理扩展到真正的多轮场景,并将其应用于从单轮问题导出的离散推理分片,而非单个长文档的块。

#### 记忆机制。

在每个分片轮次 \( t \in \{1,\dots,K\} \),策略接收问题 \( q \)、当前记忆状态 \( m_t \) 以及传入的分片 \( s_t \),并生成重写后的记忆 \( m_{t+1} \sim \pi_\theta(\cdot \mid q, m_t, s_t) \)。记忆是一个自由形式的自然语言缓冲区,上限为 \( L_m = 256 \) 个令牌,故意加以限制以防止模型复制所有已看到的证据,并使选择性保留变得非平凡。在最后轮次,策略仅基于 \( q \) 和最终记忆 \( m_K \) 生成答案 \( a \sim \pi_\theta(\cdot \mid q, m_K) \)。记忆表示不接收直接监督;其结构仅由下游奖励信号引导而产生。

#### 训练目标。

对于每个样本,从 \( \pi_{\theta_{\text{old}}} \) 采样 \( G \) 条轨迹,每条轨迹产生一个标量奖励 \( R^{(g)} = \mathcal{V}(a^{(g)}, y^\star) \)(来自基于规则的验证器)。组相对优势计算如下:

\[
\hat{A}^{(g)} = R^{(g)} - \frac{1}{G} \sum_{h=1}^{G} R^{(h)}.
\]

(1)

该优势均匀传播到轨迹 \( g \) 中的所有轮次。由于确定记忆状态在任一给定轮次应包含什么是非确定性的,我们避免中间信用分配。参照 DAPO(Yu 等人,2025b (https://arxiv.org/html/2606.12941#bib.bib12)),使用双剪切替代目标(token-mean 聚合所有轮次)更新 actor,确保较长的记忆更新不会比最终答案轮次不成比例地主导梯度。KL 惩罚作为单独的损失项应用,以约束策略漂移:

\[
\mathcal{L}(\theta) = \mathcal{L}_{\text{clip}}(\theta) + \beta \, D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}}).
\]

(2)

#### 全历史基线。

我们训练一个单独的**全历史模型**,其中策略接收所有先前轮次拼接的聊天历史,而非压缩的记忆状态。推理时,所有模型在**记忆模式**和**全历史模式**下都进行评估,从而隔离性能差异是由记忆压缩还是底层分片结构驱动。

## 4 实验设置

我们训练两个模型规模:Qwen2.5-Math-1.5B-Instruct(Yang 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib25))和 Qwen3-4B-Thinking(Yang 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib26)),每个提示采样 \( G=4 \) 条轨迹,在 2×A100 GPU 上使用 veRL+vLLM(Sheng 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib23);Kwon 等人,2023 (https://arxiv.org/html/2606.12941#bib.bib22))。actor 使用双剪切 PPO 替代目标(Schulman 等人,2017 (https://arxiv.org/html/2606.12941#bib.bib27);Yu 等人,2025b (https://arxiv.org/html/2606.12941#bib.bib12))、DrGRPO 风格的优势归一化(Liu 等人,2025 (https://arxiv.org/html/2606.12941#bib.bib16);Shao 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib28))、KL 惩罚(\( \beta = 0.001 \))以及学习率 \( 1 \times 10^{-6} \)。

我们在两种推理条件下评估:**记忆模式**下,模型在每个轮次仅接收问题、当前记忆状态和传入分片;**全历史模式**下,提供所有先前分片作为上下文。跨域评估涵盖五个 LongBench 子集:2WikiMQA(Ho 等人,2020 (https://arxiv.org/html/2606.12941#bib.bib8))、HotpotQA(Yang 等人,2018 (https://arxiv.org/html/2606.12941#bib.bib9))、MultifieldQA(Bai 等人,2024 (https://arxiv.org/html/2606.12941#bib.bib6))、Qasper(Dasigi 等人,2021 (https://arxiv.org/html/2606.12941#bib.bib10))和 TriviaQA(Joshi 等人,2017 (https://arxiv.org/html/2606.12941#bib.bib11))。训练仅在 GSM8K 上进行,在其他数据集上评估。为简洁起见,变体比较和 LongBench 结果仅使用 4B 模型,因为更大模型能提供更清晰的信号。

## 5 结果

请参阅图注图 2:跨数据集和模型规模的全历史推理准确率(a–b),以及分片注入下的 MATH500 噪声鲁棒性(c–d),同样使用完整对话历史评估。记忆强化学习(Memory RL)始终优于两个基线,恢复了 LiC 退化,并在噪声下保持优势。

| 模型 | 方法 | GSM8K | MATH500 | 有噪声 (\( n=2 \)) | 有噪声 (\( n=4 \)) |
|------|------|-------|---------|-------------------|-------------------|
| Qwen2.5-1.5B | 基础 | 0.199 | 0.334 | 0.290 | 0.284 |
| | 记忆 RL(分片版) | 0.799 | 0.550 | 0.290 | 0.290 |
| Qwen3-4B (\( r=512 \)) | 基础 | 0.265 | 0.050 | 0.064 | 0.050 |
| | 记忆 RL(分片版) | 0.825 | 0.516 | 0.160 | 0.048 |
| Qwen3-4B (\( r=1024 \)) | 基础 | 0.370 | 0.260 | 0.232 | 0.196 |
| | 记忆 RL(分片版) | 0.877 | 0.638 | 0.538 | 0.438 |
| | 记忆 RL(完整问题版) | 0.823 | 0.682 | 0.638 | 0.516 |
| | 记忆 RL(混合版) | 0.849 | 0.692 | 0.630 | 0.570 |

表 1:滚动记忆框架下的准确率。记忆 RL 模型始终优于基础模型,并能泛化到未见过的更难数据集。截断至 \( r=512 \) 导致思维模型泛化能力崩坏。

#### 记忆 RL 与全历史训练对比

图 2 (https://arxiv.org/html/2606.12941#S5.F2) 揭示了单轮与分片多轮基础模型之间存在显著的 LiC 效应(下降 19.4–64.9 个百分点)。全历史 RL 部分恢复了该下降,但记忆 RL 在两个数据集和模型规模上均超出全历史 RL 15.2–35.6 个百分点,且这些优势在完全相同的全历史条件下(无记忆机制)依然存在,表明记忆训练目标灌输的是更稳健的表示,而非仅在推理时利用压缩优势。注入噪声分片进一步暴露了此差距;全历史 RL 急剧退化,而记忆 RL 在 \( n=2 \) 时更具韧性,这与选择性保留隐式鼓励噪声过滤的推测一致。

#### 记忆增强评估

表 1 (https://arxiv.org/html/2606.12941#S5.T1) 显示,这些优势扩展到滚动记忆设置,其中记忆 RL 在两个规模上均产生一致的改进:1.5B 和 4B(\( r=1024 \))模型在 GSM8K 上分别提升 60% 和 51%,且两者都能泛化到未见过的、更难的 MATH500 数据集,这支持了训练能诱发通用增量推理能力而非数据集特定模式匹配的结论。\( r=512 \) 的消融实验揭示了 4B 思维模型需要足够的

相似文章

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。