Dynamic Rollout Editing:减少RL训练推理模型中的过度思考

arXiv cs.CL 论文

摘要

本文介绍了一种训练时干预方法——动态展开编辑(Dynamic Rollout Editing, DRE),用于减少GRPO式强化学习推理模型中的过度思考。DRE通过保留可到达解的路径前缀并偏好经过验证的较短版本,来编辑成功轨迹,从而削弱对不必要思考的偏好。

arXiv:2606.17890v1 公告类型:新 摘要:长链思维推理可以提高LLM在复杂任务上的表现,但模型通常在正确答案已经出现后,仍继续生成不必要的推理。我们将这种行为称为过度思考。我们从GRPO风格强化学习(RL)后训练的角度研究这一现象,将其视为一个训练时信用分配问题,而不仅仅是解码时停止问题。在GRPO训练开始的采样过程中,我们观察到成功轨迹相比同一提示下的失败轨迹,会表现出稍高程度的过度思考。这种早期不平衡为不良反馈循环提供了起点:由于GRPO分配序列级信用,它无法区分达成解的路径前缀与延长成功轨迹的不必要延续。两者都收到正向更新信号,使得初始不平衡在训练过程中发展为更严重的过度思考。为了解决这个问题,我们提出了动态展开编辑(Dynamic Rollout Editing, DRE),这是一种针对在答案出现后继续思考的成功轨迹的训练时干预方法。DRE保留经过验证的路径前缀,编辑剩余的思考,并在同一RL组内偏好编辑后的轨迹,从而削弱对不必要思考的偏好信号,同时不惩罚到达答案所需的推理。跨不同任务的实验证明了DRE的有效性。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:42

# 动态轨迹编辑:减少基于强化学习的推理模型中的过度思考  
来源:https://arxiv.org/html/2606.17890  

Zihao Wei¹,², Wenjie Shi, Liang Pang¹††通讯作者, Jingcheng Deng¹,², Shicheng Xu¹,², Shasha Guo¹, Zenghao Duan¹,², Jiahao Liu, Jingang Wang, Huawei Shen¹, Xueqi Cheng¹  
¹中国科学院计算技术研究所,北京,中国  
²中国科学院大学,北京,中国  
\{weizihao22z, pangliang\}@ict.ac.cn  
[email protected]  

###### 摘要  

长链思维推理可以提升大语言模型在复杂任务上的性能,但模型在正确答案出现后往往仍会继续生成不必要的推理。我们将这种行为称为**过度思考**。我们从GRPO风格的强化学习(RL)后训练角度研究这一现象,将其视为训练时的信用分配问题,而不仅仅是解码时的停止问题。在GRPO训练初期采样的轨迹中,我们观察到,对于相同的提示,成功轨迹相比不成功轨迹可能表现出略高的过度思考程度。这种早期的不平衡为一种不良反馈循环提供了起点:由于GRPO分配的是序列级别的信用,它无法区分达成解决方案的前缀与延长成功轨迹的不必要延续部分。两者都收到正的更新信号,使得初始的不平衡在训练过程中演变为更严重的过度思考。为解决这个问题,我们引入了**动态轨迹编辑**(Dynamic Rollout Editing, DRE),这是一种针对成功轨迹在答案出现后仍继续思考的介入方法。DRE保留已验证的前缀,编辑后续思考,并在同一GRPO组内偏好编辑后的轨迹,从而在不惩罚用于得出答案的推理的前提下,削弱对不必要思考的偏好信号。在多种任务上的实验证明了DRE的有效性。

# 动态轨迹编辑:减少基于强化学习的推理模型中的过度思考  

Zihao Wei¹,², Wenjie Shi, Liang Pang¹††通讯作者, Jingcheng Deng¹,², Shicheng Xu¹,², Shasha Guo¹, Zenghao Duan¹,², Jiahao Liu, Jingang Wang, Huawei Shen¹, Xueqi Cheng¹  
¹中国科学院计算技术研究所,北京,中国  
²中国科学院大学,北京,中国  
\{weizihao22z, pangliang\}@ict.ac.cn  
[email protected]  

## 1 引言  

参见图1标题  
图1:训练过程中过度思考的示意图。(a) 原始GRPO倾向于给予具有较多过度思考的成功轨迹正向信用。(b) 动态轨迹编辑偏好经过验证的较短编辑版本,从而削弱成功与过度思考之间的关联。

大语言模型通过在生成最终回复前产生长链思维过程,显著提升了推理性能Guo et al. (2025); Yang et al. (2025); Meituan LongCat Team (2025)。这一范式是强化学习后训练的核心,模型在此过程中探索推理轨迹并从结果反馈中学习。然而,更长的思考并不总是更好:生成长度与答案质量并非单调相关Ghosa et al. (2025); Han et al. (2026)。一旦正确答案出现,继续思考可能会增加推理成本,甚至可能使模型偏离正确解,这种现象通常被称为*过度思考*Sui et al. (2025); Wang et al. (2025)。现有关于过度思考的工作主要将其视为控制推理长度的问题:决定模型何时应停止,或如何在不损害准确性的情况下缩短其思考过程。对推理动态的研究界定了一些边界,如推理完成点,在此之后有用的推理让位于不必要的思考Wu et al. (2026); Sui et al. (2025); Wei et al. (2025)。基于此观点,早期退出解码、基于强化学习的停止控制器以及长度导向的正则化旨在减少过度生成Yang et al. (2026); Dai et al. (2026); Kimi Team (2025)。这些方法虽然有用,但主要在策略已学习其推理行为之后进行干预。它们未阐明强化学习如何在正确答案已验证后强化过度思考。我们在广泛用于推理模型后训练的组相对策略优化(GRPO)Shao et al. (2024)中研究这一问题。GRPO分配序列级别奖励,并使用组内相对优势更新策略。这种设计提高了任务成功率,但也可能产生信用分配问题:一条成功轨迹可能既包含指向正确答案的思考,也包含答案出现后的不必要思考。由于相同的正优势被应用于整个轨迹,GRPO无法区分导致已验证答案的推理前缀与仅延长轨迹的后续过度思考。

为了研究这个信用分配问题,我们通过解析器-验证器分析使答案出现可观测。对于每条轨迹,我们确定可以提取并外部验证正确答案的第一个点,从而可以比较答案出现前后的行为。在GRPO训练早期采样的轨迹中,成功轨迹在答案出现后已经显示出比同一提示下不成功轨迹略多的过度思考倾向。这种初始不对称可能被序列级别更新放大:当不必要思考是成功轨迹的一部分时,GRPO可能将其与导致答案的思考一起强化。随着训练提高任务成功率,这种耦合的信用使得答案出现后的过度思考更加持久,包括冗余检查、答案重访和重复验证。这一观察引发了一种不同的干预方式。我们的目标不是仅仅让训练好的模型更早停止,而是改变训练信号,使得任务成功与答案出现后的过度思考的耦合度降低。简单的长度惩罚可能抑制有用的思考,而惩罚整个成功轨迹可能削弱解决问题所需的前缀。一种有效的干预应保留已验证的推理前缀,同时减少分配给后续过度思考的偏好信号。

在这项工作中,我们引入了**动态轨迹编辑**(DRE),这是一种针对答案出现后包含过度思考的成功轨迹的训练时介入方法。图1对比了原始GRPO与DRE:原始GRPO会强化包含答案出现后过度思考的成功轨迹,而DRE则将偏好转向经过验证的较短版本。对于一条在答案出现后仍有过度思考的成功轨迹,DRE构建一个编辑后的对应版本,该版本保留到达一个保守边界的已验证前缀,并替换后续的过度思考。然后,在同一GRPO组内偏好编辑后的轨迹,使模型在保留获得正确答案的正向训练信号的同时,削弱成功与过度思考之间的关联。我们进一步引入了两种互补的训练策略:前缀掩码避免直接惩罚共享的已验证前缀,而GClip为编辑点附近的编辑令牌提供学习信号。

**贡献:**(1) 我们将答案出现后的过度思考识别为GRPO风格后训练中的一个训练时信用分配问题。我们的分析表明,序列级别优势可能会混淆导致答案的推理与答案出现后的不必要思考的信用。(2) 我们提出DRE,一种训练时干预,旨在削弱任务成功与答案出现后不必要思考之间的关联。DRE在同一GRPO组内为较短的编辑后对应版本赋予更高的偏好,同时保留达成答案的已验证推理前缀。(3) 我们在数学推理、科学问答和代码生成任务上证明了DRE的广泛有效性。DRE在保持任务性能的同时减少了思考长度,主要减少了答案出现后的思考。

## 2 答案出现后的过度思考  

参见图2标题  
图2:来自Qwen3-4B-Base的R1-Zero风格GRPO训练的行为证据。(a) AIME24准确率在训练过程中提升。(b) 验证和检查关键词在答案出现前后均增加。(c) 对于相同提示,成功轨迹比不成功轨迹表现出更多的答案重访。  

为了研究这一现象,本节首先形式化生成过程,并将**答案出现**定义为能从轨迹中提取已验证答案的最早点。这个点为分析提供了一个具体边界:该点之前的令牌可能为得出答案所需,而该点之后的令牌则允许我们衡量答案出现后的过度思考。接着,我们展示初步观察结果,表明对于相同提示,成功轨迹在答案出现后通常比不成功轨迹包含更多过度思考。最后,我们分析GRPO如何强化这种行为:由于奖励在序列级别分配,当推理出答案的思考与后续过度思考同时出现在一条成功轨迹中时,更新过程并未明确区分它们。

### 2.1 问题形式化  

我们从思考轨迹的角度形式化答案出现后的过度思考。给定提示\(x\),模型生成思考过程\(t\)后接内容过程\(y\)。我们将此生成过程建模为\(\pi_\theta(t,y|x)=\pi_\theta(t|x)\pi_\theta(y|x,t)\)。得到的轨迹记为\(\tau=(x, t, y)\)。对于每条轨迹,我们将思考过程拆分为句子,从左到右扫描句子前缀。在每个前缀处,解析器提取候选答案,验证器检查该候选对于给定提示是否正确。我们将\(k^\star(\tau)\)定义为第一个其前缀通过此验证检查的句子索引。如果没有前缀包含已验证答案,则设\(k^\star(\tau)=K_t(\tau)\),其中\(K_t(\tau)\)是\(\tau\)中思考句子的数量。因此,\(k^\star(\tau)\)标记了在思考过程中正确答案变为可验证的最早句子级点。我们使用该点作为分析边界来衡量答案出现后的过度思考,但并不假设该点之后的每个令牌都是冗余的。

### 2.2 初步观察  

#### 设置。
我们按照DeepSeek-R1-Zero Guo et al. (2025)的设置,使用GRPO训练Qwen3-4B-Base,仅使用基于规则的答案正确性和格式奖励。此设置使我们能够考察RL训练过程中答案出现后的过度思考是否增加。对于每条出现已验证答案的轨迹,\(k^\star(\tau)\)表示前缀包含该答案的第一个句子索引。我们统计\(k^\star(\tau)\)之前和之后句子中与验证和检查相关的关键词。\(k^\star(\tau)\)之前句子中的关键词可能反映了达成答案前有用的检查,而\(k^\star(\tau)\)之后句子中的关键词则作为可能过度思考的指标,因为模型在答案出现后仍在继续检查或验证。然后,我们考察这两个数量在训练过程中是否增加。为了比较同一提示下的成功和不成功轨迹,我们使用**答案重访**作为轨迹级别的度量,因为不成功轨迹可能不包含有效的\(k^\star(\tau)\)。对于每条可提取最终答案的轨迹,我们统计该答案在其首次出现后被重复的次数,并将其与同一提示下采样的其他轨迹进行比较。

**观察:RL训练提高了准确率,同时放大了答案重复和冗余验证等过度思考行为。** 图2(a)展示了训练过程中的准确率提升。图2(b)显示,验证和检查关键词在\(k^\star(\tau)\)前后均有所增加。\(k^\star(\tau)\)之前的增加与答案出现前的有用检查一致。\(k^\star(\tau)\)之后的增加则表明在答案已经出现后存在更多不必要的过度思考。图2(c)在GRPO采样组内展示了类似模式:对于相同提示,成功轨迹比不成功轨迹更频繁地重复其提取的答案。附录7中的定性示例说明了这一模式。在较早的训练步骤中,模型仍需额外思考才能得出正确答案;在较晚的步骤中,它到达了已验证的答案,但继续进行了额外的验证步骤。这些观察促使我们进行以下分析:序列级别的信用可能将导致答案出现的思考与后续的过度思考混为一谈,从而在后者与正优势关联时强化了它。

### 2.3 GRPO下过度思考的分析  

在GRPO下,每个提示对应多个采样轨迹。完整输出获得奖励,该奖励在采样组内进行归一化以形成组相对优势\(A(\tau)\)。以下论证并非训练中实际使用的带裁剪的GRPO估计器。相反,它是一个用于分析目的的未裁剪一阶近似,在\(\theta_{\mathrm{old}}\)或其附近进行评估,抑制了策略比率、裁剪和内容过程项,以便隔离标量组优势被广播的位置。为便于阅读,我们在句子级别描述广播效应,而训练目标则在令牌级别应用。

让\(\psi_s(\tau) = \nabla_\theta \log \pi_\theta(t_s | x, t_{<s})\)。然后将梯度写为:
\[
\nabla_\theta L_{\text{GRPO}}(\theta) \approx \frac{1}{N} \sum_{\tau} A(\tau) \sum_{s} \psi_s(\tau)
\]
其中\(N\)是组大小。对于成功轨迹\(\tau^*\),\(A(\tau^*) > 0\)(平均而言)。因此,每个句子令牌的更新方向是增加其对数概率。由于\(A(\tau^*)\)被应用于整个序列,无论对于指向答案的推理前缀还是答案出现后的令牌,该优势都是相同的。这种统一的信用分配可能会导致:当模型学到更可靠的推理时,答案出现后过长思考的倾向也可能得到加强。我们试图通过动态轨迹编辑来中断这种关联。

## 3 动态轨迹编辑  

图3:DRE概述。(a) 边界识别:确定编辑边界\( \hat{k} \),该边界是对\( k^\star \)的后向安全扩展。(b) 轨迹合成:保留到\(\hat{k}\)的长度,并在其后附加答案闭合和内容过程。(c) 编辑轨迹在组内被偏好。

DRE在训练时对一组采样的轨迹进行操作,其方式是编辑在答案出现后仍继续思考的成功轨迹。它由两个步骤组成:首先识别一个保守的编辑边界,该边界保留了已验证的推理前缀;然后基于此边界合成一个更短的编辑轨迹。

### 3.1 边界识别与轨迹合成  

**边界识别。** 设\(k^\star\)为答案出现点。边界\(\hat{k}\)被识别为\(k^\star\)之前的最后一个句末边界,该边界满足一个保守的安全条件:前缀\(t_{1:\hat{k}}\)必须能够通过解析器-验证器恢复出正确的答案。为了避免移除已接近答案的有效推理,我们采用后向搜索:从\(k^\star-1\)开始,向后扫描直到找到一个索引\(\hat{k}\),其对应的前缀能够导出答案,且对于所有\(i > \hat{k}\)直到\(k^\star\)的前缀\(t_{1:i}\)也能导出答案。这个后向安全停止点被接受为可编辑的边界\(\hat{k}\)。

**基于边界的轨迹合成。** 给定\(\hat{k}\),编辑保留到\(\hat{k}\)的思考,移除\(\hat{k}\)之后的原始过度思考,附加已验证的答案闭合,并重新生成内容过程。仅当重新生成的内容暴露相同的已验证答案时,我们才保留编辑后的轨迹。否则,该方法退回到未编辑的副本。因此,接受的编辑在保留已验证前缀的同时,移除了\(\hat{k}\)之后的过度思考。图3总结了边界识别、轨迹合成以及使用编辑轨迹进行训练的过程。附录8展示了一个具体的前缀保留形式的编辑示例。

### 3.2 编辑轨迹评分  

评分

相似文章

平衡思考的高效推理

Papers with Code Trending

本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。

DyCon: 通过演化难度建模的动态推理控制

arXiv cs.AI

本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。

面向强化学习后训练的跨轮次自适应展开优化

arXiv cs.LG

本文提出了CERO,一种用于LLM强化学习后训练的跨轮次自适应展开优化方法。该方法利用贝叶斯后验方差,在提示和轮次之间分配固定的展开预算,以最大化样本效率,实现了理论遗憾界,并在数学推理任务上优于GRPO。