为什么多步骤工具使用强化学习会崩溃以及监督信号如何修复它
摘要
本文研究了为什么多步骤工具使用强化学习(RL)常常崩溃或收益有限,并将控制令牌中的概率尖峰识别为关键原因。研究表明,将监督微调与RL交替进行可以提高稳定性,并探索了各种监督信号以指导稳健训练。
arXiv:2606.26027v1 Announce Type: new
Abstract: 工具使用使大型语言模型(LLMs)能够执行复杂任务,而最近的智能体强化学习(RL)方法显示出增强模型能力的潜力。然而,仅靠RL在工具使用任务中常常导致不稳定或收益有限。在我们的实验中,一些模型出现灾难性崩溃,性能急剧下降,工具调用结构失效。分析表明,这些失败源于特定控制令牌中意外的概率尖峰,破坏了结构化执行,但底层的工具使用能力仍然完整,只是被特定格式所掩盖。为了解决这个问题,我们系统地研究了一系列多样化的监督信号,包括离策略监督、提示引导、错误示例监督等,并在同步和交替训练方案下应用。我们发现,将监督微调(SFT)与RL交替进行可以显著提高稳定性,但在格式和内容分布外(OOD)评估下性能下降。我们还分析了学习率的影响以及不同设置下的泛化情况。这些结果凸显了理解RL失败的重要性,并展示了多样化的监督信号如何引导探索性学习,从而实现对复杂多步骤工具使用任务的LLMs稳健训练。我们的代码可在 https://github.com/hypasd-art/Tool-RL-Box 获取。
查看缓存全文
缓存时间: 2026/06/25 05:13
# 为什么多步工具使用强化学习会崩溃以及监督信号如何修复它
来源:https://arxiv.org/html/2606.26027 Yupu Hao1,2, Zhuoran Jin1,2, Huanxuan Liao1,2, Kang Liu1,2, Jun Zhao1,2
1 中国科学院自动化研究所复杂系统认知与决策智能重点实验室,北京,中国
2 中国科学院大学人工智能学院,北京,中国
\{haoyupu2023, liaohuanxuan2023\}@ia\.ac\.cn, \{zhuoran\.jin, kliu, jzhao\}@nlpr\.ia\.ac\.cn
###### 摘要
工具使用使大型语言模型(LLMs)能够执行复杂任务,而最近的智能体强化学习(RL)方法在提升模型能力方面显示出潜力。然而,仅靠RL往往会导致工具使用任务的不稳定性或性能提升有限。在我们的实验中,一些模型出现灾难性崩溃,性能突然下降,并且工具调用结构失效。分析表明,这些失败源于特定控制标记的概率意外飙升,破坏了结构化执行流程,但底层工具使用能力仍然完好,只是被特定格式所掩盖。为了解决这个问题,我们系统性地研究了一组多样的监督信号,包括离线策略监督、基于提示的引导、错误示例监督等,并在同步和交错训练方案下应用。我们发现,将监督微调(SFT)与RL交错进行可以显著提高稳定性,但在格式和内容分布外(OOD)评估下性能下降。我们还分析了学习率的影响以及跨设置的泛化情况。这些结果强调了理解RL失败的重要性,并展示了多样化的监督信号如何引导探索性学习,从而实现对复杂多步工具使用任务的LLM鲁棒训练。我们的代码可在 https://github.com/hypasd-art/Tool-RL-Box 获取。
# 为什么多步工具使用强化学习会崩溃以及监督信号如何修复它
Yupu Hao1,2, Zhuoran Jin1,2, Huanxuan Liao1,2, Kang Liu1,2, Jun Zhao1,2††thanks:通讯作者
1 中国科学院自动化研究所复杂系统认知与决策智能重点实验室,北京,中国
2 中国科学院大学人工智能学院,北京,中国
\{haoyupu2023, liaohuanxuan2023\}@ia\.ac\.cn, \{zhuoran\.jin, kliu, jzhao\}@nlpr\.ia\.ac\.cn
## 1 引言
参见图注 图1:在模型Qwen2.5-1.5B-Instruct的RL训练过程中,标记出现频率的变化。“被污染”表示输出中出现无关的特殊标记,“崩溃”表示输出完全无效或错误。
工具使用在大型语言模型(LLMs)中扮演着越来越重要的角色 DBLP:conf/emnlp/LiZ000YLHL23; DBLP:journals/tmlr/MialonDLNPRRSDC23; li2026agentic 。通过利用外部工具,LLMs可以作为能够自主执行复杂交互任务的智能体 DBLP:journals/fcsc/QuDWCWYXW25; DBLP:journals/corr/abs-2406-12045 。然而,基于工具的交互具有多步和结构化的特性,再加上工具反馈的多样性,给提升模型能力带来了巨大挑战。为了缓解这些问题,先前的工作主要集中在通过优化交互框架 DBLP:conf/iclr/QinLYZYLLCTQZHT24、大规模合成高质量轨迹 DBLP:conf/acl/HaoCJL0LZ25; DBLP:conf/iclr/Liu0ZHYL0GLY0WN25; prabhakar2025apigen 以及精细化的监督或无监督训练方法 DBLP:conf/iclr/Liu0ZHYL0GLY0WN25; DBLP:journals/corr/abs-2510-10197 来提升工具使用性能。特别是最近在智能体RL方面的进展 DBLP:journals/corr/abs-2510-10197; wang2025ragen; mai2025agent 激发了人们对RL作为更原则性的交互框架的兴趣,因为智能体RL在各种复杂任务中已经展示出强大的性能 zhang2025landscape; wu2025agentic 。然而,在实践中,基于RL的优化在工具使用场景中常常遭受训练不稳定性和有限的性能提升。如图1(https://arxiv.org/html/2606.26027#S1.F1)所示,错误响应的频率在某些阶段可能急剧上升。在我们的实验中,我们观察到一种令人惊讶的失效模式:模型性能可能突然崩溃到接近零,同时伴随有效工具调用结构的崩溃。通过详细分析,我们发现这些失败并非源于推理能力的丧失,而是由特定控制标记的概率意外放大所驱动,这逐渐将结构化生成扭曲为退化的执行模式。这些观察表明,仅靠RL不足以实现稳定的长距离结构化生成。我们发现,在高质量工具使用轨迹上进行监督微调可以提供良好的初始化,改善早期性能并防止崩溃。尽管如此,先前的工作表明,与RL相比,使用SFT训练的模型在泛化和性能方面可能有限 chu2025sft 。因此,我们的目标是研究不同监督信号如何与RL优化相互作用,以及监督是否能够从根本上稳定多轮智能体训练,试图结合它们以弥补各自的缺点。然而,一个关键的开放问题仍然存在:监督信号应该如何整合到RL训练中,以及哪种形式的监督对提高稳定性最有效?为了解决这个问题,我们系统性地研究了一系列广泛的监督信号,包括SFT后接RL、离线策略监督和错误轨迹监督,并在同步和交错训练范式下进行。此外,我们通过将正确提示前置在模型生成响应之前来引导生成,并在优化过程中移除这些提示,从而提出了基于提示的引导。我们还提出了过程反思监督,其中从训练过程的中间推理步骤中提取反思,以总结每一步的优缺点,并结合原始错误轨迹构建SFT数据,从而进一步提高稳定性和最终性能。我们的结果表明,简单地将监督与RL混合是不够的:同步方法通常遭受分布不匹配的问题,而将监督微调(SFT)与RL交错进行可以显著提高稳定性,但在格式和内容级分布外(OOD)评估下性能可能下降。我们进一步分析了影响稳定性和泛化的关键因素,包括学习率敏感性和跨设置迁移行为。在这些研究中,我们发现监督信号在控制RL期间的结构行为方面发挥了核心作用,而这超出了标量奖励单独能实现的效果。总的来说,我们的工作强调了智能体RL的失败主要是一个结构崩溃问题,而不是能力限制,并表明精心设计的监督信号可以有效调节标记级别的执行模式,从而实现更稳定和鲁棒的LLM工具使用学习。我们的工作有三项主要贡献:
- •我们识别出结构崩溃是多轮智能体RL中的一种基本失效模式。我们表明,在工具使用任务上的RL主要不是降低推理能力,而是诱导一种结构崩溃,其中生成退化为畸形的控制标记序列,破坏了工具调用结构,同时保留了底层的任务能力。
- •我们揭示了RL不稳定性的标记级机制。我们发现RL不成比例地放大了特殊控制标记,导致策略质量重新分布。这表明不稳定性源于控制标记动态而非能力退化,为崩溃提供了一种机制性解释。
- •我们对用于稳定多轮智能体RL的监督信号进行了系统性研究。我们在两个模型族上系统性地探索了六种监督配置,并将它们分类为同步和交错范式。我们进一步引入了过程反思监督,将中间轨迹信息转换为文本监督信号。经验上,交错训练一致地提高了稳定性和泛化能力,而同步方法则容易受到分布不匹配的影响。
参见图注 参见图注 图2:在BFCL-V3数据集上训练过程中的训练动态。左图:Qwen2.5-1.5B-Instruct。右图:Qwen3-1.7B。
## 2 相关工作
### 2.1 工具学习
最近的进展扩展了LLMs的工具使用能力 DBLP:conf/aaai/HaoCJL0LZ25; DBLP:journals/corr/abs-2504-03601; DBLP:conf/iclr/QinLYZYLLCTQZHT24,使其能够与外部API和环境进行交互,超越文本生成 DBLP:journals/corr/abs-2510-10197 。通过工具调用,模型可以执行任务 DBLP:conf/emnlp/LiZ000YLHL23; DBLP:conf/acl/TrivediKHMDLGSB24、信息检索 DBLP:journals/corr/abs-2503-09516 和规划 xie2024travelplanner ,提高其高效解决复杂任务的能力。先前的工作已通过推理框架 DBLP:conf/iclr/QinLYZYLLCTQZHT24; DBLP:conf/iclr/YaoZYDSN023、监督微调 DBLP:journals/corr/abs-2510-10197; DBLP:journals/corr/abs-2505-00024; DBLP:journals/corr/abs-2503-23383 和强化学习 DBLP:journals/corr/abs-2501-03262; DBLP:journals/corr/abs-2402-03300 增强了工具使用能力。尽管RL提高了工具调用性能 DBLP:journals/corr/abs-2504-13958; DBLP:journals/corr/abs-2509-01055; DBLP:journals/corr/abs-2509-02479,其有效性强烈依赖于基模型的先验工具知识。较小或弱初始化的模型通常无法从RL中受益,而高质量SFT数据本身已能提供强大的性能。这促使我们将监督信号纳入RL,以稳定多轮交互并改进工具使用学习。
### 2.2 强化学习中的专家轨迹
RL通过轨迹探索和基于奖励的更新来改进模型 DBLP:journals/corr/abs-2402-03300; DBLP:journals/corr/abs-2507-04136,但在采样质量较差时可能停滞不前。最近的工作通过将专家或真实轨迹纳入RL来缓解这一问题 fu2025srft; DBLP:journals/corr/abs-2505-16984 。例如,LUFFY DBLP:journals/corr/abs-2504-14945 将部分采样轨迹替换为专家轨迹并重新加权低概率标记,而ReLIFT ma2025learning 则交替执行RL和有针对性的SFT。其他方法使用部分正确答案 zhang2025adhint; zhang2025stephint; DBLP:journals/corr/abs-2503-23905; DBLP:journals/corr/abs-2510-02245 或检索到的经验 DBLP:journals/corr/abs-2507-23361; DBLP:journals/corr/abs-2508-06433 。然而,这些方法主要研究于单轮推理任务(如数学),其在多轮工具使用设置中的有效性尚待探索。
## 3 预备知识
我们将LLMs的多轮工具使用轨迹 \(\tau\) 表示为一系列动作和反馈:\(\tau = (a_1, r_1, a_2, r_2, \dots, a_T, r_T)\)。每个动作 \(a_t \in \mathcal{A}\) 从动作空间 \(\mathcal{A}\) 中抽取,该空间包括可行的工具调用和自然语言响应。在每一步,基于当前动作和前序轨迹给出反馈 \(r_t \in \mathcal{R}\):
\[
r_t = R(a_t \mid a_1, r_1, \dots, a_{t-1}, r_{t-1}) \in \mathcal{R}
\]
其中 \(\mathcal{R}\) 表示反馈空间,包括环境响应(例如,工具执行输出)和用户响应。基于累积的交互历史,模型采样下一个动作:
\[
a_t \sim P(a_t \mid a_1, r_1, \dots, a_{t-1}, r_{t-1})
\]
## 4 方法
在本节中,我们首先分析纯强化学习设置下观察到的训练不稳定性和有限性能增益。通过检查训练期间模型生成的轨迹,我们确定了这些失败的根本原因。相比之下,在RL之前引入监督微调显著提高了稳定性和性能,这凸显了监督信号的重要性。基于这一观察,我们进一步对智能体RL中的不同监督信号和整合策略进行了系统性研究,分析了它们对稳定性、结构行为和泛化的影响。
### 4.1 实验设置
数据集。我们在BFCL-V3 DBLP:conf/icml/PatilMYJSSG25上进行了实验,这是一个多轮工具使用基准测试,模型必须在交互环境中调用多个工具来回答用户查询和后续问题。我们专注于四个具有挑战性的设置:Base、Miss Func、Miss Param和Long Context。对于训练,我们从前三个设置中各随机抽取100个实例,总共300个问题(遵循先前工作 DBLP:journals/corr/abs-2510-10197,该工作证明了少量数据即可提升性能),同时保留其余数据进行评估。由于上下文长度过长,Long Context被排除在训练之外。我们还使用转换后的ToolACE DBLP:conf/iclr/Liu0ZHYL0GLY0WN25数据来增强监督微调,以研究训练分布的影响。更多细节请参阅附录B(https://arxiv.org/html/2606.26027#A2)。
模型。对于分析实验,我们使用Qwen2.5-1.5B-Instruct team2024qwen2 和 Qwen3-1.7B DBLP:journals/corr/abs-2505-09388 作为基模型。在SFT阶段,我们将每个多轮交互分解为多个单轮实例,并训练模型处理这些孤立的步骤。相反,在RL期间,我们采用完整的多轮工具使用设置,模型必须完成整个交互轨迹(包括所有工具调用)才能获得正面反馈。对于Qwen3-1.7B,我们使用非思考变体。进一步的实现细节和奖励设计见附录B(https://arxiv.org/html/2606.26027#A2)。
参见图注 图3:不同方法的训练框架,其中基于提示的引导和过程反思监督由我们提出。
### 4.2 RL中的灾难性崩溃问题
如图2(https://arxiv.org/html/2606.26027#S1.F2)所示,直接在Qwen2.5-1.5B-Instruct上应用RL常常导致灾难性崩溃,表现为奖励突然下降和持续的KL发散峰值。Qwen3-1.7B表现出较轻的不稳定性,但纯RL的收益仍然有限,并可能随时间退化。在RL之前在额外的工具使用数据集上应用SFT可以稳定训练:对于Qwen2.5-1.5B-Instruct,奖励和KL曲线平稳演化;对于Qwen3-1.7B,RL在SFT后仍然可能偶尔崩溃,但在不稳定之前能够实现显著更高的性能。
### 4.3 崩溃原因分析
通过联合分析整个RL训练过程中模型生成的轨迹,我们识别出一致的结构崩溃模式。重要的是,我们发现观察到的崩溃主要并不反映模型底层能力的退化。相反,崩溃逐渐将生成转向畸形的控制标记模式,这些模式破坏了工具调用的结构完整性。具体来说,用于工具调用格式的特殊控制标记,如和<|im_end|>,在训练过程中变得越来越混乱。随着RL优化的进行,这些标记被过度放大,并生成畸形的输出。相似文章
多步工具使用强化学习为何会崩溃以及监督信号如何修复它
本文研究了为什么多步工具使用强化学习会导致大型语言模型出现灾难性崩溃,以及如何通过交错监督微调与多样监督信号来稳定训练。
关于智能工具调用与强化学习训练的效果与效率
本文系统分析了工具调用评估对随机种子、多轮模板等微小实现选择的敏感性,揭示这些因素可能导致性能大幅变化。同时,识别了基于强化学习的工具调用训练中的计算浪费来源,并介绍了在不牺牲性能的情况下加速训练的技术。
当RL在SFT后失效:恢复模型可塑性以实现稳健的SFT到RL交接
本文研究了在大型语言模型的先SFT后RL流程中,过度监督微调(SFT)后模型可塑性的丧失问题,并提出了一种名为Rejuvenation的方法,该方法通过基于基线的模型融合和定向神经元重置来恢复可塑性,从而持续提升RL性能。
关注工具故障:实现医疗代理的协同工具增益
本文针对医疗AI代理中的工具故障问题,提出了一种基于GRPO的强化学习框架,利用实例级选择、分歧感知协同学习和熵引导采样来纠正错误的工具共识,并在七个医疗基准测试中提高了可靠性。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。