RODS:面向多轮工具使用智能体的奖励驱动在线数据合成方法
摘要
本文介绍了RODS,一种奖励驱动的在线数据合成方法,该方法解决了多轮工具使用智能体训练中静态数据集信息样本耗尽的问题。它在显著减少轨迹数量的情况下,达到了与更大规模离线流水线相当的性能。
查看缓存全文
缓存时间: 2026/06/18 05:41
# 奖励驱动的在线数据合成:面向多轮工具使用代理
来源:https://arxiv.org/html/2606.19047
††本文由蚂蚁集团研究实习生计划资助。
††通讯作者。
Ruishan Fang1,2,4,∗ Siyuan Lu1,2,3,4 Chenyi Zhuang1,† Tao Lin4,1,†
1蚂蚁集团 Inclusion AI
2浙江大学
3上海创新研究院
4西湖大学
###### 摘要
多轮工具使用强化学习(RL)受到静态数据集中信息样本快速枯竭的瓶颈。我们观察到,GRPO中的梯度信号集中在具有最高 rollout 奖励方差的任务上,这是 Popoviciu 上界的结果。因此,处于代理能力边界附近(即成功与失败大致平衡)的样本贡献了不成比例的大策略梯度。随着训练的进行,这个边界不断移动,逐渐耗尽静态数据集中信息样本的池子。我们提出RODS(奖励驱动的在线数据合成)来解决这一枯竭问题。RODS通过重用进度奖励方差作为一个实用且零成本的边界检测器(除了训练中已计算的 rollout 外无需额外推理),将RL训练与数据生成之间的循环闭合。它能持续识别这类边界样本,通过技能对齐的重采样流水线合成与其结构复杂度(如API拓扑和依赖深度)匹配的新多轮变体,并管理与策略共同演化的动态回放缓冲区。从400个人类种子样本开始,维持约800个样本的活跃训练池,RODS能达到与17K样本离线流水线相当的性能(所需轨迹数量约20倍更少),并在我们的受控设置中优于固定数据RL和环境增强方法。
参考图1:静态数据训练的当前局限 vs. RODS动态合成范式。
(a) 数据稀缺性 (C1):高质量多轮工具使用数据集需要大量人工标注。
(b) 能力 vs. 静态数据 (C2):随着模型学习,静态数据变得已掌握,导致梯度信号丧失。
(c) 语义脱节 (C3):简单拼接单轮查询会创建脱节的交互。
(d) RODS解决方案:闭环数据引擎持续摄入静态数据以检测不断演变的能力边界,合成连贯、有针对性的主动语料,正如模型所需。
## 1 引言
基于大语言模型(LLM)的代理(wang2024survey, weng2023agent)通过使用外部工具和环境交互(anthropic2026claude, openai2026gpt54thinking),在解决复杂任务方面展现出巨大潜力。近期工作将工具使用代理训练视为一个RL问题(Agentic RL),通过直接环境交互优化策略(jin2025search, feng2025retool, wang2025ragen, liu2025exploratory)。然而,将Agentic RL扩展到多轮工具使用环境带来了现有方法尚未完全解决的独特挑战,因为它同时要求大规模训练语料库和长程结构连贯性(patil2025bfcl, tbench, tau2bench)。当前的RL系统在这一范式下面临三个主要挑战(见图1(https://arxiv.org/html/2606.19047#S0.F1))。首先,高质量的多轮数据集稀缺(C1),因为标注和验证成本高昂——例如BFCL V3(patil2025bfcl)仅包含800个样本。其次,随着代理能力提升,静态数据集面临边界移动问题(C2),导致信号枯竭以及对已掌握或不可达任务的计算浪费(li2025adacurl, dai2025harder)。第三,即时合成常常因缺乏统一目标而导致语义脱节(C3),产生无回指或连贯性的轨迹,无法教授可靠的推理。尽管存在这些障碍,现有工作大致分为两类:大规模离线合成和在线环境增强。离线流水线(prabhakar2025apigen, toucan, xu2025funreasonmt)通过一次性生成大规模语料库来解决数据稀缺(C1),但它们与训练循环解耦,因此无法追踪模型不断演变的能力边界(C2)。相反,像EnvTuning(tuneenv)这样的RL训练方法能够从极少数据中学习,但最终受限于其固定种子语料库的信号枯竭(C2)。虽然在线自我对弈和自我进化方法(toolr0, li2025closeloop, zhai2025agentevolver)理论上闭合了循环,但无约束的零数据生成在复杂多轮设置中经常无法保持语义连贯性(C3),导致无教学价值的脱节轨迹。
*我们如何在极端数据稀缺下训练多轮工具使用代理?通过动态合成严格追踪演变中能力边界、同时保持多轮语义连贯性的数据。*
我们提出RODS(奖励驱动的在线数据合成)来弥合这一差距,这是一个将数据生成与RL训练循环紧密耦合的框架。我们的方法基于一个简单洞察:在策略梯度方法(如GRPO)中,进度奖励作为边界检测器,重用现有的rollout统计数据——因为rollout已用于优势估计,而rollout方差在代理能力边界附近最高(μ≈0.5,由Popoviciu上界提示)。通过在此高方差区域合成数据,并通过共同演化的回放缓冲区管理其生命周期,RODS维持了连续的梯度信息样本流。
本文做出三项主要贡献。针对静态数据集固有的信号饥饿问题(C2),我们提出RODS,一种奖励驱动的边界扩展方法,重用RL进度奖励实时识别并扩展边界任务。为保持多轮语义连贯性(C3),我们引入技能对齐的重采样合成流水线,将新轨迹锚定到经过验证的种子的复杂度配置上。它不是简单的实体替换,而是在生成新叙事和环境状态的同时保留种子的功能依赖结构。最后,我们展示了显著的数据效率(C1):从400个人类种子开始,维持约800个样本的活跃训练池,RODS达到了与17K样本离线流水线相当的性能(使用约20倍更少的数据),并在我们的受控设置中优于固定数据RL。
## 2 相关工作
#### 工具使用的数据合成。
尽管高质量人工标注基准(apibank, tbench, tau2bench, acebench, travelplanner, funcbenchgen)为多轮工具使用提供了严格的评估协议,但它们通常只有数百个实例,不足以训练可靠的代理策略。这种数据稀缺促使转向大规模离线合成。像APIGen-MT(prabhakar2025apigen)、TOUCAN(toucan)和Magnet(magnet)这样的框架优先考虑语料库规模和结构复杂度,通常一次性生成数百万条轨迹。虽然对于预训练有效,这些静态流水线与训练过程解耦,产生无法追踪模型演变能力边界的均匀数据分布(C2)。有向合成方法试图通过针对特定失败模式来缩小范围。FunReason-MT(xu2025funreasonmt)利用环境-API图和高级工具-查询合成来处理困难查询生成,而LoopTool(looptool)采用反馈循环纠正算法错误。尽管这些方法在针对已知弱点方面有明显进步,但它们仍然是离线快照,无法在活跃RL训练期间适应变化的能力边界。RODS通过引入一个在训练期间运行的奖励驱动合成循环来解决这一限制,确保生成的数据始终位于模型当前的能力边界附近。
#### 在线RL和课程学习。
代理RL中的数据效率传统上通过环境模拟或纠正性反馈解决。基于模拟的方法如ScaleEnv(scaleenv)、Agent World Model(agentworldmodel)和Simia-Agent(simulatingenv)构建高保真交互循环以最大化从现有任务中提取的信号。EnvTuning(tuneenv)通过编排一个四阶段课程并结合可操作的环境增强,进一步提高效率。然而,这些方法受限于其种子语料库的固定多样性;随着代理进步,静态池中梯度信息样本的比例逐渐缩小。自我对弈范式(toolr0, selfplayevolve)试图通过绝对零数据生成(生成器从零开始提出任务)来解决此问题。虽然理论上吸引人,但这种无约束生成通常难以处理多轮工具使用所需的长程逻辑链和相互依赖的API调用(C3)。RODS采取高度互补的方法,使用极小量的人类数据作为结构锚点。通过重用GRPO的固有rollout方差作为边界检测器,并将合成锚定在技能对齐的重采样上,RODS实现了针对性、复杂度对齐的课程,避免了从头生成多轮逻辑的高方差搜索。我们的方法与优先数据选择方法(如优先经验回放(schaul2016prioritized)、困难样本挖掘(shrivastava2016training)和基于能力的课程(platanios2019competence))一致,这些方法将学习重点放在最信息丰富的样本上。关键区别在于,这些经典方法选择或重新加权现有经验,而RODS在奖励定义的边界上生成新数据,结合了优先回放的针对性原则与生成合成的分布扩展。
## 3 RODS
为解决多轮数据稀缺和信号枯竭,我们引入RODS,一个奖励驱动的数据合成框架。RODS通过三个共同演化的模块维持饱和的学习信号。首先,基于奖励的种子检测识别高方差边界任务(§3.2(https://arxiv.org/html/2606.19047#S3.SS2))。其次,技能对齐的合成生成连贯、结构同构的变体(§3.3(https://arxiv.org/html/2606.19047#S3.SS3))。第三,动态回放缓冲区管理追踪变化的能力边界(§3.4(https://arxiv.org/html/2606.19047#S3.SS4))。
参考图2:RODS闭环RL-数据合成架构。
(顶部)奖励计算与代理训练:代理通过GRPO在混合数据集上训练;进度奖励(RP)识别边界种子并将其反馈给数据引擎。
(左下)规划与执行:规划器代理从API图中选择函数序列;执行编排器在模拟环境中实例化该序列,并接收环境反馈(重复×N次),生成可执行的原始轨迹。
(右下)精炼与评判:查询代理将轨迹转换为每轮自然语言查询;重写代理将所有查询锚定到规划器的叙事中以保证跨轮连贯性;评判代理验证语义质量,带有反馈循环(重复×N次),生成验证过的合成数据集注入训练。
### 3.1 问题形式化与设计动机
多轮工具使用被形式化为一个部分可观测马尔可夫决策过程(POMDP),其中代理通过API调用和环境反馈解决相互依赖的查询(详见附录A(https://arxiv.org/html/2606.19047#A1))。我们使用GRPO(shao2024deepseekmath)进行优化,尽管我们基于方差的边界追踪方法可延伸至其他轨迹采样方法(如PPO,见附录K(https://arxiv.org/html/2606.19047#A11))。
#### 奖励稀疏性与进度奖励。
由于稀疏的二元奖励无法在复杂的长程轨迹中分配信用(feng2025group),我们采用tuneenv中的进度奖励(RP∈[0,1]):RP = 1/N ∑_{t=1}^{N} (r_t^state · r_t^exec)。它能为部分完成分配连续信用,丰富优势信号。注意,真实值仅用于基于模拟的奖励计算;策略从未观察到它。
#### 设计启发:方差在能力边界附近达到峰值。
在像GRPO(shao2024deepseekmath)这样的策略梯度方法中,样本的梯度信号密度由其rollout奖励方差控制。虽然Popoviciu不等式(popoviciu1935sur)表明有界变量的方差上界为μ(1−μ)(在μ≈0.5时最大),这提供了一个理论上的上界,而非连续奖励方差的精确描述。我们仍将其作为经验支持的启发:连续进度奖励方差在能力边界附近(μ≈0.5)达到峰值,这由图3(https://arxiv.org/html/2606.19047#S4.F3)(右)中的每任务方差分析确认。因此,这一启发式原理支撑了RODS的设计:识别这些边界样本作为找到信息梯度信号最高浓度的有效廉价代理(理论细节见附录B.5(https://arxiv.org/html/2606.19047#A2.SS5))。
### 3.2 基于奖励的种子数据检测
为实现§3.1(https://arxiv.org/html/2606.19047#S3.SS1)中确定的边界定位启发式,我们使用K个rollout上的平均进度奖励r̄_i作为基于密度的探测器,将任务空间D划分为三个动态演化的区域:
D_mastered = {x_i: r̄_i > α^+},
D_boundary = {x_i: α^- ≤ r̄_i ≤ α^+},
D_hard = {x_i: r̄_i < α^-}. (1)
其中α^-和α^+是边界阈值(分别设为0.20和0.85,见附录B(https://arxiv.org/html/2606.19047#A2))。我们将中间区域x_i ∈ D_boundary内的任务定义为边界种子,因为它们代表模型当前的能力边界,蕴含信息梯度信号的最大潜力。
#### 类型配额种子发射。
在每个训练步骤,我们从D_boundary中选择最多M个种子。为确保技能覆盖的多样性,我们为每种类型τ强制执行配额M_τ(例如,基础/长上下文、缺失函数、缺失参数),使得∑_τ M_τ = M。在每种类型内,候选者按方差代理φ(r̄_i)=4r̄_i(1−r̄_i)降序排列,优先选择最接近能力中点(r̄_i=0.5)的种子——此处梯度信号潜力最大(参见C2)。一个长度为c步的时间排除窗口防止重复采样,选中的种子被异步分发至相似文章
OpenResearcher: 面向长周期深度研究轨迹合成的全开放流水线
OpenResearcher 提出了一种可复现的流水线,用于使用离线搜索环境和合成轨迹训练深度研究智能体,在 BrowseComp-Plus 等基准任务上实现了显著的准确率提升。
CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning
Introduces CODS, an iterative critic-guided data selection method for offline reinforcement learning that retains task performance at low data budgets by selecting high-residual transitions over multiple rounds.
演示TOFFEE:一个大规模合成数据代理轨迹的学习系统
TOFFEE是一个系统,它采用带有自适应模型选择和跨任务前缀重用的蒙特卡洛树搜索(Monte Carlo Tree Search),大规模合成高质量的数据代理轨迹。这些轨迹可用于微调或上下文学习,以提升数据代理在异构企业环境中的性能。
OpenVisTool:合成指导性视觉工具使用轨迹的开放方法
本文介绍了 OpenVisTool,一个用于合成指导性视觉工具使用轨迹的开放框架,以及相应的数据集(OpenVisTool-42K)和基准。研究表明,在基于因果关系的监督下进行微调,能在多种模型骨干上提升视觉工具使用性能。
DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。