@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
摘要
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
查看缓存全文
缓存时间: 2026/07/20 23:34
扩大基于结果的强化学习规模无法解决长周期代理任务。信用分配是瓶颈所在,而回合级奖励是不可避免的。问题在于如何获取它。众所周知,过程标注成本高昂。很高兴发布 TRACE:基于信用估计的回合级奖励分配,用于长周期代理。无需训练批评者,无需过程标签,无需蒙特卡洛延续,无需强大的LLM评判者。http://arxiv.org/abs/2607.13988
核心问题:当任务包含短推理链条且答案易于验证时,结果奖励效果良好。但代理在执行任务前可能需要进行数十次甚至数百次工具交互。单一最终奖励可以告诉我们代理是否成功,但无法分辨哪些工具调用发现了决定性证据、哪些是冗余的、或者哪些将代理引向了错误方向。这使得随着轨迹变长,强化学习变得越来越稀疏、噪声大且效率低下。
我们的方法:TRACE
TRACE 在单个工具调用边界分配信用。对于每个轨迹前缀,一个冻结的参考模型衡量黄金答案的可预测性增加了多少。TRACE 将其转换为状态值,并使用时间差分变化来奖励每次交互:
→ 当工具调用使代理更接近答案时,给予正信用
→ 当添加冗余信息时,给予接近零的信用
→ 当使代理远离答案时,给予负信用
预测最终答案的概率仍然是全局训练目标;回合级奖励仅仅揭示了哪些行动对此有所贡献。
为什么这种形式化很重要:回合级奖励在轨迹中会累积。重复搜索或重新打开相同证据无法人为累积额外的一步信用。TRACE 还可以将延迟的进展向后传播:如果一次搜索发现了一个有希望的页面,而后来的“打开”揭示了决定性证据,那么两次交互都可以获得适当定位的信用。
结果:使用纯强化学习(无冷启动SFT、无代理中期训练、无实时网络训练数据),TRACE 显著提升了长周期搜索性能: → Qwen3-4B:在 BrowseComp-Plus 上从 7.2 提升到 35.6 → Qwen3-30B-A3B:从 8.4 提升到 42.6,与 Tongyi-DeepResearch-30B-A3B 相当。 在相同模型、数据、工具和结果奖励的控制比较下,TRACE 在两个模型规模上均优于 GRPO、GSPO 和 GiGPO。
论文:https://arxiv.org/abs/2607.13988
由出色的 @LeitianT 领导,并衷心感谢我们在微软研究院的合作者:Baolin Peng、Wenlin Yao、Tao Ge、Hao Cheng、Mike Hang Wang 和 @JianfengGao0217。
TRACE:通过信用估计实现长周期代理的回合级奖励分配
来源:https://arxiv.org/html/2607.13988
Leitian Tao¹,² Baolin Peng² Wenlin Yao² Tao Ge² Hao Cheng² Mike Hang Wang² Jianfeng Gao² Sharon Li¹
¹威斯康星大学麦迪逊分校 ²微软研究院
摘要
多回合代理通过一系列扩展的工具交互序列解决复杂任务,然后生成最终答案,这使得信用分配成为后训练阶段的一个基本挑战。结果奖励为短周期推理提供了可靠的监督,但当轨迹扩展到数十次或数百次工具调用时,结果奖励变得稀疏且高方差。它们还可能具有误导性:一次失败的展开可能包含许多有用的行动,使代理更接近目标,但仅依赖结果的训练会为这些行动分配与最终错误相同的负优势分数。我们提出 TRACE(通过信用估计进行回合级奖励分配),这是一种用于代理强化学习的密集信用分配方法。TRACE 将展开表示为工具调用边界处的状态转换,从冻结的参考模型获取黄金答案的对数概率,将其转换为对数比率状态值,并推导出每个行动的奖励作为这些值的时间差分变化。这不需要额外的批评者或过程标签训练,且其单步对数比率时间差分组件会在冗余工具调用中累积。在长周期复杂搜索任务中,TRACE 使用纯强化学习显著提升了基础模型的工具使用能力,无需冷启动监督微调阶段、代理中期训练阶段或在实时网络数据上训练。在封闭网络 BrowseComp-Plus 基准测试上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学习到的搜索行为也能迁移到开放网络基准测试,且学习曲线显示在强化学习训练期间改进更早、收敛更快。
1 引言
大型语言模型代理通过与环境进行多次交互(包括网页导航、软件工程和通用计算机使用)来推理和行动,从而解决日益复杂的任务。基于可验证奖励的强化学习在单轮推理任务(如数学和编码)中非常有效,因为确定性检查器可以评估最终答案并提供干净的结果奖励。将同样的思路应用于代理很有吸引力但不够充分:一次代理展开可能包含数十次搜索、打开、查找、编码或其他工具使用决策,然后最终答案才被验证。单一的终止奖励告诉我们轨迹是否成功,但无法揭示哪些中间行动收集了必要证据、哪些是冗余的、或者哪些使代理偏离了轨道。因此,密集的回合级奖励是可取的,但获取它们具有挑战性,因为代理轨迹中的部分进展并未直接观察到。如图 1 所示,一次失败的展开可能始于有用的搜索和打开行动,使答案更易于推断,而一次成功的展开可能包含冗余的搜索或偶然的打开,这些并未对最终答案做出贡献。仅依赖结果的训练会为所有这些回合分配相同的轨迹级优势,低估了生产性探索,高估了无关行动,并随着周期增长增加了梯度方差。
先前关于过程监督的工作提供了更细粒度的反馈,但通常需要步骤级标签、一个强大的 LLM 评判者来评分中间行为,或一个经过训练的过程奖励模型,其分数可能偏离最终答案的正确性。这引出了本工作的核心问题:我们如何识别那些实际上将长周期代理移向答案的工具调用,并将这些信号转化为密集奖励,而无需依赖步骤标签、强大的评判者或训练过的过程奖励模型?
我们提出 TRACE(通过信用估计进行回合级奖励分配),这是一个无批评者的信用分配框架,它保持最终验证器作为锚点,同时在工具调用边界添加密集信用。关键思想是使用一个冻结的参考模型,不是作为评判者,而是作为一个稳定的探针,衡量每个轨迹前缀是否使黄金答案更可预测。TRACE 将展开表示为工具调用边界处的状态转换,通过参考模型对黄金答案的对数概率对每个前缀进行评分,并将分数转换为衡量向答案进展的对数比率状态值。然后,它使用相邻值之间的时间差分变化分配回合奖励:当工具调用返回的观察增加了答案可预测性时获得正信用,当未添加有用证据时获得接近零的信用,当使轨迹远离答案时获得负信用。由于单步时间差分信用会累积,冗余的中间回合无法夸大这个组件,而累积信用仍与最终参考模型状态保持一致。由此产生的奖励将这个密集的时间差分信号与标准结果级优势相结合,将可验证的成功保留为最终训练目标,同时区分哪些回合应获得信用。
(图 1 说明:在搜索轨迹的工具调用边界进行信用分配。该图展示了一个长周期搜索展开分解为工具调用回合。即使后续分支导致了错误最终答案,早期的搜索和打开行动也能向转录添加任务相关证据。结果奖励训练为展开中的所有行动附加一个轨迹级优势,而 TRACE 在工具边界计算前缀值并从相邻值变化分配回合信用。)
我们评估 TRACE 在长周期复杂搜索任务上的表现,这种设置要求代理学会与环境交互,通过多次工具调用进行探索,并根据早期观察改进后续行动。由于常见的多跳基准测试可由强大的代理在仅几次交互中解决,我们在更深的合成搜索问题上进行训练,并在封闭网络和开放网络的深度研究基准测试上进行评估。我们的方案是纯强化学习:直接使用结果级和回合级奖励,无需冷启动监督微调阶段、代理中期训练阶段、实时网络训练数据、强大的评判模型或训练过的过程奖励模型。尽管监督极少,TRACE 在封闭网络和开放网络设置中都显著提升了基础模型的工具使用能力。在封闭网络 BrowseComp-Plus 上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学到的行为也能迁移到开放网络检索,30B-A3B 代理在 BrowseComp 上达到 12.9,在 GAIA 上达到 52.0,在 xbench-DeepSearch 上达到 45.0。除了最终性能,训练曲线显示 TRACE 更早开始改进且收敛更快,表明回合级信用使得从纯强化学习中学习长周期工具使用变得更容易。这些结果表明,以验证器为锚点的回合级信用可以教会基础模型探索、与环境交互并改进工具使用以应对复杂的长周期任务,同时保持独立于昂贵的过程监督或基于强大评判者的反馈。
2 预备知识
2.1 代理强化学习
在代理强化学习中,策略 LLM π_θ 通过交错助手标记、从可用工具集 T 中调用工具以及工具观察来解决提示 x ∼ D,然后生成最终答案。常见的 KL 正则化训练目标是最大化: max_{π_θ} E_{x∼D, τ∼π_θ(·|x;T)} [r_φ(x,τ)] − β_KL D_KL[π_θ(τ|x;T) ∥ π_ref(τ|x;T)], (1) 其中 τ 表示完整展开,r_φ 是奖励函数,π_ref 是参考策略,β_KL 控制 KL 惩罚的强度。在具有可验证奖励的强化学习中,r_φ 通常是一个结果奖励,仅在展开完成后才被观察到,例如通过检查最终答案是否满足自动可验证的标准。
与单轮推理不同,代理展开会诱导出关于中间交互轨迹和最终答案的分布。我们将交互部分写成交替的策略行动和环境观察。设 R = ((a_1, o_1), …, (a_{T_R}, o_{T_R})) 和 H_k = (x, a_1, o_1, …, a_{k−1}, o_{k−1})。那么 P_θ(R, y|x; T) = ∏{k=1}^{T_R} π_θ(a_k|H_k; T) P_env(o_k|H_k, a_k; T) ⋅ ∏{t=1}^{|y|} π_θ(y_t|y_<t, H_{T_R}, o_{T_R}). (2)
策略梯度方法通常使用组相对优势,其中在给定提示 x 下采样一个轨迹组 G,计算每个轨迹的结果奖励 R_g = R(ŷ_g, y^⋆),然后标准化组内的奖励以获得结果优势 A^{out}g。轨迹 τ_g 中每个标记 t 的损失为: L^{out}(θ) = −E_g [ ∑{t} (min(r_t(θ) A^{out}g, clip(r_t(θ), c−, c_+) A^{out}_g) ) ], (3) 其中 r_t(θ) 是重要性采样比率 π_θ/π_old。
2.2 状态价值学习与时间差分学习
在传统强化学习中,状态价值 V^π(s) 定义为从状态 s 开始并遵循策略 π 的预期回报。时间差分学习通过自举更新价值函数:V(s_t) ← V(s_t) + α [r_t + γ V(s_{t+1}) − V(s_t)]。在代理强化学习中,状态自然地在工具调用边界处定义:每个工具调用及其返回的观察构成一次转换。然而,为长周期代理学习一个价值函数是具有挑战性的,通常需要一个额外的批评者网络,该网络在训练期间与策略共同更新,并可能引入近似误差或不稳定性。
2.3 过程奖励与信用分配
过程奖励模型(PRM)为中间步骤分配信用。这些模型要么在人工或合成步骤级标签上训练,要么使用基于蒙特卡洛的估计。对于代理任务,PRM 通常需要嵌入工具状态或检索到的内容,使得跨不同任务或领域的泛化变得困难。相比之下,结果奖励在展开后提供单一信号:成功或失败。虽然干净且易于获取,但结果奖励会丢失关于哪些中间行动做出了贡献的信息,并且对于长轨迹可能具有高方差。这促使了更密集、更稳定的信用分配方法的需求,这些方法不依赖于额外训练或人工标注。
3 TRACE:通过信用估计进行回合级奖励分配
我们提出 TRACE,一种用于代理强化学习的密集信用分配方法。TRACE 将结果验证器作为最终训练目标,同时通过将黄金答案的可预测性变化转化为回合级信用,在工具调用边界添加密集奖励。该过程如图 2 所示。
3.1 使用固定参考模型进行状态价值估计
关键思想是使用一个冻结的参考语言模型 π_ref 来估计一个状态可以多好地预测黄金答案 y^⋆。对于轨迹前缀 S_k = (x, a_1, o_1, …, a_k, o_k),我们计算参考模型在 S_k 条件下对黄金答案的交叉熵损失(归一化为每标记负对数似然): ℓ_k = −1/|y^⋆| ∑{t=1}^{|y^⋆|} log π_ref(y_t^⋆ | S_k, y<t). (4)
这个损失衡量了给定前缀后剩余的不确定性。我们使用 ℓ_0 作为初始不确定性,此时前缀为空。为了获得一个状态价值,我们通过对这些损失进行某种变换来量化相对于初始状态的进展。设 d_k = ℓ_k + ε,其中 ε > 0 是一个小偏移以保证对数下的数值稳定性,并定义: V(S_k) = log(d_0/d_k) = log((−ℓ̄_0 + ε)/(−ℓ̄_k + ε)). (6)
因此 V(S_0) = 0,且较大的 V(S_k) 意味着行动–观察历史已经填补了初始差距的更大比例。后来的时间差分 V(S_{k+1}) − V(S_k) 衡量了由行动 a_{k+1} 和观察 o_{k+1} 引起的转换所增加的价值。
算法 1 TRACE 奖励构建和策略更新(针对一个提示组)
1: 提示 x,黄金答案 y^⋆,当前策略 π_θ,行为快照 π_old,冻结参考 π_ref,组大小 G,周期 K,折扣 γ_td,偏移 ε,终止尺度 λ_term,权重 α_out, α_turn,裁剪界限 c_−, c_+
2: 采样 G 条轨迹 {τ_g}{g=1}^G ∼ π_old(·|x),其中 τ_g = (x, a{g,1}, o_{g,1}, …, a_{g,T_g}, o_{g,T_g}, ŷ_g)。
3: 计算终止奖励 R_g = R(ŷ_g, y^⋆) 和结果优势 A^{out}g = GroupNorm(R_g; {R_h}{h=1}^G),若组标准差为 0 则对所有 g 返回 0。
4: for g = 1,…,G do
5: 从 τ_g 形成答案准备好的前缀 S_{g,0}, …, S_{g,T_g}。
6: for k = 0,…,T_g do
7: ℓ̄_{g,k} = (1/|y^⋆|) ∑{t=1}^{|y^⋆|} log π_ref(y_t^⋆ | S{g,k}, y_<t)
8: end for
9: → 通过参考 π_ref 计算所有前缀的答案对数似然。
10: for k = 0,…,T_g do
11: V(S_{g,k}) = log((−ℓ̄_{g,0} + ε)/(−ℓ̄_{g,k} + ε))
12: end for
13: for k = 0,…,T_g−1 do
14: δ_{g,k+1} = V(S_{g,k+1}) − γ_td V(S_{g,k})
15: end for
16: → 在工具边界计算时间差分。
17: for k = 1,…,T_g do
18: A^{turn}{g,k} = δ{g,k} + λ_term A^{out}g
19: end for
20: → 回合信用结合时间差分和结果优势。
21: end for
22: 合并奖励:对于轨迹 τ_g 中的每个标记 t,若属于工具交互行动 a{g,k+1},则 turn(t)=k;最终答案标记使用 turn(t)=0 且 A^{turn}_g,0 = λ_term A^{out}g(或 A^{turn}{g,T_g+1} = λ_term A^{out}_g)。
23: 使用混合目标 L(θ) = α_out L^{out}(θ) + α_turn L^{turn}(θ) 更新策略。
相似文章
@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。
@sheriyuo: TRACE 在工具边界分配密集信用,通过询问冻结的参考模型每个新观察是否提高了标准答案的对数概率……
TRACE 是一种用于多轮代理强化学习的密集信用分配方法,它利用冻结的参考模型从工具边界的对数概率变化中计算每个动作的奖励,消除了对批评者或过程奖励模型的需求。它在 BrowseComp-Plus 等基准测试上显著提升了长期工具使用的性能。
@Ankur_Samanta_: 在多步推理强化学习后训练中关于信用分配的新工作 介绍自重置策略优化 (SRPO…
自重置策略优化 (SRPO) 通过在多步推理强化学习后训练中定位第一个错误的推理步骤并从中学习反事实延续,而无需外部监督,来解决信用分配问题。
何时蒸馏与蒸馏什么:面向多轮智能体的选择性后见蒸馏
本文首次系统研究了多轮LLM智能体中的信用分配问题,提出了SERL——一种选择性环境重加权学习框架。SERL利用环境反馈在因果相关动作上强化强化学习目标,在ALFWorld和WebShop上分别达到了90.0%和80.1%的成功率。