@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……
摘要
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
查看缓存全文
缓存时间: 2026/07/20 15:29
https://arxiv.org/pdf/2607.13988 来自微软研究院的优秀RL工作,成功将Qwen3小型MoE模型的能力提升到优于其他方法,其重点在于为长程轨迹构建基于轮次的信号。核心思想源于TD-Learning,但他们并未使用训练好的价值模型。相反,该方法在状态S_k处利用模型输出正确答案的概率来估计价值函数。这使得他们能够获得一个价值漂移:如果新的观察更有可能收敛到目标,则为正;否则为负。为了稳定延迟工具效应(例如,如果你搜索并点击某物,搜索应该获得相当的贡献),作者使用了截断的K步TD备份,并通过折扣超参数进行聚合。如果K步到达轨迹终点,信用计算还会纳入可验证的奖励信号,即GRPO优势乘以折扣的幂次和另一个控制其影响的超参数。主要的GRPO优势仍然被计算,但现在会与每步的信用计算一起考虑,每个都乘以一个参数来分配它们在总和中的强度。这产生了一个混合的每步优势,再通过使每一步的信用归属于其所属的步骤,从而转化为混合的每令牌优势。完成这一切后,使用这个修改后的优势来优化带裁剪的GRPO目标。结果非常出色!在评估的智能体基准测试上,它几乎击败了所有RL方法。所有超参数都在论文中给出。学习动态相当稳定,消融实验也验证了他们的选择。优秀的工作,希望它能适用于更通用的智能体场景!
TRACE:通过信用估计实现长程智能体的轮次级奖励分配
来源:https://arxiv.org/html/2607.13988
Leitian Tao¹,², Baolin Peng², Wenlin Yao², Tao Ge², Hao Cheng², Mike Hang Wang², Jianfeng Gao², Sharon Li¹ ¹ 威斯康星大学麦迪逊分校 ² 微软研究院
摘要
多轮智能体通过一系列工具交互来完成复杂任务,最终才给出答案,这使得信用分配成为训练后的一个根本挑战。结果奖励为短程推理提供了可靠的监督信号,但当轨迹增长到数十或数百次工具调用时,结果奖励变得稀疏且方差很高。它们也可能具有误导性:一个失败的执行可能包含许多有用的行动,使智能体更接近目标,然而仅基于结果的训练会将这些行动与最终的错误分配相同的负优势。我们提出 TRACE(Turn-level Reward Assignment via Credit Estimation),一种用于智能体强化学习的密集信用分配方法。TRACE 将执行表示为工具调用边界处的状态转移,从冻结的参考模型中获得正确答案的对数概率,将其转化为对数比率状态价值,并推导出每个行动的奖励作为这些价值的时序差分变化。这不需要额外的评论家或过程标签训练,其单步对数比率 TD 组件在冗余工具调用之间可以抵消。在长程复杂搜索任务中,TRACE 使用纯 RL 显著提升了基础模型的工具使用能力,无需冷启动的监督微调阶段、无需中间智能体训练阶段,也无需在实时网络数据上训练。在封闭网络的 BrowseComp-Plus 基准上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学到的搜索行为也能迁移到开放网络基准,并且学习曲线显示在 RL 训练期间更早开始改进并更快收敛。
1 引言
大型语言模型(LLM)智能体越来越多地通过与外部环境(包括网页导航、软件工程和通用计算机使用)进行多轮交互来推理和执行复杂任务[Yao et al., 2023, Schick et al., 2023, Nakano et al., 2021, Yao et al., 2022, Deng et al., 2023, Zhou et al., 2024, Jimenez et al., 2024, Xie et al., 2024]。带有可验证奖励的强化学习(RLVR)在单轮推理任务(如数学和编码)中效果显著,因为确定性检查器可以评估最终答案并提供清晰的结果奖励[Shao et al., 2024, Guo et al., 2025]。将同样的想法应用于智能体很有吸引力,但还不够:一个智能体执行可能包含数十次搜索、打开、查找、编码或其他工具使用决策,然后才验证最终答案。一个单一的终端奖励表明轨迹是否成功,但它并不揭示哪些中间动作收集了必要证据,哪些是冗余的,或者哪些使智能体偏离了轨道。因此,密集的轮次级奖励是可取的,但获取它们具有挑战性,因为智能体轨迹中的部分进展无法直接观察。如图 1 所示,一个失败的执行可能以有用的搜索和打开动作开始,这些动作使答案更易推断,而一个成功的执行可能包含冗余的搜索或意外的打开,这些对最终答案没有贡献。仅基于结果的训练为所有这些轮次分配相同的轨迹级优势,低估了富有成效的探索,高估了不相关的动作,并随着轨迹增长增加了梯度方差[Sutton and Barto, 2018, Arjona-Medina et al., 2019, Ye et al., 2025]。
先前关于过程监督的工作提供了更细粒度的反馈,但通常需要步骤级标签、一个强大的 LLM 裁判来评分中间行为[Zheng et al., 2023],或者一个训练好的过程奖励模型,其分数可能偏离最终答案的正确性[Uesato et al., 2022, Lightman et al., 2023, Wang et al., 2024a, Setlur et al., 2024]。这引出了本工作的核心问题:我们如何识别那些真正将长程智能体推向答案的工具调用,并将该信号转化为密集奖励,而无需依赖步骤标签、强大的裁判或训练好的过程奖励模型?
我们提出 TRACE(Turn-level Reward Assignment via Credit Estimation),一种无评论家的信用分配框架,它将最终验证器作为锚点,同时在工具调用边界处添加密集信用。其关键思想是使用一个冻结的参考模型,不是作为裁判,而是作为一个稳定的探针,来衡量每个轨迹前缀是否使正确答案更可预测。TRACE 将执行表示为工具调用边界处的状态转移,通过参考模型的正确答案对数概率对每个前缀进行评分,并将该分数转化为衡量朝向答案进展的对数比率状态价值。然后,它利用相邻价值之间的时序差分(TD)变化来分配轮次奖励:当工具调用返回的观察结果增加答案可预测性时获得正信用,当没有增加有用证据时获得接近零的信用,当将轨迹推离答案时获得负信用。由于单步 TD 信用可以抵消,冗余的中间轮次无法膨胀该组件,而累积信用与最终的参考模型状态保持一致。由此产生的奖励结合了这种密集的 TD 信号和标准的结果级优势[Sutton, 1988],保留了可验证的成功作为最终训练目标,同时区分哪些轮次应获得信用。
参见图注 图 1:搜索轨迹中工具调用边界处的信用分配。 该图展示了一个长程搜索执行被分解为工具调用轮次。早期的搜索和打开动作可能向记录中添加与任务相关的证据,即使稍后的分支导致了错误的最终答案。结果奖励训练为整个执行中的所有动作分配一个轨迹级优势,而 TRACE 则在工具边界处计算前缀价值,并从相邻价值变化中分配轮次信用。
我们在长程复杂搜索任务上评估 TRACE,这是一个智能体必须学会与环境交互、通过多次工具调用进行探索,并根据早期观察优化后续动作的设置。由于常见的多跳基准可以在仅少数轮次中被强智能体解决[Yang et al., 2018],我们在更深的合成搜索问题上进行训练,并在封闭网络和开放网络的深度研究基准上评估。我们的方法是纯 RL:直接使用结果级和轮次级奖励,无需冷启动的监督微调阶段、中间智能体训练阶段、实时网络训练数据、强大的裁判模型或训练好的过程奖励模型。尽管监督信号最少,TRACE 在封闭网络和开放网络环境中都显著提升了基础模型的工具使用能力。在封闭网络的 BrowseComp-Plus 上[Chen et al., 2025c],它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学到的行为也能迁移到开放网络检索,其中 30B-A3B 智能体在 BrowseComp 上达到 12.9,在 GAIA 上达到 52.0,在 xbench-DeepSearch 上达到 45.0。除了最终性能,训练曲线显示 TRACE 开始改进更早且收敛更快,这表明轮次级信用使得长程工具使用更易于从纯 RL 中学习。这些结果表明,以验证器为锚点的轮次级信用可以教会基础模型探索、与环境交互,并为复杂的长期任务优化工具使用,同时独立于昂贵的过程监督或基于强大裁判的反馈。
2 预备知识
2.1 智能体强化学习
在智能体强化学习中,策略 LLM π_θ 通过交织助手令牌、来自可用工具集 T 的工具调用以及工具观察结果,最终给出答案,来解决来自分布 x~D 的提示。一个常见的 KL 正则化训练目标为:
max_{π_θ} E_{x~D, τ~π_θ(·|x;T)} [r_φ(x,τ)] - β_KL D_KL[π_θ(τ|x;T) || π_ref(τ|x;T)], (1)
其中 τ 表示完整的执行,r_φ 是奖励函数,π_ref 是参考策略,β_KL 控制 KL 惩罚的强度。在可验证奖励的强化学习中,r_φ 通常是结果奖励,仅在执行完成后才观察到,例如通过检查最终答案是否满足自动可验证的标准[Sutton and Barto, 2018, Shao et al., 2024]。与单轮推理不同,智能体执行会诱导一个分布在中间交互轨迹和最终答案上[Yao et al., 2023, Schick et al., 2023, Nakano et al., 2021, Yao et al., 2022, Yao et al., 2023]。我们将交互部分写为交替的策略行动和环境观察。令 R = ((a_1, o_1), …, (a_{T_R}, o_{T_R})) 且 H_k = (x, a_1, o_1, …, a_{k-1}, o_{k-1})。则
P_θ(R, y|x;T) = [∏{k=1}^{T_R} π_θ(a_k|H_k;T) P_env(o_k|H_k, a_k;T)] · [∏{t=1}^{T_y} π_θ(y_t|y_{<t}, H_{T_R+1};T)], (2)
其中 P_env 是环境本身的转移函数,y 是生成的答案令牌。我们关注第一项,即工具交互步骤。对于训练而言,结果是令 R_k = r_φ(x, τ_k) 在完成时使用,例如来自最终答案检查器的二元成功信号。
2.2 可验证奖励的强化学习与 GRPO
基于策略梯度的 RL 算法通过收集执行并最大化奖励来优化策略。群组相对策略优化 (GRPO) [Shao et al., 2024] 是一种流行的选择,它从一个输出群组中估计基线:
A^{out}_g = (R_g - mean(R)) / std(R), (3)
其中 g 索引从策略中采样的 G 个执行之一。GRPO 避免了单独的价值函数评论家,并已被证明在数学和编码等任务中有效,在这些任务中,一个易于验证的最终答案可以提供一个稀疏但信息丰富的奖励。然而,当轨迹长度增长时,这种每轨迹优势将所有步骤混为一谈,为所有转移分配平均信用。
3 TRACE:通过信用估计实现轮次级奖励分配
我们提出 TRACE,一种无评论家的信用分配方法,用于为长程智能体轨迹生成密集、轮次级的奖励。TRACE 使用一个冻结的参考模型从每个轨迹前缀中提取价值,将对数似然转化为价值估计,并通过 TD 差异推导出信用。第 3.1 节描述如何将前缀映射到状态空间。第 3.2 节展示如何从前缀对数似然构建价值函数。第 3.3 节将 TD 信用与结果级优势结合起来,形成每令牌的混合优势。第 3.4 节提供消融实验。完整算法在算法 1 中总结。
3.1 状态表示
我们将智能体执行的交互部分表示为交替的助手工具调用和环境观察。令
τ = (x, a_1, o_1, a_2, o_2, …, a_{T_τ}, o_{T_τ}, ŷτ), (4)
其中 x 是初始提示,k 从 1 到 T_τ 索引工具调用(每个调用引起环境状态变化 o_k 生成),ŷτ 是最终答案。我们定义 S_0 = x,对于 k ≥ 1,S_k = (x, a_1, o_1, …, a_k, o_k)。在给定 S_k 时,注意力前缀允许 π_ref 为答案的延续分配一个对数概率——即,概率 p(y^⋆ | S_k, y^⋆_{<t}; T) 通过自回归公式化。
3.2 从对数概率构建价值函数
令 y^⋆ 为正确最终答案,并令 ℓ_{ref}(S_k) = (1/|y^⋆|) ∑_{t=1}^{|y^⋆|} log π_ref(y^⋆t | S_k, y^⋆{<t}; T) 为给定前缀 S_k 下 y^⋆ 的平均对数似然。如果 ℓ 更接近零,那么参考模型认为答案更可能。对于每个前缀,我们测量与初始状态相比的进展。
令 ℓ₀ = ℓ_{ref}(S_0) 为仅给定提示的对数似然。通常 ℓ₀ 是某些基准。对于更远的 k,我们定义
V(S_k) = log (d_0 / d_k) = log ((-ℓ₀ + ε) / (-ℓ_k + ε)), (6)
其中 κ ≥ 0 且 ε > 0。我们设置 κ = 0,ε > 0,并设置 V(S_k) = log (d_0 / d_k) = log ((-ℓ₀ + ε) / (-ℓ_k + ε))。因此 V(S_0)=0,且更大的 V(S_k) 意味着动作-观察历史已经缩小了初始差距的更大比例。后续的 TD 差异 V(S_{k+1}) - V(S_k) 因此衡量了由动作 a_{k+1} 和观察 o_{k+1} 引起的转移所增加的价值。
算法 1 针对一个提示组的 TRACE 奖励构建和策略更新。
1: 提示 x,正确答案 y^⋆,当前策略 π_θ,行为快照 π_old,冻结参考 π_ref,组大小 G,地平线 K,折扣 γ_td,偏移 ε,终端尺度 λ_term,权重 α_out, α_turn,裁剪边界 c_-, c_+ 2: 采样 G 个轨迹 {τ_g}{g=1}^G ~ π_old(·|x),其中 τ_g = (x, a{g,1}, o_{g,1}, …, a_{g,T_g}, o_{g,T_g}, ŷ_g)。 3: 计算终端奖励 R_g = R(ŷ_g, y^⋆) 和结果优势 A^{out}g = GroupNorm(R_g; {R_h}{h=1}^G),如果群组标准差为 0 则对所有 g 返回 0。 4: for g=1,…,G do 5: 从 τ_g 形成答案就绪前缀 S_{g,0}, …, S_{g,T_g}。 6: for k=0,…,T_g do 7: ℓ̄_{g,k} = (1/|y^⋆|) ∑{t=1}^{|y^⋆|} log π_ref(y^⋆t | S{g,k}, y{<t}^⋆; T) 8: end for 9: 计算 d_{g,k} = -ℓ̄_{g,k} + ε,V_{g,k} = log(d_{g,0} / d_{g,k})。 10: 令 r^{turn}{g,k} = 0 对于 k=0。 11: 对于 k≥1,根据截断的 K 步 TD 计算轮次信用 r^{turn}{g,k}。 … (后续步骤涉及截断 TD 和混合优势的计算,但为简洁起见,此处省略详细公式,论文中完整给出。)
对于作为工具交互动作 a_{g,k+1} 一部分生成的每个令牌,我们设置 turn(t)=k;最终答案令牌使用附录 A.1 中描述的答案尾部加权与结果组件。用于工具交互令牌的混合每令牌优势为:
Â_{g,t} = α_out A^{out}g + α_turn r^{turn}{g, turn(t)}, (11)
其中 α_out, α_turn ≥ 0 控制终端正确性和轮次级信用的相对强度。令 I_g 为用于执行 g 的策略梯度损失的助手令牌索引,并令 ρ_{g,t}(θ) = π_θ(a_{g,t} | s_{g,t}) / π_old(a_{g,t} | s_{g,t})。
相似文章
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
我使用强化学习训练了Qwen3.6-35B-A3B,用于强化学习训练小型任务专用Qwen模型。完全开源!🤓
作者使用强化学习训练了Qwen3.6-35B-A3B模型,然后用于强化学习训练小型任务专用Qwen模型,并且完全开源了所有内容。
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。
@omarsar0: Qwen 发布了关于 RL 编码智能体的新工作。(请收藏)其理念是持续构建一个验证系统,该……
Qwen 的新论文研究了面向长周期编码智能体的奖励设计,指出由于奖励破解,每个验证信号最终都会失去对正确性的追踪能力,并论证了验证必须与策略能力共同进化。