@sheriyuo: TRACE 在工具边界分配密集信用,通过询问冻结的参考模型每个新观察是否提高了标准答案的对数概率……
摘要
TRACE 是一种用于多轮代理强化学习的密集信用分配方法,它利用冻结的参考模型从工具边界的对数概率变化中计算每个动作的奖励,消除了对批评者或过程奖励模型的需求。它在 BrowseComp-Plus 等基准测试上显著提升了长期工具使用的性能。
查看缓存全文
缓存时间: 2026/07/16 08:14
TRACE 通过在工具调用边界上利用冻结的参考模型来衡量每个新观测是否提高了正确答案的对数概率,将状态值的变化转化为时间差分奖励,无需训练评论家或过程奖励模型,从而为工具调用分配密集信用。
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
论文地址:http://arxiv.org/abs/2607.13988
TRACE: 面向长时程智能体的回合级奖励分配与信用估计
来源:https://arxiv.org/html/2607.13988
Leitian Tao¹,², Baolin Peng², Wenlin Yao², Tao Ge², Hao Cheng², Mike Hang Wang², Jianfeng Gao², Sharon Li¹
¹威斯康星大学麦迪逊分校 ²微软研究院
摘要
多轮智能体通过一系列工具交互来执行复杂任务,最终才给出答案,这使得在后期训练中信用分配成为一个根本性挑战。结果奖励为短时程推理提供了可靠的监督,但随着轨迹增长到数十甚至数百次工具调用,奖励变得稀疏且方差很大。此外,结果奖励可能具有误导性:一次失败的运行轨迹中可能包含许多有用的动作,这些动作使智能体更接近目标,但仅有结果监督的训练会将这些动作与最终的错误同等视之,赋予相同的负优势。我们提出 TRACE(通过信用估计进行回合级奖励分配),一种面向智能体强化学习的密集信用分配方法。TRACE 将运行轨迹表示为工具调用边界上的状态转移,从冻结的参考模型中获取正确答案的对数概率,将其转换为对数比率状态值,并通过这些值的时间差分变化推导出每个动作的奖励。这不需要额外的评论家或过程标签训练,并且其单步对数比率时间差分组件能够跨越冗余的工具调用进行累加。在长时程复杂搜索任务上,TRACE 仅在纯强化学习下显著提升了基础模型的工具使用能力,无需冷启动监督微调阶段、无需智能体中期训练阶段、也无需基于实时网络数据训练。在封闭网络的 BrowseComp-Plus 基准上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学到的搜索行为也能迁移到开放网络基准上,并且学习曲线显示在强化学习训练期间改进更早、收敛更快。
1 引言
大型语言模型(LLM)智能体越来越多地通过与外部环境进行多次交互(包括网络导航、软件工程和一般计算机使用)来解决复杂任务 [Yao 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib4), Schick 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib5), Nakano 等人, 2021 (https://arxiv.org/html/2607.13988#bib.bib2), Yao 等人, 2022 (https://arxiv.org/html/2607.13988#bib.bib3), Deng 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib6), Zhou 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib7), Jimenez 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib8), Xie 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib9)]。使用可验证奖励的强化学习(RLVR)在单轮推理任务(例如数学和编程)中非常有效,在这些任务中,确定性检查器可以评估最终答案并提供干净的结果奖励 [Shao 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib11), Guo 等人, 2025 (https://arxiv.org/html/2607.13988#bib.bib12)]。将这一思想应用于智能体具有吸引力但并不充分:一次智能体运行可能在最终答案被验证之前包含数十次搜索、打开、查找、编程或其他工具使用决策。一个单一的最终奖励只能表明轨迹是否成功,但无法揭示哪些中间动作收集了必要证据、哪些是冗余的、或者哪些使智能体误入歧途。因此,密集的回合级奖励是可取的,但获得它们具有挑战性,因为智能体轨迹中的部分进展无法直接观测。正如图 1 所示,一次失败的运行轨迹可能以有用的搜索和打开动作开始,这些动作使答案更易于推断;而一次成功的运行轨迹可能包含冗余的搜索或偶然的打开,这些对最终答案并无贡献。仅有结果监督的训练将所有回合分配到相同的轨迹级优势,从而低估了有成效的探索、高估了无关动作,并且随着时间跨度增长增加了梯度方差 [Sutton and Barto, 2018 (https://arxiv.org/html/2607.13988#bib.bib13), Arjona-Medina 等人, 2019 (https://arxiv.org/html/2607.13988#bib.bib16), Ye 等人, 2025 (https://arxiv.org/html/2607.13988#bib.bib10)]。先前关于过程监督的工作提供了更细粒度的反馈,但通常需要步骤级标签、一个强大的 LLM 评判器来对中间行为打分 [Zheng 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib95)],或者需要训练一个过程奖励模型,其分数可能偏离最终答案的正确性 [Uesato 等人, 2022 (https://arxiv.org/html/2607.13988#bib.bib20), Lightman 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib21), Wang 等人, 2024a (https://arxiv.org/html/2607.13988#bib.bib27), Setlur 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib28), Yuan 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib29)]。这引出了本文的核心问题:我们如何识别那些真正推动长时程智能体朝答案前进的工具调用,并将这些信号转化为密集奖励,而无需求助于步骤标签、强大的评判器或训练好的过程奖励模型?
我们提出 TRACE(回合级奖励分配与信用估计),一种无需评论家的信用分配框架,它保留最终验证器作为锚点,同时在工具调用边界上增加密集信用。核心思想是使用一个冻结的参考模型,不是作为评判器,而是作为一个稳定的探针,用于衡量每个轨迹前缀是否使正确答案更可预测。TRACE 将运行轨迹表示为工具调用边界上的状态转移,通过参考模型对正确答案的对数概率对每个前缀进行评分,并将该分数转换为衡量向答案进展的对数比率状态值。然后,它使用相邻值之间的时间差分变化来分配回合奖励:当返回的观测增加答案可预测性时,工具调用获得正信用;当未添加有用证据时,信用接近零;当轨迹偏离答案时,获得负信用。由于单步时间差分信用能够累加,冗余的中间回合无法膨胀此组件,而累积信用保持与最终参考模型状态对齐。最终的奖励将这种密集的时间差分信号与标准的结果级优势 [Sutton, 1988 (https://arxiv.org/html/2607.13988#bib.bib14)] 相结合,保留可验证的成功作为最终训练目标,同时区分哪些回合应获得信用。
[图注] 图 1:搜索轨迹中工具调用边界的信用分配。图中展示了一个长时程搜索运行轨迹,分解为工具调用回合。即使后续分支导致错误最终答案,早期的搜索和打开动作也能为对话记录添加任务相关证据。结果奖励训练将单个轨迹级优势附加到运行轨迹中的所有动作上,而 TRACE 在工具边界计算前缀值,并通过相邻值的变化分配回合信用。
我们评估 TRACE 在长时程复杂搜索任务上的表现,这是一种智能体必须学习与环境交互、通过多次工具调用进行探索、并根据早期观测优化后续动作的场景。由于常见的多跳基准测试在强大的智能体面前通常只需几轮即可解决 [Yang 等人, 2018 (https://arxiv.org/html/2607.13988#bib.bib17)],我们在更深层次的合成搜索问题上进行训练,并在封闭网络和开放网络的深度研究基准上进行评估。我们的配方是纯强化学习:直接使用结果级和回合级奖励,没有冷启动监督微调阶段、没有智能体中期训练阶段、没有实时网络训练数据、没有强大的评判模型、也没有训练好的过程奖励模型。尽管监督信号极少,TRACE 仍在封闭网络和开放网络环境中显著提升了基础模型的工具使用能力。在封闭网络的 BrowseComp-Plus [Chen 等人, 2025c (https://arxiv.org/html/2607.13988#bib.bib38)] 上,它将 Qwen3-4B 从 7.2 提升至 35.6,将 Qwen3-30B-A3B 从 8.4 提升至 42.6。学到的行为也能迁移到开放网络检索中,30B-A3B 智能体在 BrowseComp 上达到 12.9,在 GAIA 上达到 52.0,在 xbench-DeepSearch 上达到 45.0。除了最终性能,训练曲线显示 TRACE 开始改进的时间更早、收敛更快,这表明回合级信用使得纯强化学习更容易学到长时程工具使用。这些结果表明,以验证器为锚点的回合级信用能够教会基础模型进行探索、与环境交互并优化复杂长时程任务的工具使用,同时独立于昂贵的过程监督或强大的基于评判器的反馈。
2 预备知识
2.1 智能体强化学习
在智能体强化学习中,策略 LLM πθ 通过交织助手令牌、来自可用工具集 T 的工具调用以及工具观测,最终产生答案来解决提示 x ∼ D。一个常见的 KL 正则化训练目标是最大化:
max_πθ E_{x∼D, τ∼πθ(·|x;T)} [r_φ(x,τ)] - β_KL D_KL[πθ(τ|x;T) ∥ π_ref(τ|x;T)],
其中 τ 表示完整的运行轨迹,r_φ 是奖励函数,π_ref 是参考策略,β_KL 控制 KL 惩罚的强度。在可验证奖励强化学习中,r_φ 通常是一个结果奖励,仅在运行轨迹完成后观察到,例如通过检查最终答案是否满足自动可验证的标准 [Sutton and Barto, 2018 (https://arxiv.org/html/2607.13988#bib.bib13), Shao 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib11)]。与单轮推理不同,智能体运行轨迹诱导出关于中间交互轨迹和最终答案的分布 [Yao 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib4), Schick 等人, 2023 (https://arxiv.org/html/2607.13988#bib.bib5), Nakano 等人, 2021 (https://arxiv.org/html/2607.13988#bib.bib2), Yao 等人, 2022 (https://arxiv.org/html/2607.13988#bib.bib3)]。我们将交互部分写成交替的策略动作和环境观测。设 R = ((a_1, o_1), …, (a_{T_R}, o_{T_R})) 和 H_k = (x, a_1, o_1, …, a_{k-1}, o_{k-1})。那么 P_θ(R, y|x; T) = [∏{k=1}^{T_R} π_θ(a_k|H_k; T) P_env(o_k|H_k, a_k; T)] · [∏{t=1}^{T_y} π_θ(y_t|y_{<t}, H_{T_R+1})],其中 y_0 表示用于捕获 H_{T_R+1} = (x, R) 的助手前缀令牌。
代理的最终奖励 r_φ(x, τ) 是一个二元信号,如果 ŷ(rollout 中的最终答案)正确则为 1,否则为 0。与基于组相对结果优势的 GRPO 风格目标 [Shao 等人, 2024 (https://arxiv.org/html/2607.13988#bib.bib11)] 类似,我们在一组 G 个采样轨迹上标准化结果奖励以获得结果优势 A^{out}_g。在本工作中,我们关注如何使用密集的回合级奖励来补充稀疏的结果优势。
2.2 基于模型的状态值
从结果奖励出发,我们可以通过一个值函数 V(s) 将信用扩散到中间状态,该函数衡量从状态 s 开始遵循策略 π 预期获得的折扣累积结果奖励 [Sutton, 1988 (https://arxiv.org/html/2607.13988#bib.bib14)]。如果我们可以访问一个近似的 V(s),我们就能够计算时间差分(TD)误差 δ_t = r_t + γ V(s_{t+1}) - V(s_t),这提供了每个动作的密集信用。然而,学习一个可靠的值函数在长时程智能体任务中非常困难:结果奖励稀疏,状态空间巨大且分布外,并且误差可能迅速累积。我们提出一种替代方案:不是训练一个评论家,而是使用一个冻结的参考模型 π_ref 作为稳定的探针,直接在每个工具边界估计“当前轨迹前缀使最终答案可预测的程度”。通过将参考模型对正确答案的预测性与 TD 学习相结合,我们能够在不训练任何额外模型的情况下获得密集的、与最终奖励对齐的回合级信用。
3 TRACE 方法
3.1 状态定义
假设一次运行轨迹包含 T 个工具调用回合。每个回合包括一次工具调用 a_k(由一系列助手令牌组成)和随后的观测 o_k。我们定义第 k 个回合的“状态”为观测之前的前缀:S_k = (x, a_1, o_1, …, a_k, o_k),其中 S_0 = x。每个状态 S_k 都包含工具交互历史,并且隐含地“准备好了”用于答案生成,因为模型可以在每一步生成最终答案(尽管通常只会在最后的 S_T 之后生成)。为了以与答案无关的方式衡量 S_k 的效用,我们使用参考模型 π_ref 在答案令牌上的条件对数概率(以 S_k 为条件)。给定真实正确答案 y^* = (y^_1, …, y^_{|y^|}),参考模型下一个令牌预测的负对数似然是 ℓ_k = -∑_t log π_ref(y^t|S_k, y^*{<t})。由于 ℓ_k 随着 S_k 包含更多相关信息而减少,我们可以将其视为状态“困惑度”的度量。
3.2 信用作为状态值变化
受强化学习中优势函数的启发,我们通过一个仅依赖于参考模型对正确答案的对数概率的变换来定义状态值 V(S_k)。设 d_k = ℓ_k + ε,其中 ε > 0 是小偏移量,并设置 V(S_k) = log d_0 / d_k = log (-ℓ_0 + ε) / (-ℓ_k + ε)。因此 V(S_0) = 0,并且更大的 V(S_k) 表示动作-观测历史已经闭合了初始间隙的更大“比例”。随后的一步 TD 差 V(S_{k+1}) - V(S_k) 因此衡量动作 a_{k+1} 和观测 o_{k+1} 所诱导的转移所增加的价值。
算法 1 TRACE 奖励构建与针对一个提示组的策略更新。 1: 提示 x,正确答案 y^,当前策略 π_θ,行为快照 π_old,冻结参考 π_ref,组大小 G,时间跨度 K,折扣 γ_td,偏移 ε,最终缩放 λ_term,权重 α_out, α_turn,裁剪边界 c_-, c_+ 2: 采样 G 条轨迹 {τ_g}{g=1}^G ∼ π_old(·|x),其中 τ_g = (x, a{g,1}, o_{g,1}, …, a_{g,T_g}, o_{g,T_g}, ŷ_g)。 3: 计算最终奖励 R_g = R(ŷ_g, y^) 和结果优势 A^{out}g = GroupNorm(R_g; {R_h}{h=1}^G),如果组标准差为 0 则对所有 g 返回 0。 4: 对于 g = 1,…,G 执行 5: 从 τ_g 中形成“准备好答案”的前缀 S_{g,0}, …, S_{g,T_g}。 6: 对于 k = 0,…,T_g 执行 7: ℓ_{g,k} = (1/|y^|) ∑_{t=1}^{|y^|} log π_ref(y^t|S{g,k}, y^{<t}) 8: 结束循环 9: 计算起始“距离” d{g,0} = -ℓ_{g,0} + ε,d_{g,k} = -ℓ_{g,k} + ε 10: 设置 V(S_{g,0}) = 0,对于 k ≥ 1,V(S_{g,k}) = log(d_{g,0}/d_{g,k})。 11: 对于 k = 1,…,T_g,设置 r^{turn}{g,k} = V(S{g,k}) - V(S_{g,k-1})。 12: 结束循环 13: 更新策略 π_θ 使用截断的 GRPO 目标,每个令牌使用混合优势 Â_{g,t} = α_out A^{out}g + α_turn r^{turn}{g, turn(t)}。
[此处省略了公式的详细翻译,因为原文中算法之后的数学推导已经以 LaTeX 格式给出,在翻译中应保持原样,但需要将算法描述翻译成中文。注意:在翻译结果中,我们保持了算法的伪代码结构,并将其中的英文说明翻译成了中文。]
4 实验
4.1 实验设置
训练数据集。
本工作的一个核心问题是:当唯一的可验证监督信号是最终答案正确性时,密集的回合级信用能否改善长时程工具使用。为了在受控环境中检验这个问题,我们在基于 OpenResearcher 发布的离线语料库 [Li 等人, 2026 (https://arxiv.org/html/2607.13988#bib.bib37)] 构建的合成多文档搜索任务上训练智能体。标准的跨文档问答基准往往过于简短:许多示例仅需…
相似文章
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
与您协同进步:将用户修正编译为编码代理的运行时强制
TRACE 是一个技能层管道,通过从交互式编码代理中挖掘用户修正,编译为运行时检查,在减少重复偏好违反方面显著优于仅靠记忆,这一点在 ClawArena 和 MemoryArena 任务中得到验证。
@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。