到达还是解决?用检查点交接归因代理强化学习的收益

arXiv cs.AI 论文

摘要

本文介绍了检查点交接协议,用于归因代理强化学习中的收益,通过分离'到达'(到达有用状态)和'解决'(从那些状态解决),表明RL改进源自这两个组成部分。

arXiv:2609.19636v1 Announce Type: new Abstract: 强化学习现在训练语言模型代理在实时环境中执行数十个步骤。收益很大,被解读为更好的决策。闭环中的代理编写自己的输入。每个观察都源于其自身的早期动作,因此它在情节后期遇到的状态部分是由其自身造成的。SFT检查点和RL检查点然后从不同的状态进行评分,即使在相同任务上也是如此。终点成功混合了两个变化:代理到达的位置,以及它到达后所做的事情。将比较限制在两个策略都到达的状态并不能将它们分离。这种限制基于结果进行选择,在我们的数据中它翻转了效果的符号。我们引入了检查点交接,这是一种评估协议,克隆一个已发布检查点到达的状态并交给另一个检查点,无需重新训练。通过交叉SFT和RL上的到达者角色和解决者角色,将终点收益分割为到达和解决。到达是指策略到达一个状态的频率,该状态经环境确认距离成功有固定数量的步骤。解决是指它从相同克隆状态完成的频率。在两个基准测试和两个独立发布的流程中,到达者与解决者的交互在所有五种条件下都是正向的。RL历史对RL解决者来说比对SFT解决者更有价值。在ALFWorld上,RL改进了这两个方面,并且SFT解决者在RL解决者失败的情况下从未成功。独立的到达和解决差距预测了总体交互。交接仅要求一个检查点的历史可以在另一个检查点下重放,因此长期评估可以在终点成功之外报告到达和完成情况。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:22

# 到达还是解决?通过检查点移交归因智能体强化学习的收益
来源:https://arxiv.org/html/2609.19636
###### 摘要

强化学习现在训练语言模型智能体在实时环境中执行数十步操作。其收益巨大,通常被解读为决策能力的提升。闭环智能体的输入由其自身生成,每个观测都源于其先前的动作,因此在情节后期遇到的状态部分是其自身造成的。SFT检查点和RL检查点则从不同的状态进行评分,即使在相同的任务上也是如此。最终成功率混合了两个变化:智能体到达的位置,以及到达后的行动方式。将比较限制在两种策略都能到达的状态并不能分离它们。这种限制选择了结果,在我们的数据中,它甚至会改变效应的符号。我们引入了检查点移交——一种评估协议,它克隆一个已释放检查点所到达的状态,并将其交给另一个检查点,无需重新训练。通过在SFT和RL之间交叉分配到达者和求解者角色,可以将最终收益拆分为到达与求解两部分。到达表示策略到达一个状态的频率,该状态被环境确认为距离成功固定步数。求解表示从相同的克隆状态完成任务的频率。在两个基准测试和两个独立发布的流程中,在所有五种条件下,到达者与求解者的交互效应均为正。RL历史对RL求解者的价值高于对SFT求解者的价值。在ALFWorld上,RL改善了这两项,且SFT求解者从未在RL求解者失败的地方成功。独立的到达和求解差距预测了总体的交互效应。移交仅要求一个检查点的历史可以在另一个检查点下重放,因此长期评估可以报告到达情况和完成情况,而不仅仅是最终成功。

## 1 引言

语言模型智能体已迅速成为基础模型的核心应用。它们搜索、调用工具并与环境进行多轮交互(Xie等人,2024;Yao等人,2025;Shridhar等人,2021)。监督微调(SFT)通过示范来发展这些能力。AgentTuning将智能体交互轨迹与通用指令数据混合(Zeng等人,2024),而Agent-FLAN则重新设计训练语料库,将格式遵循与智能体推理分开(Chen等人,2024)。智能体强化学习(RL)则通过交互和奖励来改进策略,近期工作研究了轨迹级优化与稳定性(RAGEN)、过渡级信用分配(Agent Lightning)、逐步延长的交互时域(AgentGym-RL)以及可复用的技能库(SkillRL)(Wang等人,2025;Luo等人,2025;Xi等人,2026;Xia等人,2026)。然而,这些进展仍不清楚RL相对于SFT的收益是来自到达了更多有用的状态,还是从给定状态采取了更好的行动,亦或两者兼有。这一区分对于理解RL学到了什么以及决定改进训练或评估的哪个部分至关重要。

难点在于智能体的后续输入依赖于其先前的动作。在闭环中,动作改变环境,进而影响后续观测(Sutton和Barto,2018)。因此,SFT和RL检查点可能接收到相同的任务,但产生不同的历史,并从不同的状态被评分。在图1中,一个检查点到达了装有生牛肉的错误柜子,而另一个已经烹饪好并放置了牛肉。我们称之为评估输入的策略依赖性——即内生状态问题。最终比较同时改变了到达的状态和从这些状态采取的动作,使得收益的来源无法确定。

参考标题图1:内生状态问题。两个检查点接收同一任务并行动。它们的早期动作使它们处于不同的状态,然后每个检查点都从其产生的状态被评分。有几种评估方法族关注最终结果内部。进度评估器对子目标完成度打分,过程评估器评估中间决策和程序合规性,代理状态方法验证工具调用后留下的环境状态(Ma等人,2024;Gritta等人,2026;Chuang等人,2026)。探索分析衡量进入有用区域的情况,而失败诊断则将能力变得可行使之前和之后的错误分开(Ye等人,2026;Ji等人,2026;Shao等人,2026)。因果分解进一步将结果归因于动作、转移或感知(Triantafyllou等人,2025;Wang等人,2026a)。这些方法提供了检查点已实现运行轨迹的有用描述,但它们并未揭示另一个检查点在相同状态和历史下会如何继续。筛选到已到达的状态也需要谨慎,因为到达同时取决于策略和任务难度。在这种策略依赖性选择之后比较后续分数,可能会混合求解者能力和幸存任务的难度,引入选择偏差(Hernán等人,2004)。进一步限制到两种策略都到达的任务,会丢弃仅一方到达子目标的情况,并将目标从所有任务更改为选定的子集。即使在共享的任务中,到达相同的子目标也未必产生相同的历史或预算。因此,归因整体收益需要在保持非到达情况在总体层比较的同时,从相同状态比较求解者。

为了解决这一归因差距,我们提出了检查点移交,它干预谁从某个状态继续。因为早期动作决定智能体到达的位置,而后期动作决定它是否完成,我们分配了独立的到达者和求解者角色。到达者产生状态分布,求解者在固定状态下行动。我们在{SFT, RL}×{SFT, RL}中交叉这些角色,无需重新训练。在经环境验证的前沿,我们克隆环境、历史和剩余预算,让两个求解者从相同的输入继续。到达衡量到达频率,而求解衡量在到达的条件下完成任务的频率。未到达的情况在最终总体的端点比较中仍然是失败。这种干预在已发布的检查点上分离了策略诱导的状态访问与状态条件价值(Kakade和Langford,2002)。然后在分离的数据上测量的轮廓检验两个组成部分如何预测从SFT到RL的求解者收益对到达者的依赖。

我们在TravelPlanner和ALFWorld上研究来自两个独立训练流程的SFT/RL检查点对。我们围绕三个问题组织比较。RQ1询问将求解者从SFT切换到RL的增益是否取决于到达者是SFT还是RL。RQ2询问RL相对于SFT的优势是来自更频繁地到达可求解的前沿、从相同状态更好地求解,还是两者兼有。RQ3询问独立测量的SFT/RL在到达和求解上的差异是否预测RQ1中识别的求解者收益对到达者的依赖。

本文有三项贡献。
- •我们通过将最终成功分解为状态访问和状态条件价值,刻画了闭环智能体的内生状态问题,并表明在已发布的检查点上,无论是最终比较还是筛选到已到达的状态,都无法归因RL的收益。
- •我们提出了检查点移交,它无需重新训练,即可在已发布的检查点上使用经环境验证的前沿、克隆状态继续和基于独立到达与求解差距的预测,将到达与求解分离。
- •在两个基准测试和两个训练流程上的实验表明,在所有条件下到达者与求解者的交互效应均为正,且在ALFWorld上的精确重放定位了RL收益同时存在于两个组成部分。

## 2 内生状态问题

### 2.1 设置与待估量

设一个任务T从概率分布p_T中抽取。在步骤t,令x_t为环境配置,o_t为观测,a_t为动作,h_t=(o_0, a_0, ..., a_{t-1}, o_t)为可见历史,b_t为剩余动作预算。我们称
Σ_t = (T, x_t, h_t, b_t) ∈ S (1)
为评估状态:对情节剩余部分进行评分的输入。检查点只能看到h_t;具备重放能力的评估器还保留x_t。情节在步骤t_term结束,通过提交、终止或预算耗尽,任务验证器g_T: S → {0,1}对最终结果Y = g_T(Σ_term)进行评分,其中Σ_term = Σ_{t_term}。令C={SFT, RL}索引已发布的检查点及其在任何可见历史h上诱导的策略π_c(a|h),c∈C。解码是固定的,因此我们干预c并读取π_c的结果。对于固定状态σ∈S和随机继续种子,令Y(R; σ) ∈ {0,1}为检查点R∈C从σ继续到终止时的潜在最终结果,基于潜在结果的概念(Rubin,1974);其均值V_R(σ) = Pr(Y(R; σ)=1)是继续价值,仅取决于状态和求解者。对于固定的移交分布,求解者性能是其平均继续价值。

我们将移交规则定义为从到达者轨迹到截断点τ的预定映射,该映射独立于求解者分配和继续结果选择。单独运行W∈C直到τ,会诱导出Σ_τ上的分布d_W^τ,我们让第二个检查点R继续。到达者W设定测度,求解者R设定被积函数,
J_τ(W, R) = E_{Σ∼d_W^τ} [V_R(Σ)]. (2)
W=R的分配提供同检查点控制;W≠R的分配在移交点切换检查点。

#### 归因问题。

对角线控制运行一个检查点并承担两个角色,报告J_τ(c,c)。将J记为J_τ,那么RL收益可以拆分为到达项和求解项,沿着两条路径,基于性能差异引理相同的逐项相消法(Kakade和Langford,2002):
J(RL, RL) - J(SFT, SFT) = 
    \underbrace{J(RL, RL) - J(SFT, RL)}_{\text{在RL求解者下的到达}} + 
    \underbrace{J(SFT, RL) - J(SFT, SFT)}_{\text{在SFT状态上的求解}}
= 
    \underbrace{J(RL, SFT) - J(SFT, SFT)}_{\text{在SFT求解者下的到达}} + 
    \underbrace{J(RL, RL) - J(RL, SFT)}_{\text{在RL状态上的求解}}. (3)
右边每一项都是一个交叉分配,其中一个检查点从另一个产生的状态继续。最终评估只观察到J_τ(c,c),因此它混淆了d_W^τ和V_R;两条路径因此可能不一致。三个研究问题直接随之而来:RQ1在测量求解者收益的同时改变到达者,RQ2将RL的优势归因于到达和求解,RQ3检验下面的交互预测。

### 2.2 最终比较同时改变两个因素

等式3左边的同检查点对比同时改变了测度和被积函数,因此它无法将差异归因于其中任何一个。转而评估所有四个分配,则得到一个二乘二因子设计的风险差异交互项(VanderWeele,2015),
I_τ = [J_τ(RL, RL) - J_τ(RL, SFT)] - [J_τ(SFT, RL) - J_τ(SFT, SFT)]. (4)
I_τ是等式3中两个求解项之间的差异,同样也是两个到达项之间的差异。正的I_τ意味着RL求解者的优势在RL到达者产生的状态上更大:两个角色是耦合的,两条路径意见不一。它并不说明收益有多少落在每个部分。

### 2.3 到达在成功之前早已出现分歧

图2:按到达者动作到达F2。ALFWorld未见集,每个检查点120条成对轨迹。图2显示两个检查点在第三个到达者动作时就已经出现分歧;到预算结束时,RL到达可求解前沿的次数大约是SFT的六倍。曲线记录了环境成员资格是否属于F2,即距离成功恰好两个有效动作且有足够预算完成它们的状态集合(一般的F_D定义见第3.1节)。这个验证过的前沿为第3节中的求解者比较提供了共同边界。最终成功仍然混合了到达和完成,而仅基于已到达状态的条件会改变目标人群;第2.4节和附录C量化了由此产生的选择效应和预算效应。

### 2.4 仅保留已到达的状态改变了待估量

图3:两种待估量下的I_τ。相同的ALFWorld未见集情节,两种评分方式;95%配对自助法。图3在两种不同的待估量下评估相同的ALFWorld情节。总体待估量保留每个初始情节。一个到达者从未到达的情节没有继续状态,因此计为失败。这个量结合了到达者到达的频率和求解者到达后的行为。仅已到达状态的待估量以到达者已经到达为条件,并仅在该到达者实际产生的状态上取平均。因此它衡量的是

相似文章

AgentV-RL:用智能体验证器扩展奖励建模

arXiv cs.CL

AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。