面向长期LLM智能体强化学习的粒度自适应信用分配
摘要
本文提出了GACA,一种粒度自适应的信用分配方法,用于长期LLM智能体强化学习,通过适应分辨率到步骤重要性来提高任务成功率。
arXiv:2609.12424v1 公告类型:新
摘要:强化学习现在是训练大型语言模型智能体在长期任务上的标准方式,其中数十个相互依赖的行动先于一个稀疏奖励。无评论家的、组相对的方法,如GRPO,适合这种情形,但它们将轨迹级别的标量广播到每个步骤,并不能说出哪个决策驱动了结果。GiGPO通过共享锚点状态的时间分组来恢复步骤级别的信号,但它在固定权重下合并了步骤和情节级别的估计,对关键的分支决策和常规的、近乎确定性的转换使用相同的分辨率。我们认为正确的分辨率是状态相关的,并提出了GACA,一种无评论家的估计器,其粒度基于不确定性的临界性代理。GACA通过每个步骤自身的 rollout 已经记录的负对数似然来评分每个步骤,然后用一个与该分数成比例的权重混合两个优势,使得梯度在平均以上的NLL上放置更多权重在细粒度信号上,在平均以下的NLL上放置更多权重在情节级别信号上。我们为实现的混合推导了精确的风险分解,并证明在正向方向对齐下,足够小的调制改进了固定混合。一个单独的条件结果用预期NLL界定了本地动作值变化,而误差投影分析表征了何时混合增加价值超出标量不确定性重加权。在ALFWorld和WebShop上,GACA在1.5B和7B规模上改进了任务成功率 over GRPO和GiGPO。
查看缓存全文
缓存时间: 2026/09/14 08:44
# 面向长期LLM智能体强化学习的粒度自适应信用分配
来源:https://arxiv.org/html/2609.12424
梁涛然、刘洋、罗翔、杨迎光
张蓉蓉、闵应宗、黄宇林、张建深
**单位:** 南开大学、北京大学、京东供应链技术团队Y
齐永志、徐可夫、冉丛敬、丛斌
**单位:** 南开大学、北京大学、京东供应链技术团队Y
**单位:** 上海唯捷创芯科技有限公司、武汉大学
\*同等贡献
†通讯作者
###### 摘要
强化学习现已成为训练大型语言模型智能体处理长期任务的主流方法,这类任务通常在获得单一稀疏奖励前需要执行数十个相互依赖的动作。无评论家、群体相对的方法(如GRPO)适用于此场景,但其将单个轨迹级标量广播至每个步骤,无法分辨哪个决策驱动了结果。GiGPO通过聚合共享锚点状态的时间步恢复了步骤级信号,却将步骤级与回合级估计以固定权重混合,导致关键决策分支点与常规近确定性转移获得相同分辨率。我们认为合适的分辨率应取决于状态属性,并提出GACA——一种无评论家估计器,其粒度随各步骤的关键程度动态调整。GACA通过每个步骤自身 rollout 记录的负对数似然进行评分,随后以随该分数增长的逐步骤权重混合两种优势值,使梯度在策略不确定区域跟随细粒度信号,在置信区域采用低方差信号。我们证明:更高的锚点条件期望NLL可保证局部动作值方差具有更大下界,进而保证误差最优步骤权重的更大下界;且当各状态的最优权重存在差异时,状态自适应混合严格优于任何固定权重。在ALFWorld和WebShop环境中,GACA在1.5B与7B规模下均较GRPO和GiGPO提升任务成功率。
## 1 引言
大型语言模型正日益被部署为*智能体*——在环境中持续执行多步骤操作:导航模拟家庭完成家务、浏览网店购买目标商品或调用工具满足用户请求(Yao等,2022b;Shridhar等,2020;Yao等,2022a)。强化学习(RL)是超越模仿学习、提升此类智能体性能的主要手段(Ouyang等,2022;Guo等,2025)。在此设定中,智能体生成文本动作序列,仅在任务成功或失败后获得单一稀疏奖励。无评论家、群体相对的策略梯度方法(如GRPO)尤其适用:它们用基于同一任务多次rollout的群体基线替代学习得到的价值函数,避免了在长词元序列上训练评论家的成本与不稳定性(Schulman等,2017;Ahmadian等,2024)。然而,*信用分配*仍然困难:当跨越数十步的任务失败时,学习信号应指向导致该结果的决策,而非均匀分布于整个轨迹(Sutton等,1998;Arjona-Medina等,2019)。标准GRPO未进行此类分配,它将单个群体相对标量赋给整个轨迹并广播至每个词元,导致关键早期选择与常规后期步骤获得相同信用。GiGPO(Feng等,2026)恢复了*步骤级*优势:它将群体rollout中共享同一环境状态(“锚点状态”)的时间步分组,在每个步骤组内计算群体相对优势,并将此步骤级信号与回合级信号结合,且不增加rollout成本。这是个强劲的基线,但其粒度是*均匀的*:每个步骤获得自身的步骤级优势,且两级以固定权重组合,无论该步骤多关键。长期轨迹并非如此均匀:少数步骤是真正的决策点(策略不确定且选择影响结果),而多数是近确定性延续(如走向已选对象或滚动无关列表)。常规步骤的步骤级优势多为估计噪声,固定权重以全强度将该噪声输入梯度,却在最需细粒度信号处利用不足。这种不对称性在更低层次已被记录:在LLM推理强化学习中,少量高熵词元驱动了大部分策略改进(Wang等,2026;Cui等,2025)。我们认为,信用分配的合适分辨率是状态的属性,而非全局常量。基于此观察行动成本低廉,因为策略已揭示其不确定处。我们提出GACA(粒度自适应信用分配),一种无评论家的优势估计器,它通过rollout采样动作的平均词元负对数似然(NLL)对每个步骤评分(该量通常已被记录),并以随该分数增长的逐步骤系数混合步骤级与回合级优势。粒度因此通过每步单个标量连续变化,无需离散区间划分、无需评论家、且无需额外环境交互;关闭调制后GACA即退化为它所泛化的固定两级估计器。我们的分析阐明了此决策合理的条件:更高的锚点条件期望NLL保证了群体规范动作分歧度具有更大下界,进而保证局部动作值方差及均方误差最优步骤权重的更大下界;且当各状态的最优权重存在差异时,按状态自适应该权重严格优于任何固定选择。经验上,在采用Qwen2.5主干网络的ALFWorld与WebShop环境中(1.5B与7B规模),GACA相较GRPO和GiGPO提升了任务成功率;消融实验网格在单一协议下训练和选择每个变体,将增益归因于关键度自适应粒度,而非更优的常数调优。
## 2 预备知识
### 2.1 作为序列决策过程的长期LLM智能体
在步骤\(t\),智能体观察文本状态\(s_t\)(任务指令、累积交互历史与当前观测),并采样动作\(a_t \sim \pi_\theta(\cdot \mid s_t)\),其中\(a_t = (a_t^1, \dots, a_t^{|a_t|})\)是通过自回归生成的词元序列。环境返回\(s_{t+1}\)与奖励\(r_t\),回合在\(T\)步后终止。对于轨迹\(\tau = (s_1, a_1, \dots, s_T, a_T)\),奖励稀疏:\(r_T\)是成功指标\(\{0, 1\}\),而中间\(r_t\)除无效动作的小惩罚外均为零,因此回报\(R(\tau) = \sum_t r_t\)至多为1,失败轨迹上可为负。我们记折扣步骤回报为\(\hat{g}_t = \sum_{t' \geq t} \gamma^{t' - t} r_{t'}\)。训练采用群体rollout协议:每个任务智能体采样\(G\)条轨迹,作为后续群体相对归一化的单元。优势按步骤分配并由该步骤所有词元共享,因此当\(\rho_{t,j} = \exp(\log \pi_\theta(a_t^j \mid s_t, a_t^{<j}) - \log \pi_{\theta_{\text{old}}}(a_t^j \mid s_t, a_t^{<j}))\)时,词元级优势通过截断代理\(A_t^{\text{GACA}} = \sum_j \min(\rho_{t,j}, 1 - \epsilon, 1 + \epsilon) \cdot A_t^{\text{GACA}}\)应用于式(1)(即截断策略梯度)。
### 2.2 步骤级与回合级优势
群体相对策略梯度(如GRPO)的核心思想是:对给定任务,从群体中所有轨迹的总奖励中减去群体均值,为每个词元计算归一化优势。这消除了学习评论家的需求,但将单一标量广播至所有步骤。对于步骤级信号,我们采用GiGPO的锚点状态分组:对于状态\(s\),步骤组\(\mathcal{G}_s\)包含所有在锚点状态\(s\)处采取的动作。该组内的步骤级优势计算为\(A_t^{\text{S}} = \frac{r_{\tau, \text{total}} - \mu_s}{\sigma_s}\)(在组内归一化),其中\(\mu_s\)和\(\sigma_s\)是组内回报的均值和标准差。回合级优势则对整个轨迹进行归一化:\(A^{\text{E}} = \frac{R(\tau) - \mu_{\text{task}}}{\sigma_{\text{task}}}\)。GiGPO将两者结合为\(A_t^{\text{GiGPO}} = w A_t^{\text{S}} + A^{\text{E}}\),其中\(w\)是固定权重。
## 3 方法:粒度自适应信用分配
### 3.1 关键度评分:不确定性作为信号
我们使用每步骤平均词元负对数似然(NLL)作为不确定性的代理:
\[ H_t = -\frac{1}{|a_t|} \sum_j \log \pi_\theta(a_t^j \mid s_t, a_t^{<j}) \]
在rollout中,\(H_t\)直接从记录的词元对数概率中计算。高NLL表示策略在此步骤更不确定。为归一化,我们计算轨迹平均\(\bar{H} = \frac{1}{T} \sum_t H_t\),并定义临界度分数:
\[ c_t = \frac{H_t}{\bar{H}} \]
当\(c_t > 1\)时,标记该步骤策略不确定性高于轨迹通常水平。该分数从不被阈值化为离散“关键”步骤集:每个步骤保留自身的步骤级优势,\(c_t\)仅通过3.2节的混合权重发挥作用,因此对细粒度信号的依赖随不确定性平滑变化。
熵定位了策略*犹豫*的步骤,但这与*重要*步骤不完全相同:若返回值在此移动,步骤即使被自信地采取也可能是关键。因此我们允许分数与奖励变化项融合。记\(\Delta_t = |\hat{g}_t - \hat{g}_{t-1}|\)为步骤回报的绝对变化,并将两个信号按其轨迹均值归一化:\(\hat{e}_t = H_t / \bar{H}\)与\(\hat{d}_t = \Delta_t / \bar{\Delta}\),则融合分数为:
\[ \text{score}_t = \alpha_c \hat{e}_t + (1 - \alpha_c) \hat{d}_t, \quad \alpha_c \in [0,1] \]
且式(5)的归一化应用于\(\text{score}_t\)代替\(H_t\)。设\(\alpha_c = 1\)恢复纯熵检测器,这是我们的默认选择,且如4.3节所示,在这些基准测试上已能承载信号。
### 3.2 逐步骤自适应混合
最终优势以临界度分数调制的系数在两级间插值。从基础权重\(\lambda_0 \in [0,1]\)出发:
\[ \lambda_t =
\begin{cases}
\min\left\{\lambda_0 \left[1 + \alpha_\lambda (c_t - 1)\right], 1\right\}, & c_t \geq 1 \\
\max\left\{\lambda_0 \left[1 - \beta_\lambda (1 - c_t)\right], 0\right\}, & c_t < 1
\end{cases}
\]
其中\(\alpha_\lambda \geq 0\)设定权重在高于平均不确定性时上推的幅度,\(\beta_\lambda \geq 0\)设定在低于平均时下拉的幅度。两分支在\(c_t = 1\)处相接(此时\(\lambda_t = \lambda_0\)),因此该律连续、在\(c_t\)上非递减,且限幅至\([0,1]\)(图1的(c)面板;附录C的图3为其三种调制强度的绘制)。达到代理函数的优势为:
\[ A_t^{\text{GACA}} = \lambda_t w A_t^{\text{S}} + (1 - \lambda_t) A^{\text{E}} \]
其中\(w\)是从2.2节继承的步骤优势权重,通过响应掩码广播至\(a_t\)的词元。两个分量均减去群体均值基线,且\(\lambda_t\)在更新内固定(因其由旧策略量计算)。然而,它并非独立于所采取动作:\(H_t\)读取rollout采样的动作,因此更新并非策略梯度的无偏重缩放;且由于\(\lambda_t\)随\(H_t\)增长,该规则恰在不太可能的动作上倾斜向步骤级估计器。我们视此为有意的、与不确定性相关的重加权,而非无偏估计器;附录B.4给出了通过锚点组留一平均对步骤评分的去偏变体,以组内分辨率为代价换取动作独立性。
关闭调制(\(\alpha_\lambda = \beta_\lambda = 0\))将\(\lambda_t\)冻结在\(\lambda_0\),保留固定两级估计器;当\(\lambda_0 = \frac{1}{2}\)时,此即GiGPO的组合\(\frac{1}{2}(w A_t^{\text{S}} + A^{\text{E}})\),而极端情况\(\lambda_0 \in \{0, 1\}\)分别为纯回合级和纯步骤级信用。将组合写为凸组合而非求和是刻意的:它使优势幅度在\(\lambda_t\)变动时受两个分量约束,这很重要,因为该幅度也决定步骤在式(1)中被截断的频率。
算法1显示GACA仅替换标准GRPO或GiGPO循环中的优势步骤。
**算法 1 GACA优势计算(单优化步骤)**
1: 群体rollout \(\{\tau_i\}_{i=1}^G\),含回报、步骤回报\(\hat{g}_t\)、锚点状态、词元级对数概率;超参数\(\alpha_c, \lambda_0, \alpha_\lambda, \beta_\lambda, w\)
2: 通过群体标准化计算回合优势\(A^{\text{E}}\) ▹ 式(2)
3: 构建锚点状态步骤组;计算步骤优势\(A_t^{\text{S}}\),含单例回退 ▹ 式(3)
4: 从记录的词元对数概率计算逐步骤NLL代理\(H_t\) ▹ 式(4)
5: 对每条轨迹\(\tau\)执行
6: 构建临界度分数\(c_t\),可选奖励门控 ▹ 式(5,6)
7: 由\(c_t\)设置逐步骤混合权重\(\lambda_t\) ▹ 式(7)
8: 结束循环
9: 对所有\(t\),令\(A_t^{\text{GACA}} \leftarrow \lambda_t w A_t^{\text{S}} + (1 - \lambda_t) A^{\text{E}}\) ▹ 式(8)
10: 返回\(\{A_t^{\text{GACA}}\}\)用于截断代理函数式(1)
### 3.3 为何不确定性是正确的控制信号
该设计基于三环链:策略NLL高处,其在该决策上下文实际采取的动作分歧更大;分歧更大处,局部动作值分布更广;局部动作值分布更广处,回合级估计器(无法区分分支的单个标量)是两者中较不可靠的,因此最优权重应倾斜向步骤级。我们在下文精确化每个环节,陈述两个重要结果,并将假设、完整混合命题及所有证明留至附录B。
固定一个非单例锚点状态组\(\mathcal{G}_z\),大小\(m_z \geq 2\)。在访问\(i\)处,旧策略从上下文\(S_i\)采样长度为\(L_i\)的文本动作\(X_i\),环境将其规范化为有限动作集\(\mathcal{A}_z\)中\(K_z\)个允许动作之一\(U_i = \phi(X_i)\)。记:
\[
\ell_i = -\frac{1}{L_i} \log \pi_{\theta_{\text{old}}}(X_i \mid S_i), \quad h_z = \mathbb{E}[\ell_i \mid Z_i = z], \quad D_z = \Pr(U \neq U' \mid Z = z), \quad C_z = \mathrm{Var}_{U \sim p_z}\left[Q_z(U)\right], \quad Q_z(u) = \mathbb{E}[\hat{g} \mid Z = z, U = u]
\]
其中\(Z\)表示锚点状态索引。我们有:
**命题1(NLL界定动作分歧)** 对任何非单例锚点组,\(D_z \geq 1 - \exp\left(-\frac{h_z - \log K_z}{1 - 1/K_z}\right)\)。
直觉:高平均NLL (\(h_z\))意味着策略在组内动作上分配的概率质量低且分散,因此实际采样的动作在不同rollout中分歧更大。
**命题2(分歧界定局部动作值方差)** 对任何有限动作集,\(C_z \geq \frac{D_z}{2} \cdot \Delta_z^2\),其中\(\Delta_z = \max_{u, u'} |Q_z(u) - Q_z(u')|\)。
直觉:动作分歧越大,对应动作值的差异可能越显著,从而局部动作值方差下界越高。
**主要定理(自适应权重的主导性)** 假设对于两个状态\(z_1, z_2\),其最优步骤权重\(\lambda_{z_1}^* \neq \lambda_{z_2}^*\)。则存在\(\alpha_\lambda, \beta_\lambda > 0\)使得状态自适应权重\(\lambda_t\)(由临界度分数驱动)的期望误差严格小于任何固定权重\(\lambda\)的期望误差。
证明思路:通过命题1与2,高\(H_t\)保证了高局部动作值方差,进而保证了步骤级估计器的相对可靠性;因此最优权重应依赖于\(H_t\)。自适应权重通过\(c_t\)(即\(H_t\)的归一化)实现此依赖,而固定权重无法。
## 4 实验
我们评估GACA在两个长期LLM智能体基准测试上的表现:ALFWorld(文本游戏环境)和WebShop(真实网站导航)。我们使用Qwen2.5基座模型(1.5B与7B参数)并在相同训练协议下比较GRPO、GiGPO与GACA。
### 4.1 设置
**环境与任务**:ALFWorld包含6类任务(如找物体、清洁),需7-12步完成;WebShop需导航网站、搜索并购买商品,平均交互约12步。两者均提供稀疏成功奖励(1或0)及无效动作小惩罚。
**基线**:GRPO(群体相对策略优化)、GiGPO(锚点状态分组的步骤级GRPO)。
**实现细节**:所有方法使用相同超参数(群体大小\(G=16\)、折扣因子\(\gamma=0.99\)、裁剪参数\(\epsilon=0.2\))。GACA特有参数:\(\alpha_c=1\)(纯熵)、\(\lambda_0=0.5\)、\(\alpha_\lambda=\beta_\lambda=2.0\)。训练采用与先前工作相同的强化学习循环,每任务采样轨迹、计算优势、更新策略。
### 4.2 主要结果
**表1:任务成功率(%)**
| 模型 | ALFWorld | WebShop |
|------|----------|---------|
| GRPO 1.5B | 62.3 | 28.7 |
| GiGPO 1.5B | 67.8 | 31.2 |
| **GACA 1.5B** | **71.5** | **34.8** |
| GRPO 7B | 74.1 | 41.5 |
| GiGPO 7B | 78.6 | 45.3 |
| **GACA 7B** | **82.3** | **49.7** |
GACA在两种规模与两个环境中均显著优于基线,且增益在更难任务(如WebShop)上更明显。
### 4.3 消融与分析
**表2:GACA消融(ALFWorld 7B成功率%)**
| 变体 | 成功率 |
|------|--------|
| GACA (完整) | 82.3 |
| \(\alpha_c=0\) (仅奖励变化) | 79.1 |
| \(\alpha_c=1\) (纯熵,本文默认) | 82.0 |
| \(\lambda_t\)固定 (\(\lambda_0=0.5\)) | 78.4 (≈GiGPO) |
| \(\lambda_0=0\) (纯步骤级) | 77.5 |
| \(\lambda_0=1\) (纯回合级) | 73.2 |
**关键发现**:
1. 自适应混合(完整GACA)优于所有固定权重变体,验证了状态自适应的价值。
2. 纯熵分数(\(\alpha_c=1\))效果最佳,表明不确定性是比奖励变化更直接的关键度信号。
3. 关闭调制(\(\lambda_t\)固定)退化为GiGPO,证实GACA是GiGPO的泛化。
**图2:混合权重\(\lambda_t\)随临界度\(c_t\)的变化**
- 当\(c_t > 1\)(高不确定性),\(\lambda_t\)增大,更多依赖步骤级信号。
- 当\(c_t < 1\)(低不确定性),\(\lambda_t\)减小,更多依赖回合级信号。
这符合理论预期:不确定步骤需细粒度信用分配,而确定步骤可用粗糙信号。
### 4.4 讨论
GACA的性能增益源于其粒度自适应性:在关键决策点(高不确定性),它增加步骤级信号的权重,使信用精确归因于关键动作;在常规步骤,它抑制噪声,避免干扰梯度。这种自适应性无需额外环境交互或评论家,仅利用策略自身的不确定性度量,计算成本与GiGPO相当。
## 5 结论
我们提出GACA,一种用于长期LLM智能体强化学习的粒度自适应信用分配方法。GACA通过不确定性(以NLL度量)动态调整步骤级与回合级优势的混合权重,使信用分配分辨率适应状态的关键度。理论分析证明此自适应在动作值方差变化时优于固定分配;实验证明在ALFWorld与WebShop上,GACA显著提升任务成功率。未来工作可探索将GACA扩展至连续动作空间或与评论家方法结合。
## 参考文献
(参考文献列表保持原文格式不变)相似文章
从环境反馈中学习:面向智能体强化学习的多时间尺度信用分配
本文介绍了EFCA,一种面向智能体强化学习的多时间尺度信用分配方法,利用环境交互中的短期反馈和中期状态历史信号,在ALFWorld和WebShop上提升任务成功率和任务质量。
Memory-R2: 面向长程记忆增强型LLM代理的公平信用分配
Memory-R2 引入了 LoGo-GRPO,这是一种结合了局部与全局分组相对优化的训练框架,为长程记忆增强型LLM代理提供更公平的信用分配,从而在多种骨干网络上提升准确率和推理延迟。
DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配
本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。
SLCA-GRPO: 解决工具调用强化学习中的跨段信用分配错误
SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。
ARCA:令牌信号退化时的适配器残差信用分配
本文指出了在使用LoRA进行LLM强化学习时,令牌级信用分配中存在的一种结构性失效模式,即内在信号退化。它提出了适配器残差信用分配(ARCA),该方法从适配器的隐藏状态残差中推导令牌显著性,并与基线方法保持竞争力。