共享行为体无需共享评论家:并行强化学习中价值不匹配的影响

arXiv cs.LG 论文

摘要

本文揭示了并行强化学习中的价值不匹配现象:共享评论家会混合环境特定价值,导致性能下降。为此,提出基于环境索引条件化评论家,从而在Procgen等基准测试中提升学习稳定性和回报。

arXiv:2608.26481v1 公告类型:新 摘要:当在多个相同任务的环境中并行训练单一策略时,例如程序生成的关卡、随机动力学或课程,实现中通常使用一个共享评论家跨所有采样环境。然而,不同环境可以为评论家可见的相同输入分配不同的期望回报。没有环境信息的评论家必须协调不同的价值目标,从而系统性地改变单个环境内的采样优势。使用具有多个环境和共同最优臂的说明性多臂模型,我们描述了这种价值不匹配如何重新分配采样策略更新,强化无用动作同时削弱甚至反转有用动作。使用无基线的预言过程、共享价值或采样环境特定价值,在固定策略下具有相同的平均逻辑更新,并收敛到相同最优策略,但它们实现的学习路径可能截然不同。分析促使最小干预:仅将记录的环境索引提供给评论家,以便它能分离价值目标。受控CartPole和MuJoCo实验揭示了预测的价值偏移、优势和性能差距。在更复杂的BipedalWalker和Procgen设置中,相同干预产生更稳定学习和更高回报。在所有$16$个Procgen游戏中,多头条件评论家在每个游戏的$600$个未见关卡上改进了聚合标准化回报$40.8\%$。结论:理论识别出价值不匹配作为共享评论家退化随机学习动态的直接机制,这仅通过标量估计器方差无法捕获,实验表明条件索引在并行强化学习中广泛有效。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:40

# 共享演员无需共享评论家:并行强化学习中价值错配的影响  
来源:https://arxiv.org/html/2608.26481  
杨萌  
所属机构:芝加哥大学  
赵卓凯  
所属机构:芝加哥大学  
刘雪峰 & 陈宇欣  
所属机构:佛罗里达大学  

项目页面 (https://liu-zhenya.github.io/shared-actors-need-not-share-critics/)  
代码 (https://github.com/Liu-Zhenya/share-actor-need-not-share-critic)  

###### 摘要  
当单一策略在相同任务的多个环境中并行训练时(例如程序生成的关卡、随机化动力学或课程设置),实现通常会在所有采样环境中使用一个评论家。然而,不同的环境可能对评论家可见的同一输入分配不同的期望回报。一个缺乏环境信息的评论家必须调和这些不同的价值目标,从而系统性地改变单个环境内的采样优势。通过使用具有多个环境和共同最优臂的简化老虎机模型,我们描述了这种价值错配如何重新分配采样策略更新——强化无帮助的动作,同时削弱甚至反转有用的动作。使用无基线、共享价值或采样环境特定价值的先知过程,在固定策略下具有相同的平均逻辑值更新,并收敛到相同的最优策略,但它们实际的学习路径可能截然不同。该分析引出了一种最小化干预:仅给评论家提供一个记录的环境索引,以便它可以分离价值目标。受控的CartPole和MuJoCo实验揭示了预测的偏移值、优势和性能差距。在更复杂的BipedalWalker和Procgen设置中,同样的干预带来了更稳定的学习和更高的回报。在所有16款Procgen游戏中,多头条件评论家将每款游戏在600个未见过的关卡上的聚合归一化回报提高了40.8%。总之,该理论将价值错配确定为评论家共享可能降低随机学习动态的直接机制,而标量估计器的方差 alone 无法捕捉这一点;实验表明,在并行强化学习中,基于索引进行条件化广泛有效。  
††脚注文本:预印本。†同等指导。∗通讯作者  

## 1 引言  
策略梯度方法通过更新采样轨迹的随机策略来优化期望回报 \(J(\theta) := \mathbb{E}_{\tau \sim \pi_{\theta}}[G(\tau)]\)(Williams, 1992; Sutton and Barto, 2018)。采样更新正比于 \((G_t - B_t) \nabla_{\theta} \log \pi_{\theta}(a_t \mid s_t)\),其中 \(G_t\) 是采样回报,\(B_t\) 是一个与动作无关的基线。减去这样的基线会改变实际的更新,但在固定策略下保持其期望不变(Weaver and Tao, 2001; Greensmith et al., 2004);学习的价值函数是标准选择(Schulman et al., 2016; Schulman et al., 2017)。但训练是一个闭环过程:生成样本的策略也被该样本改变。保持期望梯度并不意味着保持在线学习过程的分布。因此,即使局部期望方向相同,随机softmax策略梯度也可能遵循截然不同的学习路径(Mei et al., 2021)。特别是,基线选择改变了采样更新的符号和激进程度,而不仅仅是方差(Chung et al., 2021; Mei et al., 2022)。  

我们研究*在一个任务内跨多个环境的并行学习*。程序化泛化(Cobbe et al., 2020)、动力学随机化(Peng et al., 2018)以及如PLR、ACCEL和PATH的关卡课程(Jiang et al., 2021; Parker-Holder et al., 2022; Liu and Chen, 2026)在学习一个必须跨环境工作的策略的同时,反复采样环境变体。因此,共享演员是目标。标准的Procgen和关卡重放实现也在采样关卡之间使用一个价值函数(Cobbe et al., 2020; Jiang et al., 2021; Raileanu and Fergus, 2021)。关键的反直觉点是*相同的任务并不意味着相同的状态价值*。令 \(S\) 表示评论家可见的输入或表示。对于固定策略 \(\pi\),定义在环境 \(z\) 中的价值为 \(V_z^{\pi}(s) := \mathbb{E}_{\pi}[G \mid S=s, Z=z]\)。一个跨环境共享但无法访问 \(Z\) 的价值函数关联于边缘化价值 \(\bar{V}^{\pi}(s) := \mathbb{E}_{\pi}[G \mid S=s] = \sum_z q_z^{\pi}(s) V_z^{\pi}(s)\),其中 \(q_z^{\pi}(s) := \mathbb{P}_{\pi}(Z=z \mid S=s)\)。因此,即使奖励规模相当,不同的动力学或时域也可能产生不同的后续价值。当 \(q_z^{\pi}(s)\) 对展开分布的依赖性明确时,我们将其省略。由此产生的环境 \(z\) 中的价值错配为 \(e_z^{\pi}(s) := V_z^{\pi}(s) - \bar{V}^{\pi}(s)\)。因此,一个共享价值可能对于评论家可用的信息是正确的,并且作为基线是无偏的,却系统性地在各个环境内对样本中心产生偏移。  

图1预览了在保留这种错配的最小设置中产生的学习动态。三个过程使用相同的共享演员和环境分布;它们仅在如何对采样回报进行中心化方面有所不同。  

图1:相同的终点,不同的采样路径。一个共享的softmax演员在两个具有共同最优臂的三臂老虎机上进行训练。面板比较了原始回报(无基线)、共享价值 \(\bar{V}^{\pi_t}\) 和采样环境的价值 \(V_{Z_t}^{\pi_t}\)。(a-c)经过 \(T=100\) 次更新后的策略及其平均轨迹。(d)在4,000对运行中的平均最优臂概率,带有一个标准差。奖励为 \((1, 0.9, 0.8)\) 和 \((0.4, 0.2, 0)\),\(q_E = q_H = 1/2\),\(\eta=2\),且 \(\pi_0 = (0.34, 0.33, 0.33)\)。命题1后来证明所有三个过程都收敛到相同的最优角落;该图揭示了仅在100次更新后它们的分离。  

仅对评论家进行条件化具有相近的架构和理论先例。AACC仅向评论家提供模拟器因子以支持在变化动力学下的适应(Yue et al., 2024),而PAMDP对双评论家进行配置文件条件化以实现角色对齐(Yang et al., 2026)。先前的理论确立了条件价值恒等式、无偏期望梯度以及对特权评论家的混叠益处(Baisero and Amato, 2022; Li et al., 2024; Lambrechts et al., 2025; Ebi et al., 2026)。我们的问题涉及一个不同的后果:当环境特定价值不同时,它们的共享边缘化如何在闭环学习路径上重新分配实际的更新?  

我们的贡献是双重的。首先,我们通过由此产生的学习动态来解释价值错配。在说明性的老虎机(图1)中,三个基线在固定策略下具有相同的期望更新和相同的渐近目标,但采样路径截然不同。我们描述了共享价值估计何时强化次优样本或削弱并反转最优样本。其次,这种解释促成了一个刻意简单的干预:仅向评论家提供一个任意的记录的环境索引,使其能够为每个环境表示不同的价值,而不改变演员。例如,受控的CartPole和MuJoCo实验展示了与机制一致的价值和优势特征,并且条件化评论家始终优于共享评论家。在更复杂的BipedalWalker和Procgen设置中,条件化也带来了显著的实证收益:两种条件化评论家设计将未见过的BipedalWalker地形上的最终平均回报从90.7(共享评论家)分别提高到155.6和190.4,并将未见过的Procgen关卡上的聚合归一化回报相对于共享评论家分别提高了21.2%和40.8%。这些结果表明,纠正价值错配在多种形式的并行环境训练中都是有用的。  

## 2 相关工作  
#### 基线的作用是什么?  
经典解释是策略梯度估计器的方差缩减(Williams, 1992; Weaver and Tao, 2001; Greensmith et al., 2004),并通过依赖于动作的控制变量和Stein控制变量进行了细化(Gu et al., 2017; Liu et al., 2018; Wu et al., 2018)。在常见基准上,Tucker et al. (2018)发现依赖于动作的学习基线并未比仅基于状态的基线减少更多方差,并将先前报道的收益追溯到实现差异。第二条研究线研究了采样和更新的耦合过程:承诺行为(Chung et al., 2021)、更新激进程度(Mei et al., 2021; Mei et al., 2022)、softmax策略梯度收敛(Mei et al., 2020; Li et al., 2021; Agarwal et al., 2021; Mei et al., 2023),以及在任何固定学习率下的REINFORCE收敛(Robertson et al., 2025)。我们的分析直接建立在此观点之上。Chung et al. (2021)在单一环境中表明,基线位置(而不仅仅是方差)控制着采样符号和承诺行为。我们展示了共享价值估计如何在跨环境时产生结构化的放置错误:一个种群价值可能在高价值环境中过低,在低价值环境中过高。这即使在使用价值基线时也重新引入了竞争性强化,并抑制了有用的样本。  

#### 多任务缩放和环境变化。  
PopArt归一化了异构价值目标,同时保留了它们未归一化的预测(van Hasselt et al., 2016)。多任务PopArt将共享策略与按任务索引的价值输出相结合(Hessel et al., 2019),使其成为共享演员而不完全共享其评论家的直接架构先例。当一个缺乏任务信息的评论家在回报规模差异很大的任务之间共享时,它必须汇集相距甚远的价值目标,使得规模异构性成为价值错配一个特别明显的来源。我们隔离了环境变化在相当奖励规模下创造不同后续价值的更微妙情况。目标归一化控制目标规模,而评论家条件化分离环境特定价值;这两种干预针对干扰的互补方面。  

#### 条件化和不对称评论家。  
条件化价值和仅评论家可用的信息是既定设计(Schaul et al., 2015; Pinto et al., 2018; Hu et al., 2024)。在部分可观测性下,Baisero and Amato (2022)确立了条件价值恒等式和无偏的不对称策略梯度;DCRL结合了一个仅使用历史的评论家和一个同时使用历史和状态的评论家来研究方差权衡(Li et al., 2024);IAAC处理一般特权信号并研究期望梯度的有效性和信息量(Ebi et al., 2026)。在有限训练时域的补充理论中,特权评论家从线性演员-评论家界限中移除了代理状态混叠项(Lambrechts et al., 2025)。这些工作解释了有效性、方差或混叠益处。我们则研究环境依赖的价值偏移如何在固定策略的期望方向不变时,重新分配实际的更新。AACC是将评论家基于环境信息条件化的直接先例:它为评论家学习连续模拟器因子的编码,并研究在变化动力学下的适应(Yue et al., 2024)。它的公式也将基于模拟器因子的条件价值与仅基于观测的边缘化联系起来。PAMDP则使用基于配置文件的双评论家条件化以实现角色对齐(Yang et al., 2026)。我们使用一个任意的类别环境索引,不涉及物理参数、排序或配置文件语义,作为价值估计上的受控干预。我们的贡献是对学习动态的补充解释:环境信息改变了相同的平均策略梯度更新在采样分支间的分布方式,从而改变了实际路径。当一个评论家预测代表具有不同未来的环境时,相同的基线可能在某些环境中促进次优样本,而在其他环境中削弱或反转最优样本。这是感知混叠的一个结构化实例(Chrisman, 1992; Singh et al., 1994);我们描述了其对采样路径的后果,并在并行强化学习基准上测试了索引干预。  

## 3 问题设置:一个策略,多个环境  
#### 具有多个环境的解释性老虎机模型。  
我们在保留依赖于环境的价值的最小模型中隔离评论家共享的影响。令 \(\mathcal{Z}\) 为有限环境集合,\(\mathcal{A}\) 为包含 \(K \geq 2\) 个臂的有限集合。在回合 \(t\),一个环境...

相似文章