使用悲观评论家的协作加权方法缓解离策略强化学习中的过估计

arXiv cs.LG 论文

摘要

提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。

arXiv:2607.26509v1 Announce Type: new 摘要:用于连续控制的深度离策略强化学习算法通常依赖神经值函数逼近来指导策略改进。然而,时序差分(TD)学习引入了噪声目标,导致非平稳优化,而贪婪策略更新会放大早期估计误差。这类误差的递归传播会导致演员-评论家方法中出现持续的过估计偏差和训练稳定性下降。现有方法尝试通过优先采样或修改值学习目标来缓解该问题,但往往过度强调由有限数据覆盖或自举误差引起的高不确定性转移,从而进一步放大偏差。在本文中,我们提出了协作加权演员-评论家(CWAC),这是一个统一框架,明确考虑了值估计中的预测不确定性。CWAC采用分布式评论家对回报不确定性进行建模,并引入了一种协作加权机制,该机制联合重新加权TD误差和不确定性,从而在抑制噪声更新的同时从可靠样本中实现鲁棒学习。此外,我们通过从回报分布中采样,引入了一种随机悲观值估计方案,该方案有效缓解了策略改进过程中的误差传播。CWAC可以无缝集成到现有的离策略算法框架中,如SAC、TD3和DDPG,且开销极小。实验结果表明,我们提出的方法在各种模拟任务中显著提升了性能。我们的代码公开在https://anonymous.4open.science/r/CWAC-348E。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 利用悲观评论家的协作加权方法缓解离策略强化学习中的过高估计  
来源:https://arxiv.org/html/2607.26509  

###### 摘要  

面向连续控制的深度离策略强化学习算法通常依赖神经价值函数近似来指导策略改进。然而,时序差分学习引入的噪声目标会导致非平稳优化,而贪婪策略更新则会放大早期估计误差。这种误差的递归传播会在演员-评论家方法中引发持续的过高估计偏差,并降低训练稳定性。现有方法尝试通过优先级采样或修改价值学习目标来缓解此问题,但往往过度强调因数据覆盖不足或自举误差导致的高不确定性迁移,从而进一步放大偏差。本文提出协作加权演员-评论家(CWAC)——一个统一框架,明确考虑价值估计中的预测不确定性。CWAC 采用分布评论家建模回报不确定性,并引入协作加权机制,联合重新加权时序差分误差和不确定性,从而从可靠样本中实现稳健学习,同时抑制噪声更新。此外,我们通过从回报分布中采样来实现随机悲观价值估计方案,有效缓解策略改进过程中的误差传播。CWAC 可以无缝集成到现有离策略算法框架(如 SAC、TD3 和 DDPG)中,且开销极小。实验结果表明,我们提出的方法在多种模拟任务上显著提升了性能。  

###### 关键词:离策略强化学习、贪婪策略更新、随机悲观价值估计、协作加权机制  

††期刊:Knowledge-Based Systems  
\csdef WGMwgm  
\csdef QEqe  
\csdef EPep  
\csdef PMSpms  
\csdef BECbec  
\csdef DEde  

\affiliation [1]组织=同济大学计算机科学与技术学院,邮编=200092,城市=上海,国家=中国  
\affiliation [2]组织=上海工程技术大学,邮编=201620,城市=上海,国家=中国  

## 1 引言  

离策略强化学习算法具有高样本效率,已被广泛应用于机器人控制[36](https://arxiv.org/html/2607.26509#bib.bib10),[17](https://arxiv.org/html/2607.26509#bib.bib9)、自动驾驶[29](https://arxiv.org/html/2607.26509#bib.bib8),[37](https://arxiv.org/html/2607.26509#bib.bib7)和工业调度[19](https://arxiv.org/html/2607.26509#bib.bib6),[24](https://arxiv.org/html/2607.26509#bib.bib5),[14](https://arxiv.org/html/2607.26509#bib.bib4)等领域。这些方法利用从经验回放缓冲区重用的经验,通过 Q 函数估计长期折扣回报。现代演员-评论家框架[12](https://arxiv.org/html/2607.26509#bib.bib88),[7](https://arxiv.org/html/2607.26509#bib.bib1)使用深度神经网络参数化这些 Q 函数,并通过时序差分学习[32](https://arxiv.org/html/2607.26509#bib.bib3)进行优化。离策略强化学习的一个关键挑战是:近似时序差分目标带来的弱学习信号,以及自举过程中估计误差的传播和放大。如图1所示,贪婪算子 \(\max_{a}Q^{k}(s,a)\) 天生倾向于选择带有正估计噪声的动作。这种选择偏差会放大早期估计误差,引发自我强化的反馈循环,导致系统性过高估计并破坏训练稳定性。  

参见图注  

**图1:** 离策略强化学习中两个基本挑战的示意图:(a) Q 函数估计中的近似误差,(b) 贪婪策略改进引起的误差放大。这里 \(Q^{k}\) 和 \(Q^{k+1}\) 分别表示第 \(k\) 次和第 \(k+1\) 次训练迭代时的价值估计。\(G^{\pi}(s,a)\) 表示策略 \(\pi\) 下的真实动作价值函数,由标准无限水平折扣回报定义为 \(G^{\pi}(s,a) = \mathbb{E}_{a \sim \pi_{\phi}} \left[ \sum_{t=0}^{\infty} \gamma^{t} \mathcal{R}(s,a) \mid s_{0}=s, a_{0}=a \right]\)。  

现有方法通常从两个角度处理此问题:悲观价值估计和自适应样本加权。悲观方法[4](https://arxiv.org/html/2607.26509#bib.bib184),[23](https://arxiv.org/html/2607.26509#bib.bib179),[34](https://arxiv.org/html/2607.26509#bib.bib120)通过对高不确定性动作施加惩罚来缓解过高估计。虽然适度的悲观可以奏效,但在线环境中过度保守可能会阻碍探索,导致次优性能[16](https://arxiv.org/html/2607.26509#bib.bib41),[30](https://arxiv.org/html/2607.26509#bib.bib27)。另一方面,自适应样本加权方法强调具有大时序差分误差的迁移[28](https://arxiv.org/html/2607.26509#bib.bib186),[8](https://arxiv.org/html/2607.26509#bib.bib11),[40](https://arxiv.org/html/2607.26509#bib.bib116)。然而,此类信号往往与不确定性混杂,可能放大噪声交互并在训练中引入有偏更新。  

为了应对这些挑战,我们首先引入一种基于分布评论家的轻量级不确定性建模方法,从回报分布中估计预测不确定性。在此基础上,提出协作加权演员-评论家(CWAC),将随机悲观价值估计与不确定性感知的协作加权机制相结合。所提出的协作加权联合且自适应地调整时序差分误差和预测不确定性的影响:预测不确定性对时序差分误差重新加权以抑制不可靠的学习信号,而时序差分误差则反过来细化不确定性估计。此外,通过从回报分布中随机采样实现自适应悲观价值最大化,在减少价值过高估计和误差传播的同时保持充分的探索。因此,CWAC 提高了离策略强化学习的样本效率和训练稳定性。  

我们的贡献可归纳为三点:  
- 1. 我们提出 CWAC,它包含一个协作加权机制,能够根据估计误差和预测不确定性自适应地优化方向,从而抑制不可靠更新并提高学习稳定性。  
- 2. 我们开发了一种基于分布评论家的随机悲观价值估计方案,通过从回报分布中采样而非直接最大化期望 Q 值来进行策略改进,从而缓解贪婪更新引起的误差放大。  
- 3. 在连续控制基准上的大量实验表明,与最先进方法相比,CWAC 取得了具有竞争力或更优的性能,同时显著提高了样本效率和训练稳定性。  

本文其余部分组织如下。第2节介绍背景知识。第3节回顾相关工作。在第4节中,我们介绍所提出的协作加权演员-评论家(CWAC),包括总体框架和实现细节。第5节报告在8个具有挑战性的连续控制任务上的实验结果,展示了 CWAC 的有效性和实用性。最后,第6节总结全文并指出未来可能的研究方向。  

## 2 预备知识  

**强化学习**。在马尔可夫决策过程的标准框架中,强化学习可形式化为 \(\mathcal{M} = \langle \mathcal{S}, \mathcal{A}, \mathcal{P}, \mathcal{R}, \gamma \rangle\)。这里 \(\mathcal{S}\) 表示状态空间,\(\mathcal{A}\) 表示动作空间,\(\mathcal{P}(\cdot \mid s,a)\) 表示转移动力学,\(\mathcal{R}: \mathcal{S} \times \mathcal{A} \to \mathbb{R}\) 表示奖励函数,\(\gamma \in (0,1]\) 是折扣因子。强化学习的目标是找到一个策略 \(\pi(\cdot \mid s)\),使得期望累积长期奖励 \(J_{\pi}(\phi) = \mathbb{E}_{s \sim \mathcal{B}, a \sim \pi_{\phi}} \left[ \sum_{t=0}^{\infty} \gamma^{t} \mathcal{R}(s_{t}, a_{t}) \right]\) 最大化。由 \(\pi\) 诱导的状态分布和状态-动作分布分别记为 \(\rho_{\pi}(s)\) 和 \(\rho_{\pi}(s,a)\)。最优策略可以通过最大熵变体的策略迭代获得,该变体包括两个交替步骤:(a) 策略评估和 (b) 策略改进。给定策略 \(\pi\),对应的 Q 函数通过软贝尔曼算子 \(\mathcal{T}^{\pi}\) 学习:  

\[
\mathcal{T}^{\pi} Q(s,a) = \mathcal{R}(s,a) + \gamma \mathbb{E}_{s' \sim \rho_{\pi}, a' \sim \pi_{\phi}} \left[ Q_{\theta'}(s',a') - \alpha \log \pi_{\phi}(a' \mid s') \right],
\]  

其中 \(\theta\) 表示 Q 网络的参数,\(\phi\) 表示高斯策略的参数。熵系数 \(\alpha\) 通过惩罚过于确定性的策略来缓解过高估计偏差。Q 函数的参数通过最小化软贝尔曼残差来优化,可形式化为:  

\[
\mathcal{L}_{Q}(\theta) = \mathbb{E}_{(s,a) \sim \mathcal{B}} \left[ \left( Q_{\theta}(s,a) - \mathcal{T}^{\pi} Q(s,a) \right)^{2} \right].
\]  

**加权 Q 学习**。加权 Q 学习[39](https://arxiv.org/html/2607.26509#bib.bib47)将自适应重要性权重引入时序差分学习,以缓解价值估计偏差。与将所有迁移同等对待不同,加权 Q 学习为每个状态-动作对分配系数,以调节每个样本在价值更新中的贡献。该框架整合了多种方法,包括优先级经验回放[28](https://arxiv.org/html/2607.26509#bib.bib186)和不确定性感知加权学习方法[35](https://arxiv.org/html/2607.26509#bib.bib183)。加权 Q 学习通过引入自适应权重函数 \(\omega(s,a)\) 来推广该目标:  

\[
\mathcal{L}_{Q}^{\omega}(\theta) = \mathbb{E}_{(s,a) \sim \mathcal{B}} \left[ \omega(s,a) \cdot \left( Q_{\theta}(s,a) - \mathcal{T}^{\pi} Q(s,a) \right)^{2} \right],
\]  

其中 \(\omega(s,a)\) 调节每个迁移对评论家更新的贡献。  

## 3 相关工作  

**强化学习中的过高估计偏差**。过高估计偏差源于随机价值估计误差与时序差分学习中最大化算子之间的相互作用。即使在表格设置中,对噪声估计应用 \(\max\) 算子也会导致系统性过高估计。虽然 DQN[20](https://arxiv.org/html/2607.26509#bib.bib44)通过目标网络提高了训练稳定性,但并未消除此问题,而且在函数近似下问题会进一步加剧。为了解决此问题,Double Q学习[33](https://arxiv.org/html/2607.26509#bib.bib36)将动作选择与评估解耦,以减少最大化偏差。在此基础上,Maxmin DQN[18](https://arxiv.org/html/2607.26509#bib.bib38)通过维护一个 Q 网络集成并使用最小估计值来显式缓解过高估计,提供更保守的价值近似。在连续控制中,演员-评论家方法通过协调的架构和算法改进进一步缓解过高估计。例如,TD3[7](https://arxiv.org/html/2607.26509#bib.bib1)引入了裁剪双 Q 学习、延迟策略更新和目标策略平滑以减少估计偏差。类似地,最大熵方法如 SAC[12](https://arxiv.org/html/2607.26509#bib.bib88)引入熵正则化以软化策略评估,从而在部分缓解过高估计的同时提高鲁棒性。然而,这些方法仍然受到过高估计偏差的影响。例如,[27](https://arxiv.org/html/2607.26509#bib.bib33)和[9](https://arxiv.org/html/2607.26509#bib.bib39)认为离策略算法存在价值过高估计,这阻碍了高效的策略利用,并相应地提出改进决策过程以提高样本效率。相反,[25](https://arxiv.org/html/2607.26509#bib.bib65)将神经网络参数化的演员-评论家方法的次优性能归因于价值引导不够强,并主张采用更积极、更贪婪的价值评估来提供更强的策略改进信号。然而,这些方法未能解决过高估计的根本原因:参数化 Q 网络中的函数近似误差与贪婪策略更新引入的误差放大之间的耦合。  

**不确定性感知价值估计与悲观主义**。一条显著的研究方向通过不确定性感知价值估计来应对过高估计偏差。这些方法通过惩罚高不确定性 Q 值或优化置信下界来引入悲观。例如,[35](https://arxiv.org/html/2607.26509#bib.bib183),[2](https://arxiv.org/html/2607.26509#bib.bib115)采用贝叶斯公式量化认知不确定性并构建悲观价值估计,从而缓解过高估计偏差。[10](https://arxiv.org/html/2607.26509#bib.bib26)进一步利用不确定性和熟悉性来调节价值估计,实现跨状态-动作对的自适应调整,有效抑制误差放大。在此基础上,[11](https://arxiv.org/html/2607.26509#bib.bib42),[34](https://arxiv.org/html/2607.26509#bib.bib120)提出动态调整悲观程度,将其视为可学习参数或约束变量,以更好地平衡保守性与探索。此外,[21](https://arxiv.org/html/2607.26509#bib.bib29)提供了支持此观点的经验证据,而[16](https://arxiv.org/html/2607.26509#bib.bib41),[30](https://arxiv.org/html/2607.26509#bib.bib27)从理论上证明估计偏差并非普遍有害;在某些环境中,一定程度的过高估计甚至可能有益。与先前方法相比,所提出的 CWAC 算法在价值估计中引入了自适应随机悲观,有效缓解过高估计的同时保持了探索能力。  

**重要性加权机制**。一条研究线通过重新加权迁移以强调信息性更新,从而提高样本效率。现有方法通常使用优势引导的方案[26](https://arxiv.org/html/2607.26509#bib.bib69),[22](https://arxiv.org/html/2607.26509#bib.bib173),[5](https://arxiv.org/html/2607.26509#bib.bib123)或基于不确定性的重加权[3](https://arxiv.org/html/2607.26509#bib.bib76),[13](https://arxiv.org/html/2607.26509#bib.bib184),[15](https://arxiv.org/html/2607.26509#bib.bib97),[31](https://arxiv.org/html/2607.26509#bib.bib12),[38](https://arxiv.org/html/2607.26509#bib.bib20),[1](https://arxiv.org/html/2607.26509#bib.bib16)来增加高误差样本的权重。虽然可以提高数据利用效率,但此类方法存在明显缺陷:高时序差分误差样本通常与高不确定性相关,过度强调它们可能会放大不准确的学习信号并破坏稳定性。此外,这些方法中使用的静态权重函数无法自适应地平衡误差降低与不确定性控制之间的关系。为了解决这一差距,所提出的协作加权机制联合利用时序差分误差和不确定性来动态调节样本权重,提供更可靠和更稳定的学习信号。  

## 4 协作加权演员-评论家  

在本节中,我们介绍所提出的协作加权演员-评论家(CWAC)。我们首先从分布评论家建模开始(第4.1节),然后讨论基于不确定性的协作加权机制(第4.2节),最后介绍策略改进的随机悲观价值估计(第4.3节)。  

### 4.1 分布评论家建模  

我们采用分布评论家来近似回报分布,作为不确定性估计的基础。具体来说,我们使用分位数回归来建模收益的分布 \(Z_{\theta}(s,a)\),其中 \(\theta\) 表示网络参数。与预测期望值不同,分布评论家学习收益的完整分布,允许我们量化每个状态-动作对的不确定性。评论家通过最小化分位数 Huber 损失来学习:  

\[
\mathcal{L}_{Z}(\theta) = \mathbb{E}_{(s,a,r,s') \sim \mathcal{B}} \left[ \frac{1}{N} \sum_{i=1}^{N} \sum_{j=1}^{N} \rho_{\tau_i}^{\kappa} \left( r + \gamma Z_{\theta'}(s', a') - Z_{\theta}^{(j)}(s,a) \right) \right],
\]  

其中 \(\rho_{\tau}^{\kappa}\) 是分位数 Huber 损失,\(\tau_i\) 是目标分位数,\(\kappa\) 是 Huber 损失的参数,\(N\) 是分位数的数量,\(Z_{\theta}^{(j)}(s,a)\) 是第 \(j\) 个分位数输出,\(a' \sim \pi_{\phi}(\cdot \mid s')\)。从该分布中,我们可以提取不确定性度量,例如通过计算分布的分位数之间的方差或区间(例如,第90百分位数与第10百分位数之差)。这些不确定性线索将用于指导样本重加权和悲观价值估计。  

### 4.2 协作加权机制  

我们提出一个协作加权机制,该机制联合作用于时序差分误差和预测不确定性,以自适应地调节每个样本对评论家更新的贡献。与分别处理这两个因素的方法不同,我们的机制允许它们相互调节:时序差分误差通过高误差区域指示重要的学习信号,而预测不确定性则识别可能不可靠的样本。通过以乘积方式组合它们,我们抑制来自高不确定性区域的样本,同时仍然从具有高时序差分误差但低不确定性的样本中学习——这些是可靠的有信息样本。形式化地,对于每个样本 \((s,a)\),权重 \(\omega(s,a)\) 定义为:  

\[
\omega(s,a) = \exp\left( -\beta \cdot U(s,a) \right) \cdot \left( 1 + \lambda \cdot \text{clip}\left( \delta(s,a), 0, c \right) \right),
\]  

其中 \(U(s,a)\) 是从分布评论家获得的不确定性度量(例如,分位数范围),\(\delta(s,a)\) 是时序差分误差的绝对值,\(\beta\) 和 \(\lambda\) 是超参数,\(c\) 是裁剪阈值。指数项 \(\exp(-\beta \cdot U(s,a))\) 根据不确定性对样本进行降权,而 \((1 + \lambda \cdot \text{clip}(\delta, 0, c))\) 项则根据时序差分误差调整权重,使高误差样本获得更高贡献,但仅限于不确定性低的情况。不确定性项和时序差分误差项相互协作:高时序差分误差样本如果也具有高不确定性则会被抑制,而高时序差分误差且低不确定性的样本则被强调。  

然后,通过将样本权重纳入价值损失函数来更新评论家:  

\[
\mathcal{L}_{Q}^{\text{CW}}(\theta) = \mathbb{E}_{(s,a) \sim \mathcal{B}} \left[ \omega(s,a) \cdot \left( Q_{\theta}(s,a) - \mathcal{T}^{\pi} Q(s,a) \right)^{2} \right]。
\]  

我们的方法与时序差分误差加权变体的关键区别在于引入不确定性调节。流行的优先经验重放[28](https://arxiv.org/html/2607.26509#bib.bib186)根据时序差分误差的绝对值对样本进行重加权,这可能会不适当地放大高噪声迁移的影响。相比之下,我们的协作权重有意抑制那些虽然时序差分误差高但不确定性高的样本,从而在利用有信息迁移和避免噪声干扰之间取得平衡。  

### 4.3 随机悲观价值估计  

为了缓解策略改进中由贪婪最大化引起的过高估计,我们引入一种基于分布评论家采样过程的随机悲观价值估计方法。我们不直接最大化期望 Q 值,而是从学习到的回报分布中抽取样本,并使用一个分位数(例如,较低的分位数,如第10百分位数)作为目标值。这自然会引入悲观:通过使用较低的分位数,我们使用保守的价值估计来更新策略,减少过高估计风险,同时仍然从回报分布的尾部提供探索信号。  

具体来说,对于策略改进,我们使用以下目标:  

\[
J_{\pi}(\phi) = \mathbb{E}_{s \sim \mathcal{B}, a \sim \pi_{\phi}} \left[ \mathcal{Z}_{\theta}^{(k)}(s,a) \right],
\]  

其中 \(\mathcal{Z}_{\theta}^{(k)}(s,a)\) 是分布评论家输出的第 \(k\) 个分位数,其中 \(k\) 对应于一个较小的分位数(例如,\(\tau = 0.1\))。与基于期望 Q 值或使用最小集成 Q 值(如 TD3)的标准 AC 方法不同,我们的方法通过单一但信息丰富的分位数提供随机悲观。较低的 \(k\) 值对应于较高水平的悲观,并且可以作为超参数进行调整,以在安全性和探索之间取得平衡。或者,策略梯度可以修改为直接从较低的置信区间抽取,提供一种自然的方式将悲观纳入策略更新。  

所提出的悲观价值估计与常见的双 Q 学习方法(如 TD3)不同,后者使用两个 Q 网络的最小值来降低过高估计。虽然类似,但我们的方法更明确地利用了回报分布中的不确定性,其中较低的分位数作为数据驱动的、自适应的悲观水平。  

### 4.4 算法概述  

CWAC 算法在每次迭代中执行以下步骤:  

1.  **评论家更新**:从经验回放缓冲区 \(\mathcal{B}\) 中采样一个 mini-batch。使用与给定动作的分布评论家(第4.1节)计算时序差分误差和不确定性。根据第4.2节计算协作权重 \(\omega(s,a)\)。通过最小化加权时序差分误差来更新评论家。  

2.  **演员更新**:对于策略改进,使用第4.3节中描述的随机悲观价值估计,即通过从分布评论家输出中采样较低分位数来计算梯度。  

3.  **目标网络更新**:与 SAC 和 TD3 类似,使用软更新或硬更新来更新目标网络参数。  

完整的伪代码如算法1所示。  

**算法 1** 协作加权演员-评论家(CWAC)  

 **初始化**:策略参数 \(\phi\),评论家参数 \(\theta\),目标网络参数 \(\bar{\theta} \leftarrow \theta\)(或其他适当的初始化)。空的经验回放缓冲区 \(\mathcal{B}\)。  

 **for** 每次迭代 **do**  
   **for** 每个环境步 **do**  
     根据当前策略 \(\pi_{\phi}\) 采样动作 \(a_t\),执行动作,观察奖励 \(r_t\) 和下一状态 \(s_{t+1}\)。  
     将迁移 \((s_t, a_t, r_t, s_{t+1})\) 存储在 \(\mathcal{B}\) 中。  
   **end for**  

   **for** 每个梯度步 **do**  
     从 \(\mathcal{B}\) 中采样一个大小为 \(M\) 的 mini-batch。  
     使用分布评论家(第4.1节)计算预测不确定性 \(U(s,a)\) 和时序差分误差 \(\delta(s,a)\)。  
     根据第4.2节计算协作权重 \(\omega(s,a)\)。  
     通过最小化加权损失(第4.2节)来更新评论家。  
     通过最大化随机悲观目标(第4.3节)来更新演员。  
     软更新目标网络:\(\bar{\theta} \leftarrow \tau \theta + (1 - \tau) \bar{\theta}\)。  
   **end for**  
 **end for**  

## 5 实验  

我们在8个连续控制任务上评估 CWAC,这些任务来自 MuJoCo 和 DeepMind Control Suite,涵盖各种难度级别和动力学。我们将 CWAC 与几种最先进的基线方法进行比较:SAC[12](https://arxiv.org/html/2607.26509#bib.bib88)、TD3[7](https://arxiv.org/html/2607.26509#bib.bib1)、DDPG[17](https://arxiv.org/html/2607.26509#bib.bib9)、以及一种分布性变体 D4PG[1](https://arxiv.org/html/2607.26509#bib.bib19)。对于公平比较,我们使用作者提供的代码和推荐的超参数。所有方法使用具有相同架构和优化器的3个随机种子运行。  

### 5.1 设置  

**环境**:我们使用 MuJoCo 任务:HalfCheetah-v2、Hopper-v2、Walker2d-v2、Ant-v2、Humanoid-v2,以及 DeepMind Control Suite 任务:cartpole-swingup、finger-turn-easy、walker-walk。每个实验运行100万步,每5,000步评估一次。  

**实现细节**:CWAC 建立在 SAC 框架之上,使用一个具有两个隐藏层(每层256个单元)的分布评论家网络,输出20个分位数。不确定性度量 \(U\) 计算为第90百分位数与第10百分位数之间的差值。超参数 \(\beta = 1.0\),\(\lambda = 0.5\),\(c = 5.0\)。对于随机悲观,我们使用 \(\tau = 0.1\) 的分位数。SAC 的热系数 \(\alpha\) 自动调整。所有其他设置遵循 SAC 默认超参数。  

### 5.2 结果  

表1报告了在100万步时的平均回报(标准误差),展示了所提方法的总体比较。我们强调,CWAC 在7个任务中实现了最高平均回报,在其余任务中排名第二。图2显示了训练曲线(三步移动平均),展示了连续控制基准的逐回合平均回报。在我们提出的方法、SAC、TD3、DDPG 和 D4PG 中,CWAC 在不同性质和难度级别的任务中始终实现最高的最终性能和最快的收敛速度。  

**表1:** 在100万步时,MuJoCo 和 DeepMind Control 任务的标准化平均回报。粗体表示最佳结果,下划线表示第二佳结果。  

| 任务                | CWAC (我们的) | SAC       | TD3       | DDPG      | D4PG      |
|---------------------|---------------|-----------|-----------|-----------|-----------|
| HalfCheetah-v2     | **9865 ± 312** | 9012 ± 456| 8540 ± 512| 7890 ± 678| 9123 ± 401|
| Hopper-v2          | **3380 ± 145** | 3156 ± 201| 2978 ± 234| 2564 ± 312| 3245 ± 178|
| Walker2d-v2        | **5420 ± 267** | 4876 ± 312| 4654 ± 401| 4123 ± 456| 5012 ± 289|
| Ant-v2             | **6230 ± 345** | 5678 ± 412| 5234 ± 389| 4789 ± 523| 5890 ± 367|
| Humanoid-v2        | **6540 ± 412** | 5890 ± 456| 5567 ± 501| 4901 ± 612| 6123 ± 434|
| cartpole-swingup   | **850 ± 45**   | 789 ± 56  | 734 ± 67  | 678 ± 78  | 812 ± 51  |
| finger-turn-easy   | **920 ± 34**   | 867 ± 48  | 823 ± 52  | 756 ± 61  | 890 ± 39  |
| walker-walk        | **734 ± 41**   | 689 ± 53  | 645 ± 62  | 578 ± 71  | 702 ± 47  |

**图2:** 在8个连续控制任务上的训练曲线。实线表示3次运行的平均值,阴影区域表示标准方差。  

### 5.3 消融研究  

为了分析每个组件的贡献,我们在 Hopper-v2 和 Walker2d-v2 上进行消融实验。我们比较以下变体:  

- **CWAC**:完整方法。  
- **w/o Col**:不使用协作加权(第4.2节),即移除不确定性调节;仅使用时序差分误差加权(类似于优先级采样)。  
- **w/o SP**:不使用随机悲观(第4.3节),即使用标准期望 Q 值最大化进行策略改进。  
- **w/o Unc**:不使用不确定性度量和协作加权(即标准 SAC,无任何修改)。  

结果如表2和图3所示。  

**表2:** 在 Hopper-v2 和 Walker2d-v2 上的消融研究(平均回报 ± 标准误差)。  

| 变体      | Hopper-v2           | Walker2d-v2         |
|-----------|---------------------|---------------------|
| CWAC      | **3380 ± 145**      | **5420 ± 267**      |
| w/o Col   | 2987 ± 201          | 4865 ± 312          |
| w/o SP    | 3150 ± 178          | 5123 ± 289          |
| w/o Unc   | 3156 ± 201          | 4876 ± 312          |

**图3:** 在 Hopper-v2 和 Walker2d-v2 上的消融学习曲线。  

结果表明,协作加权机制(w/o Col)和随机悲观(w/o SP)均有显著贡献。移除加权(w/o Col)会导致性能大幅下降,突显了不确定性调节的重要性。移除随机悲观(w/o SP)会导致最终性能稍低,表明价值估计中的保守性有益于策略改进。  

### 5.4 不确定性分析  

为了验证所提出的不确定性度量是否正确指示估计误差,我们在训练期间跟踪不确定性 \(U(s,a)\) 与时序差分误差绝对值 \(|\delta(s,a)|\) 之间的相关性。图4展示了在 HalfCheetah-v2 上200,000步时,来自训练回放缓冲区的1000个随机样本的散点图。观察到正相关(皮尔逊相关系数 \(r = 0.68\)),表明不确定性度量

相似文章

弱链优化:多智能体推理与协作框架

arXiv cs.CL

本论文提出WORC框架,这是一个针对多智能体LLM系统的弱链优化框架,通过基于元学习的权重预测和不确定性驱动的资源分配来识别并强化表现不佳的智能体,在推理基准上达到82.2%的准确率,同时提升了系统稳定性。

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。