熵正则化演员-评论家方法的精细分析

arXiv cs.LG 论文

摘要

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

arXiv:2605.24357v1 公告类型:新 摘要:本文研究了演员-评论家方法中评论家在熵正则化、有限、折扣环境下的作用。我们证明,当评论家精确时,将其作为基线是一种强意义上的方差缩减方法。在这种情况下,使用随机梯度的演员-评论家方法在样本复杂度上与确定性策略梯度相匹配,仅需 $\tilde{O}(\log(1/\epsilon))$ 个样本即可达到 $\epsilon$-最优正则化值。在实践中,评论家与演员一同学习:演员更新的方差会受评论家方差和偏差的影响。具体来说,当评论家误差足够小时,方差缩减和快速收敛得以保留。这表明应先学习评论家,并在每次演员更新后保持其更新,强调了在演员-评论家方法中精确估计评论家的关键作用。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:05

# 熵正则化演员-评论家方法的精细分析  
**来源:** https://arxiv.org/html/2605.24357  

###### 摘要  
本文研究在熵正则化、有限状态、折扣环境中,评论家在演员-评论家方法中的作用。我们证明,当评论家是精确的时候,将评论家作为基线是一种强意义上的方差缩减方法。在这种情况下,使用随机梯度的演员-评论家方法达到了与确定性策略梯度相同的样本复杂度,以 \(\tilde{O}(\log(1/\epsilon))\) 个样本达到 \(\epsilon\)-最优正则化值。在实践中,评论家是与演员一起学习的:此时演员更新的方差会受到评论家方差和偏差的影响。具体来说,当评论家的误差足够小时,方差缩减和快速收敛得以保持。这表明应该先学习评论家,并在每次演员更新后保持其最新状态,强调了在演员-评论家方法中准确的评论家估计的关键作用。  

**关键词:** 演员-评论家,样本复杂度,熵,强化学习,ICML  

## 1 引言  
策略梯度方法是应用最广泛的强化学习算法之一(Williams, 1992(https://arxiv.org/html/2605.24357#bib.bib31);Sutton 等, 1998(https://arxiv.org/html/2605.24357#bib.bib23))。由于其固有的灵活性和可扩展性,它们已成为现代强化学习中的主导方法(Agarwal 等, 2021(https://arxiv.org/html/2605.24357#bib.bib21))。它们的广泛采用促成了许多技术和技巧的发展,以稳定训练并加速收敛,从而更快地发现高性能策略。策略梯度方法中的一个核心技术是引入*基线*,它作为一个控制变量,旨在降低梯度估计的方差(Konda 和 Tsitsiklis, 1999(https://arxiv.org/html/2605.24357#bib.bib34))。这源于一个观察:在表达梯度时,任何不改变期望梯度方向的因素都可以用来稳定优化。在实践中,人们普遍认为使用当前策略的价值函数可以显著提升性能(Grondman 等, 2012(https://arxiv.org/html/2605.24357#bib.bib32);Schulman 等, 2015b(https://arxiv.org/html/2605.24357#bib.bib51))。这有效地将梯度的关注点从“奖励”转移到所谓的行动“优势”上(Baird 和 Leemon, 1993(https://arxiv.org/html/2605.24357#bib.bib50)),从而提供了更密集的学习信号。这一观察还得到了*演员-评论家*方法(AC, Barto 等, 1983(https://arxiv.org/html/2605.24357#bib.bib45);Konda 和 Tsitsiklis, 1999(https://arxiv.org/html/2605.24357#bib.bib34))的主导地位的进一步支持,特别是像 A2C(Mnih 等, 2016(https://arxiv.org/html/2605.24357#bib.bib35))、PPO(Schulman 等, 2017(https://arxiv.org/html/2605.24357#bib.bib36))、TRPO(Schulman 等, 2015a(https://arxiv.org/html/2605.24357#bib.bib37))等算法。然而,尽管这种转变似乎是自然的进展,但价值函数作为稳定器的具体作用在理论上仍然理解不足。  

最近,强化学习理论出现了一波新的理论分析,为许多基础方法提供了严谨的基础。早期的工作依赖于渐近保证(Williams, 1992(https://arxiv.org/html/2605.24357#bib.bib31);Greensmith 等, 2004(https://arxiv.org/html/2605.24357#bib.bib39)),而最近的研究则建立了策略梯度方法的非渐近全局收敛率(Mei 等, 2020b(https://arxiv.org/html/2605.24357#bib.bib3);Xiao, 2022(https://arxiv.org/html/2605.24357#bib.bib38);Labbé 等, 2026b(https://arxiv.org/html/2605.24357#bib.bib16))。更近期,理论被扩展到演员-评论家方法,证明了有限时间内的全局收敛(Kumar 等, 2024(https://arxiv.org/html/2605.24357#bib.bib1)),这遵循了策略梯度分析中依赖于梯度一致有界的思路。与这些理论进展并行的是,最近有实证观察到改进评论家可以显著提升演员-评论家方法的收敛性(Wang 等, 2025(https://arxiv.org/html/2605.24357#bib.bib44))。尽管这有力地表明演员-评论家方法减少了梯度方差,但其程度尚不清楚。具体来说,我们可以区分两种类型的方差缩减:  

- **弱方差缩减**:更新的方差通过乘以一个常数因子而减小,类似于尾部平均(Polyak 和 Juditsky, 1992(https://arxiv.org/html/2605.24357#bib.bib41))或移动平均方法(Morales-Brotons 等, 2024(https://arxiv.org/html/2605.24357#bib.bib40));  
- **强方差缩减**:梯度估计器的方差随着迭代接近最优值而消失,从而实现线性收敛,类似于 SVRG(Johnson 和 Zhang, 2013(https://arxiv.org/html/2605.24357#bib.bib42))、SAGA(Defazio 等, 2014(https://arxiv.org/html/2605.24357#bib.bib43))等方法。  

自然,强方差缩减比弱方差缩减能带来快得多的收敛速度。据我们所知,目前尚不清楚演员-评论家方法是否实现了*弱*或*强*方差缩减。  

**表 1:** 与评论家未知的相关演员-评论家方法的比较。我们的方法是第一个实现 \(\tilde{\mathcal{O}}(1/\epsilon)\) 样本复杂度的方法。- \(^1\) 此处结果针对熵正则化问题。  

在本文中,我们给出肯定回答:*是的,演员-评论家方法实现了强方差缩减*,至少当评论家已知时是如此。我们的理论源于一个观察:当价值函数(即评论家)完全已知时,演员-评论家方法随机梯度的方差可以被确定梯度的范数乘以一个因子所界定。在这种情况下,我们证明演员-评论家方法实现了 \(\mathcal{O}(\log(1/\epsilon))\) 的样本复杂度,与确定性迭代复杂度相匹配。另一方面,如果评论家是在线学习的,我们证明演员-评论家方法的行为由评论家的偏差和方差决定。具体来说,我们表明如果执行足够多的评论家迭代,演员-评论家方法能够达到 \(\tilde{\mathcal{O}}(1/\epsilon)\) 的样本复杂度。  

我们的贡献可以总结如下:  

- **我们提出了一种新的演员-评论家理论分析。** 据我们所知,我们首次证明了具有精确评论家的演员-评论家方法*充当了一种强方差缩减方法*,不仅仅是减少了更新的残差方差,而是完全消除了它。  
- **当评论家不精确时,它必须与演员一起学习。** 在这种情况下,评论家的偏差和方差会向演员引入类似的偏差和方差。因此,当正确设置算法时,演员可以以与评论家学习速率相近的速率学习:在某种意义上,训练中最重要的部分是评论家,花时间学习它是值得的。关键的是,需要在演员更新之间执行多次评论家更新,这证实了最近的实证发现(Wang 等, 2025(https://arxiv.org/html/2605.24357#bib.bib44))。  
- **我们通过两个环境实证验证我们的发现**,表明随着连续演员更新之间的评论家更新次数增加,学习策略的性能单调提升。  

我们在表 1(https://arxiv.org/html/2605.24357#S1.T1)中与最相关的工作进行了比较,并在第 2 节(https://arxiv.org/html/2605.24357#S2)中讨论了相关工作。第 3 节(https://arxiv.org/html/2605.24357#S3)介绍了背景。我们在第 4 节(https://arxiv.org/html/2605.24357#S4)中分析了具有精确评论家的演员-评论家方法,在第 5 节(https://arxiv.org/html/2605.24357#S5)中分析了具有不精确评论家的情况。实证研究在第 6 节(https://arxiv.org/html/2605.24357#S6)中,我们在第 7 节(https://arxiv.org/html/2605.24357#S7)中讨论了展望。  

## 2 相关工作  

#### 熵正则化强化学习。  
熵正则化强化学习通过奖励更高的熵来促进随机策略,鼓励探索并提高学习稳定性(Williams 和 Peng, 1991(https://arxiv.org/html/2605.24357#bib.bib27);Mnih 等, 2016(https://arxiv.org/html/2605.24357#bib.bib35);Neu 等, 2017(https://arxiv.org/html/2605.24357#bib.bib59);Haarnoja 等, 2018(https://arxiv.org/html/2605.24357#bib.bib28))。它支撑着广泛使用的深度强化学习方法,如 Soft Actor-Critic 和熵正则化演员-评论家方法(Haarnoja 等, 2018(https://arxiv.org/html/2605.24357#bib.bib28)),尽管这些方法在实践中表现出色,但其理论仍然理解不足。一系列工作从算法和理论角度研究这一目标(Nachum 等, 2017(https://arxiv.org/html/2605.24357#bib.bib19);Geist 等, 2019(https://arxiv.org/html/2605.24357#bib.bib49)),将熵正则化与软策略迭代和软 Q 学习联系起来,明确了策略梯度方法与基于价值的方法之间的联系。另一系列工作(Lan, 2023(https://arxiv.org/html/2605.24357#bib.bib18))研究了熵正则化强化学习中的策略镜像下降,并建立了正则化目标的收敛保证。然而,策略镜像下降直接在策略空间上操作,这使得扩展到表格设置之外不那么直接。相比之下,演员-评论家方法直接更新参数化策略,为可扩展扩展提供了更自然的基础,并激发了对演员-评论家方法的专门分析。  

#### 策略梯度方法。  
策略梯度方法可以追溯到 Williams (1992)(https://arxiv.org/html/2605.24357#bib.bib31)和 Sutton 等 (1999)(https://arxiv.org/html/2605.24357#bib.bib22)。Mei 等 (2020b)(https://arxiv.org/html/2605.24357#bib.bib3)、Zhang 等 (2020)(https://arxiv.org/html/2605.24357#bib.bib24)和 Xiao (2022)(https://arxiv.org/html/2605.24357#bib.bib38)通过证明强化学习目标满足 Łojasiewicz 型不等式,为 softmax 策略建立了*精确*梯度下的全局收敛,在熵正则化强化学习中获得了线性收敛率。在随机梯度下,Zhang 等 (2021a)(https://arxiv.org/html/2605.24357#bib.bib25)和 Yuan 等 (2022)(https://arxiv.org/html/2605.24357#bib.bib30)证明了在蒙特卡洛梯度估计下收敛到一阶稳定点,后续工作表明在额外结构(特别是通过正则化)下可以恢复全局保证(Zhang 等, 2021b(https://arxiv.org/html/2605.24357#bib.bib17);Ding 等, 2025(https://arxiv.org/html/2605.24357#bib.bib26);Labbé 等, 2026a(https://arxiv.org/html/2605.24357#bib.bib14),b(https://arxiv.org/html/2605.24357#bib.bib16))。  

然而,由于方差高,原始的随机策略梯度在实践中仍然脆弱,这促使人们使用更复杂的方法。几项近期工作为策略梯度的变体建立了收敛保证,例如依赖于基于海森矩阵的方差缩减(Fatkhullin 等, 2023(https://arxiv.org/html/2605.24357#bib.bib46))、动量和重要性采样(Barakat 等, 2023(https://arxiv.org/html/2605.24357#bib.bib48)),或逆 Fisher 预处理(Mondal 和 Aggarwal, 2024(https://arxiv.org/html/2605.24357#bib.bib47))。Fatkhullin 等 (2023)(https://arxiv.org/html/2605.24357#bib.bib46)和 Mondal 与 Aggarwal (2024)(https://arxiv.org/html/2605.24357#bib.bib47)的方法通常需要更重的计算,例如估计二阶量或逆 Fisher 型矩阵,而 Barakat 等 (2023)(https://arxiv.org/html/2605.24357#bib.bib48)的方差缩减方法在实践中不如演员-评论家方法有竞争力。这激发了我们对演员-评论家方法的关注(Barto 等, 1983(https://arxiv.org/html/2605.24357#bib.bib45);Konda 和 Tsitsiklis, 1999(https://arxiv.org/html/2605.24357#bib.bib34)),它提供了一个可扩展的参数空间框架,同时通过评论家实现方差缩减。  

#### 演员-评论家方法的收敛性分析。  
演员-评论家方法的早期分析是渐近的,使用了双时间尺度随机逼近(Konda 和 Tsitsiklis, 1999(https://arxiv.org/html/2605.24357#bib.bib34))或基于 ODE 的论证(Bhatnagar 等, 2009(https://arxiv.org/html/2605.24357#bib.bib55);Castro 和 Meir, 2010(https://arxiv.org/html/2605.24357#bib.bib57))。最近,在特殊控制设置中获得了非渐近速率:对于 LQR,Yang 等 (2019)(https://arxiv.org/html/2605.24357#bib.bib52)证明了全局线性收敛,但需要 \(\tilde{\mathcal{O}}(\epsilon^{-5})\) 次评论家更新以保持足够的价值估计精度。在一般强化学习设置中,多项工作建立了具有有限样本复杂度界限的非渐近收敛到稳定点(Xu 等, 2020(https://arxiv.org/html/2605.24357#bib.bib53);Qiu 等, 2021(https://arxiv.org/html/2605.24357#bib.bib54);Kumar 等, 2023(https://arxiv.org/html/2605.24357#bib.bib56);Olshevsky 和 Gharesifard, 2023(https://arxiv.org/html/2605.24357#bib.bib10);Chen 和 Zhao, 2023(https://arxiv.org/html/2605.24357#bib.bib11))。在非正则化设置中,通过结合稳定性论证与一致梯度/探索控制,获得了全局收敛保证(Kumar 等, 2024(https://arxiv.org/html/2605.24357#bib.bib1);Gaur 等, 2024(https://arxiv.org/html/2605.24357#bib.bib7)),实现了 \(\tilde{\mathcal{O}}(\epsilon^{-3})\) 的样本复杂度。对于表格熵正则化目标,Cayci 等 (2024)(https://arxiv.org/html/2605.24357#bib.bib12)也推导了有限样本保证,但复杂度更高,为 \(\tilde{\mathcal{O}}(\epsilon^{-5})\)。在连续动作设置中,最近的分析(Zorba 等, 2026(https://arxiv.org/html/2605.24357#bib.bib13);Kerimkulov 等, 2025(https://arxiv.org/html/2605.24357#bib.bib15))建立了熵正则化演员-评论家方法的全局收敛保证,但仅限于确定性环境。  

相比之下,我们在随机设置中分析了熵正则化的演员-评论家方法,并证明当评论家精确时,它是一种*强方差缩减方法*,达到了 \(\tilde{O}(\log(1/\epsilon))\) 的样本复杂度;此外,我们表明即使评论家不精确,熵正则化的演员-评论家方法仍然实现了 \(\tilde{\mathcal{O}}(\epsilon^{-1})\) 的样本复杂度。  

## 3 背景  

#### 马尔可夫决策过程。  
我们考虑一个折扣 MDP \(\mathcal{M}=(\mathcal{S},\mathcal{A},\gamma,\mathsf{P},\mathsf{r},\rho)\),具有有限的状态空间 \(\mathcal{S}\) 和动作空间 \(\mathcal{A}\),折扣因子 \(\gamma\in(0,1)\),转移核 \(\mathsf{P}(s'|s,a)\),奖励 \(\mathsf{r}(s,a)\in[0,1]\),以及初始分布 \(\rho\)。一个平稳策略 \(\pi:\mathcal{S}\to\mathcal{P}(\mathcal{A})\) 诱导出 \(\mathsf{P}_\pi(s'|s)=\sum_a \mathsf{P}(s'|s,a)\pi(a|s)\)。价值函数定义为  

\[
\mathrm{v}_\pi(s) \overset{\Delta}{=} \mathbb{E}_s^\pi \left[ \sum_{t=0}^{\infty} \gamma^t \mathsf{r}(S_t, A_t) \right], \tag{1}
\]

其中 \(S_0=s\),\(A_t\sim\pi(\cdot|S_t)\),\(S_{t+1}\sim\mathsf{P}(\cdot|S_t,A_t)\)。对于 \(\rho\in\mathcal{P}(\mathcal{S})\),定义 \(\mathrm{v}_\pi(\rho)=\sum_s \rho(s)\mathrm{v}_\pi(s)\)。  

(由于篇幅限制,原文继续,但根据指令,我们只翻译给定的内容。注意:原输入在“## 3Background”之后被截断,我们只翻译到提供的地方。)

相似文章