重新审视 Adam 在流式强化学习中的应用

arXiv cs.LG 论文

摘要

本文重新审视了 Adam 优化器在流式强化学习中的应用,证明经过适当调优后,DQN 和 C51 等成熟方法表现良好。作者提出了自适应 Q(lambda) 算法,该算法将资格迹与 Adam 的方差自适应特性相结合,在 55 款 Atari 游戏中超越了现有的流式强化学习方法。

arXiv:2605.06764v1 公告类型:新文章 摘要:在感知到观察结果并立即采取行动后,直接从交互序列中学习而无需显式存储这些数据,有望带来更简单、更高效且适应性更强的算法。然而,在过去十多年中,深度强化学习却采取了相反的路径,通过为智能体添加回放缓冲区或并行采样例程,以努力缓解学习不稳定性问题。近期,Elsayed 等人 (2024) 重新关注了这一主题,通过资格迹和优化例程的修改来处理更新计算,提出了 StreamQ 算法。在本工作中,我们退后一步,研究在此在线设置下,诸如 DQN 和 C51 所实现的成熟更新方法的有效性。我们不仅发现它们表现良好,而且通过分析优化算法(特别是 Adam)如何与这些更新相互作用,我们认为以下两个特性对于稳健的性能至关重要:i) 目标函数的导数需要是有界的;ii) 权重更新需进行方差调整。严谨且详尽的实验证明,C51(具备上述两个特征)在 55 款 Atari 游戏子集中与 StreamQ 具有竞争力。基于这些见解,我们推导了一种基于资格迹的方差调整算法,称为自适应 Q$(\lambda)$,在同一子集中接近人类基线的两倍表现,在所有性能指标上均超越了现有方法。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:49

# 重新审视流式强化学习中的 Adam 优化器
来源: https://arxiv.org/html/2605.06764
重新审视流式强化学习中的 Adam

Florin Gogianu, Adrian Catalin Lutu, Razvan Pascanu

关键词:流式强化学习 (Streaming RL), Adam, 优化, 资格迹 (Eligibility Traces), 分布强化学习 (Distributional RL)

**摘要**
从交互序列中学习,即在感知并采取行动后立即进行处理,而无需显式存储数据,这一方式有望带来更简单、更高效且更具适应性的算法。然而,在过去十多年里,深度强化学习却走了相反的道路,通过为智能体增加回放缓冲区或并行采样例程,以努力克服学习不稳定性。最近,elsayed2024streamin 重新探讨了这一主题,侧重于通过资格迹进行更新计算以及对优化例程的修改,从而提出了 StreamQ 算法。在本研究中,我们退一步,研究在此在线设置下,由 DQN 和 C51 实现的现有更新方法的有效性。我们发现它们不仅表现良好,而且通过分析优化算法(特别是 Adam)如何与这些更新相互作用,我们认为对于稳健的性能而言,两个属性至关重要:i) 目标函数的导数必须有界;ii) 权重更新必须是方差调整的。严格且详尽的实验表明,兼具这两种特性的 C51 在 55 款 Atari 游戏的子集中与 StreamQ 具有竞争力。基于这些见解,我们推导了一种基于资格迹的方差调整算法,称为自适应 Q(λ)(Adaptive Q(λ)),它在同一子集上的表现接近人类基线的两倍,在所有性能指标上均超越了现有方法。

**贡献**
1. **我们强调了 Adam 和既定目标函数在流式 RL 设置中的有效性。**
   背景:最近的文献表明,流式环境的严重非平稳性需要专门的算法。我们通过将 DQN 和 C51 适配到流式设置中来对比这一观点,表明当适当调整时,标准的优化技术可以 surprisingly 有效。

2. **我们确立了方差调整的优化算法以及精心调整的 $\varepsilon$ 值是流式 RL 智能体的重要组成部分。**
   背景:我们提供了关于方差调整更新和 Adam 的 epsilon 值作用的机制性见解。我们提供证据表明,较大的 $\varepsilon$ 值可以充当稀疏和噪声梯度成分的滤波器,从而实现更稳定的学习动态。

3. **我们提出了 Adaptive Q(λ)。**
   背景:AQ(λ) 结合了资格迹与 Adam 的方差自适应机制以及有界的误差信号,形成了一种优于现有流式 RL 方法性能的算法。

4. **我们在流式 RL 设置下进行了大规模实证评估,在 55 款 Atari 游戏中对 StreamQ、DQN 和 C51 进行了广泛的基准测试,并为这些算法设定了新的性能期望。**
   背景:为了严格证明我们的算法贡献,这 55 款 Atari 游戏是根据 aitchison2023atari5 建立的性能相关性框架选择和排序的。

###### Abstract

从交互序列中学习,即在感知并采取行动后立即进行处理,而无需显式存储数据,这一方式有望带来更简单、更高效且更具适应性的算法。然而,在过去十多年里,深度强化学习却走了相反的道路,通过为智能体增加回放缓冲区或并行采样例程,以努力克服学习不稳定性。最近,elsayed2024streamin 重新探讨了这一主题,侧重于通过资格迹进行更新计算以及对优化例程的修改,从而提出了 StreamQ 算法。在本研究中,我们退一步,研究在此在线设置下,由 DQN 和 C51 实现的现有更新方法的有效性。我们发现它们不仅表现良好,而且通过分析优化算法(特别是 Adam)如何与这些更新相互作用,我们认为对于稳健的性能而言,两个属性至关重要:i) 目标函数的导数必须有界;ii) 权重更新必须是方差调整的。严格且详尽的实验表明,兼具这两种特性的 C51 在 55 款 Atari 游戏的子集中与 StreamQ 具有竞争力。基于这些见解,我们推导了一种基于资格迹的方差调整算法,称为自适应 Q(λ),它在同一子集上的表现接近人类基线的两倍,在所有性能指标上均超越了现有方法。

## 1 引言

过去十年中,深度强化学习 (DRL) 的大部分性能提升可以追溯到优化例程在训练期间能够使用的离策略数据量的扩展。不断扩大的经验回放缓冲区或环境的超大规模并行采样,使得最初为经验风险最小化开发的随机梯度下降算法得以发挥优势,但这以巨大的内存、样本和算法复杂性为代价。为了达到随机梯度下降对稳定性的要求,我们通常使用由 7GB 回放缓冲区和数百万个参数组成的智能体,去处理那些原本只需 4Kb ROM 就能容纳的环境 (bowling2025talk)。

> [!NOTE]
> 图 1:55 款 Atari 游戏上的 IQM 和归一化人类平均分数。所有智能体仅从当前转换中学习,不使用经验回放或目标网络。C51 和 AQ(λ) 展示了有界目标和方差调整优化的有用性。

相比之下,社区中少数声音开始主张开发计算受限的智能体,其复杂度低于环境 (javed2024bigWorld; bowling2025rethinking; lewandowski2025bigWorld)。因此,远离从伪平稳缓冲区中采样的批次学习,转向以流式方式从每次交互中学习,不存储数据或不利用并行环境。

可以说,实现这一愿景的一个主要需求是开发新的 RL 目标和优化算法,能够纯粹从顺序数据中稳定且高效地学习。seijen2016trueOnlineTD; vanHasselt2014trueGTDlmbda; javed2024swiftTD 开辟了道路,而 elsayed2024streamin; elelimy2025gradient 的最新结果表明,即使是对于历史上难以控制的基准测试(如街机学习环境 ALE),也有了解决方案。在线设置下的这些最新突破归功于基于资格迹 (sutton1988tdlmbda; sutton2018rlbook) 方法的复兴 (vanHasselt2014trueGTDlmbda; mahmood2015wisTrace; white2016greedy; vanHasselt2021expected)。

事实上,资格迹长期承诺通过在每个转换中使用多步回报更新值函数,从而解决将当前或未来奖励传播到过去状态和行动的核心问题。改进的时间信用分配反过来将解锁更低的样本复杂性,并有助于缩小与批量 RL 算法的差距$^{1}$。elsayed2024streamin 和 elelimy2025gradient 都强调了资格迹在其采用的其他算法创新中的重要性,例如权重的稀疏初始化、新的正则化目标和优化器,以及对观察、奖励和激活的广泛归一化使用,从而打破通向高效在线学习者的“流式屏障”。

然而,有人指出,资格迹方法与带有动量的随机梯度下降 (SGD-M) (polyak1964sgdm) 有着不止是偶尔的相似之处,甚至在最近的 elsayed2024streamin 中也是如此。此外,同样实施目标导数运行平均值的优化算法,如自适应矩估计 (Adam) (kingma2015adam),以及在较小程度上的均方根传播 (RMSProp) (tieleman2012rmsprop),对于使用神经网络函数近似训练强化学习 (RL) 智能体至关重要。有鉴于此,我们旨在重新审视以下问题:

**Q1: 为批量强化学习开发的目标和优化器在在线设置中是否具有竞争力?**

通过部署仔细且广泛的实证协议,我们发现,一旦适配到流式设置中,批量 RL 中常用的目标、更新规则和优化例程会产生 surprisingly 强的结果。这些强有力的实证发现本身应有助于塑造围绕流式深度强化学习这一略显新兴领域的讨论。它们暗示了 TD(0) 方法与 Adam 式更新相结合时的通用性和鲁棒性。并且应为新流式算法的开发建立更强大的基线。

**Q2: 什么解释了 TD(0) 方法和 Adam 式更新的性能?**

获得这些结果的关键在于我们为 Adam 选择的独特超参数集。我们的最佳配置始终要求梯度运行平均值的系数接近 1.0,并且数值稳定性项的值非常大。在第 4 节中,我们测试了几个可能解释这一值选择的假设。同样,我们注意到对具有目标导数有界的算法的偏好,例如 Categorical DQN (C51) 和一些 Deep Q-Network (DQN) 版本。

最后,我们将这些观察结果和分析提炼为一种基于资格迹的算法,我们称之为 Adaptive Q(λ),它改进了现有方法。在本节末尾,我们总结我们的贡献:

- **Adam 的不合理有效性。** 我们提供证据表明,在批量 RL 设置中开发的目标和优化器在良好调优后,在流式协议中表现非常出色。
- **机制性见解。** 我们识别并讨论了流式 RL 的几个重要属性:基于长梯度历史的方差调整更新、目标有界导数的作用,以及 $\varepsilon$ 对性能的巨大影响。
- **Adaptive Q(λ)。** 我们提出了一种新的资格迹更新规则,改进了现有方法。
- **广泛基准测试。** 我们展示了一项彻底的实证研究,评估适配到流式设置的 DQN 和 C51,以及 StreamQ,在 55 款 Atari 游戏上的表现。

## 2 背景

本研究设定在经典的情节式强化学习设置中,为方便起见,遵循 elsayed2024streamin, elelimy2025gradient 等人定义的约定:一个*智能体*与*环境*交互,按照其状态条件行动生成行为(策略)$A_t \sim \pi(\cdot|S_t)$,生成时间索引序列 $S_0, A_0, R_1, S_1, A_1, R_2, ..., S_T$。其目标是通过估计处于状态 $S_t=s$ 并遵循策略 $\pi$ 的预期回报(我们称之为值函数 $v_\pi(s) \doteq \mathbb{E}_\pi[G_t|S_t=s]$)来最大化未来折扣回报的总和 $G_t \doteq \sum_{k=t+1}^T \gamma^{k-t-1} R_k$,其中 $\gamma$ 控制给予即时奖励相对于轨迹后期收到奖励的权重。当 $v_\pi$ 的估计器使用函数近似时,我们将其记为 $v(s, \bm{w})$,其中 $\bm{w}$ 是参数向量。通常,我们不仅关心估计状态的效用,也称为*值预测*问题。此外,我们还对其对应物,即*控制*问题感兴趣,其对应的动作值函数为 $q_\pi(s,a) \doteq \mathbb{E}_\pi[G_t|S_t=s, A_t=a]$ 及其函数近似等价物 $q(s,a,\bm{w})$。然后,优化控制问题中的目标就是找到最大化状态-动作值函数的最优策略 $\pi^\star$:$q_\pi(s,a) = \max_\pi q_\pi(s,a)$。

#### 时序差分学习 (Temporal Difference Learning)

估计预期折扣奖励总和的直接方法是等到情节结束,并为每个前导状态计算它。这种回报估计构成了一个学习目标,我们可以据此调整当前的值函数:$\bm{w}_{t+1} \doteq \eta (G_t - v(S_t, \bm{w}_t)) \nabla_{\bm{w}} v(S_t, \bm{w}_t)$。蒙特卡洛 (MC) 方法的缺点是策略在情节结束前保持不变。一种更频繁更新的方法是基于我们在下一步状态评估的训练估计器,以及我们在当前步骤采取行动获得的奖励 $R_{t+1} + \gamma v(S_{t+1}, \bm{w})$ 来计算学习目标。然后,要最小化的目标函数变成时序差分 (TD) 误差:$\delta \doteq R_{t+1} + \gamma v(S_{t+1}, \bm{w}) - v(S_t, \bm{w})$,我们将在本工作中大量使用它。为了完整起见,控制问题相关的 TD 误差为 $\delta \doteq R_{t+1} + \gamma \max_a q(S_{t+1}, a, \bm{w}) - q(S_t, A_t, \bm{w})$。因为目标使用了立即下一步状态 $S_{t+1}$ 的预测,我们称之为 TD(0) 方法。但我们可以将学习目标引导得更远到未来,从而产生 $n$ 步方法,其中回报估计为:$G_{t:t+n} \doteq \sum_{k=0}^{n-1} \gamma^k R_{t+k+1} + \gamma^n v(S_{t+n}, \bm{w})$。选择 $n$ 允许在两种主要估计器之间进行插值:TD(0) 中的一步前瞻和 MC。

#### 关于 $\lambda$-回报

绝大多数批量 RL 算法都牢牢立足于我们刚刚描述的*前向*视图。对于给定状态,智能体“向前看”时间,观察当前策略收到的未来奖励,并据此决定如何更新值估计。这对于 TD(0) 和小的 $n$ 值下的 $n$ 步回报方法来说效果很好,但对于其他多步方法来说,实现起来很快变得棘手,尤其是在与重采样策略结合使用时 (daley2019reconciling)。一种替代方案是 $\lambda$-回报,这是一种回报估计器,通过计算轨迹上所有 $n$ 步回报的加权平均来进一步平衡偏差-方差权衡,$G_t^\lambda \doteq (1-\lambda) \sum_{n=1}^{T-t-1} \lambda^{n-1} G_{t:t+n} + \lambda^{T-t-1} G_t$。设置 $\lambda=0$ 恢复 TD(0),而当 $\lambda=1$ 时,估计器变为 MC 回报。这种估计器在具有神经网络近似的纯基于值的方法中很少见,因为它需要每次重新计算每个 $n$ 步回报。

#### 资格迹 (Eligibility Traces)

然而,如果我们采取*后向*视图,即每次对值函数的更新都依赖于当前

相似文章