重访不确定性下Q学习中的TD目标聚合

arXiv cs.LG 论文

摘要

本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。

arXiv:2608.03069v1 公告类型:新 摘要:深度Q网络(DQN)通过自举的时间差分更新学习价值函数,其中未来回报使用下一状态动作值的贪婪最大化来近似。虽然有效,但这种聚合规则本质上对估计噪声敏感:当Q值不确定时,最大化算子确定性地偏向最大估计值,而不管其可靠性如何,从而通过自举放大误差。在这项工作中,我们提出了\textbf{后继者轨迹聚合深度Q网络}(SADQ),这是对Q学习的一种简单修改,用于正则化TD目标的形成方式。SADQ使用从学习到的动力学模型获得的一步轨迹预测来指导下一状态候选动作之间的比较,在不改变底层学习框架的情况下为聚合步骤引入额外结构。由此产生的混合贝尔曼更新减弱了不可靠的最大值,同时在模型误差递减时保持标准不动点。我们提供的理论分析表明,SADQ以逐点方式减少了自举引起的过估计。在经验上,与强大的DQN变体相比,SADQ在经典控制任务、真实世界向量环境和Atari基准上持续提高了训练稳定性。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# 重新审视 Q 学习中不确定性下的 TD 目标聚合
来源:https://arxiv.org/html/2608.03069
Xiaonan Zhang (https://arxiv.org/html/2608.03069v1/mailto:[email protected]) 计算机科学系 佛罗里达州立大学 塔拉哈西,佛罗里达州,美国

###### 摘要

深度 Q 网络 \(DQNs\) 通过自举的时间差分更新来学习价值函数,其中未来回报使用对下一状态动作值的贪心最大化来近似。虽然这种方法有效,但这种聚合规则本质上对估计噪声敏感:当 Q 值不确定时,最大化算子会确定性地偏向最大的估计值,而不考虑其可靠性,从而通过自举放大误差。在这项工作中,我们提出了成功者回滚聚合深度 Q 网络 \(SADQ\),这是对 Q 学习的一种简单修改,用于规范 TD 目标的形成方式。SADQ 使用从学习到的动力学模型获得的一步回滚预测来指导候选下一状态动作之间的比较,在不改变底层学习框架的情况下,为聚合步骤引入额外结构。由此产生的混合 Bellman 更新会衰减不可靠的最大值,同时在模型误差递减时保持标准不动点。我们的理论分析表明,SADQ 以逐点方式减少了自举引起的过估计。在经验上,与强 DQN 变体相比,SADQ 在经典控制任务、真实世界向量环境和 Atari 基准测试中持续提高了训练稳定性。

## 1 引言

Q 学习及其深度变体(如深度 Q 网络 \(DQN\))通过自举的时间差分 \(TD\) 更新来学习动作价值函数\[mnih2015human,liang2022reducing\]。在这些方法中,未来回报使用贪心备份 \(\max_{a^\prime}Q(s^\prime,a^\prime)\) 来近似,而不是直接观测得到\[moore1993prioritized,ghiassian2020gradient\]。这种机制在实践中已被证明是有效的,但当与函数逼近结合时,它也引入了众所周知的失稳来源\[maei2009convergent,lee2019target,rowland2023statistical\]。

大量工作致力于提高 Q 值估计的质量。诸如优先采样\[schaul2015prioritized\]、多步回报\[mnih2016asynchronous\]、包括 Double 和 Dueling DQN 在内的架构改进\[van2016deep,wang2016dueling\],以及分布方法\[bellemare2017distributional,dabney2018distributional\]等方法显著提升了经验性能和稳定性。这些方法主要旨在减少估计不确定性,或在单个价值预测层面更好地刻画预测离散程度。然而,即使价值估计得到改善,TD 目标仍然通过对下一状态动作的硬最大化来形成。这种最大化隐含地假设 Q 值的相对排序是可靠的。在实践中,尤其是在学习过程中,Q 值往往是有噪声且不确定的。在这种情况下,仅根据最大估计值来选择动作可能很脆弱:贪心算子可能偏向于那些因暂时过估计而显得最优、而非具有真正长期优势的动作。这种不确定性通过自举更新被递归放大,导致有偏的目标和不稳定的学习动态。

这一观察表明,挑战不仅在于准确估计 Q 值,还在于在形成 TD 目标时如何在不确定性下对候选动作进行排序。特别是,标准的贪心备份缺乏任何机制来评估竞争动作值的可靠性。这就引出了一个自然的问题:我们能否在不放弃 Q 学习的简洁性和效率的情况下,为 TD 更新的聚合步骤引入额外结构?这种结构的一个来源是预测环境动力学下动作的直接后果。最近在学习的动力学模型方面的进展\[ha2018recurrent,hafner2025mastering\]表明,短视野回滚能够提供关于动作结果的有意义信息。然而,在大多数现有工作中,这些模型用于规划或数据生成,而不是用于塑造 TD 目标本身。

在本文中,我们提出了 *成功者回滚聚合深度 Q 网络* \(SADQ\),这是一种对 TD 目标构造的简单修改,将一步回滚信息纳入动作比较。SADQ 不是仅仅依赖贪心价值最大化,而是使用基于回滚的评估来指导目标中使用的下一状态动作的选择。重要的是,回滚并不是用来替代 Q 值,而是用来规范化聚合过程,减少对不可靠最大值的敏感性,同时保持标准自举框架。

我们的贡献可总结如下:

- • 我们指出,在噪声价值估计下脆弱的动作聚合是 Q 学习中失稳的结构性来源。
- • 我们提出了 SADQ,一种回滚引导的聚合机制,在不改变底层学习范式的情况下规范化贪心 TD 目标的构造。
- • 我们提供了理论分析,表明所得到的更新在模型误差递减时减少了最大化引起的偏差,同时保持了最优不动点。
- • 我们在各种基准和真实世界决策任务中展示了一致的经验改进。

## 2 相关工作

#### Q 估计的稳定化策略。

Q 学习的核心不稳定性源于自举目标,其中硬最大化算子引入了系统性的过估计偏差,并放大了估计方差\[mnih2015human,sutton2018reinforcement\]。早期工作如 Double DQN 减轻了 Q 值预测中的过估计偏差\[van2016deep\],而 Dueling DQN 将状态价值与优势函数分离\[wang2016dueling\]。更进一步,分布强化学习技术,如 C51\[bellemare2017distributional\] 和 QR-DQN\[dabney2018distributional\],在应用最大化之前对整个回报分布进行建模,从而改变了不确定性通过 max 算子传播的方式\[tang2022nature,schwarzer2023bigger,kastner2025categorical\]。贝叶斯方法也相继出现,将先验知识和自适应探索策略整合到 DQN 框架中\[cao2012bayesian\]。作为这些创新的补充,采样技术被用于在样本层面提高数据效率和探索能力\[osband2015bootstrapped,schaul2015prioritized,elvira2021advances\]。尽管有这些进展,大多数现有方法最终仍会回归到 Q 更新的 max 运算。相比之下,我们的工作明确聚焦于重构基于 max 的 TD 目标本身。

#### 强化学习中的基于模型与生成方法。

基于模型的强化学习利用学习的动力学模型进行规划和决策\[ha2018recurrent,schwarzer2020data,mondal2023efficient\]。例如,循环状态空间模型 \(RSSM\)\[hafner2019learning,hafner2025mastering\] 将变分推断与循环动力学相结合,以推断紧凑的潜在状态。后续方法如 RePo\[zhu2023repo\] 和 Denoised MDP\[wang2022denoised\] 去除了像素重建,并强调与奖励相关的特征,以提高可处理性和任务对齐。为了增强泛化性和鲁棒性,几种方法通过潜在表示上的互信息正则化引入信息瓶颈\[bai2021dynamic,saanum2023reinforcement,tang2023understanding\]。基于扩散的生成模型最近被引入强化学习,作为轨迹建模和合成数据生成的强大工具\[janner2022planning,lu2023synthetic,wang2026off\]。一些方法将策略或价值引导整合到扩散过程中,以使生成偏向于任务相关行为\[rigter2024world,chen2023offline\]。另一些方法采用基于能量的目标来引导强化学习的生成建模\[lu2023contrastive,liu2024energy\]。与利用预测模型进行长视野规划的方法不同,我们的方法采用一步后继者回滚,并将其直接整合到 TD 目标聚合中,从而修改的是更新规则而非规划过程。

#### 与路径一致性方法的关系。

所提出的聚合与路径一致性方法(如 PCZero\[zhao2023generalized\])在概念上具有相似性,后者通过强制沿选定轨迹的一致性来减少方差。PCZero 在历史和搜索扩展状态之上构建一个窗口,并最小化该窗口内的价值变化,反映了沿最优路径的价值应保持一致的原则\[zhao2022efficient\]。式 \(17 (https://arxiv.org/html/2608.03069#S5.E17)\) 中的混合 TD 目标可以被视为这一思想的单步类似物。给定一组回滚信息估计 \(\{\widetilde{Q^\prime}_{\phi}(s^\prime,a^\prime)\}_{a^\prime\in\mathcal{A}}\),我们识别出预测后继结果与贪心备份最一致的动作,并在该动作与标准最大化者之间进行插值。与多步或基于窗口的一致性不同,我们的方法在单个转移的最细时间粒度上操作,直接规范化 TD 更新中的聚合步骤。

#### 与基于模型的价值扩展的关系。

SADQ 与基于模型的价值扩展方法相关,因为两者都利用预测模型信息来改进价值学习。诸如 MVE\[palenicek2022revisiting\] 和 STEVE\[buckman2018sample\] 等方法使用学习的动力学和奖励模型,通过在回滚视野上累积预测奖励,然后从终端预测状态进行自举,来构造扩展的价值目标。相比之下,SADQ 不使用模型来扩展多个回滚步骤的 Bellman 备份。辅助模型为每个候选下一动作提供一个一步前瞻分数,用于改进基于 max 的 TD 目标内部的动作选择步骤。因此,SADQ 与利用预测结构进行价值学习的动机相同,但区别在于模型进入更新的位置。价值扩展通过基于回滚的奖励累积修改目标价值,而 SADQ 修改动作聚合过程,同时将最终的自举价值评估保持在 Q 学习框架内。

## 3 预备知识

### 3\.1 强化学习

强化学习是一种机器学习范式,智能体通过与环境的交互来学习做出决策\[matsuo2022deep,saanum2024reinforcement,zhang2024sf\]。通常,强化学习问题被建模为马尔可夫决策过程 \(MDP\),由元组 \(S,A,P,R,\gamma\) 刻画。其中,\(S\) 表示状态集合,\(A\) 表示动作集合,\(P\) 表示状态转移概率,\(R\) 指定奖励函数,\(\gamma\) 作为折扣因子。智能体的目标是学习一个最优策略 \(\pi^{*}(s)\),以最大化随时间累积的期望回报。

强化学习方法大致可分为基于策略\[schulman2015trust\]、基于价值\[mnih2015human\] 和演员-评论家方法\[haarnoja2018soft\]。基于策略的方法直接学习一个将状态映射到动作的策略 \(\pi(a|s)\),而基于价值的方法侧重于估计价值函数,如 Q 函数 \(Q(s,a)\),以估计动作的质量。鉴于本工作以 DQN 为中心,我们的讨论主要强调基于价值的方法及其与最优策略学习的相关性。

### 3\.2 深度 Q 强化学习

作为基础的深度 Q 强化学习算法,深度 Q 网络 \(DQN\)\[mnih2015human\] 将 Q 学习与深度神经网络相结合,以支持高维状态空间中的决策。特别地,DQN 由两个不同的神经网络组成:主 Q 网络和目标 Q 网络。主 Q 网络(简称为 Q 网络)近似 Q 值 \(Q(s,a)\)。为了稳定训练,一个单独的目标 Q 网络(记为 \(Q^\prime(s,a)\))独立地计算目标 Q 值 \(y\)。训练 Q 网络的优化目标定义为最小化 TD 误差,如下所示:

\[
\mathcal{L}_{Q}=\mathbb{E}_{(s,a,r,s^\prime)\in D}[y-Q(s,a)],
\tag{1}
\]
其中 \((s,a,r,s^\prime)\) 是从经验回放缓冲区 \(\mathcal{D}\) 采样的转移。式 \(1 (https://arxiv.org/html/2608.03069#S3.E1)\) 中的目标 Q 值 \(y\) 由目标 Q 网络 \(Q^\prime\) 计算,公式为:

\[
y=r+\gamma\max_{a^\prime}Q_{\text{target}}(s^\prime,a^\prime),
\tag{2}
\]
式 \(2 (https://arxiv.org/html/2608.03069#S3.E2)\) 中的最大化算子决定了未来价值估计如何聚合到 TD 目标中,使其成为学习动态的关键组成部分。

## 4 动机

#### 观察:

图 1 (https://arxiv.org/html/2608.03069#S4.F1) 显示 DQN 训练通常先经历一个快速提升阶段,然后进入稳定阶段。为了考察在这一转变过程中价值估计如何演化,我们跟踪 Q 差异 \(\Delta_{Q}(s)=\max_{a}Q(s,a)-\min_{a}Q(s,a)\),它直接依赖于 TD 目标中使用的 max-Q 项。如下方面板所示,\(\Delta_{Q}\) 在性能上升阶段增加,在转变点附近达到峰值(虚线),然后随评估回报一起下降到稳定水平。由于 \(\max_{a}Q(s,a)\) 是自举目标中选择的量,性能动态与 \(\Delta_{Q}\) 之间的一致性表明,训练行为与 max-Q 统计量的大小密切相关。特别是,\(\Delta_{Q}\) 的过冲及其后的收缩表明,最大化 Q 值的过度放大在稳定状态下并不能持续,这促使我们更仔细地考察 max-Q 是如何进入 TD 更新的。

参照标题\(a\)
参照标题\(b\)

图 1:上方面板:DQN 在 Acrobot 和 Cartpole 环境中的训练性能。下方面板:Q 差异 \(max Q(s,a)-min Q(s,a)\) 的评估。
#### 洞察:

关键在于动作值之间的大分离是暂时的。一旦学习稳定下来,差异会收缩而不是保持较大。这表明,激进地放大最大的 Q 值并不是良好性能的先决条件,而是在学习过程中价值估计仍然不确定时出现的。在这个阶段,动作值是有噪声的且不断被重塑,但最大化算子将其排序视为完全可靠。通过选择一个最大的估计值,TD 目标可能被那些没有得到底层动力学充分支持的暂时峰值所主导。这些峰值随后通过自举被强化,尽管随着学习的进行它们最终会消退。因此,困难不仅在于准确估计 Q 值,还在于当这些估计仍然不可靠时如何比较动作。

这样的观察提出了一个简单的问题:能否在不放弃 Q 学习基本结构的前提下,使 TD 目标中使用的下一状态评估比单一最大化值更鲁棒?解决这个问题促使我们重新思考如何将预测的未来后果纳入 TD 更新。

相似文章

使用随机梯度马尔可夫链蒙特卡罗的大样本准确不确定性量化

arXiv cs.LG

本文提出了针对带动量和不带动量的随机梯度Langevin动力学(SGLD)的新离散时间近似方法,能够准确预测平稳协方差、迭代平均协方差和积分自相关时间。该方法为大样本不确定性量化提供了改进的调参指导,尤其在模型错误指定情况下。

信任区域Q伴随匹配

Hugging Face Daily Papers

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。