门控Q学习:按需引入离策略偏差
摘要
介绍了门控Q学习(Gated Q-learning),一种新的Q(λ)框架,能够在Watkins和Peng的Q学习之间平滑插值,以权衡离策略偏差和多步信用分配。提供了理论保证以及在随机游走环境中的实证验证。
查看缓存全文
缓存时间: 2026/08/03 07:33
# 将离策略偏差加入口味
来源:https://arxiv.org/html/2607.28916
门控 Q\-学习:将离策略偏差加入口味
Brett Daley
关键词:Q\-学习、离策略学习、偏差\-方差权衡、多步回报、资格迹。
概要多步信用分配对于样本高效的强化学习至关重要,然而在 Q\-学习中管理离策略偏差仍然是一个基本挑战。30 年来,从业者一直面临二选一的困境:以严重截断资格迹为代价消除偏差(Watkins 的 Q\(λ\\lambda\)),或者忽略偏差以加快学习速度,同时将有害误差注入价值估计(Peng 的 Q\(λ\\lambda\))。现代离策略估计器无法解决这一矛盾,因为重要性采样比率在 Q\-学习的贪婪目标策略下会坍缩。我们引入了门控 Q\-学习,一种新颖的算法框架,通过平滑插值两种历史极端情况来终结这一困境。我们的方法不依赖重要性采样,而是采用一种连续的、依赖于状态\-动作的门控机制,以探索感知的方式选择性地衰减资格迹。我们为该机制提供了严格的理论基础,证明了期望算子仍然是压缩映射,并推导出其精确不动点。实证评估验证了中间门控能够安全地启用更长的信用分配时域,从而在初始学习速度上优于任一极端情况。门控 Q\-学习为重要性采样提供了一种简单替代方案,同时允许定制 Q\-学习智能体中的有效多步时域和离策略偏差量。
贡献\(s\)1.我们识别出一类新的、通用的 Q\(λ\\lambda\) 算法,这些算法利用依赖于状态\-动作的迹衰减值。这为 Q\-学习方法中的部分离策略偏差校正提供了新视角,而重要性采样在此处无法应用。背景:状态\-动作依赖迹此前已被研究用于结合重要性采样控制期望 Sarsa 中的离策略偏差(例如,Munos 等人,2016 (https://arxiv.org/html/2607.28916#bib.bib27);Sutton & Barto,2018 (https://arxiv.org/html/2607.28916#bib.bib33),第 12.8 章)。据我们所知,这一思想在 Q\-学习中从未被探索过,除 Watkins 的 Q\(λ\\lambda\)\(Watkins,1989 (https://arxiv.org/html/2607.28916#bib.bib34)\) 之外,后者应用基于探索条件的迹截断来消除离策略偏差。2.我们提出了门控 Q\(λ\\lambda\),它实现了软性的、基于探索条件的迹截断,以减轻离策略偏差,同时保留多步信用分配。我们还简要讨论了一个nnn\-步版本。背景:门控 Q\(λ\\lambda\) 在经典方法 Watkins 的 Q\(λ\\lambda\)\(Watkins,1989 (https://arxiv.org/html/2607.28916#bib.bib34)\) 和 Peng 的 Q\(λ\\lambda\)\(Peng & Williams,1996 (https://arxiv.org/html/2607.28916#bib.bib28)\) 之间平滑插值。3.我们在一个为离策略控制改编的随机游走环境中进行了大规模超参数扫描,生成详细热图以可视化步长、迹衰减和门控对门控 Q\(λ\\lambda\) 的影响。我们的热图清楚地展示了 Watkins 的 Q\(λ\\lambda\) 与 Peng 的 Q\(λ\\lambda\) 之间的性能权衡。背景:Sutton & Barto \(2018 (https://arxiv.org/html/2607.28916#bib.bib33),练习 7.1\) 描述了我们实验中改编的 19 状态随机游走。4.我们推导了这类具有状态\-动作依赖迹的通用 Q\(λ\\lambda\) 算法底层价值函数算子,正式证明了所选择的迹如何影响其压缩率和不动点。背景:Kozuno 等人 \(2021 (https://arxiv.org/html/2607.28916#bib.bib21)\) 为 Peng 的 Q\(λ\\lambda\) 推导了类似结果。我们的定理将这些结果显著推广到新识别出的 Q\(λ\\lambda\) 算法类别。
###### 摘要
多步信用分配对于样本高效的强化学习至关重要,然而在 Q\-学习中管理离策略偏差仍然是一个基本挑战。30 年来,从业者一直面临二选一的困境:以严重截断资格迹为代价消除偏差(Watkins 的 Q\(λ\\lambda\)),或者忽略偏差以加快学习速度,同时将有害误差注入价值估计(Peng 的 Q\(λ\\lambda\))。现代离策略估计器无法解决这一矛盾,因为重要性采样比率在 Q\-学习的贪婪目标策略下会坍缩。我们引入了门控 Q\-学习,一种新颖的算法框架,通过平滑插值两种历史极端情况来终结这一困境。我们的方法不依赖重要性采样,而是采用一种连续的、依赖于状态\-动作的门控机制,以探索感知的方式选择性地衰减资格迹。我们为该机制提供了严格的理论基础,证明了期望算子仍然是压缩映射,并推导出其精确不动点。实证评估验证了中间门控能够安全地启用更长的信用分配时域,从而在初始学习速度上优于任一极端情况。门控 Q\-学习为重要性采样提供了一种简单替代方案,同时允许定制 Q\-学习智能体中的有效多步时域和离策略偏差量。
## 1引言
尽管 Q\-学习\(Watkins,1989 (https://arxiv.org/html/2607.28916#bib.bib34)\) 简单,但它仍然是现代强化学习 \(RL\) 的主流方法。Q\-学习的吸引力在于其理论优雅性,以及它将行为策略与目标策略解耦的能力,允许智能体在探索环境或从历史回放缓冲区学习的同时,不断精炼最优价值的估计。特别是在深度 RL 中,当神经网络作为函数逼近器时,Q\-学习支撑了迄今为止一些最样本高效方法的成功,包括深度 Q 网络\(DQN; Mnih 等人,2015 (https://arxiv.org/html/2607.28916#bib.bib24)\)、Rainbow\(Hessel 等人,2018 (https://arxiv.org/html/2607.28916#bib.bib17)\) 和并行 Q 网络\(PQN; Gallici 等人,2025 (https://arxiv.org/html/2607.28916#bib.bib13)\)。它在离线 RL 中也扮演着关键角色(例如,Fujimoto 等人,2019 (https://arxiv.org/html/2607.28916#bib.bib12);Kumar 等人,2019 (https://arxiv.org/html/2607.28916#bib.bib22);2020 (https://arxiv.org/html/2607.28916#bib.bib23);Kostrikov 等人,2022 (https://arxiv.org/html/2607.28916#bib.bib20)\),其中其离策略特性非常适合从静态数据集学习。因此,推进 Q\-学习的算法基础直接转化为跨大量深度 RL 架构的更广泛改进。
标准 Q\-学习根植于 11\-步时序差分 \(TD\) 学习\(Sutton,1988 (https://arxiv.org/html/2607.28916#bib.bib31)\),它难以在长时间跨度上快速分配信用。多步学习对于加速这一过程至关重要,但天真地应用前向视角回报估计器,如nn\-步回报或λ\\lambda\-回报,在离策略设置中会产生强烈偏差。这种偏差源于智能体的探索行为与目标贪婪行为之间的分布不匹配。理论上正确的方法是通过在采取探索性动作时截断多步回报估计来消除这种偏差,就像 Watkins 的 Q\(λ\\lambda\)\(Watkins,1989 (https://arxiv.org/html/2607.28916#bib.bib34)\) 所做的那样。然而,经验证据表明,简单地*忽略*这些校正往往能带来更优性能\(Daley & Amato,2019 (https://arxiv.org/html/2607.28916#bib.bib7);Hernandez\-Garcia & Sutton,2018 (https://arxiv.org/html/2607.28916#bib.bib16)\),这正是 Peng 的 Q\(λ\\lambda\)\(Peng & Williams,1996 (https://arxiv.org/html/2607.28916#bib.bib28)\) 背后的动机。从业者因此面临有限的选择:要么严格消除偏差,以严重截断和更慢的学习为代价;要么接受偏差,最终限制可以安全部署的多步回报的长度。
尽管确实存在能够对离策略偏差进行更细粒度控制的多步离策略估计器,但它们依赖重要性采样\(Kahn & Marshall,1953 (https://arxiv.org/html/2607.28916#bib.bib19)\),因此与 Q\-学习不兼容。关键例子包括 Tree Backup\(Precup 等人,2000 (https://arxiv.org/html/2607.28916#bib.bib29)\)、Retrace\(Munos 等人,2016 (https://arxiv.org/html/2607.28916#bib.bib27)\) 和基于近期性界限的重要性采样\(Daley 等人,2023 (https://arxiv.org/html/2607.28916#bib.bib8)\)——所有这些方法都根据目标策略与行为策略所赋予动作概率的比率来调整强化程度。然而,在 Q\-学习中,目标策略是严格贪婪的,导致重要性采样比率变为二值。因此,这一类方法整体退化为同样激进的 Watkins 式校正,而如前所述,这种校正无法保留快速学习所需的较长信用分配时域。
显然需要一种新机制来调节多步 Q\-学习中的离策略偏差,而不使用重要性采样。我们提出了一种新颖方法,利用自适应λ\\lambda\-值,在采取探索性(非贪婪)动作时部分“门控”资格迹的传播。我们称这种算法为*门控 Q\(λ\\lambda\)*,它减轻了部分但非全部的离策略偏差,同时沿贪婪轨迹保留迹。这一策略在原则性(但缓慢)的 Watkins 更新和有偏(但快速)的 Peng 更新之间平滑插值。我们假设平衡这种权衡会导致比任一极端情况更优的学习性能。门控 Q\-学习在概念上类似于长短期记忆 \(LSTM\) 网络\(Hochreiter & Schmidhuber,1997 (https://arxiv.org/html/2607.28916#bib.bib18)\)、门控循环单元\(GRUs; Cho 等人,2014 (https://arxiv.org/html/2607.28916#bib.bib4);Chung 等人,2014 (https://arxiv.org/html/2607.28916#bib.bib5)\) 和门控注意力\(Xu 等人,2015 (https://arxiv.org/html/2607.28916#bib.bib36);Dhingra 等人,2017 (https://arxiv.org/html/2607.28916#bib.bib10)\) 中发现的门控机制,其名称也受到启发,但其作用不同——它调节 RL 中的信用分配。
我们的论文致力于深入理解这种门控机制在离策略信用分配中的性质和影响。我们主要关注资格迹和λ\\lambda\-回报,尽管我们也简要讨论了一个nnn\-步变体(见第 ̃4.2 节 (https://arxiv.org/html/2607.28916#S4.SS2)\)。我们首先将门控 Q\(λ\\lambda\) 推导为一类新的、更通用的 Q\(λ\\lambda\) 的特例,该类允许状态\-动作依赖的λ\\lambda\-值,同时以贪婪策略为目标——后者是与 \(2016 (https://arxiv.org/html/2607.28916#bib.bib27)\) 的逐决策算子相比的关键不同点。这大大拓宽了我们理论分析的范围,同时有助于背景化并证明我们自适应门控策略的具体选择是合理的。然后,我们在随机游走中进行一项聚焦的超参数研究,以说明门控机制如何影响信用分配和学习速度。基于这些实证见解,我们正式分析门控 Q\(λ\\lambda\),以确定其压缩率和不动点,为迹保留与离策略偏差之间的权衡提供清晰的理论证明。我们的结果表明,仍然存在可发现的基本 Q\-学习改进,并且通过将离策略偏差调整到期望的中间量,可以同时实现更快的学习和更低的渐近误差。
## 2背景
RL 问题考虑一个智能体,其目标是在环境中学习采取行动,以最大化其期望的累积折扣奖励。自Watkins \(1989 (https://arxiv.org/html/2607.28916#bib.bib34)\) 的开创性工作引入 Q\-学习以来,RL 问题最常被表述为从基于样本的交互中求解马尔可夫决策过程 \(MDP\)。MDP 通常由元组\(S,A,p,r\)\(\\mathcal\{S\},\\mathcal\{A\},p,r\) 描述。在每个离散时间步t≥0t\\geq 0,智能体观察状态St∈SS\_\{t\}\\in\\mathcal\{S\},并根据行为策略b\(a\|s\)b\(a\|s\) 选择一个动作At∈AA\_\{t\}\\in\\mathcal\{A\},该策略将状态映射为动作上的概率分布。然后环境根据转移动力学p\(s′∣s,a\)p\(s^\{\\prime\}\\mid s,a\) 转移到新状态St\+1S\_\{t\+1\},智能体收到由奖励函数r\(s,a\)r\(s,a\) 控制的标量奖励Rt\+1R\_\{t\+1\}。智能体的基本目标是最大化期望回报,定义为折扣未来奖励的累积和,Gt≔∑i=0∞γiRt\+i\+1G\_\{t\}\\coloneqq\\sum\_\{i=0\}^\{\\infty\}\\gamma^\{i\}R\_\{t\+i\+1\},其中γ∈\[0,1\)\\gamma\\in\[0,1\) 是折扣因子。在离策略学习中,我们明确区分这个行为策略 \(它探索环境并生成轨迹数据\) 与目标策略π\(a\|s\)\\pi\(a\|s\),即算法试图评估或优化的不同策略。
为了衡量策略π\\pi 的质量,我们定义动作价值函数qπ\(s,a\)≔Eπ\[Gt∣St=s,At=a\]q\_\{\\pi\}\(s,a\)\\coloneqq\{\\mathbb\{E\}\_\{\\pi\}\[G\_\{t\}\\mid S\_\{t\}=s,A\_\{t\}=a\]\},它表示在状态ss 中采取动作aa 并随后遵循π\\pi 的期望回报。Q\-学习旨在通过学习最优动作价值函数q∗q\_\{\*\},将这些估计表示为一个表格矩阵或参数化函数Q∈R\|S×A\|Q\\in\\mathbb\{R\}^\{\\absolutevalue\{\\mathcal\{S\}\\times\\mathcal\{A\}\}\}。Q\-学习的显著特征是,其目标策略始终相对于当前价值估计是*贪婪的*。因此,一个状态的估计价值由下式给出
V\(s\)≔maxa∈AQ\(s,a\),V\(s\)\\coloneqq\\max\_\{a\\in\\mathcal\{A\}\}Q\(s,a\)\\,其中终止状态的价值总是定义为0。经典的 1\-步 Q\-学习更新规则定义为
Q\(St,At\)←Q\(St,At\)\+α\(Rt\+1\+γV\(St\+1\)−Q\(St,At\)⏟δt′\),Q\(S\_\{t\},A\_\{t\}\)\\leftarrow Q\(S\_\{t\},A\_\{t\}\)\+\\alpha\\Bigl\(\\underbrace\{R\_\{t\+1\}\+\\gamma V\(S\_\{t\+1\}\)\-Q\(S\_\{t\},A\_\{t\}\)\}\_\{\\delta^\{\\prime\}\_\{t\}\}\\Bigr\)\\,其中α∈\(0,1\]\\alpha\\in\(0,1\] 是步长。我们将量δt′\\delta^\{\\prime\}\_\{t\} 称为*Q\-学习 \(QL\) 误差*,以区别于经典的状态价值 TD 误差。基于贝尔曼最优性方程\(Bellman,1957 (https://arxiv.org/html/2607.28916#bib.bib2)\),这种 1\-步更新非常稳健,并保证在表格设置中收敛到q∗q\_\{\*\}\(Watkins & Dayan,1992 (https://arxiv.org/html/2607.28916#bib.bib35)\)。然而,由于未来奖励的信息仅通过即时自举传递,其 1\-步特性导致信用分配极其缓慢,因为奖励必须在反复的回合交互中,一次一步地通过状态\-动作空间向后传播。
为了克服缓慢的信用分配,我们可以考虑 Q\-学习的*多步*版本,将 1\-步目标替换为广义多步回报估计器G^t\\hat\{G\}\_\{t\}:
Q\(St,At\)←Q\(St,At\)\+α\(G^t−Q\(St,At\)\)。Q\(S\_\{t\},A\_\{t\}\)\\leftarrow Q\(S\_\{t\},A\_\{t\}\)\+\\alpha\\Bigl\(\\hat\{G\}\_相似文章
Drift Q-Learning
提出了DriftQL,它结合了基于漂移的行为正则化器与评论家驱动的策略改进,用于离线强化学习,在D4RL和OGBench上优于扩散和流方法,同时保持简单性和效率。
用于样本高效连续控制的无偏模型化表示
本文介绍了 DR.Q 算法,该算法通过最大化互信息并采用淡出优先经验回放,改善了 Q-learning 的模型化表示,从而减少了连续控制任务中的偏差和过拟合。
策略梯度与软Q学习之间的等价性
# 策略梯度与软Q学习之间的等价性 来源:[https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/](https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/) OpenAI ## 摘要 策略梯度方法和Q学习方法是无模型强化学习中两种主要方法。Q学习方法在有效时样本效率很高,但目前还不太清楚它们为什么能够工作
基于块策略漂移门控的在线策略蒸馏
本文提出了一种轻量级的基于块策略漂移门控方法,通过根据新旧学生概率变化对损失进行加权,改进了语言模型的在线策略蒸馏,在数学基准上取得了更高的推理准确性。
Reversal Q-Learning
本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。