深度强化学习评估与设计范式的原则性分析

arXiv cs.LG 论文

摘要

本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。

arXiv:2607.07769v1 公告类型:新 摘要:从利用深度神经网络逼近状态-动作价值函数从而赢得最具挑战性的游戏之一,到算法进步使得即使不明确说明问题规则也能解决问题,强化学习研究在过去十年中一直是显著科学进步的核心。本文聚焦于这一研究进展的关键要素,分析了强化学习中的经典评估与设计范式。我们引入了强化学习中缩放定律的理论基础,并展示了强化学习算法的渐近性能在性能排名与数据范围之间并不存在单调关系。我们进行了大规模实验,结果表明,在经典设计与评估范式下的一系列强化学习研究得出了错误的结论。我们的分析和结果为深度强化学习的缩放、容量和复杂性提供了核心分析。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:15

# 深度强化学习评估与设计范式的原理分析 来源:https://arxiv.org/html/2607.07769 ###### 摘要 从利用深度神经网络近似状态-动作价值函数从而攻克最具挑战性的游戏之一,到算法进步使得无需明确阐述任务规则即可解决问题,强化学习研究在过去十年中一直是显著科学进展的中心。在本文中,我们聚焦于这一研究进展的关键要素,并分析了强化学习中经典的评估与设计范式。我们介绍了强化学习中缩放定律的理论基础,并证明强化学习算法的渐近性能在性能排名与数据规模之间并不存在单调关系。我们进行大规模实验,结果表明,在经典设计和评估范式下的一系列强化学习研究得出了错误结论。我们的分析和结果为深度强化学习的缩放、容量和复杂性提供了核心分析。 ## 1 引言 基于严格的理论保证,强化学习研究在首次提出通过深度神经网络近似状态-动作价值函数的研究后实现了高速发展 (Mnih et al. 2015 (https://arxiv.org/html/2607.07769#bib.bib126); Stiennon et al. 2020 (https://arxiv.org/html/2607.07769#bib.bib84); Schrittwieser et al. 2020 (https://arxiv.org/html/2607.07769#bib.bib19); Lee et al. 2024 (https://arxiv.org/html/2607.07769#bib.bib85); Korkmaz 2025 (https://arxiv.org/html/2607.07769#bib.bib51))。一系列非常成功的深度强化学习算法被提出 (Hasselt et al. 2016 (https://arxiv.org/html/2607.07769#bib.bib72); Wang et al. 2016 (https://arxiv.org/html/2607.07769#bib.bib163); Hessel et al. 2018 (https://arxiv.org/html/2607.07769#bib.bib61), 2021 (https://arxiv.org/html/2607.07769#bib.bib48); Kapturowski et al. 2023 (https://arxiv.org/html/2607.07769#bib.bib21); Korkmaz 2024 (https://arxiv.org/html/2607.07769#bib.bib42)),这些研究聚焦于不同的架构思想或针对过估计问题的基础理论,它们均在高数据域(即两亿帧训练)中设计和测试。另一条近期研究路线(有大量论文)专注于在低数据域(即十万次环境交互训练)中提升深度强化学习策略的性能极限。当前强化学习研究中的许多不同概念,从架构提议到学习环境的底层动态,都因仅在低数据域基准中的策略性能比较而加速发展并获得显著关注,成长为几个主要研究领域。在本文中,我们聚焦于深度强化学习研究中的评估范式、隐含假设和经典方法选择,并证明存在一个显著被忽视的根本前提,它驱动着这条研究路线却未被明确讨论:即深度强化学习算法的性能曲线与不同样本复杂度域之间存在单调关系。我们表明,这一在大量低数据域研究中普遍共享的隐含假设,塑造了深度强化学习研究中经典设计和评估选择的方式,并且代表了科学进展中的一个显著误导方向。从这些经典选择中得出的次优结论,以错误的推理塑造了未来的研究方向。我们证明,这些方法论决策助长了不正确的理由和结论,从而将研究努力误导到某些概念上多年。因此,在本文中,我们针对这些根本前提,旨在回答以下问题:*深度强化学习研究中哪些隐含假设和经典选择从根本上影响了所做出的结论?* *从数据稀缺域到渐近域,样本复杂度与算法性能之间的基础关系是什么?* 因此,为了回答上述问题,我们在本文中聚焦于深度强化学习的底层设计和评估范式,并做出以下贡献: - •我们分析了深度强化学习研究中的评估范式和经典方法选择,并介绍了这些方法选择如何影响算法设计、性能比较和算法结论的理论基础。我们的分析为深度强化学习的缩放、容量和复杂性奠定了基础。 - •我们的理论分析证明,性能曲线与渐近样本复杂度和低数据样本复杂度域之间存在非单调关系。关于大规模隐含假设实例的核心焦点,我们的结果表明,一系列深度强化学习研究中所做的经典方法选择导致了不正确的理由和结论。 - •我们在低数据域和高数据域街机学习环境基准中,对全面且多样的深度强化学习基线算法进行了大规模扩展实验。我们的结果表明,最近在街机学习环境 100K 基准中提出和评估的算法,严重受到关于性能曲线与样本复杂度之间关系的隐含假设的影响,导致算法评估中的系统性偏差。 ## 2 背景与预备知识 强化学习问题被形式化为一个马尔可夫决策过程 (MDP),表示为一个元组 ⟨S,A,P,R,γ,ρ0⟩\\langle S,A,\\mathcal\{P\},\\mathcal\{R\},\\gamma,\\rho\_\{0\}\\rangle,其中 SSSS 表示状态空间,AAAA 表示动作集,P\\mathcal\{P\} 表示 S×A×SS\\times A\\times S 上的转移概率分布,R:S×A→R\\mathcal\{R\}:S\\times A\\to\\mathbb\{R\} 表示奖励函数,γ∈\(0,1\]\\gamma\\in\(0,1\] 表示折扣因子。强化学习的目标是学习一个最优策略 π\(s,a\)\\pi\(s,a\),将状态观测映射到动作 π:S→Δ\(A\)\\pi:S\\to\\Delta\(A\),以最大化期望累积折扣奖励 R=Eat∼π\(st,⋅\)∑tγtR\(st,at,st\+1\)R=\\mathbb\{E\}\_\{a\_\{t\}\\sim\\pi\(s\_\{t\},\\cdot\)\}\\sum\_\{t\}\\gamma^\{t\}\\mathcal\{R\}\(s\_\{t\},a\_\{t\},s\_\{t\+1\}\)。该目标通过构建一个状态-动作价值函数来实现,该函数学习每个状态-动作对的期望累积折扣奖励,即如果在状态 s∈Ss\\in S 中执行动作 a∈Aa\\in A 将获得的值。 Q\(s,a\)=∑s′P\(s′\|s,a\)\[R\(s,a,s′\)\+γV\(s′\)\]\\mathcal\{Q\}\(s,a\)=\\sum\_\{s^\{\\prime\}\}\\mathcal\{P\}\(s^\{\\prime\}\|s,a\)\[\\mathcal\{R\}\(s,a,s^\{\\prime\}\)\+\\gamma\\mathcal\{V\}\(s^\{\\prime\}\)\] 在状态空间和/或动作空间足够大以致状态-动作价值函数 Q\(s,a\)\\mathcal\{Q\}\(s,a\) 无法以表格形式保存的情况下,使用函数近似器。因此,对于深度强化学习,Q\\mathcal\{Q\} 函数通过深度神经网络近似 θt\+1=θt\+α\(\\displaystyle\\theta\_\{t\+1\}=\\theta\_\{t\}\+\\alpha\(R\(st,at,st\+1\)\\displaystyle\\mathcal\{R\}\(s\_\{t\},a\_\{t\},s\_\{t\+1\}\)\+γQ\(st\+1,argmaxa⁡Q\(st\+1,a;θt\);θt\)\\displaystyle\+\\gamma\\mathcal\{Q\}\(s\_\{t\+1\},\\operatorname\*\{arg\\,max\}\_\{a\}\\mathcal\{Q\}\(s\_\{t\+1\},a;\\theta\_\{t\}\);\\theta\_\{t\}\)−Q\(st,at;θt\)\)∇θtQ\(st,at;θt\)\.\\displaystyle\\qquad\\qquad\\qquad\\qquad\\qquad\-\\mathcal\{Q\}\(s\_\{t\},a\_\{t\};\\theta\_\{t\}\)\)\\nabla\_\{\\theta\_\{t\}\}\\mathcal\{Q\}\(s\_\{t\},a\_\{t\};\\theta\_\{t\}\)\. 对偶架构:对偶架构 (Wang et al. 2016 (https://arxiv.org/html/2607.07769#bib.bib163)) 输出两个全连接层流,分别用于估计给定状态 ssss 下每个动作的优势函数 A\(s,a\)\\mathcal\{A\}\(s,a\),A\(s,a\)=Q\(s,a\)−maxa⁡Q\(s,a\)\\mathcal\{A\}\(s,a\)=\\mathcal\{Q\}\(s,a\)\-\\max\_\{a\}\\mathcal\{Q\}\(s,a\),以及状态值函数 V\(s\)\\mathcal\{V\}\(s\)。特别地,对偶架构的最后一层包含前向映射 Q\(s,a;θ,α,β\)=V\(s;θ,β\)\+\(A\(s,a;θ,α\)−maxa′∈A⁡A\(s,a′;θ,α\)\)\\mathcal\{Q\}\(s,a;\\theta,\\alpha,\\beta\)=\\mathcal\{V\}\(s;\\theta,\\beta\)\+\\big\(\\mathcal\{A\}\(s,a;\\theta,\\alpha\)\-\\max\_\{a^\{\\prime\}\\in A\}\\mathcal\{A\}\(s,a^\{\\prime\};\\theta,\\alpha\)\\big\),其中 θ\\theta 表示卷积层的参数,α\\alpha 和 β\\beta 分别表示输出优势估计和状态值估计的全连接层参数。 固有高容量模型:第一个被提议具有固有高容量的算法是 C51。特别地,第 iii^\\{\\textrm\{th\}\\} 个原子的投影贝尔曼更新计算为 \(ΦTZθ\(st,at\)\)i\\displaystyle\(\\Phi\\mathcal\{T\}\\mathcal\{Z\}\_\{\\theta\}\(s\_\{t\},a\_\{t\}\)\)\_\{i\}=∑jN−1\[1−\|\[Tzj\]vminvmax−zi\|Δz\]01\\displaystyle=\\sum\_\{j\}^\{\\mathcal\{N\}\-1\}\\big\[1\-\\dfrac\{\|\[\\mathcal\{T\}z\_\{j\}\]^\{v\_\{\\textrm\{max\}\}\}\_\{v\_\{\\textrm\{min\}\}\}\-z\_\{i\}\|\}\{\\Delta z\}\\big\]^\{1\}\_\{0\}τj\(st\+1,maxa∈A⁡EZθ\(st\+1,a\)\)\\displaystyle\\qquad\\qquad\\quad\\tau\_\{j\}\(s\_\{t\+1\},\\max\_\{a\\in A\}\\mathbb\{E\}\\mathcal\{Z\}\_\{\\theta\}\(s\_\{t\+1\},a\)\),其中 zi=vmin\+iΔz:0≤i<Nz\_\{i\}=v\_\{\\textrm\{min\}\}\+i\\Delta z:0\\leq i<\\mathcal\{N\} 表示分类学习中的原子集,原子概率被学习为一个参数模型 (Bellemare et al. 2017 (https://arxiv.org/html/2607.07769#bib.bib165)) τi\(st,maxa∈A⁡EZθ\(st,a\)\)=eθi\(st,at\)∑jeθj\(st,at\),Δz:=vmax−vminN−1\\tau\_\{i\}\(s\_\{t\},\\max\_\{a\\in A\}\\mathbb\{E\}\\mathcal\{Z\}\_\{\\theta\}\(s\_\{t\},a\)\)=\\dfrac\{e^\{\\theta\_\{i\}\(s\_\{t\},a\_\{t\}\)\}\}\{\\sum\_\{j\}e^\{\\theta\_\{j\}\(s\_\{t\},a\_\{t\}\)\}\}\\\>\\\>\\textrm\{,\}\\\>\\\>\\Delta z:=\\dfrac\{v\_\{\\textrm\{max\}\}\-v\_\{\\textrm\{min\}\}\}\{\\mathcal\{N\}\-1\} 在此基线之后,Q\\mathcal\{Q\}RDQ\\mathcal\{Q\}N 算法 (Dabney et al. 2018b (https://arxiv.org/html/2607.07769#bib.bib53)) 被提出以学习分位数投影 TZ\(st,at\)=R\(\\displaystyle\\mathcal\{T\}\\mathcal\{Z\}\(s\_\{t\},a\_\{t\}\)=\\mathcal\{R\}\(st,at,st\+1\)\\displaystyle s\_\{t\},a\_\{t\},s\_\{t\+1\}\)\+γZ\(st\+1,argmaxa∈A⁡Ez∼Z\(st\+1,at\+1\)\[z\]\)\\displaystyle\+\\gamma\\mathcal\{Z\}\(s\_\{t\+1\},\\operatorname\*\{arg\\,max\}\_\{a\\in A\}\\mathbb\{E\}\_\{z\\sim\\mathcal\{Z\}\(s\_\{t\+1\},a\_\{t\+1\}\)\}\[z\]\),其中 st\+1∼P\(⋅\|st,at\)s\_\{t\+1\}\\sim\\mathcal\{P\}\(\\cdot\|s\_\{t\},a\_\{t\}\),Z∈Z\\mathcal\{Z\}\\in Z 表示任意价值函数的分位数分布。在此研究之后,IQ\\mathcal\{Q\}N 算法 (Dabney et al. 2018a (https://arxiv.org/html/2607.07769#bib.bib47)) 被提出,以学习完整的分位数函数,而不是像 Q\\mathcal\{Q\}RDQ\\mathcal\{Q\}N 算法那样学习一组离散的分位数。IQ\\mathcal\{Q\}N 算法的目标是最小化损失函数 L=1K\\displaystyle\\mathcal\{L\}=\\dfrac\{1\}\{\\mathcal\{K\}\}∑i=1K∑j=1K′ρδ\(R\(st,at,st\+1\)\\displaystyle\\sum\_\{i=1\}^\{\\mathcal\{K\}\}\\sum\_\{j=1\}^\{\\mathcal\{K^\{\\prime\}\}\\}\rho\_\{\\delta\}\(\\mathcal\{R\}\(s\_\{t\},a\_\{t\},s\_\{t\+1\}\)\(1\)\+γZδj′\(st\+1,argmaxa∈AQβ\(st,at\)\)−Zδi\(st,at\)\)\\displaystyle\+\\gamma\\mathcal\{Z\}\_\{\{\\delta^\{\\prime\}\_\{j\}\}\}\(s\_\{t\+1\},\\operatorname\*\{arg\\,max\}\_\{a\\in A\}\\mathcal\{Q\}\_\{\\beta\}\(s\_\{t\},a\_\{t\}\)\)\-\\mathcal\{Z\}\_\{\\delta\_\{i\}\}\(s\_\{t\},a\_\{t\}\)\),其中 ρδ\\rho\_\{\\delta\} 表示 Huber 分位数回归损失,Qβ=∫01FZ−1\(δ\)dβ\(δ\)\\mathcal\{Q\}\_\{\\beta\}=\\int^\{1\}\_\{0\}\\mathcal\{F\}^\{\-1\}\_\{\\mathcal\{Z\}\}\(\\delta\)d\\beta\(\\delta\)。注意 Zδ=FZ−1\(δ\)\\mathcal\{Z\}\_\{\\delta\}=\\mathcal\{F\}^\{\-1\}\_\{\\mathcal\{Z\}\}\(\\delta\) 是随机变量 Z\\mathcal\{Z\} 在 δ∈\[0,1\]\\delta\\in\[0,1\] 处的分位数函数。 ## 3 低数据域与渐近性能 我们的论文通过广泛的实证分析和理论研究发现,强化学习算法的渐近性能不一定为其在低数据域中的相对性能排名提供任何信息或指示。第 6 节 (https://arxiv.org/html/2607.07769#S6) 中的结果广泛表明,强化学习研究中的大量工作都持有这一假设,并得出了错误的结论。在本节中,我们介绍我们发现的理论基础,该发现由我们在第 6 节 (https://arxiv.org/html/2607.07769#S6) 中的广泛实证分析揭示,涉及到非平稳策略的优化,即在无折扣、有限时域 MDP 中,奖励和转移可能在回合中的每一步变化,并使用线性函数近似。特别地,有限时域 MDP 表示为一个元组 ⟨S,A,P,R,H⟩\\langle S,A,\\mathcal\{P\},\\mathcal\{R\},\\mathcal\{H\}\\rangle,其中 SSSS 是状态集,AAAA 表示动作集。对于每个时间步 t∈\[H\]=\{1,...,H\}t\\in\[\\mathcal\{H\}\]=\\\{1,\\dots,\\mathcal\{H\}\\\},状态 ssss 和动作 aaaa,转移概率核 Pt\(s′\|s,a\)\\mathcal\{P\}\_\{t\}\(s^\{\\prime\}\|s,a\) 给出下一个状态的概率分布,奖励 Rt\(s,a,s′\)\\mathcal\{R\}\_\{t\}\(s,a,s^\{\\prime\}\) 给出即时奖励。一个非平稳策略 π=\(π1,...,πH\)\\pi=\(\\pi\_\{1\},\\dots,\\pi\_\{\\mathcal\{H\}\}\) 引入的状态-动作价值函数由下式给出 Qtπ\(s,a\)=E\[∑h=tHRh\(sh,πh\(sh\),sh\+1\)\|sh=s,ah=a\]\\displaystyle\\mathcal\{Q\}\_\{t\}^\{\\pi\}\(s,a\)=\\mathbb\{E\}\\left\[\\sum\_\{h=t\}^\{\\mathcal\{H\}\}\\mathcal\{R\}\_\{h\}\(s\_\{h\},\\pi\_\{h\}\(s\_\{h\}\),s\_\{h\+1\}\)\\bigg\|s\_\{h\}=s,a\_\{h\}=a\\right\],其中我们令 ah∼πh\(sh\)a\_\{h\}\\sim\\pi\_\{h\}\(s\_\{h\}\),对应的价值函数为 Vtπ\(s\)=Qt\(s,πt\(s\)\)\\mathcal\{V\}\_\{t\}^\{\\pi\}\(s\)=\\mathcal\{Q\}\_\{t\}\(s,\\pi\_\{t\}\(s\)\)。最优非平稳策略 π∗\\pi^\{\*\} 的价值函数 Vt∗\(s\)=Vtπ∗\(s\)\\mathcal\{V\}\_\{t\}^\{\*\}\(s\)=\\mathcal\{V\}\_\{t\}^\{\\pi^\{\*\}\}\(s\) 满足 Vt∗\(s\)=supπVtπ\(s\)。\\mathcal\{V\}\_\{t\}^\{\*\}\(s\)=\\sup\_\{\\pi\}\\mathcal\{V\}\_\{t\}^\{\\pi\}\(s\)。目标是学习一个非平稳策略序列 πk\\pi^\{k\}(对于 k∈\{1,...,K\}k\\in\\\{1,\\dots,\\mathcal\{K\}\\\}),同时与一个未知的 MDP 交互,以最小化遗憾,该遗憾在 K\\mathcal\{K\} 个长度为 H\\mathcal\{H\} 的回合上渐近度量,Regret\(K\)=∑k=1K\(V1∗\(s1k\)−V1πk\(s1k\)\)\\textsc\{Regret\}\(\\mathcal\{K\}\)=\\sum\_\{k=1\}^\{\\mathcal\{K\}\}\\left\(\\mathcal\{V\}\_\{1\}^\{\*\}\(s^\{k\}\_\{1\}\)\-\\mathcal\{V\}\_\{1\}^\{\\pi^\{k\}\}\(s^\{k\}\_\{1\}\)\\right\),其中 s1k∈Ss^\{k\}\_\{1\}\\in S 是第 kkkk 个回合的起始状态。遗憾求和了在 K\\mathcal\{K\} 个回合学习过程中,学习策略序列 πk\\pi^\{k\} 获得的期望奖励与 π∗\\pi^\{\*\} 获得的期望奖励之间的差距。在线性函数近似设置中,对于每个 t∈\[H\]t\\in\[\\mathcal\{H\}\],存在一个特征映射 φt:S×A→Rdt\\phi\_\{t\}:S\\times A\\to\\mathbb\{R\}^\{d\_\{t\}\},它将一个状态

相似文章

深度强化学习中的性能变异

arXiv cs.LG

本文指出了深度强化学习中传统不确定性估计的局限性,并提出基于百分位数的统计量和可视化方法,以更好地评估运行间性能变异。案例研究展示了该方法在PPO、SAC、TD-MPC、DQN和Rainbow算法上的应用。

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。