面向低方差在线策略评估的鲁棒数据收集策略学习
摘要
本文提出了一种鲁棒的基于梯度的算法,用于学习行为策略,以降低在线强化学习策略评估中的方差,通过理论保证和数值验证来处理转移函数中的不确定性。
查看缓存全文
缓存时间: 2026/08/26 09:34
# 用于低方差在线策略评估的鲁棒数据收集策略学习 来源: https://arxiv.org/html/2608.24146 作者: Shoze Daniel Liu 机构:麻省理工学院 邮箱:[[email protected]](mailto:) 机构:普渡大学 邮箱:[[email protected]](mailto:) Licheng Luo 机构:加州大学河滨分校 邮箱:[[email protected]](mailto:) Rohan Chandra 机构:弗吉尼亚大学 邮箱:[[email protected]](mailto:) Nan Jiang 机构:伊利诺伊大学厄巴纳-香槟分校 邮箱:[[email protected]](mailto:) Shangtong Zhang 机构:弗吉尼亚大学 邮箱:[[email protected]](mailto:) ###### 摘要 在强化学习的策略评估中,经典的同策略方法在估计策略性能时往往具有高方差。为了缓解这一问题,提出了行为策略搜索,旨在学习为降低在线评估方差而定制的数据收集策略。然而,这些方法未考虑转移函数的不确定性。实践中,由于建模误差或近似限制,模拟器的转移过程通常与真实世界不同。因此,在模拟环境中训练的行为策略在部署到真实环境时可能仍会导致高方差,从而产生对真实世界评估样本的高成本依赖。本文提出了一种基于双层梯度的算法,用于学习既高效又对转移不确定性具有鲁棒性的行为策略。理论上,我们推导了新的转移方差梯度表达式,并建立了算法的全局收敛保证。数值实验表明,与现有方法相比,我们的方法对转移扰动的敏感性更低,为其实际效用提供了支持证据。 ## 1 引言 近年来,强化学习(RL)在机器人、医疗保健、推荐系统和自然语言处理等领域取得了显著成功(Mnih 等,2015;Silver 等,2017;Jumper 等,2021;Xie 等,2026;Liu 等,2026c;Liu 等,2026d)。这些进步的一个核心组成部分是策略评估,即估计策略性能的任务。最直接的方法是同策略蒙特卡洛方法,它收集目标策略的轨迹,并通过对观察到的回报取平均来估计其价值。尽管概念简单且应用广泛,但此方法通常具有高评估方差,限制了所得估计的可靠性。为了提高效率,越来越多的研究开始探索学习单独的数据收集行为策略,通过离策略评估来降低方差(Hanna 等,2017;Zhong 等,2022;Liu 和 Zhang,2024;Liu 等,2025a;Liu,2025)。这一研究方向被称为行为策略搜索,它优化一个方差减少的行为策略,使收集的轨迹产生更具信息性的评估。通过适当选择行为策略,行为策略搜索已被证明可以实现比朴素同策略评估更低的方差。相比之下,在标准离策略评估中,数据被假定由一个固定行为策略预先记录,重点在于设计改进的估计器。相比之下,行为策略搜索显式地优化行为策略本身以降低方差,并且适用于不同的离策略评估器。 尽管取得了这些进展,但现有的行为策略搜索方法通常在预设的转移函数下优化行为策略,而未考虑底层的不确定性。实践中,真实的转移函数往往由于近似误差、对抗性扰动或部分可观测性而偏离假定的模型。这种差异会损害评估的可靠性:在模拟器转移下优化的行为策略在部署到真实环境时可能仍然会导致高方差。因此,先前的方法可能仍然需要大量昂贵的真实世界样本来实现准确的评估。 为了解决方差减少和转移不匹配这两个挑战,我们提出了一种**高效且鲁棒的策略评估框架**,该框架明确考虑了转移不确定性。我们将行为策略搜索建模为一个最小化最大化问题,其中对抗性转移模型试图最大化评估方差,而行为策略则被优化以最小化它。我们的贡献总结如下: (1) 我们为策略评估中的鲁棒行为策略搜索引入了一个新颖的对抗性框架(第3.3节); (2) 我们推导了同转移和离转移设置下的解析转移梯度表达式,并为内循环的对抗性优化提供了收敛保证(第4节); (3) 我们提出了一种双层鲁棒梯度算法,并为方差最小化的行为策略搜索提供了全局收敛保证(第5节); (4) 我们通过数值实验证明,与现有方法相比,我们的方法对转移扰动的敏感性更低(第6节),验证了我们理论结果的实用性。 ## 2 相关工作 **行为策略搜索**。行为策略搜索通过优化数据收集策略来减少评估方差。Hanna 等(2017)将其表述为一个优化问题,使用随机梯度下降来优于标准的蒙特卡洛方法。Zhong 等(2022)通过自适应行为策略扩展了这一方法,优先考虑欠采样区域。然而,这些方法忽略了转移不确定性;因此,在模拟中优化的行为策略在真实世界动态下可能仍然会导致高方差。相比之下,我们的方法明确地建模了转移不确定性,以确保学习到的行为策略即使在扰动动态下仍然有效。Liu 和 Zhang(2024)也研究了方差减少问题,推导了一个具有理论保证的闭式、可离线学习的行为策略。然而,他们的公式依赖于预先记录的具有预设和固定转移概率的数据,当这些概率在部署时发生转变时无法适应,使其容易受到建模误差和模拟到现实不匹配的影响。我们的方法通过将对抗性转移建模集成到行为策略搜索中,填补了这一空白,将效率与对转移变化的鲁棒性相结合。类似地,虽然Russo 和 Pacchiano(2025)优化了用于多策略评估的自适应探索,但他们假设固定的动态;相比之下,我们的框架主动针对对抗性转移变化的鲁棒性。 **鲁棒策略评估**。近期的工作开始关注强化学习策略评估的鲁棒性。例如,Katdare 等(2023)和Voloshin 等(2021)提出了通过估计器修改或鲁棒模型学习来提高模拟器不匹配下的鲁棒性的技术。然而,这些方法要么依赖于获取真实世界数据,要么专注于最小化最坏情况预测误差,并未直接解决策略评估的核心问题——高方差。相比之下,我们的工作通过设计对对抗性转移变化具有鲁棒性的行为策略来主动减少方差,无需目标环境数据。虽然鲁棒MDP(RMDP)框架(Iyengar,2005;Nilim 和 El Ghaoui,2005)也考虑了转移不确定性下的鲁棒性,但它们通常为奖励最大化而设计,并依赖于线性规划技术。这些方法(例如,Wang 等,2023a;Wang 等,2024)不适用于我们的场景,因为我们的目标是策略价值估计器的方差最小化,这是一个根本上的非线性目标。我们通过提出一种新颖的对抗性转移方差梯度方法填补了这一空白,该方法明确针对转移不确定性下的方差减少。 ## 3 背景 ### 3.1 马尔可夫决策过程 我们研究一个具有有限状态空间 𝒮 和有限动作空间 𝒜 的有限视野马尔可夫决策过程(MDP,Puterman (2014))。对于有限集合 𝒳,我们用 Δ(𝒳) ≐ {p: 𝒳 → [0,1] | ∑_{x∈𝒳} p(x)=1} 表示 𝒳 上的概率单纯形。该MDP由转移概率函数 p: 𝒮 × 𝒜 → Δ(𝒮)、奖励函数 r: 𝒮 × 𝒜 → [0,1]、初始状态分布 p₀ ∈ Δ(𝒮) 和固定视野长度 T 组成。为简化符号,我们在不失一般性的前提下考虑无折扣设置。只要视野是固定的且有限的,我们的方法自然适用于折扣设置(Puterman, 2014)。策略 π: 𝒮 → Δ(𝒜) 将每个状态映射到动作上的概率分布。我们考虑参数化策略 πθ,其中参数 θ ∈ Θ 是一个向量,Θ ⊆ ℝⁿ,n 是某个常数。同样,我们通过参数 ω ∈ Ω 参数化转移函数 pω: 𝒮 × 𝒜 → Δ(𝒮),其中 Ω ⊆ ℝᵐ 且是紧致的。除非另有说明,本文使用的所有范数均为欧几里得范数(即,‖x‖ = ‖x‖₂)。MDP过程从时间步0开始,初始状态 S₀ 从 p₀ 中采样。在每个时间步 t ∈ [T-1],动作 Aₜ 根据 π(⋅|Sₜ) 采样。然后,环境给出有限奖励 R_{t+1} ≐ r(Sₜ, Aₜ),并根据 p(⋅|Sₜ, Aₜ) 获得后继状态 S_{t+1}。经过 T 步后,智能体与环境的交互终止。如果智能体在时间步T之前到达任何终止状态,它将停留在那里并获得零奖励。我们用 h ≐ {S₀, A₀, R₁, S₁, A₁, ..., S_{T-1}, A_{T-1}, R_T} 表示此MDP的轨迹。然后我们将 h 的回报定义为 g(h) ≐ ∑_{t=0}^{T-1} R_{t+1}。对于任何策略,我们有一个轨迹分布 Pr(H=h|π),其中 H 是用于表示轨迹的随机变量。最后,我们将策略的价值定义为 v(π) ≐ 𝔼_{H∼π}[g(H)]。为简化符号,我们还定义 ℓ_{pω} ≐ ∑_{t=0}^{T-1} log(pω(S_{t+1}|S_t, A_t))。 ### 3.2 策略评估中的方差减少 我们考虑强化学习策略评估的任务,其目标是估计感兴趣的策略 πₑ(称为目标策略)的价值。传统的同策略蒙特卡洛(MC)方法通过重复在线执行目标策略 πₑ 并对观察到的回报取平均来估计 v(πₑ)。即,对于所有 Hᵢ ∼ πₑ,MC(πₑ, H) ≐ (1/n) ∑_{i=0}^{n-1} g(Hᵢ)。然而,在实践中,这种直接的方法可能导致高评估方差,导致结果可靠性降低(Liu 和 Zhang, 2024;Liu 等, 2025b;Liu 等, 2025a;Chen 等, 2025)。为了缓解这一挑战,近期的工作提出了使用离策略评估方法来减少方差,即执行不同的策略 πθ(行为策略)来收集数据。为了广泛的适用性,我们考虑一个通用的离策略估计器 OPE(πₑ, πθ, H),它使用来自 πθ 的轨迹 H 来估计 πₑ 的价值。一个标准的例子是重要性采样:IS(πₑ, πθ, H) ≐ g(H) ∏_{t=0}^{T-1} [πₑ(Aₜ|Sₜ) / πθ(Aₜ|Sₜ)]。先前的工作表明,通过适当设计行为策略 πθ,可以使用离策略估计器实现比传统同策略MC方法更低的评估方差(Hanna 等, 2017;Zhong 等, 2022)。这就是所谓的**行为策略搜索**问题,我们的目标是解决 min_{θ∈Θ} 𝕍_{H∼πθ}[OPE(πₑ, πθ, H)]。 ### 3.3 鲁棒行为策略搜索 标准的行为策略搜索方法通常假设固定的转移概率,但在实践中,模拟器和真实环境之间通常存在差异。在模拟环境中学习到一个方差减少的行为策略后,从业者通常将其部署到真实系统中以评估目标策略。然而,由于在行为策略搜索阶段未考虑对**动态变化的鲁棒性**,所得策略在收集真实世界数据时可能仍然会导致高方差。因此,实现可靠的评估通常需要大量昂贵的真实世界样本,这促使我们提出一种考虑鲁棒性的公式。为了解决这个问题,我们将鲁棒行为策略搜索问题表述为一个最小化最大化问题: $$ \min_{\theta \in \Theta} \max_{\omega \in \Omega} \mathbb{V}_{H \sim p_{\omega}, \pi_{\theta}} \left[ \mathrm{OPE}(\pi_{e}, \pi_{\theta}, H) \right], \quad (1) $$ 其中内部最大化识别最坏情况的转移扰动,外部最小化寻求缓解这种对抗效应的行为策略。这种最小-最大化公式是建模对抗性动态的鲁棒RL文献中的标准做法(Katdare 等, 2023;Voloshin 等, 2021)。遵循鲁棒RL中的标准实践(Iyenga...
相似文章
面向动态UBSR度量的MDPs在线策略评估
本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。
策略感知模拟器学习的理论基础与高效算法
本文提出了一种用于基于模型的强化学习中模拟器学习的策略鲁棒性目标,将其建模为模型玩家与对抗性策略玩家之间的极小极大博弈。提供了理论保证和可证明收敛的算法,实验表明预测误差在关键区域降低1.5-2.2倍,并提升了策略从模拟到真实世界的迁移效果。
使用动作相关分解基线的策略梯度方差缩减
# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别
通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
自蒸馏策略梯度
本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。