真实世界强化学习中的离线超参数选择动力学模型

arXiv cs.LG 论文

摘要

本文首次将校准模型应用于真实工业场景中的离线超参数选择,以市政水处理厂为例,展示了这些模型能够生成逼真的轨迹并恢复超参数敏感性趋势。

arXiv:2608.11349v1 公告类型:新 摘要:在真实世界系统中部署强化学习的一个关键障碍是超参数选择,尤其是在缺乏模拟器且在线实验成本高昂的情况下。已有研究提出使用离线数据训练的校准模型来近似环境动力学,并实现离线超参数选择,但这些方法迄今为止仅在简单的模拟环境中得到评估。在本文中,我们首次将校准模型应用于真实工业场景:一座市政水处理厂。我们评估了多种校准模型方法,包括带有拉普拉斯距离度量的k近邻模型,用于高维、非平稳传感器数据的预测任务。我们的结果表明,这些模型能够生成逼真的长时域轨迹,并恢复有意义的超参数敏感性趋势。我们进一步考察了校准模型如何扩展到全年数据集,如何支持预训练智能体的微调学习率选择,以及它们在分布偏移下的鲁棒性。总体而言,我们的研究为使用离线动力学模型支持强化学习在真实环境中的部署提供了概念验证,同时强调了未来工作面临的重要实践挑战。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

# 用于真实世界强化学习中离线超参数选择的动力学模型
来源:https://arxiv.org/html/2608.11349
用于真实世界强化学习中离线超参数选择的动力学模型

Jordan Coblin, Han Wang, Martha White, Adam White

关键词:应用强化学习,动力学模型,超参数选择,水处理,工业控制

摘要强化学习在真实世界系统中部署的一个关键障碍是超参数选择,尤其是在没有仿真器且在线实验成本高昂的情况下。先前的工作提出使用在离线数据上训练的校准模型来近似环境动力学,并实现离线超参数选择,但这些方法迄今仅在简单的模拟环境中得到评估。在本文中,我们首次将校准模型应用于真实世界的工业场景:一座市政水处理厂。我们评估了几种校准模型方法,包括一种使用拉普拉斯距离度量的 \(k\)-最近邻模型,用于高维、非平稳传感器数据的 nexting 预测任务。我们的结果表明,这些模型能够生成逼真的长时域 rollout,并恢复有意义的超参数敏感性趋势。我们进一步考察了校准模型如何扩展到长达一年的数据集,它们如何支持为预训练智能体选择微调学习率,以及它们在分布偏移下的鲁棒性。总体而言,我们的研究结果为使用离线动力学模型支持强化学习在真实世界环境中的部署提供了概念验证,同时也突出了未来工作面临的重要实际挑战。

贡献\(s\)1\.我们首次将校准模型应用于真实世界工业环境中的离线超参数选择,重点关注来自一座市政水处理厂的传感器预测任务。背景:用于离线超参数选择的校准模型由Wang et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib30)提出,但仅在简单模拟领域中得到评估。尽管Janjua et al. 2023 (https://arxiv.org/html/2608.11349#bib.bib13)研究了水处理厂中的预测任务,该工作并未考虑用于超参数选择的校准模型。2\.我们通过引入 rollout 质量分析、超参数敏感性分析,以及使用动态时间规整评估模型生成轨迹与真实轨迹之间的对齐,扩展了校准模型的实证评估方法。我们使用这些方法比较了几种校准模型架构的性能。背景:先前的工作主要集中比较最佳超参数配置的性能,但未考察模型精度或超参数敏感性的度量。3\.我们通过将校准模型扩展到长达一年的离线数据集,并研究其在微调设置下模拟分布偏移的能力,弥合了向真实世界部署的鸿沟。背景:先前的研究集中于小规模模拟领域,并未解决可扩展性和在真实分布偏移下适应的关键挑战,而这两者对于在实践中的强化学习系统部署至关重要。

###### 摘要

强化学习在真实世界系统中部署的一个关键障碍是超参数选择,尤其是在没有仿真器且在线实验成本高昂的情况下。先前的工作提出使用在离线数据上训练的校准模型来近似环境动力学,并实现离线超参数选择,但这些方法迄今仅在简单的模拟环境中得到评估。在本文中,我们首次将校准模型应用于真实世界的工业场景:一座市政水处理厂。我们评估了几种校准模型方法,包括一种使用拉普拉斯距离度量的 \(k\)-最近邻模型,用于高维、非平稳传感器数据的 nexting 预测任务。我们的结果表明,这些模型能够生成逼真的长时域 rollout,并恢复有意义的超参数敏感性趋势。我们进一步考察了校准模型如何扩展到长达一年的数据集,它们如何支持为预训练智能体选择微调学习率,以及它们在分布偏移下的鲁棒性。总体而言,我们的研究结果为使用离线动力学模型支持强化学习在真实世界环境中的部署提供了概念验证,同时也突出了未来工作面临的重要实际挑战。

## 1引言

强化学习 \(RL\) 在包括装配线自动化\(Tortorelli et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib29)\)、火力发电\(Zhan et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib33)\)和商业制冷\(Luo et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib19)\)等一系列工业应用中提供了自适应、数据驱动的控制能力。然而,在真实世界系统中部署强化学习仍面临众多实际挑战。其中,超参数选择受到的关注相对较少,尽管强化学习性能对学习率、探索调度和模型架构等超参数高度敏感\(Henderson et al. 2018 (https://arxiv.org/html/2608.11349#bib.bib11); Andrychowicz et al. 2020 (https://arxiv.org/html/2608.11349#bib.bib1); Eimer et al. 2023 (https://arxiv.org/html/2608.11349#bib.bib9)\)。在真实世界任务中有几种标准的超参数选择方法,每种方法都有其局限性。默认超参数\(Degrave et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib7)\)很少反映目标系统的动力学,且可能造成大量性能未实现。基于仿真器的调参\(Levine et al. 2016 (https://arxiv.org/html/2608.11349#bib.bib17); OpenAI et al. 2019 (https://arxiv.org/html/2608.11349#bib.bib24)\)需要精确的仿真器,而这通常不可用。最后,在真实环境中直接调参\(Azuatalam et al. 2020 (https://arxiv.org/html/2608.11349#bib.bib3); Luo et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib19)\)在交互成本高昂、存在风险或耗时较长时通常不可行。

一种有前途的替代方案是利用工业系统中常见的大型离线数据集,为随后将在线学习的智能体选择超参数——这种设置被称为Data2Online\(Wang et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib30)\)。该方法在离线日志上训练一个动力学模型,并将其用作替代环境,称为校准模型。候选智能体配置通过与该模型交互进行评估,然后选择性能最佳的配置用于在真实系统中部署并继续在线学习。与标准基于模型的强化学习不同,该模型不直接用于优化部署策略;其目的是保持候选超参数配置的相对性能。尽管先前的工作表明校准模型能够足够好地近似环境动力学以实现这一目的,但迄今为止它们仅在简单模拟领域中得到评估,其在真实世界系统中的有效性尚不清楚。

在本工作中,我们将校准模型框架扩展到位于加拿大艾伯塔省德雷顿谷的一座水处理厂 \(WTP\) 中的传感器预测任务。我们的贡献有三方面:\(1\) 我们首次在实际工业系统中将校准模型用于离线超参数选择;\(2\) 我们扩展了校准模型的评估方法,引入了 rollout 质量分析、超参数敏感性分析以及用于评估轨迹相似性的动态时间规整;\(3\) 我们研究了在大规模离线数据集上的可扩展性以及在分布偏移下的鲁棒性,以应对对真实世界强化学习部署至关重要的挑战。

#### 与时间序列预测和基于模型的强化学习的联系。

在本文研究的被动预测设置中,校准模型类似于多变量时间序列预测器:由于智能体不对工厂采取行动,模型在没有动作条件的情况下生成未来传感器轨迹。这使我们的设置与多步序列预测的预测方法联系起来\(Salinas et al. 2020 (https://arxiv.org/html/2608.11349#bib.bib26); Oreshkin et al. 2020 (https://arxiv.org/html/2608.11349#bib.bib25); Nie et al. 2023 (https://arxiv.org/html/2608.11349#bib.bib23)\)。相比之下,在控制设置中,校准模型必须表示以动作条件为条件的动力学,这使其与基于模型的强化学习中的学习动力学模型更为相关\(Deisenroth & Rasmussen 2011 (https://arxiv.org/html/2608.11349#bib.bib8); Chua et al. 2018 (https://arxiv.org/html/2608.11349#bib.bib5); Janner et al. 2019 (https://arxiv.org/html/2608.11349#bib.bib14)\)。与这两个领域的关键区别在于模型的用途。校准模型不是最小化预测误差或直接优化部署策略,而是作为一个评估环境,用于比较随后将在线学习的智能体的超参数配置。因此,其效用取决于在长 rollout 上保持超参数排名,而这不必与预测精度一致。

## 2背景

本节介绍使用校准模型进行离线超参数选择的框架和方法。我们首先形式化问题设置和校准目标,然后描述用于近似环境动力学的 \(k\)-最近邻 \(k\text{NN}\) 模型。接下来,我们介绍实验中研究的 nexting 预测任务,最后介绍动态时间规整,我们用它来评估校准模型 rollout。

### 2\.1问题形式化

设D=\{\(si,ai,ri,si′\)\}i=1N\mathcal\{D\}=\{\(s_\{i\},a_\{i\},r_\{i\},s_\{i\}^{\prime}\)\}_\{i=1\}^\{N\}为在行为策略πβ\pi_\{\beta\}下从马尔可夫决策过程 \(MDP\) 中采样的NN个转移组成的数据集,其中si∈Ss_\{i\}\in\mathcal\{S\}为状态,ai∈Aa_\{i\}\in\mathcal\{A\}为动作,ri∈Rr_\{i\}\in\mathbb\{R\}为奖励,si′∈Ss_\{i\}^{\prime}\in\mathcal\{S\}为下一状态。我们使用D\mathcal\{D\}训练一个动力学模型p^\(s′,r\|s,a\)\hat\{p\}\(s^{\prime},r\|s,a\)来近似环境的真实转移函数p\(s′,r\|s,a\)p\(s^{\prime},r\|s,a\)。

遵循Wang et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib30),我们将p^\hat\{p\}称为校准模型:它仅用于评估随后将在线学习的智能体的超参数配置。

设A\mathscr\{A\}为学习算法,Λ\Lambda为超参数空间,λ∈Λ\lambda\in\Lambda为一个超参数配置。对于每个λ\lambda,我们将策略序列\{πtλ\}t=0∞\{\pi_\{t\}^{\lambda\}\}_\{t=0\}^{\infty\}定义为在环境pp中交互式运行A\mathscr\{A\}的结果,即\{πtλ\}=A⁡\(λ,p\)\{\pi_\{t\}^{\lambda\}\}=\mathscr\{A\}\(\lambda;p\)。真实环境中的期望回报定义为:

Jenv\(λ\)=Ep\[∑t=0∞γtrt\|at∼πtλ\(⋅\|st\),\(st\+1,rt\)∼p\(⋅\|st,at\)\],J_\{\text\{env\}\}\(\lambda\)=\mathbb\{E\}_\{p\}\left\[\sum_\{t=0\}^{\infty\}\gamma^\{t\}r_\{t\}\,\Big\|\,a_\{t\}\sim\pi_\{t\}^{\lambda\}\(\cdot\|s_\{t\}\),\,\(s_\{t\+1\},r_\{t\}\)\sim p\(\cdot\|s_\{t\},a_\{t\}\)\right\],其中γ∈\[0,1\]\gamma\in\[0,1\]为折扣因子。类似地,使用校准模型的期望回报为Jmodel\(λ\)=Ep^\[∑t=0∞γtrt\|at∼πtλ\(⋅\|st\),\(st\+1,rt\)∼p^\(⋅\|st,at\)\]J_\{\text\{model\}\}\(\lambda\)=\mathbb\{E\}_\{\hat\{p\}\}\left\[\sum_\{t=0\}^{\infty\}\gamma^\{t\}r_\{t\}\,\Big\|\,a_\{t\}\sim\pi_\{t\}^{\lambda\}\(\cdot\|s_\{t\}\),\,\(s_\{t\+1\},r_\{t\}\)\sim\hat\{p\}\(\cdot\|s_\{t\},a_\{t\}\)\right\],其中策略序列\{πtλ\}\{\pi_\{t\}^{\lambda\}\}现在通过与环境p^\hat\{p\}交互来学习,即\{πtλ\}=A⁡\(λ,p^\)\{\pi_\{t\}^{\lambda\}\}=\mathscr\{A\}\(\lambda;\hat\{p\}\)。

我们分别定义每种情况下的最优超参数为λenv⋆=arg⁡maxλ∈ΛJenv\(λ\)\lambda_\{\text\{env\}\}^{\star\}=\arg\max_\{\lambda\in\Lambda\}J_\{\text\{env\}\}\(\lambda\)和λmodel⋆=arg⁡maxλ∈ΛJmodel\(λ\)\lambda_\{\text\{model\}\}^{\star\}=\arg\max_\{\lambda\in\Lambda\}J_\{\text\{model\}\}\(\lambda\),目标是学习一个校准模型p^\hat\{p\},使得λmodel⋆=λenv⋆\lambda_\{\text\{model\}\}^{\star\}=\lambda_\{\text\{env\}\}^{\star\}。

### 2\.2\bold\{k\}\text\{NN\}校准模型

一个好的校准模型必须在长时域 rollout 下保持稳定,因为通常需要数百或数千步来评估一个超参数配置。然而,典型的动力学模型已知会遭受复合误差,这可能导致在长时域上显著偏离真实环境\(Talvitie 2017 (https://arxiv.org/html/2608.11349#bib.bib28); Lambert et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib16)\)。为缓解这一问题,Wang et al. 2022 (https://arxiv.org/html/2608.11349#bib.bib30)提出使用一种非参数kNNk\text\{NN\}模型来估计pp,即仅使用数据集内的转移来预测下一状态和奖励,避免外推到未观测区域。

kNNk\text\{NN\}模型从D\mathcal\{D\}中采样转移,根据某种距离度量找到给定状态-动作对的kk个最近邻。为了找到邻居,可以使用近似拉普拉斯表示\(Wu et al. 2018 (https://arxiv.org/html/2608.11349#bib.bib32)\)代替原始状态-动作空间中的距离来构建对 MDP 底层结构敏感的距离度量。我们将使用这种距离度量的模型称为拉普拉斯kNNk\text\{NN\}模型,而将使用原始状态-动作空间中距离的模型称为欧几里得kNNk\text\{NN\}模型。

为解决认知不确定性,我们使用一个由五个kNNk\text\{NN\}模型组成的留一块\(leave-one-block-out,LOBO\)集成。数据集D\mathcal\{D\}被划分为五个连续块,每个模型在排除不同块的D\mathcal\{D\}子集上训练。通过取给定超参数配置在所有模型中的最差排名来聚合各模型的结果,从而提供超参数性能的保守估计。

### 2\.3Nexting 预测

nexting 预测问题涉及智能体预测一个观测信号未来值的折扣和,被框架化为一般价值函数 \(GVF\)\(Modayil et al. 2012 (https://arxiv.org/html/2608.11349#bib.bib22)\)。这种形式化使得能够对环境中标量信号(通常称为累积量)进行时间上扩展的预测。遵循Janjua et al. 2023 (https://arxiv.org/html/2608.11349#bib.bib13),本工作重点关注 WTP 中传感器的 nexting 预测问题。对于与通道或传感器ii相关联的在时间tt处的信号otio^\{i\}_\{t\},nexting 价值函数定义为:

vti\(s\)=E⁡\[Gti∣st=s\],Gti=∑k=0∞γkot\+k\+1i,v^\{i\}_\{t\}\(s\)=\mathbb\{E\}\left\[G^\{i\}_\{t\}\mid s_\{t\}=s\right\],\quad G^\{i\}_\{t\}=\sum_\{k=0\}^{\infty\}\gamma^\{k\}o^\{i\}_\{t\+k\+1\},\(1\)
其中γ∈\[0,1\]\gamma\in\[0,1\]为控制预测时间尺度的折扣因子。该任务实例化了第2.1节 (https://arxiv.org/html/2608.11349#S2.SS1)中的形式化:累积量oio^\{i\}扮演奖励的角色,nexting 目标GtiG^\{i\}_\{t\}是对应的回报。由于智能体的任务是预测而非控制,智能体性能通过衡量

相似文章

预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择

arXiv cs.LG

本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。

Scaling Automatic Research Agents via World Models

arXiv cs.LG

This paper identifies a scalability bottleneck in RL-trained automatic research agents—environment execution dominates training cost—and proposes World Model RL (WMRL) with online debiasing and inverse-variance denoising to replace real execution, achieving 3–4x training speedups and better generalization.