动态上下文调度:超越静态环境的学习

arXiv cs.AI 论文

摘要

该论文提出动态上下文调度方法,旨在增强上下文强化学习的泛化能力,实验表明在模拟环境中在分布外和分布内区域均实现性能提升。

arXiv:2608.20799v1 公告类型:新 摘要:我们研究动态上下文调度作为上下文强化学习的训练工具。我们并非将片段内的上下文变化视为部署现实,而是将其作为受控的塑造机制。因此,上下文在每个训练片段内根据预定的调度进行演变,使策略暴露于环境参数空间中更丰富、更具时间结构的区域。我们引入DYNAMICCARLENV,这是一个框架,用于包装具有可插拔调度家族的上下文环境,例如正弦偏移或余弦退火。在CartPole、BipedalWalker和VehicleRacing环境中使用CARL上下文化,我们表明动态调度在分布外(OOD)区域与静态上下文基线匹配或超越。有趣的是,对于更复杂的BipedalWalker和VehicleRacing环境,我们还在分布内(ID)评估中实现了更高的性能。初步结果表明,自动搜索多阶段课程可以成功发现改善泛化的调度,其性能与对单阶段调度器进行的广泛网格搜索相当。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:25

# 超越静态宇宙的学习 来源:https://arxiv.org/html/2608.20799

## 动态上下文调度:超越静态宇宙的学习

###### 摘要  
我们研究*动态上下文调度*作为上下文强化学习的训练工具。我们并非将情节内上下文变化视为部署的现实,而是将其视为一种受控的塑造机制。因此,上下文根据预定调度在每个训练情节内演变,使策略接触到环境参数空间中更丰富、更具时间结构性的区域。我们引入DynamicCARLEnv框架,该框架包装了带有可插拔调度族(如正弦偏移或余弦退火)的上下文环境。在CartPole、BipedalWalker和VehicleRacing与CARL上下文化的结合下,我们表明动态调度在分布外(OOD)情景中匹配或超越静态上下文基线。有趣的是,对于更复杂的BipedalWalker和VehicleRacing环境,我们也实现了更高的分布内(ID)评估性能。初步发现表明,多阶段课程的自动搜索可以成功发现改善泛化的调度,其性能与单阶段调度器的广泛网格搜索相当。

## 1 引言  
强化学习(RL)在模拟中表现出色,但在狭窄、平稳条件下训练的策略常常在部署时环境参数发生偏移时失效。摩擦力、负载、执行器增益或重力的微小变化可能导致回报大幅下降([5]、[8]、[16]、[53]、[43]、[21]、[41]、[46]、[15]、[51]、[18]、[17],例如参见[...])。这种脆弱性反映了训练期间遇到的单一动态情景与测试时可能面临的不同动态之间明显不匹配。几个既定范式解决了这个问题。主要而言,它们旨在让智能体在训练期间接触更广泛多样的经验,以便转移到新经验时不会在测试时出现如此剧烈且可能灾难性的偏移。*域随机化*(DR)通过让智能体以无结构方式接触许多环境实例来提高鲁棒性。DR通常从一个分布中采样相关环境,而不明确告知学习智能体环境的变化。[13]提出了一系列利用*过程内容生成*(PCG)来改变视频游戏关卡结构和视觉效果的环境。这广泛地实现了对环境变化鲁棒的行为学习,但高度依赖于分布的选择。过于宽泛的分布甚至可能导致智能体遗忘理想行为,因为采样环境可能需要截然相反的解决方案。因此,DR和PCG常与*课程学习*技术结合,以指导学习转向越来越复杂的场景。*鲁棒RL*优化最坏情况目标。例如,在现实世界系统中,噪声传感器读数是预料之中的。为了提高RL策略的鲁棒性,鲁棒性目标通常被建模为极大极小问题。在此设置中,目标是学习一个在最坏可能的对抗设置下最大化奖励的策略。这种学习风格可以缓解最坏情况结果,但通常牺牲平均或最佳情况下的性能,因为学习到的策略行为保守。*Meta-RL*实现了对新环境的在线适应。然而,此类方法通常需要复杂的架构和昂贵的双层优化。此外,Meta-RL通常基于系统识别方法。在此过程中,智能体试图从观测历史中估计或识别环境动态。虽然支持在线适应,但这些方法需要在部署时进行进一步的环境交互以继续学习。与先前示例相反,*上下文RL*(cRL)旨在明确地向智能体提供环境如何相互关联的知识。为此,cRL假设转移和奖励依赖于显式的上下文变量c,智能体学习一个以当前上下文为条件的策略。虽然天真地将上下文视为另一个可观测变量有助于学习更通用的行为,但也探索了更专用的架构,其中上下文被注入到潜在表示中。上述列出的大多数方法的一个关键假设是,上下文被视为一个整体的静态元素。相应的上下文c在情节开始时采样一次,并在情节结束前保持固定。这种设计选择有利于训练稳定性和信用分配,但也极具限制性。真实世界的物理不会在时间步长之间重置;负载会移动,执行器会疲劳,地形变化会连续展开。对于训练而言,更重要的是,每情节静态采样丢弃了一个丰富的结构化信号来源,即情节内上下文的*时间变化*。我们提出利用情节内上下文变化,不是作为部署条件的模型,而是作为*训练工具*。具体来说,我们定义了一族*动态上下文调度*,用于控制上下文c如何在每个训练情节内演变,包括正弦扫描、分段常数模式、线性漂移、随机游走、余弦退火和混合组合,并研究它们对策略鲁棒性和泛化性的影响。然而,我们的评估协议始终考虑静态上下文下的策略。因此,时间变化服务于训练时目的:(i)*正则化*;(ii)*探索*。前者防止策略过拟合,后者确保智能体经历更广泛、具有时间结构的状态-上下文对。这种训练策略与[57]的*动态上下文MDP*(dcMDP)形式体系相关,该形式允许上下文通过一个过程Ω(c_{t+1} | c_t)外生地演变。在这里,我们用确定性的参数化调度实例化Ω,而不是使用学习或随机模型,保持框架简单且可解释,同时保留完整的cMDP语义。因此,上下文保持在智能体的控制之外,转移和奖励依赖于c_t,智能体可以观测或不观测c_t。我们的工作提供了以下贡献:  
1.  我们为(上下文)强化学习提供了一种新的训练范式,以促进学习策略更好的泛化能力;  
2.  我们对广泛的调度族进行了经验评估,以研究动态上下文变化如何以及哪些方面有助于更好的泛化;  
3.  我们提出了CARL基准的开源扩展,以方便使用动态上下文调度;  
4.  我们进行了一种状态空间覆盖分析,揭示了一个反直觉的结果:动态调度在不扩大智能体状态空间足迹的情况下改善了泛化。

## 2 相关工作  
上下文马尔可夫决策过程(cMDP)为标准MDP增添了上下文的概念。一个MDP M = (S, A, T, R, ρ)包含一个状态空间S、一个动作空间A、转移动力学T: S × A × S → [0,1]、一个奖励函数R: S × A → ℝ和一个初始状态分布ρ。上下文MDP引入了上下文c ∈ C的概念,它参数化转移函数T_c、奖励函数R_c以及初始状态分布ρ_c,同时保持状态和动作空间不变。上下文空间可以是离散的,或由一个分布p_C描述。因此,cMDP M表示一族相关的MDP M = {M_c}_{c∼C},并且可以被视为部分可观测MDP的子类。[57]提出了cMDPs的一个特例,其中上下文是历史依赖的,并且允许随时间演变,他们称之为动态cMDP(dcMDPs)。最近[8]提出了上下文的一种新分类法,区分了异生(环境强加的)和自生(智能体驱动的)上下文。他们进一步讨论了上下文如何随时间演变。因此,自生上下文的概念与dcMDP设置相关,因为自生上下文可能直接受到智能体行为的影响(例如电池电量),而异生上下文独立于智能体的决策。[27]强调了cMDP设置对于评估学习策略的零样本泛化性的效用,并提出了一种新的评估协议。[6]在其关于上下文对训练各种深度RL智能体影响的研究中,在他们的新颖CARL基准上实施了该协议。CARL扩展了常见的RL基准和环境,添加了物理上下文,例如机器人重力、摩擦力或质量。他们的研究表明,仅在上下文分布上训练而没有明确访问真实上下文值的智能体倾向于学习鲁棒行为,但不一定能最优地解决每个环境。另一方面,天真地将上下文拼接到状态观测中的上下文感知智能体可能能够完美地适应环境变化,但可能需要对RL流程(例如超参数选择)进行更改才能实现。除了天真拼接之外,多篇作品探索了如何利用超网络来促进学习策略的更好适应性,通过学习适配器模块或直接学习策略的权重。与这些工作方向相反,[43]、[24]试图通过将上下文信息注入世界模型的潜在表示中来利用上下文信息。在上下文RL研究中,最常见的是,上下文被视为一个整体的静态量,并且假设在整个情节中基本保持静态。据我们所知,很少有作品探索上下文的动态变化。例如,[24]旨在学习上下文何时发生变化,例如门打开或关闭。然而,每当作品旨在实时学习估计上下文时,策略可能会在假设状态之间上下文发生变化的前提下运行。类似地,[10]旨在学习不仅在给定上下文下表现良好,而且同时估计MDP在情节之间如何变化的策略,以便该策略也很好地为解决未来任务做好准备。与这些方法相反,我们的工作提出利用这样一个事实:大部分训练发生在模拟中,并且可以在整个情节中显式地调整上下文,目标是推动RL智能体的泛化能力。

## 3 动态上下文调度  
我们引入了一个训练框架,用参数化的内情节调度取代标准的静态每情节上下文。上下文c_t根据选定的调度族在整个训练情节中演变,而评估始终使用预定的一组静态上下文,以便对策略在固定动态上的泛化能力进行评判,而不是对其跟踪变化的能力进行评判。

##### 动态上下文环境  
我们将我们的DynamicCARLEnv(https://github.com/mrazmartin/dynamicCARL)作为轻量级包装器开源,它位于任何CARL环境之上。我们拦截每个环境步骤,以(i)推进参数化上下文调度,(ii)将更新的c_t传递给底层模拟器,并(iii)将所选上下文信号传递给策略观测。因此,转移 s_t →^{a_t, c_t} s_{t+1} 由实时调度的上下文而非静态情节采样控制。上下文通过用户提供的getter/setter可调用对象从模拟器读取和写入,这将调度逻辑与环境内部细节隔离,并使包装器适用于任何CARL兼容的物理后端。

图1:围绕CARLEnv的动态上下文包装器。蓝色组件由用户控制。*上下文调度器*根据*调度参数*(例如振幅、周期、漂移率、停留时间、变化点)生成每步上下文c_t。包装器通过*物理适配器*应用c_t,通过*观测适配器*(无、c_0或c_t)控制策略观测到的内容,并

相似文章

面向上下文强化学习的任务特化微调

arXiv cs.LG

本文介绍了面向上下文强化学习的任务特化微调(TSFT),该框架利用一个简单的参数模型和整数线性规划高效分配微调预算,在任务覆盖方面显著超越基线方法。

非平稳环境下的上下文强化学习综述

arXiv cs.AI

本综述探讨了非平稳环境下的上下文强化学习(ICRL),其中预训练决策模型通过累积的上下文进行适应,无需参数更新。它围绕变化的内容、变化的方式以及变化的可观测性来组织文献,并指出了诸如陈旧上下文压力测试和自适应遗忘等研究空白。