非平稳环境下的上下文强化学习综述

arXiv cs.AI 论文

摘要

本综述探讨了非平稳环境下的上下文强化学习(ICRL),其中预训练决策模型通过累积的上下文进行适应,无需参数更新。它围绕变化的内容、变化的方式以及变化的可观测性来组织文献,并指出了诸如陈旧上下文压力测试和自适应遗忘等研究空白。

arXiv:2607.11906v1 公告类型:新 摘要:决策预训练变换器、算法蒸馏、长上下文元强化学习以及检索增强型智能体的发展,重新激发了人们对上下文强化学习(ICRL)的兴趣:即预训练或微调后的决策模型能够从交互上下文中推断潜在任务规则并改进未来行为,而无需在测试时更新参数。这一研究方向探讨了试错证据、奖励、状态转移、示范、反馈或检索到的经验何时能够在上下文窗口内实现类似学习的计算。然而,现有的ICRL综述主要围绕预训练目标、架构、上下文格式、评估协议和理论机制来组织该领域,而对非平稳环境的探讨相对不足。在变化的环境中,累积的上下文不再仅仅是关于固定任务的更多证据:奖励规范、转移核、观测通道、动作接口、约束模型,或示范和记忆分布都可能与当前机制不符。因此,先前有用的上下文可能变得过时、具有误导性,或者在旧机制重现时重新发挥作用。我们将非平稳ICRL定义为在部署策略参数保持不变的情况下通过上下文进行适应的问题:策略必须同时推断当前的决策规则以及累积证据中哪些部分仍然支持该规则。我们定义了非平稳ICRL,将其与元强化学习、决策序列建模、检索增强型强化学习、价值和模型感知的ICRL以及奖励反馈智能体联系起来,并围绕三个问题组织文献:变化的是什么、变化如何展开、以及变化对智能体的可观测性如何。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:19

# 非平稳环境下的情境上下文强化学习:综述 来源:https://arxiv.org/html/2607.11906 独立研究员 丁子洛 北京人形机器人创新中心 ###### 摘要 决策预训练Transformer、算法蒸馏、长上下文元强化学习以及检索增强智能体的发展,重新激发了人们对情境上下文强化学习(ICRL)的兴趣:即一个预训练或微调后的决策模型,能够从交互上下文中推断潜在任务规则并改进未来行为,而无需在测试时更新参数。这一研究方向探讨的是,试错证据、奖励、状态转移、示范、反馈或检索到的经验,如何能够在上下文窗口内实现类似学习的计算。然而,现有的ICRL综述主要围绕预训练目标、架构、上下文格式、评估协议和理论机制来组织该领域,而对非平稳设置的探讨相对不足。在不断变化的环境中,累积的上下文并不仅仅是对一个固定任务的更多证据:奖励规范、转移核、观测通道、动作接口、约束模型,或示范与记忆分布,都可能与当前状态脱节。因此,先前有用的上下文可能变得过时、具有误导性,或是在旧状态重现时重新变得有用。我们将非平稳ICRL定义为:在部署策略参数保持不变的情况下,通过上下文进行适应的问题——策略必须同时推断当前的决策规则,以及其累积证据中哪些部分仍支持该规则。我们定义了非平稳ICRL,将其与元强化学习、决策序列建模、检索增强强化学习、价值与模型感知的ICRL,以及奖励反馈智能体联系起来,并围绕三个问题组织文献:什么在变化、变化如何展开、以及变化对智能体的可观测程度如何。我们进一步通过上下文管理操作和影响方面来分析各种方法,包括写入、检索、压缩、信任、遗忘或隔离的内容,并认为平均回报和留出任务泛化性不足以证明在漂移下的适应能力。本综述围绕生命周期评估、过期上下文压力测试、有效性感知检索、自适应遗忘、上下文中毒以及非平稳ICRL的有限上下文理论,提出了一项研究议程。 ## 1 引言 情境上下文强化学习(ICRL)探讨的是,一个预训练或微调后的序列决策模型,能否从其上下文中的交互历史推断任务规则并改进未来动作,而无需在测试时更新参数(Duan等,2016 (https://arxiv.org/html/2607.11906#bib.bib5))。上下文可能包含状态、动作、奖励、转移结果、示范、反馈、检索到的记忆或摘要,但其核心定义特征是:通过该上下文而非在线优化器实现类似学习的适应(Laskin等,2023 (https://arxiv.org/html/2607.11906#bib.bib3);Zisman等,2024 (https://arxiv.org/html/2607.11906#bib.bib25))。这个概念贯穿于黑盒元强化学习(Duan等,2016 (https://arxiv.org/html/2607.11906#bib.bib5);Wang等,2016 (https://arxiv.org/html/2607.11906#bib.bib6))、基于梯度的元学习(Finn等,2017 (https://arxiv.org/html/2607.11906#bib.bib84))、离线轨迹建模(Janner等,2021 (https://arxiv.org/html/2607.11906#bib.bib97))、决策Transformer(Chen等,2021 (https://arxiv.org/html/2607.11906#bib.bib4))、算法蒸馏(Laskin等,2023 (https://arxiv.org/html/2607.11906#bib.bib3))、监督式ICRL(Lee等,2023 (https://arxiv.org/html/2607.11906#bib.bib13))以及长上下文元强化学习(Melo,2022 (https://arxiv.org/html/2607.11906#bib.bib168);Grigsby等,2024a (https://arxiv.org/html/2607.11906#bib.bib17))。它也继承了来自情境上下文学习的一个更广泛的问题:序列模型何时仅仅是基于示例进行条件化(Brown等,2020 (https://arxiv.org/html/2607.11906#bib.bib132);Min等,2022 (https://arxiv.org/html/2607.11906#bib.bib182)),其前向传播又何时实现了接近推理(Chan等,2022 (https://arxiv.org/html/2607.11906#bib.bib127);Garg等,2022 (https://arxiv.org/html/2607.11906#bib.bib128);Akyurek等,2023 (https://arxiv.org/html/2607.11906#bib.bib129))、优化(von Oswald等,2023 (https://arxiv.org/html/2607.11906#bib.bib130);Kirsch等,2022 (https://arxiv.org/html/2607.11906#bib.bib131))或学习(Wies等,2023 (https://arxiv.org/html/2607.11906#bib.bib183);Akyurek等,2024 (https://arxiv.org/html/2607.11906#bib.bib184))的功能?这种能力在强化学习中尤其具有吸引力。如果有用的适应能够通过输入流发生,那么系统可以快速响应,而无需运行优化器、更改部署的权重或将适应过程隐藏于在线更新之中。这个承诺在平稳设置中远比在变化设置中更容易实现。最近的综述工作已经广泛地围绕预训练、上下文构建、架构、评估和理论来组织ICRL(Moeini等,2025b (https://arxiv.org/html/2607.11906#bib.bib1))。我们在此聚焦于在累积上下文的整个生命周期内环境发生变化的情况。我们所说的非平稳性,指的是决策过程中导致某些累积证据对动作的有效性发生改变的时间性变化。在一个平稳的小样本任务中,更多的上下文通常意味着关于某个潜在任务的更多证据。而在非平稳性下,同一段额外的轨迹可能是有用的证据、过时的证据、具有误导性的示范,或者只有在先前的状态重现后才会再次有用的记忆。问题不再只是智能体是否使用上下文,而是智能体能否判断其上下文中哪些部分仍然描述着它正在行动的世界。 对于ICRL,非平稳性最好被视为上下文有效条件的改变:过去的轨迹、奖励、反馈、示范或检索到的记忆可能不再支持相同的策略选择。其根本来源可以是变化的奖励规范(Besbes等,2014 (https://arxiv.org/html/2607.11906#bib.bib82);Song等,2025 (https://arxiv.org/html/2607.11906#bib.bib65))、转移核(Lecarpentier和Rachelson,2019 (https://arxiv.org/html/2607.11906#bib.bib135);Chandak等,2020c (https://arxiv.org/html/2607.11906#bib.bib136))、观测通道(Cobbe等,2020 (https://arxiv.org/html/2607.11906#bib.bib27);Wang等,2025e (https://arxiv.org/html/2607.11906#bib.bib29))、动作接口(Chandak等,2020b (https://arxiv.org/html/2607.11906#bib.bib24);Sinii等,2024 (https://arxiv.org/html/2607.11906#bib.bib23))、偏好或安全模型(Moeini等,2025a (https://arxiv.org/html/2607.11906#bib.bib57);Song等,2025 (https://arxiv.org/html/2607.11906#bib.bib65))、任务分布(Al-Shedivat等,2017 (https://arxiv.org/html/2607.11906#bib.bib142);Wang等,2025a (https://arxiv.org/html/2607.11906#bib.bib60))或数据背后的行为策略(Dong等,2026 (https://arxiv.org/html/2607.11906#bib.bib133);Schmied等,2024 (https://arxiv.org/html/2607.11906#bib.bib20))。这些来源施加了不同的适应负担。奖励切换需要对反馈进行重新解释,转移漂移改变了动作-结果证据,动作重映射改变了行为的意义,而行为策略的转变则改变了示范或检索轨迹的可信度。一个突然的奖励切换(Adams和MacKay,2007 (https://arxiv.org/html/2607.11906#bib.bib117);Garivier和Moulines,2011 (https://arxiv.org/html/2607.11906#bib.bib118))与渐进的转移漂移(Lecarpentier和Rachelson,2019 (https://arxiv.org/html/2607.11906#bib.bib135);Feng等,2023 (https://arxiv.org/html/2607.11906#bib.bib81))构成了不同的适应问题;一个重复出现的潜在模式(Hallak等,2015 (https://arxiv.org/html/2607.11906#bib.bib115);Killian等,2017 (https://arxiv.org/html/2607.11906#bib.bib116))与单向退化(Khetarpal等,2022 (https://arxiv.org/html/2607.11906#bib.bib79);Abel等,2023 (https://arxiv.org/html/2607.11906#bib.bib80))构成了不同的记忆问题;一个可观测的任务描述符(Hallak等,2015 (https://arxiv.org/html/2607.11906#bib.bib115);Humplik等,2019 (https://arxiv.org/html/2607.11906#bib.bib165))与一个隐藏的变化点(Adams和MacKay,2007 (https://arxiv.org/html/2607.11906#bib.bib117);Keplinger等,2025 (https://arxiv.org/html/2607.11906#bib.bib44))构成了不同的推理问题。对于ICRL而言,相关的后果是上下文具有生命周期。当它识别出当前模式时可能有用;当它将智能体锚定于过去模式时可能有害;而当旧模式重现时则可能再次有用。这一框架借鉴了更早的马尔可夫决策过程(Puterman,1994 (https://arxiv.org/html/2607.11906#bib.bib113))、部分可观测决策过程(Kaelbling等,1998 (https://arxiv.org/html/2607.11906#bib.bib114))、情境MDP(Hallak等,2015 (https://arxiv.org/html/2607.11906#bib.bib115))、隐参数MDP(Killian等,2017 (https://arxiv.org/html/2607.11906#bib.bib116);Doshi-Velez和Konidaris,2016 (https://arxiv.org/html/2607.11906#bib.bib141))以及认知-POMDP(Ghosh等,2021 (https://arxiv.org/html/2607.11906#bib.bib153))的形式化框架,但将重点从求解一个已知的模型类转向在一个固定的上下文窗口内管理证据。 我们使用*非平稳ICRL*来指代固定参数、受上下文条件约束的序列决策,其中决策过程在策略承载上下文的生命周期内发生变化。部署的策略必须利用近期和存储的交互历史来检测状态的证据、修正其潜在任务信念、并改变其动作分布,而无需在测试时更新参数。核心困难不仅在于为当前状态选择合适的策略,还在于判断哪些先前的奖励、转移、示范、反馈或记忆仍然为该选择提供有效证据。它涵盖了算法蒸馏(Laskin等,2023 (https://arxiv.org/html/2607.11906#bib.bib3))和决策预训练Transformer(Furuta等,2022 (https://arxiv.org/html/2607.11906#bib.bib170);Liu和Abbeel,2023 (https://arxiv.org/html/2607.11906#bib.bib171);Polubarov等,2026 (https://arxiv.org/html/2607.11906#bib.bib63))中交互历史驱动适应的情形;监督式ICRL(Lee等,2023 (https://arxiv.org/html/2607.11906#bib.bib13);Lin等,2024 (https://arxiv.org/html/2607.11906#bib.bib14))和离线预训练智能体(Tarasov等,2025 (https://arxiv.org/html/2607.11906#bib.bib50);Wang等,2024a (https://arxiv.org/html/2607.11906#bib.bib174))中任务示例、奖励或轨迹标识当前状态的情形;检索增强型ICRL(Schmied等,2024 (https://arxiv.org/html/2607.11906#bib.bib20);Sridhar等,2024 (https://arxiv.org/html/2607.11906#bib.bib21))和基于检索的RL(Goyal等,2022 (https://arxiv.org/html/2607.11906#bib.bib199);Humphreys等,2022 (https://arxiv.org/html/2607.11906#bib.bib200))中记忆选择决定模型所见证据的情形;以及价值感知智能体(Liu等,2026 (https://arxiv.org/html/2607.11906#bib.bib62);Berkes等,2026 (https://arxiv.org/html/2607.11906#bib.bib61))或模型感知智能体(Son等,2025 (https://arxiv.org/html/2607.11906#bib.bib51);Xu等,2026c (https://arxiv.org/html/2607.11906#bib.bib52))中从上下文推断价值或动态的情形。它不包括那些不适应新的测试时证据的标准离线RL策略、部署时的微调、以及特定领域的机器人或多智能体综述,除非其机制阐明了固定参数上下文问题。我们将LLM智能体和更广泛的基础智能体系统视为桥梁案例,前提是它们在上下文、动作、反馈和未来行为之间形成了闭环。纯粹的对话式记忆、检索增强的问答或一次性提示因此被排除在核心主张之外,除非保留的上下文在一个重复的环境中改变了决策。因此,最接近的工作并非单一的脉络,而是多个交叉的研究方向:终身学习和持续ICRL(Xu等,2024 (https://arxiv.org/html/2607.11906#bib.bib22);Wang等,2025d (https://arxiv.org/html/2607.11906#bib.bib59));非平稳MDP分析(Lecarpentier和Rachelson,2019 (https://arxiv.org/html/2607.11906#bib.bib135);Chandak等,2020c (https://arxiv.org/html/2607.11906#bib.bib136);Wei和Luo,2021 (https://arxiv.org/html/2607.11906#bib.bib147))、动态遗憾分析(Luo等,2024 (https://arxiv.org/html/2607.11906#bib.bib137);Pettet等,2024 (https://arxiv.org/html/2607.11906#bib.bib139);Chen等,2025a (https://arxiv.org/html/2607.11906#bib.bib55))以及近最优非平稳控制(Mao等,2021 (https://arxiv.org/html/2607.11906#bib.bib148));价值和不确定性感知的ICRL(Tarasov等,2025 (https://arxiv.org/html/2607.11906#bib.bib50);Liu等,2026 (https://arxiv.org/html/2607.11906#bib.bib62);Berkes等,2026 (https://arxiv.org/html/2607.11906#bib.bib61))、组合式或次优数据ICRL(Xu等,2026a (https://arxiv.org/html/2607.11906#bib.bib64);Dong等,2026 (https://arxiv.org/html/2607.11906#bib.bib133))以及模型感知的ICRL(Son等,2025 (https://arxiv.org/html/2607.11906#bib.bib51);Xu等,2026c (https://arxiv.org/html/2607.11906#bib.bib52));检索增强型ICRL(Schmied等,2024 (https://arxiv.org/html/2607.11906#bib.bib20);Sridhar等,2024 (https://arxiv.org/html/2607.11906#bib.bib21))、历史策划(Chen等,2025b (https://arxiv.org/html/2607.11906#bib.bib53))以及基于检索的RL(Goyal等,2022 (https://arxiv.org/html/2607.11906#bib.bib199);Humphreys等,2022 (https://arxiv.org/html/2607.11906#bib.bib200));大型异构序列智能体数据集(Nikulin等,2025 (https://arxiv.org/html/2607.11906#bib.bib42);Wang等,2025a (https://arxiv.org/html/2607.11906#bib.bib60))、通才序列智能体(Polubarov等,2025 (https://arxiv.org/html/2607.11906#bib.bib49);2026 (https://arxiv.org/html/2607.11906#bib.bib63))以及混合专家路由(Wu等,2025 (https://arxiv.org/html/2607.11906#bib.bib54));以及奖励反馈智能体(Monea等,2024 (https://arxiv.org/html/2607.11906#bib.bib103);Song等,2025 (https://arxiv.org/html/2607.11906#bib.bib65))、安全反馈智能体(Chandak等,2020a (https://arxiv.org/html/2607.11906#bib.bib140);Moeini等,2025a (https://arxiv.org/html/2607.11906#bib.bib57))以及障碍式安全ICRL(Kwon等,2026 (https://arxiv.org/html/2607.11906#bib.bib58))。 非平稳视角改变了该领域的评估方式。当前许多ICRL评估测试的是留出任务泛化性或随提示变长而提高的平均性能。这些测试是有用的,但它们本身并不能证明一个智能体是否能在变化后恢复、拒绝过时的示范、在模式重现时重用旧上下文、或在有限的上下文预算下运行。对于非平稳ICRL,评估应该报告生命周期曲线、变化后恢复能力、动态遗憾、过期上下文敏感性、检索效用以及在变化频率和可观测性受控条件下的适应能力。最近的工作开始直接通过终身ICRL(Xu等,2024 (https://arxiv.org/html/2607.11906#bib.bib22))、持续ICRL(Wang等,2025d (https://arxiv.org/html/2607.11906#bib.bib59))等方向来解决这些问题。

相似文章

通过自适应安全约束实现非平稳环境下的安全持续强化学习

arXiv cs.LG

提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。

# 立场:部署的强化学习应当是持续性的 ## 摘要 强化学习(RL)通常在静态环境中进行训练,并以固定策略部署——这种范式我们称之为"一次性RL"。然而,现实世界中的部署环境往往是动态的、不断演变的,这使得一次性训练的策略随着时间推移性能逐渐退化。我们认为,部署的强化学习系统应当采用持续学习的方式,在与环境的持续交互中不断适应和改进。本文阐述了这一立场,分析了当前范式的局限性,并概述了实现持续性部署RL所需面对的挑战与机遇。 ## 1. 引言 强化学习在众多领域取得了令人瞩目的成就,从游戏竞技到机器人控制,再到推荐系统。然而,主流的RL研究与实践遵循着一种固定的模式:在模拟或受控环境中训练智能体,直至达到满意的性能,然后将固定策略部署到实际应用中。这种"训练-部署"的分离范式在许多场景下运作良好,但我们认为它在根本上与现实世界部署的本质相矛盾。 现实世界是动态的。用户偏好会改变,物理条件会波动,对抗性参与者会适应,系统本身也会因磨损或升级而发生变化。一个在部署时表现优异的策略,数周或数月后可能就变得次优甚至有害。更重要的是,部署本身就是一种持续获取真实环境数据的机会——而一次性RL完全忽视了这一宝贵资源。 我们的核心立场是:**部署的强化学习系统应当在整个运行生命周期内持续学习和适应**。这不仅仅是一种技术改进,而是对RL应如何在现实世界中运作的根本性重新思考。 ## 2. 一次性RL的局限性 ### 2.1 分布偏移问题 一次性RL面临的最根本问题是训练分布与部署分布之间的不匹配。即便使用了域随机化或其他鲁棒性技术,训练环境也无法完全覆盖真实部署条件的多样性。当环境随时间演变时,这种差距只会愈发扩大。 ### 2.2 数据利用效率低下 部署的RL系统在与环境交互时会产生大量宝贵数据,但一次性范式完全丢弃了这些信息。这是一种巨大的浪费——这些实际运行数据往往比训练数据更能反映真实世界的复杂性。 ### 2.3 无法从错误中恢复 当策略遭遇训练分布之外的情况时,一次性RL系统无法自主修正。唯一的解决方案是重新训练并重新部署,这既耗时又成本高昂,在许多实际场景中甚至不可行。 ### 2.4 错失改进机会 随着系统积累更多与真实用户和环境交互的经验,策略理应变得越来越好。一次性RL无法利用这种自然积累的经验来提升性能。 ## 3. 持续性部署RL的愿景 我们所倡导的持续性部署RL,是指系统在整个部署生命周期内: 1. **持续收集**与真实环境交互的经验数据 2. **在线更新**策略以适应环境变化和新发现的规律 3. **保持安全约束**,确保持续学习不会导致性能急剧下降或危险行为 4. **平衡探索与利用**,在不影响当前服务质量的前提下寻求改进 这一愿景与持续机器学习(Continual ML)的理念高度契合,但RL场景带来了独特的挑战:智能体的行为直接影响其所获得的数据,探索可能产生实际代价,而奖励信号往往稀疏且延迟。 ## 4. 关键挑战 ### 4.1 灾难性遗忘 持续学习最著名的挑战是灾难性遗忘——在学习新任务时忘记旧知识。在RL场景中,这意味着适应新情况可能导致在已掌握情况下的性能退化。需要开发能够在保持既有能力的同时适应新情况的算法。 ### 4.2 安全性与稳定性 部署中的持续学习引入了新的安全风险。一个正在学习的系统可能尝试危险动作,或者由于错误的梯度更新而突然性能下降。需要建立严格的安全机制,包括行为约束、性能监控和自动回滚能力。 ### 4.3 非平稳性处理 持续性RL系统必须区分真正的环境变化(需要适应)和观测噪声(不应过度拟合)。同时,系统自身的学习也会改变数据分布,造成非平稳性,给学习算法的稳定性带来挑战。 ### 4.4 样本效率 在线学习通常比离线批量学习样本效率更低。在部署场景中,每次交互都可能有实际成本,因此需要高度样本高效的算法,能够从少量新数据中快速适应。 ### 4.5 评估与监控 如何判断持续学习是否真正带来了改进?如何检测策略退化?需要建立全面的在线评估框架,能够在不中断服务的情况下持续监控系统性能。 ## 5. 现有方法与进展 研究社区已在若干相关方向取得了进展: **元强化学习**训练能够快速适应新任务的智能体,为持续适应提供了有价值的视角。**在线强化学习**研究非平稳环境中的学习,直接与持续性部署RL的需求相关。**持续监督学习**开发了多种对抗灾难性遗忘的技术,如弹性权重整合(EWC)、渐进式神经网络等,这些方法有望迁移到RL场景。**离线到在线RL**研究如何利用离线数据进行预训练,然后通过在线交互进行微调,与我们的愿景高度吻合。 然而,这些研究方向大多仍相互孤立,缺乏针对实际部署场景的整合性框架。 ## 6. 实践路径 我们建议研究社区和从业者从以下几个方向推进持续性部署RL: **建立基准**:开发专门评估持续性部署RL能力的标准化基准,包括环境非平稳性、安全约束和长期性能指标。 **算法创新**:设计原生支持持续学习的RL算法,而非将持续学习作为事后的补丁。 **系统基础设施**:构建支持持续学习的工程基础设施,包括经验回放系统、在线评估框架和安全监控机制。 **跨领域合作**:加强RL研究者与系统工程师、安全专家和实际部署从业者之间的合作。 ## 7. 结论 我们相信,将部署的RL系统从一次性范式转向持续学习范式,是释放RL在现实世界应用中全部潜力的关键一步。这不仅能提升系统的长期性能和鲁棒性,更能从根本上改变我们思考和构建智能系统的方式。 现实世界不会为我们的智能体停止演变。是时候让我们的智能体也不再停止学习了。

arXiv cs.LG

本立场文章认为,已部署的强化学习智能体永远不应停止学习,因为"先训练后修复"的范式在本质上无法应对现实环境中的非平稳性和分布偏移问题。作者识别出部署后非平稳性的四个来源,并倡导将持续强化学习作为已部署系统的标准方法。

自巩固语言模型:从上下文中持续整合知识

arXiv cs.CL

本文介绍了自巩固语言模型(SCoL),这是一种利用元强化学习将当前上下文写入模型权重以实现持续知识整合的框架。实验表明,在问答任务和长上下文巩固任务中,该方法在知识获取和保留方面均优于基线方法。