重复作为强化:通过即时情节重复提升强化学习的样本效率

arXiv cs.LG 论文

摘要

本文介绍了即时情节重复(IER),这是一种受生物学启发的机制,通过在数据收集期间主动重复成功情节中的动作序列来提升强化学习中的样本效率,并在MuJoCo、DeepMind Control Suite和机器人任务上展示了性能提升。

arXiv:2608.17347v1 公告类型:新 摘要:重复是人类学习中的一个基本机制,回顾成功经历可以加强记忆、巩固技能并提升未来表现。受这一生物学原理启发,我们引入了即时情节重复(IER),这是一种简单且新颖的机制,通过在环境交互期间立即重复成功情节中的动作序列来提升样本效率。与传统方法如经验回放和自模仿学习(SIL)不同,这些方法在训练更新期间被动重用过去经验,而IER直接影响数据收集过程。当识别到一个高奖励情节时,智能体将在后续固定数量的情节中重复其动作序列,通过与环境的重新交互来强化有价值的行为。我们将IER集成到最先进的SAC和TD3算法中,并在连续控制基准测试上评估其有效性,包括MuJoCo、DeepMind Control Suite以及使用机器人操作器的真实世界动态物体翻译任务。实验结果表明,这种简单机制提升了学习性能,优于标准和基于自模仿的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:27

# 通过即时回合重复强化强化学习中的样本效率  
来源:https://arxiv.org/html/2608.17347  
作为强化学习的重复:通过即时回合重复强化样本效率  

Hoda Yamani, Yuning Xing, Koen van Rijnsoever, Bruce A\. MacDonald, Henry Williams  

关键词:强化学习、经验回放、回合重复、样本效率、连续控制、自模仿学习、TD3、SAC  

摘要重复是生物学习中的核心机制,通过重温成功经验来增强记忆并稳定技能习得。受这一原理启发,我们提出了即时回合重复(IER)这一简单机制,它通过在环境交互中积极重放高回报回合的动作序列来提高强化学习的样本效率。不同于在策略更新时被动重用存储转换的回放缓冲区方法,IER直接修改数据收集过程:当一个回合获得比以往观测到的更高累积奖励时,智能体立即在不同初始条件下重放相同的动作序列(重复固定次数)。IER可与包括SAC和TD3在内的非策略连续控制算法无缝集成,无需架构修改。在MuJoCo、DeepMind Control Suite及真实机器人操作任务上的实验表明,与标准非策略和SIL增强基线相比,IER能提升学习效率并加速策略优化,表明结构化的动作序列为提升强化学习效果提供了简单而有效的机制。  

贡献1\.我们引入IER,这是一种受生物学启发的机制,通过立即重放先前高回报回合的动作序列来修改强化学习交互循环。背景:与仅在存储后重用经验的回放缓冲区方法不同,IER在数据收集过程中进行干预,用成功先前回合的动作替代策略选择的动作。2\.IER通过在环境交互中重复高回报回合的完整动作序列,引入了回合级行为巩固,而非将经验视为独立的转换样本。背景:这将经验重用从被动的回放缓冲区采样转变为主动的回合级动作重放,使得成功行为在新转换仍在收集时得以重温。3\.我们提供了一种将IER简单通用地集成到非策略连续控制算法中的方法,证明了其与SAC和TD3的兼容性且无需架构修改。背景:该方法在交互层面运行,无需改变网络结构或损失函数。4\.通过在MuJoCo、DeepMind Control Suite及真实机器人操作任务上的评估,我们证明在一致的训练设置下,即时回合重复能提高样本效率并加速收敛。背景:实证分析在一致的训练设置下将IER与标准非策略基线和自模仿方法进行了对比。  

###### 摘要  

重复是人类学习的基本机制,通过重温成功经验来强化记忆、巩固技能并提升未来表现。受这一生物学原理启发,我们引入即时回合重复(IER),这是一种简单新颖的机制,通过在环境交互中立即重复成功回合的动作序列来提高样本效率。不同于诸如经验回放和自模仿学习等传统方法(它们在训练更新中被动重用过往经验),IER直接影响数据收集过程。当识别出高回报回合后,智能体将在后续的固定数量回合中重复其动作序列,通过与环境的重新交互来强化有价值的行为。我们将IER集成到最先进的SAC和TD3算法中,并在连续控制基准任务上评估其有效性,包括MuJoCo、DeepMind Control Suite以及使用机器人操作器进行的现实世界动态物体平移任务。实验结果表明,这一简单机制在标准及自模仿基线上提升了学习性能。  

## 1引言  

强化学习提供了一个强大框架,用于训练智能体通过与环境交互并从反馈中学习来做出序贯决策35 (https://arxiv.org/html/2608.17347#bib.bib36)。强化学习已在从机器人操作、自动驾驶到游戏等各个领域取得了显著成功16 (https://arxiv.org/html/2608.17347#bib.bib4);34 (https://arxiv.org/html/2608.17347#bib.bib5);23 (https://arxiv.org/html/2608.17347#bib.bib6)。然而,限制其更广泛应用的关键挑战之一是样本效率,即从有限的交互中学习有效策略的能力7 (https://arxiv.org/html/2608.17347#bib.bib7)。与通常能从相对较少经验中学习复杂行为的生物智能体相比,强化学习智能体通常需要数百万次交互才能达到类似性能25 (https://arxiv.org/html/2608.17347#bib.bib8);2 (https://arxiv.org/html/2608.17347#bib.bib9)。这种低效性构成了重大障碍,尤其是在交互成本高昂且耗时的真实环境中9 (https://arxiv.org/html/2608.17347#bib.bib10)。  

神经科学研究强调,奖励驱动的重复是高效学习背后的基本机制33 (https://arxiv.org/html/2608.17347#bib.bib19);8 (https://arxiv.org/html/2608.17347#bib.bib20)。当人类或动物经历奖励结果时,他们更有可能重新参与导致该奖励的相同动作序列22 (https://arxiv.org/html/2608.17347#bib.bib21)。这种动作重复强化了动作与结果之间的联系,并支持程序性记忆和运动技能的发展17 (https://arxiv.org/html/2608.17347#bib.bib28);12 (https://arxiv.org/html/2608.17347#bib.bib25)。例如,在学习骑自行车时,一个人最初可能会挣扎,尝试平衡、转向和踩踏的不同方式。然而,一旦他们成功骑行了一小段距离,他们会本能地重复相同的动作协调10 (https://arxiv.org/html/2608.17347#bib.bib18);22 (https://arxiv.org/html/2608.17347#bib.bib21)。每次重复都会提高他们的能力,成功的动作模式变得更加稳定和高效。在神经层面,这一过程通过突触可塑性和多巴胺能调节等机制强化突触连接,支持有效策略随时间的巩固和优化18 (https://arxiv.org/html/2608.17347#bib.bib22);32 (https://arxiv.org/html/2608.17347#bib.bib24)。  

参见标题图1:即时回合重复算法示意图:在每个回合结束时(当done为真时),如果智能体识别出一个具有高奖励的回合,它会立即通过在该环境中按顺序执行该回合的动作来启动重复,从开始到结束,重复R次。受此启发,我们研究如何将重复明确地融入强化学习框架,以强化高价值经验并提升学习。虽然现有技术如经验回放28 (https://arxiv.org/html/2608.17347#bib.bib30)和PER31 (https://arxiv.org/html/2608.17347#bib.bib35)通过在策略更新时重用存储的转换来提高训练效率,但它们这样做是被动的,并未直接影响智能体在交互过程中的行为。因此,即使成功的行为也很少在环境中重复,延迟了其强化。  

最近的方法,如自模仿学习(SIL)29 (https://arxiv.org/html/2608.17347#bib.bib11),在此基础上进行构建,鼓励智能体模仿具有高累积奖励的过往经验。SIL从回放缓冲区采样回合,并优先考虑高回报以指导学习。然而,这些方法仍然是被动的,并未直接改变智能体与环境的交互方式6 (https://arxiv.org/html/2608.17347#bib.bib14)。  

我们提出即时回合重复(IER),这是一种新颖且概念上简单的机制,旨在通过在发现成功行为时立即进行强化来提高强化学习中的样本效率。与传统的非策略方法(它们在交互中执行策略生成的动作,并主要依赖于回放缓冲区中存储转换的被动重用)不同,IER通过重复新发现的高回报回合的动作序列来修改数据收集过程。当智能体识别出一个达到新最高奖励的回合时,它会存储相应的动作序列,并在当前回合结束后立即在后续固定数量的回合中重复该序列,而不是从当前策略中采样动作。通过围绕已证明高价值的行为生成额外样本,IER增加了有希望的状态-动作区域中信息经验的密度。重要的是,这种干预仅影响交互策略,而不改变底层网络架构、目标函数或优化过程。  

我们将IER集成到标准非策略框架中,并在模拟和现实世界机器人环境中的连续控制基准任务上评估其有效性。实验结果表明,IER优于基线算法,突出了其提升学习效率和性能的潜力。代码可用性:IER的实现可在https://github.com/UoA-CARES/instant-episode-repetition公开获取。  

## 2背景与相关工作  

### 2\.1重复的行为和神经基础  

重复和强化是生物系统中适应性学习的基本机制15 (https://arxiv.org/html/2608.17347#bib.bib27)。强化增加了重复与奖励结果相关的动作的可能性,这一原则在操作性条件反射中被形式化,并由多巴胺能奖励预测信号支持37 (https://arxiv.org/html/2608.17347#bib.bib29);32 (https://arxiv.org/html/2608.17347#bib.bib24)。反过来,重复通过反复激活神经回路和结构化练习来稳定和优化强化后的行为,增强突触效能并支持长期记忆巩固18 (https://arxiv.org/html/2608.17347#bib.bib22);4 (https://arxiv.org/html/2608.17347#bib.bib23)。  

在神经层面,任务相关回路的反复激活强化了突触连接,这一过程由赫布学习捕捉18 (https://arxiv.org/html/2608.17347#bib.bib22)。长时程增强提供了生理证据,表明持续的共同激活增强了突触效能并支持记忆巩固4 (https://arxiv.org/html/2608.17347#bib.bib23)。通过这些机制,重复将短暂的成功转化为稳定的行为模式,并逐步提高执行效率12 (https://arxiv.org/html/2608.17347#bib.bib25)。  

重要的是,重复不是机械复制。行为和运动学习研究强调“无重复的重复”,即每次执行都在略有变化的条件下进行,以促进鲁棒性和泛化能力3 (https://arxiv.org/html/2608.17347#bib.bib2);26 (https://arxiv.org/html/2608.17347#bib.bib3)。神经影像学研究进一步证明了重复抑制,反映了当熟悉的模式被重新参与时处理效率的提高20 (https://arxiv.org/html/2608.17347#bib.bib26)。总之,这些发现表明,有效的学习来自于在自然变化下反复重新参与成功的行为。  

这些原则表明,重复通过在保持适应性的同时稳定有效行为来巩固成功。将这一见解转化为强化学习,激发了通过故意重放高回报回合来在交互中强化有价值策略的方法。受这一生物学视角启发,我们引入IER作为策略学习的交互级重复机制。  

### 2\.2自模仿学习(SIL)  

SIL是一种基于值的强化学习技术,它通过利用具有高折扣回报的过往经验来改善策略学习29 (https://arxiv.org/html/2608.17347#bib.bib11)。它通过增加折扣回报超过当前价值估计的动作的似然性来执行非策略更新。然而,SIL仍然是一种被动方法:尽管它基于成功的过往回合更新策略,但智能体仍然从其当前策略中采样动作,且高回报轨迹不会直接影响新经验。这种学习与行为之间的分离限制了SIL在交互中强化成功策略的能力。  

SIL的最新扩展通过集成额外的学习信号或辅助机制来提高学习效率。例如,27 (https://arxiv.org/html/2608.17347#bib.bib15)提出了A-SILfD,它结合了专家演示并使用集成Q函数来约束更新以减轻过估计。然而,他们的方法依赖于强调关键行为的专家数据,限制了其在缺乏此类数据或难以获取的情况下的适用性。  

1 (https://arxiv.org/html/2608.17347#bib.bib16)将SIL与内在动机相结合,引导探索走向先前成功的行为,内在信号进一步强调了高回报回合的优先级。6 (https://arxiv.org/html/2608.17347#bib.bib14)引入了一种结合了Hindsight的回合级重放策略来改善策略学习。虽然在目标条件设定中有用,但依赖Hindsight Experience Replay(HER)限制了其在非结构化或通用环境中的使用。24 (https://arxiv.org/html/2608.17347#bib.bib17)在SIL框架内结合对抗训练以提高鲁棒性。然而,他们的方法主要通过离线重放运行,并未影响交互中的动作选择,降低了其实时适应和行为塑造的有效性。  

相比之下,提出的IER方法超越了纯粹的策略驱动采样,允许智能体重放整个成功轨迹,从而将对过往成功的回忆直接嵌入到交互过程中。通过强化时间连贯的动作序列而非孤立的转换,IER在动态演变的条件下进行在线策略评估,同时强化了有价值的行为模式。据我们所知,这是一个自模仿的新方向,可以集成到广泛的算法中,包括基于值和演员-评论家方法,而无需结构修改或外部演示。  

## 3方法论  

在本节中,我们介绍IER并描述它如何集成到标准非策略演员-评论家强化学习中。IER在回合边界处操作,改变交互动态,同时保留底层学习目标和优化过程。  

### 3\.1预备知识  

强化学习被建模为马尔可夫决策过程(MDP)  

M=\(S,A,P,R,γ\),\\mathcal\{M\}=\(\\mathcal\{S\},\\mathcal\{A\},P,R,\\gamma\),\(1\)其中S\\mathcal\{S\}和A\\mathcal\{A\}表示

相似文章

后见之明经验回放

OpenAI Blog

# 后见之明经验回放 来源:[https://openai.com/index/hindsight-experience-replay/](https://openai.com/index/hindsight-experience-replay/) ## 摘要 处理稀疏奖励是强化学习(RL)中最大的挑战之一。我们提出了一种名为后见之明经验回放的新颖技术,它允许从稀疏二元奖励中进行样本高效学习,因此避免了复杂的奖励工程设计的需要。它可以与任意组合

面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放

arXiv cs.CL

# 面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放 来源:[https://arxiv.org/html/2604.16918](https://arxiv.org/html/2604.16918) Weiyu Ma1 Yongcheng Zeng2 Yan Song3 Xinyu Cui2 Jian Zhao4 Xuhui Liu1 Mohamed Elhoseiny1 1 阿卜杜拉国王科技大学 (KAUST) 2 中国科学院自动化研究所 (CASIA) 3 伦敦大学学院计算机科学系人工智能中心 4 中关村人工智能研究院 weiyu\.