在图像强化学习中整合新颖性和惊奇性以优先化经验与探索

arXiv cs.LG 论文

摘要

本文介绍了新颖性和惊奇性优先经验回放(NSPER),通过结合新颖性和惊奇性来优先化经验与探索,以提升图像强化学习中的样本效率。

arXiv:2608.17373v1 Announce Type: new 摘要:样本效率是强化学习(RL)中的一个核心挑战,尤其是在图像领域,智能体必须从高维视觉输入中学习。传统采样通常依赖于随机或次优的经验选择,导致冗余更新和学习缓慢。提高效率需要既能优先处理信息丰富的经验,又能鼓励有效探索的机制。优先经验回放(PER)通过重用高价值转换来解决部分挑战,而内在奖励则促进对新颖或不确定状态的探索。然而,它们的整合尚未得到广泛研究。本文介绍了新颖性和惊奇性优先经验回放(NSPER),它使用新颖性来捕捉代表性不足的状态,使用惊奇性来揭示智能体对环境理解中的差距。我们进一步扩展了NSPER+R,将这些信号作为内在奖励整合,共同改进回放质量和探索。在DeepMind Control Suite任务上的实验表明,与现有图像强化学习方法相比,NSPER和NSPER+R提高了训练效率和收敛速度。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:28

# 基于图像强化学习中用于经验优先级排序与探索的新颖性与惊奇性融合机制
来源:https://arxiv.org/html/2608.17373  
Henry Williams、Bruce A. MacDonald  
致谢:新西兰奥克兰大学电气、计算机与软件工程系机器人学习团队与CARES机器人实验室。通讯作者:[email protected]

###### 摘要

样本效率是强化学习(RL)的核心挑战,尤其在基于图像的领域中,智能体必须从高维视觉输入中学习。传统采样方法常依赖随机或次优的经验选择,导致冗余更新和学习速度缓慢。提升效率需要一种既能优先选择信息量丰富的经验,又能鼓励有效探索的机制。优先经验回放(PER)通过重复利用高价值转移来应对这一挑战的部分方面,而内在奖励则促进对新颖或不确定状态的探索。然而,两者的集成尚未得到充分研究。本文提出新颖性与惊奇性优先经验回放(NSPER),利用新颖性捕获未充分表征的状态,并利用惊奇性揭示智能体对环境理解中的空白。我们进一步扩展为NSPER+R,将这些信号作为内在奖励集成,共同提升回放质量和探索效果。在DeepMind Control Suite任务上的实验表明,与现有基于图像的强化学习方法相比,NSPER和NSPER+R能提升训练效率与收敛速度。

\{IEEEkeywords\}  
强化学习、优先经验回放、样本效率、新颖性、惊奇性、内在奖励、连续控制、基于图像的控制

参考图示 图1:新颖性与惊奇性优先经验回放(NSPER)架构概览。

## 1 引言

强化学习(RL)在基于图像的应用中展现出巨大潜力,允许智能体直接从视觉输入中学习\[44, 17\]。该范式已广泛应用于游戏\[26\]、机器人技术\[13\]和自动驾驶\[33\]等领域,其中视觉作为环境反馈的主要来源。然而,高维图像数据引入了冗余性、高内存需求和大量计算开销,使策略学习更复杂且更耗资源\[9\]。由于强化学习本质上依赖大量交互数据,提升样本效率至关重要\[11\]。一个有前景的方向是在训练期间优先处理信息量丰富的经验,并引导探索朝向那些提供最高学习价值的经验。这种优先级排序可通过内在学习信号指导,这些信号标示哪些转移对学习最有用\[5\]。

受人类认知启发,其中内在信号能激发好奇心\[4, 10\]并引导记忆系统优先处理新颖或显著的经验\[35, 7\],强化学习智能体可以采用类似机制来增强探索并加速学习。此类信号为指导探索行为和选择训练中最具信息量的经验提供了基础\[30, 16\],从而以两种互补方式提升样本效率。首先,它们可被设计为内在奖励,鼓励智能体获取多样化且信息量丰富的经验,从而加速策略优化\[28\]。其次,它们可在经验回放中用作优先级评分,使智能体能够专注于具有最高学习潜力的转移。

在内在信号中,新颖性和惊奇性已被证明是特别有效的内在奖励\[6\]。新颖性反映状态的陌生程度,驱动探索朝向未充分代表或未探索的区域\[18, 20\]。另一方面,惊奇性产生于结果与预测显著偏离时,揭示智能体环境模型的空白及其从过去经验中泛化能力的局限\[1\]。结合这两种信号使智能体能够识别需要进一步学习的区域并调整探索策略,从而实现更高效、更有针对性的探索\[22, 39\]。

优先经验回放(PER)是强化学习中一种成熟的方法,它在回放缓冲区内利用此类内在信号来提升样本效率\[32\]。在其原始形式(我们称之为TD-PER)中,转移基于时序差分(TD)误差进行优先级排序,该误差衡量智能体行动后预测结果与实际结果之间的差异。虽然在离散动作空间中有效,但TD-PER在连续控制环境中表现欠佳\[29, 27\]。为克服这些限制,已提出多种扩展方法,包括用辅助信号增强TD误差或使用受生物学启发的机制进行优先级排序\[31, 27, 40, 37\]。尽管有这些进展,但在基于图像的强化学习中集成内在奖励与PER仍然有限。例如,对比好奇心学习框架(CCLF)\[37\]使用好奇心优先处理令人惊讶的增强输入。然而,将内在奖励更广泛地用作经验优先级排序的评分信号仍有待探索。

为解决这一差距,我们提出NSPER,一种新颖的优先级排序方法,使用两种不同的内在信号——新颖性和惊奇性——在PER中指导经验选择。通过结合这些信号指导采样,NSPER识别出具有高学习潜力的多样化且信息量丰富的转移,从而提升回放经验的质量。我们进一步引入NSPER+R,作为NSPER的扩展,不仅将新颖性和惊奇性用于优先级排序,还作为内在奖励。这种双重机制改进了经验选择和探索行为,带来更快的收敛和更可泛化的策略。为评估我们的方法,我们将其集成到PixelTD3(TD3算法的基于图像变体)\[14\]中,并在DeepMind Control Suite的挑战性任务上评估其性能\[38\],展示了在复杂高维视觉环境中的显著改进。模型架构如图1所示。实现代码已在https://github.com/UoA-CARES/NSPER公开。

本文的主要贡献总结如下:
1. 我们提出NSPER,一种新颖的方法,在PER中使用内在奖励作为优先级信号,以提升基于图像强化学习的样本效率。
2. 我们通过NSPER+R扩展了这一思路,该方法同时利用新颖性和惊奇性进行优先级排序和作为内在奖励,进一步增强了探索和策略学习。
3. 我们对不同的优先级排序策略及其与内在奖励的集成进行了全面评估,分析了它们对训练效率和学习性能的影响。
4. 我们进行了消融研究,以单独分析新颖性和惊奇性的贡献,以及当它们与内在奖励结合使用时的综合效应。

## 2 相关工作

经验优先级排序和内在动机是提升强化学习样本效率和探索的关键策略。先前工作探索了各种机制来识别信息量丰富的经验并引导智能体朝向新颖或令人惊讶的转移,为将这些想法结合以增强复杂环境中学习的方法提供了基础。

### 2.1 经验优先级排序方法

PER方法通过为具有更高学习潜力的转移分配更高的采样概率来提升样本效率\[42\]。TD-PER\[32\]是一种常见变体,它基于TD误差对转移进行排序,假设具有较大TD误差的转移更不熟悉,因此信息量更大。然而,在连续高维空间中,动作或观测的微小扰动可能导致价值估计的巨大波动,即使是对于已充分学习的转移也是如此,使得TD误差成为一个有噪声且不稳定的优先级信号\[29\]。这种敏感性使TD误差成为一个有噪声且不可靠的优先级信号,促使研究者寻求在连续控制任务中提供更稳定、更具信息量学习信号的替代策略\[8, 25\]。

为了解决这些限制,LA3P\[31\]通过将低TD误差转移分配给执行器以稳定策略更新,将高TD误差转移分配给评论器以改进价值估计,从而解耦学习信号。另一种方法\[42\]优先处理具有低TD误差的近期转移,从而专注于最新经验,但这可能因丢弃旧但有价值的数据而导致灾难性遗忘。模型增强PER(MaPER)\[27\]整合了从学习到的环境动力学中导出的辅助信号来补充TD误差,从而改进了对重要经验的识别。尽管有这些改进,所有这些方法主要依赖TD误差作为主要优先级排序标准。

相比之下,奖励预测误差(RPE)优先级排序\[40\]引入了一种受生物学学习启发的替代信号。通过测量期望奖励与实际奖励之间的差异,RPE在其预测准确性方面提供了信息反馈,允许其随时间调整策略并增强决策能力\[36\]。类似地,我们的方法提出了一种新颖的优先级排序策略,使用替代的内在信号,促进探索并强调不熟悉的转移。

### 2.2 内在动机策略

内在动机在强化学习中已被广泛探索,以鼓励智能体超越外在奖励进行探索和学习\[28\]。这种方法鼓励智能体在环境中寻找新颖的状态和行为\[3, 37\]。已经提出了几种内在动机机制,包括状态新颖性\[6\]、状态预测误差\[6\]、对结果的不确定性\[24\]以及环境动力学\[34\]。其中,新颖性和惊奇性通过直接针对有意义的机会,引导探索朝向不熟悉的状态和显著的预测误差,从而实现更集中、更高效的学习,并且性能优于仅依赖不确定性或环境动力学的方法\[39\]。

新颖性鼓励访问很少遇到的状态,促进对环境更广泛的理解\[18\]。惊奇性通过环境动力学中的预测误差来衡量,例如下一状态误差和状态转移差异\[30, 1\]。结合新颖性和惊奇性可以捕获智能体-环境交互的互补方面,改善探索和表征学习\[18, 20\],并允许在复杂任务中更好地平衡探索与利用\[22\]。

尽管有这些进展,但将内在动机信号整合到记忆优先级排序机制中仍然是一个持续的挑战。最近的几项研究专注于将基于好奇心的指标与经验回放相结合,以进一步优化优先级排序策略。

### 2.3 将内在信号集成到经验回放中

最近的研究探讨了将内在动机融入记忆优先级排序。基于好奇心的经验优先级排序(CDP)\[43\]优先处理导致罕见目标状态的轨迹,确保智能体专注于未充分探索的区域。然而,CDP基于事后经验回放(HER)\[2\],这限制了其仅适用于面向目标的任务。增强型好奇心驱动经验回放(ACDER)\[23\]也将好奇心信号集成到HER中,但仍然受限于目标条件探索。

一个更相关的方法CCLF\[37\],在基于图像的强化学习中引入了一种自监督的优先级排序机制。CCLF选择令人惊讶的增强输入以提升样本效率,但它主要关注表征学习,而不是优化用于策略改进的经验选择。

我们的方法扩展了这些见解,将新颖性和惊奇性整合到经验优先级排序中,确保所选转移同时支持探索和策略优化。通过将内在奖励与结构化的优先级排序机制相结合,它克服了PER的局限性,并利用内在动机在具有挑战性的环境中实现更有效的学习。

## 3 方法论

本节概述了支撑我们方法的组成部分,首先回顾PER、PixelTD3以及新颖性和惊奇性信号的计算。然后我们介绍我们的框架NSPER及其扩展NSPER+R。

### 3.1 PER

PER通过重放具有更高学习潜力的转移来提升样本效率。缓冲区BB中的转移存储为:
Bi=\(si,ai,ri,si\+1\),B\_\{i\}=\(s\_\{i\},a\_\{i\},r\_\{i\},s\_\{i\+1\}\),\(1\)
其中ii索引时间步。每个转移的优先级定义为:
σi=\|δi\|\+ε,\\sigma\_\{i\}=\|\\delta\_\{i\}\|\+\\epsilon,\(2\)
在标准变体TD-PER中,δi\\delta\_\{i\}是TD误差,且ε\>0\\epsilon\>0确保非零优先级。

转移按...

相似文章

面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放

arXiv cs.CL

# 面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放 来源:[https://arxiv.org/html/2604.16918](https://arxiv.org/html/2604.16918) Weiyu Ma1 Yongcheng Zeng2 Yan Song3 Xinyu Cui2 Jian Zhao4 Xuhui Liu1 Mohamed Elhoseiny1 1 阿卜杜拉国王科技大学 (KAUST) 2 中国科学院自动化研究所 (CASIA) 3 伦敦大学学院计算机科学系人工智能中心 4 中关村人工智能研究院 weiyu\.

提示驱动探索

arXiv cs.LG

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

基于重试的策略梯度强化学习中探索的涌现

arXiv cs.LG

本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。