R2R2: 通过自预测学习中的冗余减少实现鲁棒表示,用于密集经验重用

arXiv cs.LG 论文

摘要

提出R2R2,一种用于强化学习中自预测学习的正则化方法,以缓解高更新-数据比下的过拟合,在连续控制任务上取得了显著改进。

arXiv:2605.14026v1 公告类型:新 摘要:在数据稀缺领域(如真实世界机器人)的强化学习中,密集数据重用提高了效率但会导致过拟合。虽然先前的工作关注于评论者偏差,但在高更新-数据比(UTD)机制下,自预测学习(SPL)中的表示级不稳定性仍未得到充分探索。为填补这一空白,我们提出了通过冗余减少实现鲁棒表示(R2R2),一种SPL内的正则化方法。我们从理论上指出标准零中心化与SPL的谱特性相冲突,并据此设计了一个非中心化目标。我们在SPL原生算法(如TD7)上验证了R2R2。此外,为了证明其与先前进展的正交性,我们通过集成一个定制的SPL模块(称为SimbaV2-SPL)扩展了原本缺乏SPL的最新方法SimbaV2。在11个连续控制任务上的实验证实,R2R2有效缓解了过拟合;具体而言,在UTD比为20时,它使TD7提升了约22%,并在SimbaV2-SPL(其本身已建立新的最佳性能)之上提供了额外增益。代码见:https://github.com/songsang7/R2R2
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:26

# 基于冗余缩减的密集经验重用鲁棒表示在自预测学习中的应用
来源:https://arxiv.org/html/2605.14026

###### 摘要

在数据稀缺领域(如现实世界机器人)的强化学习中,密集数据重用可提升效率,但会导致过拟合。虽然先前工作关注了评论员偏差,但在高更新-数据比(UTD)机制下,自预测学习(SPL)中的表示层面不稳定性仍未得到充分探索。为弥合这一差距,我们提出鲁棒表示通过冗余缩减(R2R2),一种在SPL框架内的正则化方法。我们从理论上识别到标准零中心化与SPL的谱性质相冲突,并据此设计了一个非中心化目标。我们在SPL原生算法(如TD7)上验证了R2R2。此外,为证明其与先前进展的正交性,我们通过集成一个定制的SPL模块,将原本缺乏SPL的最新算法SimbaV2扩展为SimbaV2-SPL。在11个连续控制任务上的实验证实,R2R2能有效缓解过拟合;具体而言,在UTD比为20时,它使TD7提升了约22%,并在SimbaV2-SPL(其自身已树立新的最先进水平)之上带来额外增益。代码可在以下网址找到:https://github.com/songsang7/R2R2

机器学习,ICML

{NoHyper}

## 1 引言

参考图注图1:不同UTD比率(1、10和20)下的性能比较。我们的方法表现出鲁棒性,在高UTD机制下损失极小或有所增益。值得注意的是,我们提出的SimbaV2-SPL优于当前最先进的SimbaV2(Lee等人,2025b (https://arxiv.org/html/2605.14026#bib.bib5)),而R2R2在此增强基线上实现了进一步的性能提升。历史上,强化学习(RL)一直致力于提高样本效率。离策略方法(Mnih等人,2015 (https://arxiv.org/html/2605.14026#bib.bib16);Lillicrap等人,2016 (https://arxiv.org/html/2605.14026#bib.bib1);Fujimoto等人,2018 (https://arxiv.org/html/2605.14026#bib.bib9);Haarnoja等人,2018a (https://arxiv.org/html/2605.14026#bib.bib3),b (https://arxiv.org/html/2605.14026#bib.bib4))通过经验回放缓冲区重用过去经历实现了这一点,而基于模型的RL方法(Sutton, 1990 (https://arxiv.org/html/2605.14026#bib.bib18);Janner等人,2019 (https://arxiv.org/html/2605.14026#bib.bib17);Ha和Schmidhuber, 2018 (https://arxiv.org/html/2605.14026#bib.bib19))则通过从学习到的模型生成合成经历来实现。随后,自预测学习(SPL)(Schwarzer等人,2021 (https://arxiv.org/html/2605.14026#bib.bib7);van den Oord等人,2018 (https://arxiv.org/html/2605.14026#bib.bib33))作为一种有前景的框架出现,它使用辅助任务来预测基于当前状态和动作的下一个状态的潜在表示。SPL通过为演员-评论员训练提供关于环境动态的额外信息,最大化了数据效率。与这些进步并行,另一种提高样本效率的方法是增加更新-数据比(UTD),即每次环境交互的梯度更新次数。为了实现这种密集更新同时减轻过拟合,先前的大多数工作在无模型范式中运作,主要关注解决价值估计偏差。诸如REDQ(Chen等人,2021 (https://arxiv.org/html/2605.14026#bib.bib20))和CrossQ(Bhatt等人,2024 (https://arxiv.org/html/2605.14026#bib.bib21))等著名方法通过使用集成或归一化成功稳定了训练。

然而,这些以价值为中心的进步主要针对评论员的输出,并未明确处理表示层面的过拟合。因此,高UTD训练与SPL的交集仍未得到充分探索。我们认为,处理表示层面的不稳定性是一个与减轻价值偏差正交的挑战;虽然高UTD机制会引发所有组件的过拟合,但现有的以价值为中心的策略不足以防止SPL编码器和潜在动力学模型中的表示退化。

为解决这个问题,我们提出通过冗余缩减实现鲁棒表示(R2R2),这是一种结合冗余缩减原理(Barlow and others, 1961 (https://arxiv.org/html/2605.14026#bib.bib24);Zbontar等人,2021 (https://arxiv.org/html/2605.14026#bib.bib23);Bardes等人,2022 (https://arxiv.org/html/2605.14026#bib.bib14))的正则化方法,用于稳定SPL在不同更新频率(从标准到高UTD设置,UTD≈20)下的性能。从根本上讲,我们通过避免零中心化,与计算机视觉中的标准冗余缩减方法(Zbontar等人,2021 (https://arxiv.org/html/2605.14026#bib.bib23);Bardes等人,2022 (https://arxiv.org/html/2605.14026#bib.bib14))不同。基于SPL执行转移动力学谱分解的理论见解(Tang等人,2023 (https://arxiv.org/html/2605.14026#bib.bib15)),我们识别出中心化在数学上消除了对应于全局动力学信息的主导特征向量。因此,R2R2采用非中心化的正则化方案,在保留此信息的同时,即使密集重用经验也能确保鲁棒的特征学习。至关重要的是,由于我们的方法针对编码器的正则化而非价值函数,我们的表示层面干预与现有的以价值为中心的高UTD策略正交,因此自然兼容。

为验证R2R2的有效性和普适性,我们首先将其应用于SPL原生算法,如TD7(Fujimoto等人,2023 (https://arxiv.org/html/2605.14026#bib.bib10))。在标准基准测试上,我们的方法有效缓解了高UTD(UTD=20)下的性能退化,并将TD7的聚合归一化分数提升了约22%。这一优势在DMC-Hard(Lee等人,2025a (https://arxiv.org/html/2605.14026#bib.bib22))中更为明显,这是标准DMC套件(Tassa等人,2018 (https://arxiv.org/html/2605.14026#bib.bib27),2020 (https://arxiv.org/html/2605.14026#bib.bib41))中一个具有挑战性的子集,R2R2显著提升了基线性能(1.02 → 1.32)。此外,为了证明其与架构进步的正交性,我们针对最先进的SimbaV2(Lee等人,2025b (https://arxiv.org/html/2605.14026#bib.bib5))。由于我们的方法需要SPL框架,我们首先将定制的SPL模块集成到该架构中,称为SimbaV2-SPL。单是这一集成就在连续控制基准测试上树立了新的最先进性能。关键在于,将R2R2应用于此增强基线带来了进一步的增益,归一化分数达到1.38,从而证实我们的R2R2即使对最强的架构也提供了互补的益处。

总之,本文的贡献如下:

- *(方法)*我们提出R2R2,一种基于我们理论分析的正则化方法。通过利用冗余缩减原理,我们的方法明确地减轻了高UTD机制下密集经验重用引起的表示层面不稳定性。
- *(理论)*我们提供了理论分析,识别出SPL的谱分解特性与特征中心化(零中心化)之间的根本冲突。我们证明了零中心化消除了代表全局动力学的本征模。
- *(架构)*我们通过将定制的SPL框架集成到最先进的SimbaV2中,构建了SimbaV2-SPL。与我们提出的正则化不同,此架构扩展弥合了潜在动力学建模与现代无模型骨干之间的差距。
- *(性能)*我们证明了R2R2能普遍改进各种骨干算法,特别是在高UTD机制下。此外,我们提出的架构SimbaV2-SPL本身就在连续控制基准测试上树立了新的最先进性能,而在此增强基线上,SimbaV2-SPL + R2R2实现了额外的性能增益。

## 2 相关工作

### 2.1 更新-数据比

标准的离策略算法(Mnih等人,2015 (https://arxiv.org/html/2605.14026#bib.bib16);Lillicrap等人,2016 (https://arxiv.org/html/2605.14026#bib.bib1);Fujimoto等人,2018 (https://arxiv.org/html/2605.14026#bib.bib9);Haarnoja等人,2018a (https://arxiv.org/html/2605.14026#bib.bib3),b (https://arxiv.org/html/2605.14026#bib.bib4))通常将更新-数据比(UTD)限制为1,以避免密集数据重用引起的过拟合。然而,最近的趋势倾向于高UTD比率(例如,UTD≈20)。为减轻此过拟合,Dyna类方法通过合成转移增强训练(Sutton, 1990 (https://arxiv.org/html/2605.14026#bib.bib18);Janner等人,2019 (https://arxiv.org/html/2605.14026#bib.bib17);Voelcker等人,2025 (https://arxiv.org/html/2605.14026#bib.bib35)),而无模型方法则利用随机集成(Chen等人,2021 (https://arxiv.org/html/2605.14026#bib.bib20))或成功引入批归一化(Bhatt等人,2024 (https://arxiv.org/html/2605.14026#bib.bib21);Ioffe和Szegedy, 2015 (https://arxiv.org/html/2605.14026#bib.bib38))以减轻偏差。最近,注意力转向了架构创新;SimBa(Lee等人,2025a (https://arxiv.org/html/2605.14026#bib.bib22))和BRO(Nauman等人,2024 (https://arxiv.org/html/2605.14026#bib.bib36))证明了如层归一化(Ba等人,2016 (https://arxiv.org/html/2605.14026#bib.bib34))和Dropout(Srivastava等人,2014 (https://arxiv.org/html/2605.14026#bib.bib37))等正则化技术可与基于模型的效率相媲美。在此基础上,SimbaV2(Lee等人,2025b (https://arxiv.org/html/2605.14026#bib.bib5))进一步扩大了网络容量并优化了归一化,确立了新的最先进水平。

尽管有这些进展,先前的工作主要针对价值函数集成或架构约束引起的不稳定性。相比之下,表示层面退化这一具体问题代表了一个正交挑战,受到的关注相对有限。

### 2.2 自监督学习

自监督学习(SSL)已从对比方法(如SimCLR(Chen等人,2020 (https://arxiv.org/html/2605.14026#bib.bib28)))发展到非对比不对称方法(如BYOL(Grill等人,2020 (https://arxiv.org/html/2605.14026#bib.bib13))和SimSiam(Chen和He, 2021 (https://arxiv.org/html/2605.14026#bib.bib12)))。与这些架构解决方案不同,基于冗余缩减(Barlow and others, 1961 (https://arxiv.org/html/2605.14026#bib.bib24))的方法,包括Barlow Twins(Zbontar等人,2021 (https://arxiv.org/html/2605.14026#bib.bib23))和VICReg(Bardes等人,2022 (https://arxiv.org/html/2605.14026#bib.bib14)),通过显式去相关特征维度来防止坍塌。我们利用这些原理在容易过拟合的RL场景中学习鲁棒的状态表示。

### 2.3 自预测学习

为提高样本效率,先前的工作利用了从重构(Yarats等人,2021 (https://arxiv.org/html/2605.14026#bib.bib32);Jaderberg等人,2017 (https://arxiv.org/html/2605.14026#bib.bib31))到对比学习(van den Oord等人,2018 (https://arxiv.org/html/2605.14026#bib.bib33);Laskin等人,2020 (https://arxiv.org/html/2605.14026#bib.bib30))的各种辅助目标。超越这些,自预测学习(SPL)专注于捕获潜在的时序动态而非静态特征。著名的实现包括SPR(Schwarzer等人,2021 (https://arxiv.org/html/2605.14026#bib.bib7)),它改编自BYOL(Grill等人,2020 (https://arxiv.org/html/2605.14026#bib.bib13)),以及TD7(Fujimoto等人,2023 (https://arxiv.org/html/2605.14026#bib.bib10)),它采用了SimSiam(Chen和He, 2021 (https://arxiv.org/html/2605.14026#bib.bib12))风格的框架。最近的理论研究(Tang等人,2023 (https://arxiv.org/html/2605.14026#bib.bib15);Ni等人,2024 (https://arxiv.org/html/2605.14026#bib.bib11))进一步泛化了SPL框架,提供了对其谱性质的洞见。

## 3 预备知识

### 3.1 强化学习问题

我们在马尔可夫决策过程(MDP)的框架内处理强化学习问题,形式化为一个元组(S,A,P,R,γ)(Sutton和Barto, 2018 (https://arxiv.org/html/2605.14026#bib.bib6))。智能体的目标是学习一个策略π,最大化期望的折扣累积回报。在SPL的背景下,我们专注于学习一个信息丰富的潜在表示φ:S→R^k,它封装了关于转移动力学P的基本信息,这构成了样本高效学习的基础。

### 3.2 自预测学习的谱视角

SPL通常涉及训练一个编码器φ以及一个潜在转移预测器T。目标是使预测的未来表示与实际未来表示之间的差异最小化。形式上,对于一个转移元组(st,at,st+1),SPL损失(L_SPL)由下式给出:

L_SPL = E_(st,at,st+1)~D [ || T(φ(st), at) - sg(φ(st+1)) ||_2^2 ], (1)

其中sg(·)表示停止梯度操作,这是训练稳定性的关键组成部分。

与谱分解的联系。最近的理论进展建立了SPL的学习动态与状态转移矩阵的谱分解之间的联系。考虑表示矩阵Φ∈R^{|S|×k},其中每一行对应于状态s的嵌入φ(s)。具体地,(Tang等人,2023 (https://arxiv.org/html/2605.14026#bib.bib15))证明最小化SPL目标隐式地最大化了涉及转移矩阵P^π的迹泛函:

max_Φ Tr( (Φ^⊤ P^π Φ)^⊤ (Φ^⊤ P^π Φ) )  s.t.  Φ^⊤ Φ = I_k. (2)

由此目标推导出的最优表示Φ^*张成了由P^π的前k个右特征向量定义的子空间。具有行随机转移矩阵P的马尔可夫链的一个基本性质是特征值1总是存在。特别地,常数向量1是满足P1=1的右特征向量,反映了概率质量守恒。这个常数特征向量与全局偏差对齐。这一观察表明,为捕获全局动力学,需要保留常数模态。

### 3.3 自监督学习中的冗余缩减

为学习无坍塌的鲁棒表示,冗余缩减方法对嵌入的统计特性施加显式约束。在这些方法中,VICReg(Bardes等人,2022 (https://arxiv.org/html/2605.14026#bib.bib14))特别有效,因为它将学习目标解耦为三个独立的部分:

相似文章

表示学习助力可扩展多任务深度强化学习

arXiv cs.LG

本文认为,表示学习(而非基于模型的规划)是可扩展多任务深度强化学习的关键。文章介绍了MR.Q,一种简单的无模型算法,通过辅助预测目标,在多种连续控制任务上优于之前基于世界模型的方法。

用于样本高效连续控制的无偏模型化表示

Hugging Face Daily Papers

本文介绍了 DR.Q 算法,该算法通过最大化互信息并采用淡出优先经验回放,改善了 Q-learning 的模型化表示,从而减少了连续控制任务中的偏差和过拟合。