基于观测的自预测强化学习用于视觉连续控制

arXiv cs.LG 论文

摘要

本文提出了 OG-SPR,一种无模型视觉强化学习算法,它将潜在自预测与观测预测相结合,学习具有动力学感知的表示,从而在 DeepMind Control Suite 任务上提高了样本效率。

arXiv:2608.05989v1 公告类型:新 摘要:从像素中进行样本高效的策略学习是强化学习(RL)中长期存在的挑战。近年来,基于动态的表示学习方法通过在潜在空间(自预测)或观测空间(观测预测)中执行辅助预测来学习具有动力学感知的表示,从而显著提高了无模型视觉 RL 的样本效率。然而,在训练数据有限的情况下,这两类最先进的方法在具有挑战性的视觉控制任务上仍然表现不佳。我们认为,仅依赖任何一种预测目标可能是不够的。相比之下,观测预测将学习到的表示锚定在观测层级的动态中,但并未直接规范潜在表示在较长时域上的时间可预测性。在本文中,我们提出了观测锚定的自预测表示(OG-SPR),这是一种用于连续控制的无模型视觉 RL 算法,它学习到的表示既在潜在空间中具有时间可预测性,又锚定在观测层级的动态中。OG-SPR 包含两个核心辅助目标:多步潜在自预测和下一步观测预测。我们的实验表明,直接将潜在自预测施加在共享表示上可能会对其过度约束,并且不一定能提高性能。为了解决这个问题,OG-SPR 引入了两个轻量级适配器用于潜在自预测,使共享表示能够从时间预测信号中获益,而无需被迫直接满足自预测目标。在 DeepMind Control Suite 的 28 个视觉控制任务上的实验表明,OG-SPR 在总体性能上优于最先进的自预测和观测预测 RL 方法,并且在诸如 dog 和 humanoid 等具有挑战性的领域中尤其显著。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:53

# 面向视觉连续控制的观测锚定自预测强化学习
Source: https://arxiv.org/html/2608.05989

###### 摘要

从像素中高效采样学习策略一直是强化学习(RL)中的长期难题。近年来,基于动态的表示学习方法通过在潜在空间(自预测)或观测空间(观测预测)中执行辅助预测来学习动态感知表示,从而显著提升了无模型视觉 RL 的样本效率。然而,这两类方法中的最先进方法在训练数据有限时,仍难以应对具有挑战性的视觉控制任务。我们认为,单独依赖任何一种预测目标可能都不够充分。自预测鼓励潜在表示在多个未来时间步上具有时间可预测性,但并不明确要求潜在转移与观测层面的动态对齐。相比之下,观测预测将学习到的表示锚定在观测层面的动态中,但并未直接约束潜在表示在较长时域上的时间可预测性。本文提出了观测锚定自预测表示(OG-SPR),一种用于连续控制的无模型视觉 RL 算法,其学习到的表示既在潜在空间中具有时间可预测性,又锚定于观测层面的动态。构建于演员-评论家框架之上,OG-SPR 融入了两个核心辅助目标:多步潜在自预测和下一观测预测。此外,OG-SPR 还使用短期价值预测作为辅助任务,以进一步稳定价值学习。我们的实验表明,直接将潜在自预测施加到共享表示上可能会过度约束该表示,且不一定能提升性能。为解决这一问题,OG-SPR 引入了两个轻量级适配器用于潜在自预测,使共享表示能够受益于时间预测性信号,而不必被迫直接满足自预测目标。在 DeepMind Control Suite 的 28 个视觉控制任务上的实验表明,OG-SPR 在总体性能上优于最先进的自预测和观测预测 RL 方法,在诸如 dog 和 humanoid 等具有挑战性的领域中尤为突出。

## 引言

参见图注图 1:OG-SPR 在 DeepMind Control Suite 上 500k 环境步时相较于最先进基线的性能提升。对于每个任务,基线得分定义为最新的自预测方法 MR.Q(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3))和观测预测方法 AnonMethod(Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))中较强的结果。
从像素输入中学习策略是强化学习(RL)中的一个重要问题。尽管先前工作已经展示了通过无模型方法掌握视觉连续控制的潜力,例如 DrQ(Yarats 等人 2021(https://arxiv.org/html/2608.05989#bib.bib2))和 DrQ-v2(Yarats 等人 2022(https://arxiv.org/html/2608.05989#bib.bib1)),但样本效率仍然是一个主要挑战。近年来,基于动态的表示学习在数据高效的视觉 RL 方面取得了显著进展(Schwarzer 等人 2021(https://arxiv.org/html/2608.05989#bib.bib5),2023(https://arxiv.org/html/2608.05989#bib.bib6);Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3);Kim 等人 2025(https://arxiv.org/html/2608.05989#bib.bib7);Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))。这些方法为无模型 RL 算法学习动态感知表示,而不像基于模型的 RL 方法(Hansen 等人 2022(https://arxiv.org/html/2608.05989#bib.bib36),2024(https://arxiv.org/html/2608.05989#bib.bib11);Hafner 等人 2025(https://arxiv.org/html/2608.05989#bib.bib10))那样使用学习到的动态模型进行规划或价值估计。两个具有代表性的研究方向是自预测方法和观测预测方法。自预测方法(Zheng 等人 2023(https://arxiv.org/html/2608.05989#bib.bib32);Scannell 等人 2024(https://arxiv.org/html/2608.05989#bib.bib31);Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3))受自监督学习(Grill 等人 2020(https://arxiv.org/html/2608.05989#bib.bib8))的启发,通过在多个时间步上预测未来观测的潜在嵌入来学习表示。相比之下,观测预测方法(Gelada 等人 2019(https://arxiv.org/html/2608.05989#bib.bib9);Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))通过预测下一观测来训练表示。

这两类工作近期均已在多种任务上取得了匹配或超越最先进基于模型方法(如 DreamerV3(Hafner 等人 2025(https://arxiv.org/html/2608.05989#bib.bib10))和 TD-MPC2(Hansen 等人 2024(https://arxiv.org/html/2608.05989#bib.bib11)))的性能(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3))。这表明学习有意义的表示是数据高效视觉 RL 的关键推动力。尽管取得了这些进展,这些方法在不同任务上的成功仍然不均衡。两类方法中的近期强方法在有限数据预算(例如 500k 环境步)下仍难以应对具有挑战性的视觉控制领域(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3);Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))。我们认为,单独依赖潜在自预测或下一观测预测可能都不足以实现数据高效的视觉连续控制。自预测鼓励潜在表示在多个未来时间步上具有时间可预测性,但并不明确要求潜在转移与观测层面的动态对齐。相反,观测预测通过未来观测重构将学习到的表示锚定在观测层面的动态中,但并不直接在潜在空间中施加长时域的时间可预测性。因此,这两个目标施加了互补的归纳偏置,引出了以下问题:

*一个无模型视觉 RL 智能体能否通过学习既在潜在空间中具有时间可预测性、又锚定于观测层面动态的表示,在连续控制中变得更加数据高效?*

在本文中,我们通过探索如何利用潜在自预测和观测预测的互补优势,为这一问题提供了肯定答案。具体而言,我们提出了观测锚定自预测表示(OG-SPR),一种学习同时满足这两个目标的表示的无模型 RL 算法。OG-SPR 构建于离策略演员-评论家框架(Sutton 等人 1998(https://arxiv.org/html/2608.05989#bib.bib12))之上,通过两个面向动态的辅助任务学习状态-动作表示:多步潜在自预测和下一观测预测。除了这些面向动态的目标,OG-SPR 还将短期价值预测作为辅助目标,以稳定价值学习(Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))。然而,如我们的消融研究所示,简单地将这些辅助目标组合起来并不能有效提升性能。我们假设,将潜在自预测目标直接施加到共享表示上可能会过度约束该表示。为缓解这一问题,OG-SPR 为潜在自预测引入了两个轻量级适配器,一个放置在观测编码器之后,另一个放置在状态-动作编码器之后。这些适配器构成了一个适配器介导的自预测分支,使得共享表示能够接收时间预测性学习信号,而不必被迫直接满足自预测目标。

我们在 DeepMind Control Suite(DMControl)(Tassa 等人 2018(https://arxiv.org/html/2608.05989#bib.bib13))的 28 个视觉控制任务上,以有限数据预算评估了 OG-SPR。实验结果表明,OG-SPR 在平均性能上优于最先进的自预测和观测预测 RL 方法(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3);Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46)),在诸如 dog 和 humanoid 等具有挑战性的领域中尤为突出,如图 1(https://arxiv.org/html/2608.05989#Sx1.F1)所示。OG-SPR 通过整合自预测和观测预测方法,为复杂视觉连续控制任务的数据高效 RL 迈出了初步一步。我们希望这项工作能够激发对二者交叉领域的进一步研究,以提升无模型视觉 RL 的数据效率。

## 相关工作

### 面向数据高效 RL 的表示学习

表示学习被广泛用于提高 RL 的样本效率。已有工作探索了多种面向 RL 的表示学习方法(Echchahed 和 Castro 2025(https://arxiv.org/html/2608.05989#bib.bib38))。基于度量的方法(Liao 等人 2023(https://arxiv.org/html/2608.05989#bib.bib20);Zhang 等人 2025(https://arxiv.org/html/2608.05989#bib.bib21))通过对状态表示之间施加任务相关的相似性来塑造嵌入空间。数据增强方法(Yarats 等人 2022(https://arxiv.org/html/2608.05989#bib.bib1);Ma 等人 2024(https://arxiv.org/html/2608.05989#bib.bib16))鼓励学习到的表示对无关视觉变化保持不变。对比学习方法(Eysenbach 等人 2022(https://arxiv.org/html/2608.05989#bib.bib18);Liu 等人 2025(https://arxiv.org/html/2608.05989#bib.bib19))通过对比正样本对与负样本对来学习表示。我们的工作聚焦于基于动态的表示学习,即通过动态预测为无模型 RL 学习动态感知表示(Gelada 等人 2019(https://arxiv.org/html/2608.05989#bib.bib9);Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3))。

### 基于动态的表示学习

近年来,基于动态的方法已在多种任务上取得了与基于模型方法(如 DreamerV3(Hafner 等人 2025(https://arxiv.org/html/2608.05989#bib.bib10))和 TD-MPC2(Hansen 等人 2024(https://arxiv.org/html/2608.05989#bib.bib11)))相当或更优的性能,且算法和计算复杂度更低(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3);Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))。这一研究方向大致可分为自预测方法和观测预测方法。自预测方法通过预测未来观测的潜在嵌入来学习表示。TD7(Fujimoto 等人 2023(https://arxiv.org/html/2608.05989#bib.bib22))在潜在动态空间中为低维连续控制任务学习状态-动作表示。在 TD7 的基础上,MR.Q(Fujimoto 等人 2025(https://arxiv.org/html/2608.05989#bib.bib3))是一种最先进的自预测方法,它在潜在自预测基础上增加了额外的预测目标,如奖励和终止预测。观测预测方法也通过动态建模训练表示,但将预测目标锚定在观测空间中。OFENet(Ota 等人 2020(https://arxiv.org/html/2608.05989#bib.bib23))是低维设置下具有代表性的观测预测方法。AnonMethod(Anonymous 2026(https://arxiv.org/html/2608.05989#bib.bib46))是近期的观测预测方法。它解决了低维设置下观测预测表示学习的一个瓶颈,即重构损失往往被取值范围较大的观测维度所主导。为缓解这一问题,AnonMethod 在归一化的观测空间中同时进行表示学习和 RL,使观测预测学习能够适用于多种领域。然而,现有的基于动态的方法通常只关注潜在空间或观测空间中的预测,这两个方向在很大程度上是作为独立的研究脉络发展的。在潜在空间和观测空间中同时训练表示用于无模型 RL 的潜力尚未得到充分探索。OG-SPR 为弥合这一空白迈出了初步一步。

### 基于模型的强化学习

基于模型的方法,例如 Dreamer 系列(Hafner 等人 2020(https://arxiv.org/html/2608.05989#bib.bib24),2021(https://arxiv.org/html/2608.05989#bib.bib25),2025(https://arxiv.org/html/2608.05989#bib.bib10)),也学习带有观测预测的潜在动态。我们的工作与这些方法在学习目标和学习到的动态的使用方式上均有所不同。在学习目标方面,OG-SPR 仅与这些方法在观测预测上重叠,其余目标则是不同的。在使用方式方面,OG-SPR 不为 RL 训练维护学习到的动态模型。相反,它通过潜在空间和观测空间中的动态建模来学习表示,以用于无模型 RL。

## 预备知识

### 强化学习

强化学习(RL)解决序列决策问题,通常形式化为马尔可夫决策过程(MDP)。一个 MDP 可以用元组 \(S,A,P,r,\gamma\) 表示,其中 \(S\) 和 \(A\) 分别表示状态空间和动作空间;\(P(s_{t+1}|s_t,a_t)\) 表示在给定当前状态 \(s_t\) 和动作 \(a_t\) 时下一状态 \(s_{t+1}\) 的转移概率;\(r:S\times A\rightarrow\mathbb{R}\) 是奖励函数;\(\gamma\in[0,1)\) 是折扣因子。RL 的目标是学习一个策略 \(\pi:S\rightarrow A\),以最大化折扣累积奖励 \(\sum_{t=0}^{\infty}\gamma^t r_t\)。演员-评论家方法(Sutton 等人 1998(https://arxiv.org/html/2608.05989#bib.bib12))通常学习动作价值函数 \(Q^{\pi}(s,a)=\mathbb{E}_{\pi}[\sum_{t=0}^{\infty}\gamma^t r_t|s_0=s,a_0=a]\),该函数从初始状态 \(s\) 和动作 \(a\) 出发,对期望回报进行建模。

在低维设置中,智能体在时间步 \(t\) 接收到的观测 \(o_t\) 通常被视为状态 \(s_t\)(即 \(s_t:=o_t\))。在复杂设置(例如视觉 RL)中,\(o_t\) 不一定满足马尔可夫性质,因此可能不能直接被视为 \(s_t\)。这引入了部分可观测 MDP(POMDP)。遵循常见做法(Mnih 等人 2013(https://arxiv.org/html/2608.05989#bib.bib37);Yarats 等人 2022(https://arxiv.org/html/2608.05989#bib.bib1)),我们通过将连续三个先前观测堆叠为状态 \(s_t:=[o_{t-2},o_{t-1},o_t]\) 来近似马尔可夫状态。

## 方法

如图 2(https://arxiv.org/html/2608.05989#Sx4.F2)所示,OG-SPR 构建于带有价值网络和策略网络的演员-评论家框架之上。

参见图注

\(a\) 带有两个长期价值预测头和三个辅助预测头的价值网络。参见图注 \(b\) 带有输入解耦的策略网络。

图 2:OG-SPR 完整方法示意图。图像状态 \(s\) 首先经过在线编码器 \(f\),随后进入适配器 1 \(u_1\),接着...

相似文章

SPOTting the Future:深度强化学习的前瞻性解释

arXiv cs.AI

介绍了SPOT(采样策略观察树),一种模型无关的框架,通过构建有限时域前瞻树来揭示动作的下游后果,从而解释深度强化学习策略,并在SUMO-RL交通信号控制领域进行了演示。