V-Simba:释放RL在视觉连续控制中的架构潜力
摘要
本文介绍了V-Simba,一种视觉RL架构,通过添加归一化层和逐点卷积来提高样本效率和稳定性。它在DMC、Adroit和Meta-World基准测试中达到或超越了最先进的方法,同时比DrQ-v2更具计算效率。
arXiv:2608.07870v1 公告类型:新
摘要:提高样本效率仍然是强化学习(RL)中的核心挑战,尤其是在机器人技术等现实场景中,因为数据收集成本高昂。这一挑战在视觉RL中尤为突出,因为高维输入常常掩盖学习信号。虽然先前视觉RL的研究侧重于算法解决方案,例如更好的动力学模型或探索策略,但近期基于状态的RL进展表明,仅凭架构设计就能显著提升样本效率。这引出了一个重要问题:这些架构原则能否迁移到视觉RL?为此,我们引入了V-Simba,一种受基于状态的RL中Simba架构启发的简单而有效的视觉RL架构。V-Simba基于带有数据增强的Soft Actor-Critic(SAC)构建,通过添加归一化层来稳定训练,并使用逐点卷积来减少计算量。尽管其简单性,V-Simba在DMC、Adroit和Meta-World基准测试中达到或超越了最先进的方法,同时比DrQ-v2更具计算效率。我们的代码已公开在 https://github.com/DAVIAN-Robotics/V-Simba。
查看缓存全文
缓存时间: 2026/08/11 08:07
# 释放 RL 在视觉连续控制中的架构潜力
来源:https://arxiv.org/html/2608.07870
V-Simba:释放 RL 在视觉连续控制中的架构潜力
Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron,
Byungkun Lee, Aaron Courville, Pablo Samuel Castro,
Jaegul Choo, Clare Lyle
关键词:深度强化学习,视觉强化学习,神经网络设计,可塑性,归一化
## 摘要
提升样本效率仍然是强化学习(RL)中的核心挑战,尤其是在机器人等真实世界场景中,数据收集成本高昂。这一挑战在视觉强化学习中尤为突出,因为高维输入常常掩盖学习信号。虽然先前在视觉强化学习中的工作主要聚焦于算法层面的解决方案,例如更好的动力学模型或探索策略,但近期基于状态的强化学习进展表明,仅靠架构设计就能在样本效率上带来显著提升。这引出了一个重要问题:这些架构原则能否迁移到视觉强化学习中?为此,我们提出了 V-Simba,一种受基于状态的强化学习中的 Simba 架构启发而设计的简单而有效的视觉强化学习架构。V-Simba 构建在带有数据增强的 Soft Actor-Critic(SAC)之上,通过添加归一化层来稳定训练,并使用逐点卷积来降低计算量。尽管其设计简单,V-Simba 在 DMC、Adroit 和 Meta-World 基准测试中均达到或超越了现有最先进方法,同时计算效率高于 DrQ-v2。我们的代码已在 https://github.com/DAVIAN-Robotics/V-Simba 公开。
参见标题
图 1:基准测试总结。我们使用一组超参数,在跨多个领域的 29 个视觉连续控制任务上评估了 V-Simba 的有效性。通过将 V-Simba 整合到带有数据增强的 Soft Actor-Critic 中,它达到或超越了最先进的视觉强化学习方法,展现出更优的样本与计算效率。
## 1 引言
深度强化学习(RL)长期以来一直是解决连续控制任务的重要方法。然而,强化学习通常依赖在环境中进行大量的试错,这在时间、计算和现实世界约束方面往往代价高昂。这一问题在视觉强化学习中尤为严重,因为智能体必须从高维、嘈杂且通常部分可观测的图像输入中学习。因此,提升样本效率(即从有限的交互数据中有效学习)已成为视觉强化学习的核心研究课题。
为了提高样本效率,近期工作主要集中在算法创新上,包括增强表示学习、潜在动力学建模、世界模型以及改进的探索策略。然而,尽管取得了这些进展,底层神经架构仍然相对简单。一个突出的例子是 DrQ-v2,它将 DDPG 算法与数据增强相结合。其架构由一个浅层卷积编码器组成,随后是一个大型全连接层和中间的一个层归一化层。由于其简单性和强大的实证表现,DrQ-v2 已成为视觉强化学习中的事实标准,许多最先进的方法在采用 DrQ-v2 架构时仅做了极小的修改。
参见标题
图 2:DrQ-v2 与 V-Simba 的对比。在 Dog Stand 环境中对 DrQ-v2 架构和我们的 V-Simba 进行比较。两者均在 Soft Actor-Critic(SAC)上评估,结果取 5 个种子的平均值。(a) V-Simba 在样本和计算效率方面均显著优于 DrQ-v2。(b) 与 DrQ-v2 不同,V-Simba 具有稳定的学习动态,表现为平滑的损失景观、较低的休眠比例、较高的特征多样性,以及受控良好的特征、参数和梯度范数。每个指标的详细说明见附录 7.2(https://arxiv.org/html/2608.07870#S7.SS2)。
然而,我们的分析揭示,这种普遍采用的架构存在严重的训练不稳定性。如图 2(b) 的顶行所示,DrQ-v2 表现出尖锐的损失景观(这与较差的泛化能力相关)、高比例的休眠单元(表明可塑性丧失),以及低特征多样性(表明特征坍缩)¹¹ 我们使用这些指标作为诊断探针,以揭示我们架构旨在解决的失败模式,而非作为最终回报的直接预测器;我们将在附录 7(https://arxiv.org/html/2608.07870#S7)中讨论其适用范围和局限性。(woo2023convnextv2)。
相比之下,基于状态的强化学习的最新进展表明,精心设计的架构可以有效缓解这些不稳定性。值得注意的是,Simba 系列架构引入了有原则的架构设计指南,通过针对性的归一化和正则化来约束特征、权重和梯度的增长,从而稳定训练。
尽管在基于状态的任务中表现出色,Simba 架构缺乏适合视觉数据的归纳偏置。强化学习中的卷积架构面临独特的挑战,例如由跨空间层次的参数增长失控所导致的严重可塑性丧失和容量退化。此外,将大量归一化直接应用于高分辨率卷积特征图会带来难以承受的计算瓶颈。
为此,我们提出了 V-Simba,一种专门为克服这些视觉强化学习挑战而设计的架构。V-Simba 构建在 Soft Actor-Critic(SAC)之上,融入了三个核心架构组件:(1) 层归一化(LN)以控制特征范数,(2) l2 权重正则化以限制参数增长,以及 (3) 带有奖励归一化的分布式 critic 以稳定梯度。关键在于,为了使这些稳定机制在高维图像输入下计算上可行,V-Simba 采用了激进的早期空间降维,同时大量使用轻量级逐点卷积和最大池化操作。
我们使用一组跨所有任务的统一超参数,在三个标准基准测试上评估了 V-Simba:DMControl、Adroit 和 Meta-World。尽管设计简单,V-Simba 显著优于 DrQ-v2,同时减少了模型大小(7.2M → 5.0M)和训练时间(1M DMControl 步骤从 5.4 小时降至 4.8 小时)。最值得注意的是,V-Simba 在所有基准测试中均优于高度复杂的算法方法,如 DrM,以及 MR.Q、TD-MPC2 和 TACO。
V-Simba 旨在为推进视觉连续控制提供一个强大、稳定且高效的架构基础。我们希望我们的工作能够凸显有原则的架构设计在视觉强化学习社区中尚未被充分发掘的潜力。
## 2 相关工作
仅从高维视觉观测中学习对强化学习提出了重大挑战。由于观测空间的部分可观测性(第 3.1 节),与基于状态的同类方法相比,视觉强化学习智能体普遍存在样本效率低下和泛化差距较大的问题。
视觉强化学习的算法方法主要集中在:(1) 通过辅助任务预测未来潜在状态进行表示学习,这既可用于无模型方法中的辅助损失,也可用于基于模型的方法中的独立动力学模型;(2) 数据增强,尤其是随机平移,以提高效率和泛化能力;(3) 探索方法,包括规划、好奇心驱动和信息最大化。这些算法创新推动了视觉强化学习的快速发展,带来了样本效率的持续提升。
与算法创新相比,视觉强化学习的架构设计受到的关注相对较少。该领域长期以来主要使用与十多年前 DQN 建立的相似的浅层卷积神经网络(CNN)架构。虽然一些工作融入了来自计算机视觉的架构元素——例如 Impala、BBF 和 EfficientZero 中的 ResNet 类架构,或 DTQN 中的 Transformer——但这些修改往往与复杂的算法方法一同引入。这种纠缠掩盖了架构设计对性能提升的真正贡献。最近的研究指出了归一化技术的益处,但这些研究通常应用于常规 CNN 编码器,且架构修改极少。
确实重新审视视觉编码器的研究,例如全局平均池化、Hadamard 最大池化编码器或专家混合,大多面向离散动作、Atari 风格领域。这反映了强化学习中架构和表示设计更广泛的复兴,包括高容量分类值函数、用于扩展连续控制的动态网络扩展、约束初始表示以稳定时序差分学习,以及在稳定性-可塑性权衡之间取得平衡的重新初始化方案。然而,在视觉连续控制中,架构创新仍然稀缺。
## 3 预备知识
### 3.1 视觉强化学习
强化学习(RL)通常被形式化为马尔可夫决策过程(MDP),由元组 (S, A, P, R, γ) 定义,其中 S 表示状态空间,A 表示动作空间,P: S × A → P(S) 表示转移函数,R: S × A → R 表示奖励函数,γ ∈ [0,1) 表示折扣因子。从初始状态 s₀ ∈ S 出发,目标是找到一个最优策略 π*: S → P(A),使得期望折扣回报 E_π[∑_{t=0}^∞ γ^t R(s_t, a_t)] 最大化。视觉强化学习是该问题的一个子类,其中智能体无法访问真实状态 s ∈ S,而是接收系统的高维像素观测 o ∈ O。由于这些观测可能无法完全捕获真实状态,该问题被建模为部分可观测马尔可夫决策过程(POMDP),由元组 (S, O, A, P, R, γ) 表示,其中 O 表示观测空间。
### 3.2 数据正则化 Q 学习
数据正则化 Q 学习(DrQ-v2)是一种无模型强化学习算法,因其简单性、高效性和有竞争力的性能,已成为视觉强化学习中的强基线。它建立在深度确定性策略梯度(DDPG)算法之上,并引入了两个关键修改:(1) 通过随机平移变换广泛使用数据增强,(2) 通过指数移动平均(EMA)更新来稳定目标 Q 函数。
其核心在于,DrQ-v2 通过以下方式提升离策略学习的样本效率:相似文章
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
碰撞前的预见:基于冻结视觉语言模型的预测性安全强化学习
本文提出VLM-Safe-RL框架,该框架将冻结的视觉语言模型集成到约束MDP的拉格朗日更新中,为高速视觉控制任务的安全强化学习提供预测性成本信号。该方法在Safety-Gymnasium FormulaOne L2上优于标准约束感知基线,并能泛化到未见过的环境。
早期判决,更优预算:面向计算高效RLVR的顺序自适应rollout分配
本文提出SARA,一种面向RLVR的顺序自适应rollout分配方法,该方法提前放弃饱和组并重新分配预算,相比动态采样,在rollout数量减少22%的情况下达到相当精度,若与之结合则可节省高达67%。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
基于观测的自预测强化学习用于视觉连续控制
本文提出了 OG-SPR,一种无模型视觉强化学习算法,它将潜在自预测与观测预测相结合,学习具有动力学感知的表示,从而在 DeepMind Control Suite 任务上提高了样本效率。