离线质量-多样性强化学习下的层次技能策略学习

arXiv cs.AI 论文

摘要

介绍了QDOS,这是一个用于离线到在线强化学习的统一流水线,采用优势加权质量-多样性预训练来提取多样且高价值的技能,显著提升了操作和移动任务的性能。

arXiv:2608.19684v1 公告类型:新 摘要:最近的研究探讨了如何利用预收集的数据集来提高强化学习的策略性能和样本效率。一种有前景的方法是采用两阶段策略:第一阶段,从给定数据集中提取多样技能作为低级策略,第二阶段训练高级策略来解决特定任务。通常,低级策略的提取基于无监督学习,如轨迹VAE。然而,这种方法的一个局限是低级策略的质量高度依赖于数据集的质量。为了解决这个问题,我们引入了QDOS(质量-多样性离线技能学习),这是一个用于鲁棒离线到在线学习的统一流水线。我们的方法结合了优势加权质量-多样性预训练目标,该目标根据每个轨迹段的估计优势对技能提取和多样性目标进行加权。这种方法允许模型提取多样且高价值的技能。通过提供鲁棒且任务相关的技能表示,QDOS显著提升了低级策略所使用的嵌入技能空间的质量。我们进一步将其与双重数据集重用策略相结合,其中离线数据既用于技能预训练,也通过伪标签化用于填充在线重放缓冲区。实验表明,QDOS在结构化操作任务和非结构化移动任务中显著优于强基线,证实了其在挑战性稀疏奖励领域加速探索和提高最终回报的能力。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:00

# 基于离线质量多样性强化学习的层次化技能策略学习

来源:https://arxiv.org/html/2608.19684

作者:Takayuki Osa  
所属机构:日本东京RIKEN高级智能项目中心

作者:Tatsuya Harada  
所属机构:日本东京大学  
所属机构:日本东京RIKEN高级智能项目中心

###### 摘要

近期研究探索如何利用预先收集的数据集提升强化学习的策略性能与样本效率。一种有前景的方法是采用两阶段策略:第一阶段从给定数据集中提取多样化的技能作为低层策略,第二阶段针对特定任务训练高层策略。通常,低层策略的提取基于轨迹变分自编码器等无监督学习方法。然而,此方法的局限性在于低层策略的质量高度依赖于数据集的质量。为解决此问题,我们引入了QDOS(质量多样性离线技能学习),这是一个鲁棒的离线到在线学习统一流程。我们的方法结合了优势加权质量多样性预训练目标,该目标通过估计每个轨迹片段的优势函数来对技能提取和多样性目标进行加权。此方法使模型能够提取多样化且高价值的技能。通过提供鲁棒且任务相关的技能表征,QDOS显著提升了低层策略所使用的嵌入技能空间质量。我们进一步将其与双重数据集重用策略相结合,其中离线数据既用于技能预训练,也通过伪标签技术用于填充在线回放缓冲区。实验表明,在结构化操作任务和非结构化运动任务中,QDOS显著优于强基线方法,验证了其在具有挑战性的稀疏奖励环境中加速探索和提升最终回报的能力。

## 一、引言

深度强化学习(RL)在解决复杂控制任务方面取得了显著成功,涵盖从玩电子游戏到机械臂操作等多个领域\[1 (https://arxiv.org/html/2608.19684#bib.bib1), 2 (https://arxiv.org/html/2608.19684#bib.bib2)\]。尽管取得了这些成就,标准在线RL范式需要与环境进行大量交互才能学习有效策略。这种样本低效性使得在数据收集成本高昂且可能危险的机器人等真实世界应用中,RL往往代价过高且不安全。

为应对这些局限性,离线强化学习作为一种有前景的替代方案出现,使智能体能够完全从静态、预先收集的数据集中学习策略,无需在线交互\[3 (https://arxiv.org/html/2608.19684#bib.bib3)\]。与此同时,无监督技能发现方法旨在从大规模无标签数据集中提取可复用行为或“技能”。近期方法如OPAL\[4 (https://arxiv.org/html/2608.19684#bib.bib4)\]和SPiRL\[5 (https://arxiv.org/html/2608.19684#bib.bib5)\]将原始技能编码到潜在空间中,并训练利用这些低层策略解决复杂任务的高层策略。这种时间抽象降低了任务的有效时间范围,简化了长期问题的学习。

近期工作开始在“离线到在线”场景下连接这两个领域,即智能体先在离线数据上预训练,然后通过与环境在线交互进行微调。SUPE\[6 (https://arxiv.org/html/2608.19684#bib.bib6)\]等方法表明,将离线数据同时用于技能提取和作为高层策略的回放缓冲区,可以显著加速探索,从而在在线RL后获得更高的性能。

参见图示图1:QDOS框架概述。\(1\)离线预训练:智能体从包含成功动作、失败尝试和噪声的混合质量数据集中学习低层技能\(\pi_\theta\)。我们采用优势加权质量多样性目标来过滤次优数据(失败尝试和噪声),同时提取多样化且高质量的技能。\(2\)采用双重数据集重用的在线RL:相同的离线数据通过伪标签技术被重复用于填充高层回放缓冲区,使高层策略能够利用先验知识进行高效在线探索。

然而,一个关键挑战依然存在:当离线数据包含最优与次优动作的混合时,如何识别并提取有用的行为?真实世界的数据集通常包含与噪声、失败尝试和无关行为混杂的最优轨迹。以往方法中使用的标准轨迹变分自编码器对所有数据片段一视同仁,旨在最小化整个数据集的重建误差。当离线数据存在噪声时,这些方法学习到的技能空间会变得“混杂”,有用技能与无用技能纠缠在一起,导致高层策略难以选择有效动作。

这导致了当前方法中的权衡问题。纯多样性驱动的方法(例如,最大化互信息)鼓励不同的行为,但无法区分**不同的有用行为**和**不同的无用行为**。相反,纯奖励驱动或行为克隆方法往往坍缩到单一模式,无法捕捉到鲁棒下游探索所需的解决方案多样性。因此,目前缺乏一个能够过滤噪声,同时保留适用于加速在线学习的高质量技能多样化集的统一框架。

在这项工作中,我们提出了QDOS(质量多样性离线技能学习),一个用于鲁棒离线到在线学习的统一框架,如图1 (https://arxiv.org/html/2608.19684#S1.F1)所示。我们的方法通过引入基于离线强化学习无监督多解发现的技能学习来解决混合质量困境。技能学习的目标函数同时包含期望回报和技能多样性项,从而产生多样化且高质量的行为。这种方法使得学习由有用原始技能组成的技能空间成为可能。我们将其整合到一个离线到在线框架中,该框架两次重用离线数据:首先用于技能提取,其次通过“伪标签”技术填充在线回放缓冲区,其中离线轨迹被标注上推断出的技能和乐观奖励估计,遵循SUPE\[6 (https://arxiv.org/html/2608.19684#bib.bib6)\]的做法。这使高层策略从一开始就能对大量的离线数据集进行异策略学习。

我们在多样化且复杂的领域中广泛评估了我们的方法,包括蚂蚁足球(antsoccer)、厨房(kitchen)和人形迷宫(humanoidmaze)。我们的实验表明,在样本效率、渐近性能和目标寻找速度方面,我们的方法显著优于最先进基线(如SUPE\[6 (https://arxiv.org/html/2608.19684#bib.bib6)\]),尤其是在需要组合多样化、动态行为的任务中。

## 二、相关工作

### 二-A、无监督技能发现

无监督技能发现旨在学习可复用的行为而无需外部奖励,通常通过最大化内在目标来实现。早期的在线方法侧重于最大化潜在编码与状态之间的互信息\[7 (https://arxiv.org/html/2608.19684#bib.bib7), 8 (https://arxiv.org/html/2608.19684#bib.bib8)\]或正则化选项策略\[9 (https://arxiv.org/html/2608.19684#bib.bib9)\]。这些方法鼓励智能体访问多样化的状态并学习可区分的行为。

在离线设置中,OPAL\[4 (https://arxiv.org/html/2608.19684#bib.bib4)\]和SPiRL\[5 (https://arxiv.org/html/2608.19684#bib.bib5)\]等方法通过使用轨迹变分自编码器从固定演示数据集中学习技能来适应这些思想。它们将短轨迹段压缩到潜在变量\(z\)中,允许高层策略在此潜在空间中操作。然而,这些方法通常在预训练阶段后丢弃离线数据。此外,它们没有考虑数据质量;它们试图重建所有轨迹,包括次优轨迹,当数据集存在噪声时,这会降低学习到的技能空间质量。

### 二-B、离线强化学习

离线RL专注于从静态数据集中学习最优策略。主要挑战是分布偏移,即学习到的策略访问数据集支持范围之外的状态,导致价值高估。CQL\[10 (https://arxiv.org/html/2608.19684#bib.bib10)\]和IQL\[11 (https://arxiv.org/html/2608.19684#bib.bib11)\]等算法通过约束策略或价值函数来解决此问题。虽然这些方法在从固定数据学习方面很有效,但它们可能过于保守,当允许智能体与环境进行在线交互时,这会阻碍探索。

### 二-C、离线到在线强化学习

离线到在线RL利用离线数据来加速在线学习。一种常见策略是用离线预训练的策略初始化RL智能体,然后在线微调它\[12 (https://arxiv.org/html/2608.19684#bib.bib12), 13 (https://arxiv.org/html/2608.19684#bib.bib13)\]。近期工作如SUPE\[6 (https://arxiv.org/html/2608.19684#bib.bib6)\]提出了一种更集成的方法,将离线数据重复用于技能学习和在线回放。通过对离线轨迹进行伪标签,标注推断出的技能和奖励,SUPE使高层策略能够从丰富的离线数据集中学习。然而,SUPE在技能学习过程中对所有离线数据一视同仁,继承了标准变分自编码器处理混合质量数据时的脆弱性。我们的方法通过在技能发现过程中应用优势加权来改进这一点,以确保只捕获有益且多样化的行为并进行重用。

### 二-D、质量多样性RL

质量多样性(QD)优化是一种旨在生成大量多样化且高性能解决方案的范式,与寻求单一全局最优解的纯优化形成对比。这一概念由生成和发展系统社区引入\[14 (https://arxiv.org/html/2608.19684#bib.bib14), 15 (https://arxiv.org/html/2608.19684#bib.bib15)\],相关算法包括基于局部竞争的多样性搜索(Novelty Search with Local Competition)和MAP-Elites。QD算法在行为或特征空间而非基因型空间中操作,试图用高性能的解决方案填充行为空间,即使它们不是适应度景观中的全局峰值。在机器人领域,QD已被用于创建行为库\[16 (https://arxiv.org/html/2608.19684#bib.bib16)\]和损伤适应。它也被应用于工程设计\[17 (https://arxiv.org/html/2608.19684#bib.bib17)\]和视频游戏关卡生成\[18 (https://arxiv.org/html/2608.19684#bib.bib18)\]。

近期,这些思想已被应用于强化学习。DiveOff\[19 (https://arxiv.org/html/2608.19684#bib.bib19)\]引入了一种QD视角到离线RL,旨在从单一任务中发现多个解决方案。DiveOff采用一种变分目标,该目标最大化潜在技能与轨迹之间的互信息以确保多样性,同时正则化潜在空间以保持高质量。具体来说,它使用坐标上升方法来防止模式坍塌并确保学习到的技能覆盖有用行为的流形。我们的工作在此基础上,通过将优势加权显式地整合到QD目标中,确保多样性专门在高价值轨迹中寻找。

### 二-E、当前方法在混合质量数据上的局限性

尽管数据重用很有前景,但现有方法如SUPE和OPAL依赖于离线数据集由连贯、可分段的行为组成的假设。在现实场景中,数据集通常是非结构化的,包含最优轨迹、探索性噪声和失败尝试的混合。标准轨迹变分自编码器最小化整个数据集的重建误差,迫使模型将表征能力分配给噪声。这导致了“混杂的”技能空间,其中不同的潜在编码映射到难以区分或无用的行为。我们的工作通过引入优势加权目标来解决这一关键差距,该目标提取高质量片段并学习与高优势行为对应的潜在技能空间。

## 三、预备知识

### 三-A、问题表述

我们考虑一个由元组\(\mathcal{M}=\{\mathcal{S}, \mathcal{A}, \mathcal{P}, \gamma, r, \rho\}\)定义的马尔可夫决策过程(MDP),其中\(\mathcal{S}\)是状态空间,\(\mathcal{A}\)是动作空间,\(\mathcal{P}\)是转移动力学,\(\gamma\)是折扣因子,\(r\)是奖励函数,\(\rho\)是初始状态分布。

我们假设可以访问一个静态的离线数据集\(\mathcal{D}=\{\tau_i\}_{i=1}^N\),其中每个轨迹\(\tau_i\)由一个状态-动作-奖励元组序列组成:\(\tau_i=(s_0,a_0,r_0,\dots,s_T,a_T,r_T)\)。关键在于,虽然奖励存在,但数据集在技能定义方面是**无标签的**。没有分段或标签\(z\)来指示当前激活的原始行为。数据集中混合了好与坏的动作;智能体必须推断哪些行为值得学习和重用。

目标有两个:

1.  **技能发现:** 学习一个低层潜在条件策略\(\pi_\theta(a \mid s,z)\)和先验\(p(z)\),以捕获多样化、有用的功能行为,同时过滤噪声和次优数据。
2.  **层次化适应:** 学习一个高层策略\(\pi_\psi(z \mid s)\),该策略在交互过程中选择这些技能以最大化期望回报\(\eta(\pi)=\mathbb{E}[\sum \gamma^t r_t]\)。

### 三-B、当前方法的局限性

SUPE(用于探索的无标签先验数据技能)\[20 (https://arxiv.org/html/2608.19684#bib.bib20)\]使用标准变分自编码器从离线数据集嵌入技能,并重用该数据填充在线高层回放缓冲区。虽然SUPE连接了离线技能学习和在线RL,但它隐含地假设提取的技能是有意义的。标准轨迹变分自编码器将所有片段视为有效信号。在有噪声的数据集中,变分自编码器会重建噪声,导致一个“混杂的”技能库,其中不同的潜在编码映射到难以区分或无用的行为。这导致伪标签不可靠,使高层策略接收到不一致的信号并无法学习到鲁棒策略。这种混合质量问题如图2 (https://arxiv.org/html/2608.19684#S3.F2)所示。

参见图示图2:混合质量困境:标准变分自编码器同等编码所有行为,将噪声与有用技能纠缠在一起。

## 四、方法

在本节中,我们详细描述提出的QDOS框架,该框架包含两个主要阶段:(1) 优势加权质量多样性技能预训练,以及(2) 基于轨迹技能的在线探索。总体流程总结在算法1 (https://arxiv.org/html/2608.19684#alg1)中。

### 四-A、优势加权质量多样性预训练

我们的技能学习框架受到DiveOff\[19 (https://arxiv.org/html/2608.19684#bib.bib19)\]的启发,该工作将质量多样性方法引入离线RL。虽然DiveOff的主要目标是在单个任务中发现多个多样化的解决方案,但我们的工作通过显式地将优势加权整合到质量多样性目标中进行了改进,确保多样性专门在高价值轨迹中寻找,从而使得学习到的技能空间既多样又高质量。

相似文章

Reversal Q-Learning

arXiv cs.LG

本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。