离线到在线强化学习的自适应 Q 分块
摘要
本文介绍了自适应 Q 分块(AQC),这是一种强化学习方法,能够动态选择动作分块大小,以平衡反应式控制与长期规划。该方法在 OGBench 和 Robomimic 上取得了最先进的结果,提升了大规模 VLA 模型在机器人任务中的性能。
arXiv:2605.05544v1 公告类型:新发布
摘要:带有动作分块的离线到在线强化学习消除了多步异策略偏差并实现了时间相干的探索,但所有现有方法都在每个状态下使用固定的分块大小。这种方法是次优的:在接近接触事件时,智能体需要短分块来进行反应式控制,而在自由空间运动中,长分块能提供更好的信用分配。自然的解决方案是为几种分块大小训练 critic,并在每个状态下选择最佳的一个,但简单地比较学习到的 critic 值会因折扣尺度不匹配而系统地坍缩为最短分块,并在低价值状态下退化为噪声。我们提出了自适应 Q 分块(AQC),通过比较每种分块大小相对于每步长基线的优势(并经折扣因子归一化)来解决这两种失败。当不存在真实信号时,该标准将带有偏差的错误答案转化为无偏的近随机选择,而当特定尺度能实现更好的规划时,它则变得具有区分度。我们在理论上证明了优势选择器对噪声的免疫性以及自适应分块相比任何固定分块大小的价值优势。我们展示了 AQC 在 OGBench 和 Robomimic 上实现了最先进的离线和在线成功率,并且可以应用于增强预测动作序列的大规模 VLA 模型的性能,显著提升了在 RoboCasa-GR1 任务上的表现。
查看缓存全文
缓存时间: 2026/05/08 07:58
# 用于离线到在线强化学习的自适应 Q-Chunking
来源: https://arxiv.org/html/2605.05544
Nandiraju Gireesh$^{1,2}$, Yuanliang Ju$^{3}$, He Wang$^{1,2,\dagger}$
$^1$北京大学 $^2$Galbot $^3$多伦多大学
###### 摘要
带有动作分块(Action Chunking)的离线到在线强化学习消除了多步离策略偏差,并实现了时间相干性的探索,但所有现有方法都在每个状态下使用固定的分块大小。这是次优的:在接近接触事件时,智能体需要短分块进行反应式控制,而在自由空间运动中,长分块能提供更好的信用分配。自然的解决方案是为几种分块大小训练评论家(critics),并在每个状态下选择最佳的一个,但由于折扣尺度不匹配,对 learned critic 值的朴素比较会系统地崩溃到最短分块,并且在低价值状态下退化为噪声。我们提出**自适应 Q-Chunking (AQC)**,通过比较每个分块大小相对于每地平线基线的优势,并以折扣因子归一化,从而解决这两种失效情况。当不存在真实信号时,该准则将偏置的错误答案转换为无偏的近随机选择;当特定尺度能实现更好的规划时,它变得具有区分性。我们从理论上证明了优势选择器对噪声的免疫性,以及自适应分块相对于任何固定分块大小的价值优势。我们证明了 AQC 在 OGBench 和 Robomimic 上达到了最先进的离线和在线成功率,并且可以应用于增强预测动作序列的大规模 VLA 模型的性能,显著提升了在 RoboCasa-GR1 任务上的表现。
## 1 引言
强化学习(RL)承诺仅从奖励中学习任何任务,但对于复杂行为来说,从头开始是不切实际的 \[levine2020offline\]。离线 RL 通过从预收集的数据中学习固定策略来解决这一问题,但必须应对分布偏移和价值高估 \[kumar2020conservative,fujimoto2018addressing,ross2011reduction\]。一种实用的方法是离线到在线 RL:首先从演示的固定数据集中学习,然后通过在线交互继续改进 \[nair2020awac,lee2022offline,ball2023efficient,nakamoto2024cal,zhou2025wsrl\]。这种组合在许多任务上效果良好,但在奖励稀疏的长视界设置中表现不佳 \[ogbench\_park2024,park2025horizon\]。智能体必须执行数百个动作才能收到反馈,使得学习缓慢。更糟糕的是,单步策略在探索过程中往往表现不一致,很少到达发生奖励的状态 \[li2025reinforcement\]。
动作分块通过提交动作序列而不是单步动作来解决这两个问题 \[zhao2023learning,chi2023diffusion\]。越来越多的工作将分块纳入 RL:基于 Transformer 的 episodic critics \[li2024top\]、由粗到细的离散 Q-networks \[seo2024reinforcement,seo2024continuous\]、用于离线 RL 的解耦价值学习 \[kim2025deas\] 以及退视地平线利用 \[nagy2026sear\]。其中,Q-Chunking (QC) \[li2025reinforcement\] 是最直接相关的前驱工作:它学习 $h$ 个连续动作分块的 Q 值,即使在数据集不完美的情况下也能使价值估计保持稳定 \[fedus2020revisiting\],并且开环执行整个分块能产生更相干的探索。然而,QC 在每个状态和每个任务中使用单一的固定分块大小 $h$。解耦 Q-Chunking (DQC) \[li2026decoupled\] 通过允许策略和评论家在不同的分块大小下运作,部分解决了这种刚性,但它并不针对每个状态适应分块大小,并且需要不适用于标准基于奖励的任务的目标条件训练 \[andrychowicz2017hindsight\]。
**图 1: AQC 的定性 rollout。我们的方法根据任务阶段自适应地调整承诺地平线 $k^*$。它利用长分块 ($k^*=16$) 进行自由空间中的高效移动,并在复杂的富含接触的操纵过程中自动切换到细粒度控制 ($k^*=1$)。**
我们认为,更深层的局限在于根本使用任何固定分块大小。考虑一个在自由空间中移向物体的机械臂:长动作序列在这里效果良好,因为运动是可预测的。但在接近抓握或插入等接触事件时,相同的长序列变得有害——小误差通过接触动力学累积,机器人必须在每一步对新的观察做出反应。没有单个分块大小能很好地处理这两种情况,而为每个任务调整合适的大小需要大量的实验。
自然的解决方案是为几种分块大小训练评论家,并在每个状态下选择最佳的一个。但这种朴素方法因两个原因而失败。首先,较短分块的评论家在构造上会产生较大的值,因此智能体总是选择最短的分块,即使较长的分块可能更好。其次,在预期回报较低的状态中,所有分块大小给出的值几乎相同,因此选择变成了随机噪声而不是有意义的选择。
我们提出**自适应 Q-Chunking (AQC)**,通过比较每个分块大小相对于基线行为所能达到的*优势*来解决这两个问题。优势衡量了特定分块比从演示策略执行该长度的分块好多少。这种比较消除了两种偏差来源:短分块不再人为地占主导地位,而在没有明显更好分块的低位价值状态中,智能体默认使用可用的最长分块。当短分块在接触附近独特地有帮助,或长分块有利于自由空间运动时,优势变得巨大并指导选择(图 1 \[https://arxiv.org/html/2605.05544#S1.F1\])。
同样的方法自然延伸到增强具有离线 RL 的视觉-语言-动作(VLA)模型 \[bjorck2025gr00t\]。我们在 RoboCasa-GR1 桌面操纵任务上,基于 GR00T N1.6 骨干网络训练评论家。VLA 原生输出动作分块;AQC 在每个尺度上对多个候选分块进行评分,并通过每尺度优势准则选择最佳前缀。这赋予了 VLA 在接触附近的反应式控制能力,同时在自由空间中保留平滑运动,而无需修改底层模型。
我们的主要贡献如下:
- 我们提出了 AQC,这是一种离线到在线 RL 方法,通过原则性的基于优势的准则在每个状态下适应分块大小。
- 我们提供了理论分析,建立了优势可分性、相对于固定分块策略的价值优势以及闭环最优性界限。
- 我们展示了在 OGBench \[ogbench\_park2024\] 和 Robomimic \[robomimic2021\] 上的最先进结果,在多样化的领域中优于先前的方法。
- 我们展示了我们的方法增强了 VLA 策略在 RoboCasa-GR1 桌面任务上的性能,在富含接触的操纵方面超过了先前的分块评论家方法。
## 2 相关工作
#### 离线到在线强化学习。
离线到在线 RL 方法在固定数据集上预训练策略,随后通过环境交互进行 refine。先前工作通过优势加权回归 \[nair2020awac\]、隐式 Q 学习 \[kostrikov2021offline\]、校准悲观主义 \[nakamoto2024cal\]、交错离线-在线批次 \[ball2023efficient\]、基于 warmup 的重新校准 \[zhou2025wsrl\]、策略扩展 \[zhang2023policy\] 或复活 RL \[agarwal2022reincarnating\] 来解决离线到在线的价值偏移。虽然这些方法侧重于管理离线到在线的转换,但我们的方法旨在解决一个互补的瓶颈:现有方法无法根据状态调整其规划地平线。
#### 强化学习中的动作分块。
动作分块预测并执行未来的动作序列,而不是在每一步执行单个动作。QC \[li2025reinforcement\] 将其扩展到基于 TD 的 RL,训练覆盖完整 $h$ 步分块的评论家,以消除离策略多步偏差,同时产生时间相干的探索。TOP-ERL \[li2024top\] 引入了基于 Transformer 的离策略 episodic RL,在短动作分块上具有多步回报。tian2025chunking 将分块评论家与软演员-评论家结合,在 $n$ 步回报上学习 Transformer 评论家,同时保持单步演员。CQN-AS \[seo2024reinforcement\] 和 CQN \[seo2024continuous\] 使用带有动作序列的由粗到细 Q-network 进行数据高效的 RL,将 Q 函数因式分解为离散动作箱。DEAS \[kim2025deas\] 将价值学习与动作序列解耦,用于可扩展的离线 RL。SEAR \[nagy2026sear\] 利用动作分块的时间结构,通过退视地平线提高样本效率。DQC \[li2026decoupled\] 将评论家使用的分块大小与策略使用的分块大小解耦,但需要目标条件的 hindsight relabeling \[andrychowicz2017hindsight\] 和额外的蒸馏超参数。相反,我们通过从长视界价值估计引导的直接 $k$ 步 TD 损失来学习部分评论家,在不使用蒸馏或目标条件的情况下实现相同的不动点,并扩展到推理时的自适应分块大小选择。
#### 多步回报和层次化 RL。
多步 TD 方法 \[hessel2018rainbow\] 加速信用传播,但在数据陈旧时引入离策略偏差 \[fedus2020revisiting,kozuno2021revisiting\]。Retrace \[munos2016safe\] 通过重要性采样截断校正此偏差,而动作分块 \[li2025reinforcement\] 通过以确切的行为策略轨迹为条件来消除它。park2025horizon 正式表明,较长的有效地平线会放大引导误差,这启发了我们使用长视界价值函数为短视界评论家提供引导目标的想法。学习时间扩展动作已在层次化 RL \[dayan1992feudal,dietterich2000hierarchical,kulkarni2016hierarchical,vezhnevets2016strategic,vezhnevets2017feudal,nachum2018data,ajay2020opal,shankar2020learning,pertsch2021accelerating,gehring2021hierarchical,xie2021latent\] 和选项框架 \[sutton1999between,menache2002q,csimcsek2004using,csimcsek2007betweenness,konidaris2011autonomous,bacon2017option,bagaria2019option,bagaria2024effectively\] 中得到广泛研究,尽管双层优化仍然是一个持续的挑战 \[nachum2018data\]。我们将这个双层问题坍塌为时间扩展动作空间中的单层目标,其中“高层”选择是一个确定性的基于优势的准则,不需要额外的学习参数。
## 3 背景
### 离线到在线强化学习
我们考虑一个无限视界、完全可观测的马尔可夫决策过程(MDP)$\mathcal{M}=(\mathcal{S},\mathcal{A},T,r,\rho,\gamma)$,其中 $\mathcal{S}$ 是状态空间,$\mathcal{A}$ 是动作空间,$T(s'\mid s,a):\mathcal{S}\times\mathcal{A}\to\Delta(\mathcal{S})$ 是转移核,$r(s,a):\mathcal{S}\times\mathcal{A}\to\mathbb{R}$ 是奖励函数,$\rho\in\Delta(\mathcal{S})$ 是初始状态分布,$\gamma\in[0,1)$ 是折扣因子。我们假设可以访问由行为策略 $\pi_\beta$ 收集的离线数据集 $\mathcal{D}=\{(s,a,r,s')\}$。离线到在线 RL 的目标是找到一个策略 $\pi:\mathcal{S}\to\Delta(\mathcal{A})$,以最大化预期折扣回报 $\eta(\pi):=\mathbb{E}\left[\sum_{t=0}^{\infty}\gamma^{t}r(s_{t},a_{t})\right]$,分为两个阶段:在 $\mathcal{D}$ 上进行预训练的*离线阶段*,随后是在不断增长的回放缓冲区中添加环境交互进行微调的*在线阶段*。
### TD 学习和引导偏差问题
Actor-critic RL 方法 \[sutton1998reinforcement,haarnoja2018soft\] 通过时序差分(TD)损失学习评论家 $Q_\phi(s,a)$:
$$
\mathcal{L}(\phi)=\mathbb{E}_{s_{t},a_{t},r_{t},s_{t+1}\sim\mathcal{D}}\!\left[\bigl(Q_{\phi}(s_{t},a_{t})-r_{t}-\gamma\bar{V}(s_{t+1})\bigr)^{2}\right], \quad (1)
$$
其中 $\bar{V}(s)$ 是目标价值估计。在具有有效视界 $H=1/(1-\gamma)$ 的长视界、稀疏奖励任务中,1 步 backup 每次梯度更新仅向后传播一步奖励信号,需要 $O(H)$ 次更新,初始状态才能收到任何信号。
多步回报方法 \[hessel2018rainbow\] 通过使用长度为 $n$ 的轨迹段 $(s_{t},a_{t},\ldots,s_{t+n})$ 构造 $n$ 步 backup 来加速这一过程:
$$
\hat{V}_{n\text{-step}}:=\sum_{j=0}^{n-1}\gamma^{j}r_{t+j}+\gamma^{n}Q_{\bar{\phi}}(s_{t+n},a_{t+n}), \quad a_{t+n}\sim\pi(\cdot\mid s_{t+n}), \quad (2)
$$
将有效视界减少 $n$ 倍。然而,当数据为离策略时,$n$ 步估计器是*有偏的* \[fedus2020revisiting,kozuno2021revisiting\],这意味着回放缓冲区中的累积奖励 $\mathbf{r}_{t:t+n}$ 是在 $\pi_\beta$ 下收集的,而不是当前策略 $\pi$,因此总和不再是 on-policy $n$ 步回报的无偏估计。
### 动作分块 Q 学习
QC \[li2025reinforcement\] 提出用*动作分块*解决这种紧张关系:与其训练单动作评论家 $Q(s_{t},a_{t})$,不如训练*分块评论家* $Q^{h}(s_{t},\mathbf{a}_{t:t+h})$,它以整个 $h$ 个连续动作的分块作为输入。分块 TD backup 为:
$$
\mathcal{L}_{h}(\phi)=\mathbb{E}\!\left[\!\left(Q^{h}(s_{t},\mathbf{a}_{t:t+h})-\sum_{j=0}^{h-1}\gamma^{j}r_{t+j}-\gamma^{h}\max_{i\leq N}\bar{Q}^{h}(s_{t+h},a^{(i)}_{t+h:t+2h})\right)^{\!2}\right], \quad (3)
$$
其中 $\{a^{(i)}_{t+h:t+2h}\}_{i=1}^{N}$ 是在 $s_{t+h}$ 处从 $\pi_\beta$ 采样的 $N$ 个候选动作分块。对 $N$ 个样本的 $\max$,称为 EMAQ \[ghasemipour2021emaq\],近似 best-of-$N$ bootstrap 并确保评论家推高至行为价值之上。关键在于,因为完整分块 $\mathbf{a}_{t:t+h}$ 直接取自数据并在 backup 期间保持固定,所以 $n$ 步偏差被*消除*:生成奖励 $\mathbf{r}_{t:t+h}$ 的动作与评论家所条件的动作之间没有策略不匹配 \[li2024top,li2025reinforcement\]。
### 通过 Expectile 回归的隐式价值 Backup
为了避免在 TD 目标中进行显式动作最大化,可以学习价值函数 $V_\xi(s)$ 以隐式近似 $\max_{a}Q(s,a)$,使用*expectile 损失* \[kostrikov2021offline\]:
$$
\mathcal{L}_{V}(\xi)=\mathbb{E}_{(s_{t},\mathbf{a}_{t:t+h})\sim\mathcal{D}}\!\left[f^{\kappa_{V}}_{\mathrm{exp}}\!\left(\bar{Q}^{h}(s_{t},\mathbf{a}_{t:t+h})-V_{\xi}(s_{t})\right)\right], \quad (4)
$$
其中 $f^{\kappa_{V}}_{\mathrm{exp}}(u)=|\kappa_{V}-\mathbb{I}[u<0]|u^2$。相似文章
ACSAC:基于因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 方法
本文介绍了 ACSAC,一种强化学习方法,它使用带有因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 算法来处理长期限、稀疏奖励任务。通过根据状态需求动态调整动作 Chunk Size,该方法在操控任务中展示了最先进的性能。
@svlevine: 动作分块是一种神秘而有效的方法。现代大规模模仿学习没有它基本无法工作……
Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。
分层优势加权:面向稀疏回合结果的VLA在线强化学习微调
本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。
Adaptive Chunking:为RAG优化分块方法选择
介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。
@starlitmatcha:今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是……的实现
Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。