离线强化学习中的策略提取解耦
摘要
提出在离线强化学习中将策略提取从actor训练中解耦,以解决如分布外动作放大和支持-价值权衡等问题,显示出比耦合方法更好的性能。
查看缓存全文
缓存时间: 2026/08/24 04:34
# 面向离线强化学习的解耦策略提取 来源:https://arxiv.org/html/2608.20909 林旭尧,Simplexity Robotics & 伦斯勒理工学院,[email protected] 单逸翔,Simplexity Robotics,[email protected] 段金茹,Simplexity Robotics & 东北大学,[email protected] 杨涛、赵新宇、雷润宇、赵一铭、范佳鑫、冯宗保 & 贾鹏,Simplexity Robotics {yangtao, zhaoxinyu, leirunyu, , fanjiaxin, fengzongbao, jiapeng}@s-robots.com 致谢:通讯作者。 ###### 摘要 离线强化学习方法通常联合训练演员和评论家,其中评论家用于指导演员选择更高价值的动作。这种耦合学习过程在线上强化学习中有充分动机,因为改进的演员可以收集新数据,进而更新演员和评论家。然而,在离线强化学习中训练数据是固定的,演员侧的策略改进无法生成新数据来验证或纠正评论家。此外,保留这种耦合范式导致两个相关挑战。首先,演员更新可能偏向高价值但潜在超出分布的动作,并放大评论家的高估。其次,保守的价值估计或行为克隆正则化在抑制超出分布动作和支持区域内选择高价值动作之间创造了艰难的权衡。基于此观察,我们重新审视传统离线强化学习范式,提出将策略改进与演员训练解耦。具体而言,我们仅训练演员以建模行为分布,并在推理时通过单独学习的评论家对多个演员生成的提议进行重新排序来执行策略改进。我们将此范式称为解耦策略提取范式。在此范式下,演员提供行为支持的动作候选,而评论家在此候选集中执行基于价值的选择。大量实验表明,解耦策略提取范式优于行为克隆和联合学习的离线强化学习方法,即使在使用简单的Q学习评论家时仍保持有效。 ## 1 引言 强化学习从奖励反馈中学习决策策略,通常采用演员-评论家架构实现。评论家估计动作的长期价值,演员在其指导下被训练以偏好更好的动作。这种分工在线上强化学习中特别自然,因为评论家驱动演员走向高价值动作,而改进的演员反过来通过新环境交互扩展评论家的数据支持并纠正其估计误差,从而形成有意义的闭环训练过程。 [图例] 图1:30个离线GCRL任务上的总体表现。解耦策略提取变体优于原始耦合基线。完整的任务级结果和超参数在附录A.3中提供。 尽管广泛的离线强化学习方法保留了这种演员-评论家结构,但我们认为在离线强化学习中保留演员侧策略改进的理由已大幅减弱。由于数据集固定,改进演员既不改变训练分布,也不收集可纠正评论家错误的新经验。此外,保留此训练范式面临两个基本问题:超出分布放大循环问题和支持-价值权衡问题。首先,演员不断转向被评论家分配更高价值的潜在超出分布动作,从而放大评论家高估的影响,并进一步使策略偏离数据分布,导致超出分布放大循环问题。其次,现有方法通常引入保守的价值估计或行为克隆正则化来控制这种偏离。然而,弱约束可能无法抑制超出分布动作,而强约束可能阻止策略在数据支持区域内选择高价值动作,导致价值最大化和分布支持之间的艰难权衡,即支持-价值权衡问题。 基于上述观察,我们通过将策略改进与演员学习解耦,重新审视离线强化学习的范式设计。具体而言,我们提出学习一个行为克隆演员,并独立学习一个评论家。在推理时,演员提议多个支持的动作候选,由评论家重新排序并选择。与先前的耦合策略改进方法相反,我们将此范式称为解耦策略提取范式。在此范式下,策略改进不再通过评论家驱动的演员优化隐式实现,而是显式实例化为测试时动作选择。这种解耦自然地解决了上述两个问题。首先,由于评论家不再更新演员,评论家高估不会通过演员优化被递归放大,从而避免了超出分布放大循环。其次,分布支持和价值最大化不再在单一演员目标内平衡,避免了耦合策略改进中固有的支持-价值权衡。 图1中的总体结果证明了将策略改进与演员学习解耦的优势。在30个离线目标条件任务中,用解耦策略提取变体替代原始评论家指导的演员一致提高了性能。例如,使用IQL评论家时,解耦变体将平均成功率从47.89%提高到68.49%。其他评论家骨干的类似改进表明,该益处并非特定于某个价值学习目标。这些结果支持了解耦策略提取范式,其中演员仅负责建模数据支持的动作分布,而策略改进通过推理时的评论家指导选择显式执行。值得注意的是,尽管相关的推理时策略优化方法已出现在一些现有工作中,但我们的目标是系统地讨论强化学习方法机制。我们的范式与现有方法之间的关系将在第6节讨论。 我们的贡献如下: - 我们重新审视了离线强化学习中流行的耦合策略改进范式,并识别了其局限性。基于此分析,我们提出更适合离线设置的解耦策略提取范式。 - 我们用多个评论家骨干实例化此范式,并表明在广泛的离线目标条件任务中,解耦策略提取持续优于相应的耦合方法。 - 所提出的范式对大规模策略具有重要意义。通过将策略改进委托给轻量级评论家,同时避免对演员的重复更新,它为具有大策略模型的离线强化学习提供了计算效率更高的方法。 ## 2 预备知识 ### 2.1 离线目标条件强化学习 我们考虑一个目标条件马尔可夫决策过程 \( \mathcal{M} = (\mathcal{S}, \mathcal{A}, \mathcal{G}, P, r, \rho_0, p_G, \gamma, H) \), 其中 \( s \in \mathcal{S} \)、\( a \in \mathcal{A} \) 和 \( g \in \mathcal{G} \) 分别表示状态、动作和目标。目标条件策略 \( \pi(a \mid s, g) \) 最大化 \[ J(\pi) = \mathbb{E}_{g \sim p_G, \tau \sim p^\pi(\cdot \mid g)} \left[ \sum_{t=0}^{T-1} \gamma^t r(s_t, a_t, g) \right], \quad T \leq H. \] 我们将 \( x = (s, g) \) 写作状态-目标上下文。相应的动作价值函数为 \[ Q^\pi(x, a) = \mathbb{E}_{\pi} \left[ \sum_{k=0}^{T-t-1} \gamma^k r(s_{t+k}, a_{t+k}, g) \mid x_t = x, a_t = a \right]. \] 在离线强化学习中,学习者只能访问固定数据集 \( \mathcal{D} = \{(s_i, a_i, r_i, s_i', d_i, g_i)\}_{i=1}^M \), 且无法收集额外的交互数据。数据集诱导上下文边缘分布 \( \rho_{\mathcal{D}}(x) \) 和行为条件动作分布 \( \mu_{\mathcal{D}}(a \mid x) \)。由于价值估计在数据集覆盖的状态-动作区域最可靠,将策略优化至弱支持的动作可能利用无法通过新交互纠正的外推误差。因此,我们使用行为支持区域作为讨论动作覆盖和超出分布漂移的参考。 ### 2.2 价值学习与策略提取 我们将评论家学习与策略提取分离。令 \( c \) 表示评论家学习规则,例如Q学习、IQL或TRL。我们写作 \[ \widehat{Q}^c = \mathsf{ValueLearn}_c(\mathcal{D}), \quad \Pi = \mathsf{Extract}(\mathcal{D}, \widehat{Q}^c), \] 其中 \( \widehat{Q}^c(x, a) \) 是用于动作选择的标量分数,无论评论家训练期间使用的辅助价值函数或目标网络如何。 对于从有限候选集中选择,仅动作的相对排序重要: \[ \arg\max_{a \in \mathcal{C}} h(\widehat{Q}^c(x, a)) = \arg\max_{a \in \mathcal{C}} \widehat{Q}^c(x, a) \] 对任何严格递增函数 \( h \) 成立。因此,不同的评论家可以通过共享的基于排序的提取接口进行比较。 许多离线强化学习方法通过使用评论家衍生监督训练演员来提取策略。例如,正则化演员目标优化高价值动作,同时惩罚偏离行为分布,而优势加权回归使用评论家估计衍生的权重拟合数据集动作。我们将任何训练目标依赖于评论家价值、优势或其他评论家衍生信号的演员称为 *RL训练演员*。相比之下, *行为克隆提议器* \( q_{\mathrm{BC}}(a \mid x) \) 仅从数据集动作训练,不接收评论家衍生监督。 ### 2.3 提议与选择策略 我们使用 \( q(a \mid x) \) 表示随机动作提议器。给定上下文 \( x \),提议器采样 \( N \) 个候选动作 \[ C_N(x; q) = \{a_1, \ldots, a_N\}, \quad a_i \sim q(\cdot \mid x). \] 基于评论家的选择器选择 \[ \Pi[q, \widehat{Q}^c, N](x) = \arg\max_{a_i \in C_N(x; q)} \widehat{Q}^c(x, a_i). \] 作为对照,我们也考虑从相同候选集中随机选择, \[ \Pi_{\mathrm{rand}}[q, N](x) \sim \mathrm{Unif}(C_N(x; q)), \] 这衡量了在不使用评论家排序的情况下采样多个动作的效果。当 \( N = 1 \) 时不执行比较,部署的动作是单个提议。当 \( N > 1 \) 时,基于评论家的选择在推理时改变部署的动作分布,而无需重新训练提议器。 此表示法明确三个因素:提议分布 \( q \)、评论家排序函数 \( \widehat{Q}^c \) 和候选预算 \( N \)。在我们的实验中,我们将 \( q \) 实例化为冻结的行为克隆提议器,并改变评论家骨干和候选预算以诊断离线策略提取。在分布诊断中,我们使用行为克隆动作分布作为行为支持区域的经验代理。 ## 3 诊断离线强化学习中的耦合策略改进 如第1节所讨论,联合训练的演员-评论家方法面临两个关键限制:通过演员-评论家反馈循环放大评论家错误,以及支持-价值权衡。在本节中,我们实证研究这两个问题。我们进一步测试在固定评论家的计算匹配候选搜索下,解耦提议学习与基于评论家的选择是否改变性能。详细设置在附录A.4和A.5中提供。 ### 3.1 超出分布放大循环 [图例] 图2:虚线轮廓标记相同检查点95%保形BC参考区域,外部比率在每个面板中报告。颜色编码CRR的原始诊断优势和TD3的检查点内 \( \min(Q_1, Q_2) \) 百分位数排名。 超出分布动作已被公认为离线强化学习中的核心挑战。这一困难的一个关键来源在于评论家估计误差与耦合策略改进之间的交互。当演员在离线数据集支持之外的动作上分配概率质量时,评论家可能因此高估其中一些动作。直接针对这些估计优化演员可能会增加这些被高估的超出分布动作的概率,进一步使演员转向评论家不太可靠的区域。这在评论家错误和演员分布漂移之间创建了自我强化的反馈循环。在线上强化学习中,此类错误可以被纠正,因为更新的策略生成新交互,为这些新访问区域提供训练数据。然而,在离线强化学习中,数据集保持固定,使得此反馈循环没有等效的纠正机制。 接下来,我们实证研究耦合策略改进方法中没有显式悲观正则化的反馈循环错误放大。图2比较了EDP-BC、EDP-CRR和EDP-TD3,分别代表BC策略、优势加权回归和行为正则化Q最大化。尽管所有方法使用相同的初始化,但训练后,在相同检查点BC95区域之外的动作比例不同;EDP-BC为6.8%,而EDP-CRR为31.3%,EDP-TD3为16.8%。这些结果凸显了耦合策略改进的一个根本弱点:直接针对不完美的离线评论家优化演员,可能通过演员-评论家反馈循环放大分布漂移。此外,在CRR下,超过BC95的动作获得更高的诊断优势,在TD3下获得更高的检查点内Q排名。这些结果提供了评论家对齐的演员漂移的证据:耦合更新可以将演员移出BC参考支持,而冻结提议策略移除此反馈路径。 ### 3.2 支持-价值权衡 如前所述,在耦合策略改进范式下,超出分布动作可能导致评论家估计误差和演员更新之间的循环错误放大,从而导致演员分布漂移。现有的离线强化学习方法通常通过保守或
相似文章
流体控制的离线强化学习:基于数据的多观测策略提取
本文提出了一种用于主动流动控制的新型离线强化学习框架,采用带有点注意力层的传感器位置条件架构来处理变化的传感器配置,从而无需昂贵的在线交互即可实现数据驱动的策略提取。
离线质量-多样性强化学习下的层次技能策略学习
介绍了QDOS,这是一个用于离线到在线强化学习的统一流水线,采用优势加权质量-多样性预训练来提取多样且高价值的技能,显著提升了操作和移动任务的性能。
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
超越惩罚机制:基于扩散模型的离线强化学习分布外检测与选择性正则化
本文介绍了 DOSER,这是一种利用扩散模型进行分布外(OOD)检测和选择性正则化的框架,旨在离线强化学习中通过区分有益和有害的 OOD 动作来提升在静态数据集上的表现。