从噪声到控制:Parameterized Diffusion Policies

arXiv cs.AI 论文

摘要

本文介绍了参数化扩散策略(Parameterized Diffusion Policy, PDP)框架,该框架通过以低维潜在参数为条件,使扩散策略变得可控,从而实现无需重新训练即可进行平滑的行为插值和自适应。在仿真和真实机器人实验中,该方法在复杂的多模态机器人任务上展现了更优的性能。

arXiv:2606.00336v1 Announce Type: new 摘要:我们提出参数化扩散策略(Parameterized Diffusion Policy, PDP),这是一个学习以嵌入在已学习行为流形中的低维连续参数为条件的扩散策略的框架。通过构建该流形,使得潜在表示之间的距离反映物理轨迹之间的语义相似度,我们将扩散从一种随机多样性机制转变为一种精确且可优化的行为引导工具。我们的方法能够在无需更新策略权重的情况下实现已知策略之间的平滑插值,并对新约束进行高效自适应。实验表明,在仿真和真实机器人实验中,与标准扩散策略相比,PDP在复杂的多模态基准测试中显著提升了自适应性能,尤其是在需要合成新行为的场景中。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:46

# 从噪声到控制:参数化扩散策略 来源:https://arxiv.org/html/2606.00336 Haotian Fu、Mingxi Jia、George Konidaris、Yilun Du、Bruno Castro da Silva ###### 摘要 我们提出参数化扩散策略 (PDP),一个用于学习扩散策略的框架,该策略以嵌入在习得行为流形中的低维连续参数为条件。通过构造此流形,使得潜在表示之间的距离反映物理轨迹之间的语义相似性,我们将扩散从一种随机多样性机制转变为一种精确且可优化的行为引导工具。我们的方法支持在已知策略之间平滑插值,并高效适应新约束,而无需更新策略权重。我们证明,在复杂的多模态基准测试(包括模拟和真实机器人实验)中,与标准扩散策略相比,PDP 显著提高了适应性能,尤其在需要合成新颖行为的场景中。机器学习,ICML ## 1 引言 现实世界的机器人任务通常*未充分指定*:特定环境中的给定目标可能通过许多不同的动作序列实现 (Ivanovic et al., 2020 (https://arxiv.org/html/2606.00336#bib.bib22); Lynch et al., 2020 (https://arxiv.org/html/2606.00336#bib.bib35))。例如,一个踢足球的机器人可以通过多种可行的射门轨迹得分,这些轨迹都满足“球进入球门”,但在如何避开防守队员和满足约束方面有所不同 (图1 (https://arxiv.org/html/2606.00336#S1.F1))。这种一对多的结构在操作和导航中普遍存在 (Mandlekar et al., 2021 (https://arxiv.org/html/2606.00336#bib.bib38); Florence et al., 2022 (https://arxiv.org/html/2606.00336#bib.bib13); Chen et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib3))。因此,为机器人策略学习提供的专家数据集自然是*多模态*的,一个理想的策略预期既能 (i) 包含此类多模态行为,又能在约束发生变化时 (ii) 找到要执行的*正确*行为 (da Silva et al., 2012 (https://arxiv.org/html/2606.00336#bib.bib5); Dalal et al., 2021 (https://arxiv.org/html/2606.00336#bib.bib6))。

查看图注

图 1:观测侧偏移 vs. 约束引起的行为偏移,以及为什么 PDP 能够实现稳定的行为引导。
顶部:标准评估改变观测,而预期行为保持不变。中部:我们研究约束引起的行为偏移,即环境变化使得训练数据集中的许多轨迹模式失效,成功需要选择或发现一个不同的轨迹模式。底部:在标准 DP 中,通过采样噪声进行引导是病态的:微小的扰动可能导致巨大且不可预测的轨迹变化。相比之下,PDP 暴露了一个习得的行为潜在变量 z,其几何结构与轨迹相似性对齐,因此 z 中的微小变化会引起行为的平滑变化,从而实现插值和适应。

扩散策略最近已成为行为克隆的强默认选择,因为它们能够建模多模态和高维动作序列,并通过随机去噪生成多样化的轨迹 (Chi et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib4))。然而,多样性本身并不等同于*可控性*。大多数标准评估主要关注*观测侧*分布偏移 (图1 (https://arxiv.org/html/2606.00336#S1.F1),顶部) (Zhu et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib67); Wolf et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib59)),即确保外观或相机条件的变化不影响物理意图的行为。相比之下,许多部署失败源于*约束引起的行为偏移* (图1 (https://arxiv.org/html/2606.00336#S1.F1),中部):新的障碍物、接触约束或可行性条件可能使先前示范的策略失效,迫使机器人选择或发现超越训练数据集覆盖范围的新颖行为模式 (Konidaris & Barto, 2009 (https://arxiv.org/html/2606.00336#bib.bib28); Pan et al., 2025a (https://arxiv.org/html/2606.00336#bib.bib43); Wagenmaker et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib56))。本文针对以下设置:扩散策略在多模态示范上离线预训练。部署时,任务保持不变,但*约束发生变化*,使得训练数据集中仅有一种或少数几种行为模式仍然可行。在更困难的情况下,观察到的模式可能都不满足新约束,要求智能体插值出一个新的行为模式。关键在于,我们希望适应是*快速*且*数据轻量*的,可能仅由单个新示范指导。这激发了当前扩散策略控制接口无法满足的两个要求:(1) 通过参数更新实现快速行为引导。当训练中未见的约束使现有策略失效时,我们希望仅通过调整*少量参数*在测试时引导策略,而不是重新训练整个策略。换句话说,适应应只需解决一个紧凑的优化问题,或进行少量梯度步,即可生成可靠满足新约束的可行行为。(2) 用于泛化的平滑、几何对齐的行为流形。除了在记忆的模式中进行选择外,策略还应通过在行为之间进行插值以生成未明确示范但分布合理的轨迹,从而在*训练分布内部*进行泛化。这需要一个行为空间,其几何结构与轨迹相似性对齐:在该空间中移动一小段距离应引起执行轨迹相应且可预测的小变化。这样的空间既能支持模式插值(以提高覆盖率),也能支持对新约束的快速适应(以保持可行性)。

我们提出参数化扩散策略 (PDP):以从示范中习得的*连续*行为参数 z 为条件的扩散策略。PDP 学习一个轨迹编码器,将每个示范映射到潜在码,并优化生成的表示,使其*几何对齐*:z 中的距离反映物理轨迹之间的语义相似性。将扩散去噪器以 z 为条件,将扩散从“噪声驱动的多样性”转变为显式且可优化的控制机制:z 成为 (i) 选择所需模式、(ii) 在行为之间平滑插值以生成未观察但分布内轨迹,以及 (iii) 通过测试时优化 z 快速适应约束变化(无需更新策略权重)的低维手柄。我们在一个专门设计的基准测试套件中评估 PDP,该套件旨在分离多模态训练数据下约束变化时的行为侧适应。在多个模拟任务和一个真实机器人任务中,我们发现 PDP 相比其他扩散策略和行为克隆基线能够实现更可靠的引导和适应。

## 2 相关工作

##### 扩散模型与潜在结构。扩散模型已成为一类主流的生成模型,因为它们能够表示复杂的多模态分布,但其潜在空间通常结构不良,且控制信号难以优化。这限制了它们在视觉和序列决策设置中平滑插值和控制输出的能力 (Sohl-Dickstein et al., 2015 (https://arxiv.org/html/2606.00336#bib.bib51); Song & Ermon, 2019 (https://arxiv.org/html/2606.00336#bib.bib52); Ho et al., 2020 (https://arxiv.org/html/2606.00336#bib.bib20); Dhariwal & Nichol, 2021 (https://arxiv.org/html/2606.00336#bib.bib7); Park et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib45); Pan et al., 2025b (https://arxiv.org/html/2606.00336#bib.bib44); Hahm et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib18); Moser et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib41); Karras et al., 2022 (https://arxiv.org/html/2606.00336#bib.bib27); Nichol & Dhariwal, 2021 (https://arxiv.org/html/2606.00336#bib.bib42); Song et al., 2021 (https://arxiv.org/html/2606.00336#bib.bib53); Li et al., 2025a (https://arxiv.org/html/2606.00336#bib.bib30), b (https://arxiv.org/html/2606.00336#bib.bib31))。最近的 analysis 强调了扩散潜在空间中的几何扭曲,并提出了解缠或等距潜在学习以改善插值和可编辑性 (Park et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib45); Pan et al., 2025b (https://arxiv.org/html/2606.00336#bib.bib44); Hahm et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib18))。这些限制对于控制和决策任务更为重要,因为精确的行为引导对于安全性和可行性至关重要。因此,最近的综述将此类限制视为扩散在机器人学中的关键机遇 (Zhu et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib67); Xu et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib61); Wolf et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib59); Makarova et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib37)),而其他工作则探索了 RL 引导的训练,以将生成行为与超越简单似然的目标对齐 (Black et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib1); Miao et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib40); Wang et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib58))。

##### 扩散策略与行为引导。基于生成扩散模型,扩散策略已成为机器人模仿的强大范式 (Chi et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib4); Wang et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib57); Li et al., 2024b (https://arxiv.org/html/2606.00336#bib.bib33); Jackson et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib23); Janner et al., 2022 (https://arxiv.org/html/2606.00336#bib.bib24); Høeg et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib21))。虽然表达能力很强,但这些策略通常需要测试时引导以适应新约束而无需重新训练 (Du et al., 2023b (https://arxiv.org/html/2606.00336#bib.bib12); Yu et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib63))。当前策略通常通过注入外部指导来引导冻结的策略,例如价值函数梯度、人类反馈或专门的几何先验 (Ding et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib8); Li et al., 2025c (https://arxiv.org/html/2606.00336#bib.bib34); Shan et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib50); Du et al., 2023a (https://arxiv.org/html/2606.00336#bib.bib11); Du & Mordatch, 2019 (https://arxiv.org/html/2606.00336#bib.bib10); Zhu et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib66))。其他方法直接在高维噪声空间中优化以改进行为 (Wagenmaker et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib56); Li et al., 2024a (https://arxiv.org/html/2606.00336#bib.bib32); Kang et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib26); Ding et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib9))。然而,由于潜在噪声缺乏几何正则化,这种优化通常是病态的 (Park et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib45); Pan et al., 2025b (https://arxiv.org/html/2606.00336#bib.bib44); Hahm et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib18))。为了提高可控性,一系列并行的工作学习显式表示,通常通过离散瓶颈,如技能 token 或向量量化码 (Chen et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib3); Lee et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib29); Wu et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib60); Qiao et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib47); Ma et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib36))。虽然这些表示有助于模式选择,但它们自然地将控制限制在一个有限的行为集合中。

##### 参数化技能与动作。类似的高层想法关于参数化动作和技能也在强化学习中得到研究,作为结构化抽象和任务迁移的机制 (Masson et al., 2016 (https://arxiv.org/html/2606.00336#bib.bib39); Hausknecht & Stone, 2016 (https://arxiv.org/html/2606.00336#bib.bib19); Dalal et al., 2021 (https://arxiv.org/html/2606.00336#bib.bib6); Zhang et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib64); Gupta et al., 2025 (https://arxiv.org/html/2606.00336#bib.bib17))。通过学习显式的层次化表示,这些方法提高了样本效率,并使长时域任务中复杂行为的组合成为可能 (Fu et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib15); Zheng et al., 2024 (https://arxiv.org/html/2606.00336#bib.bib65); Konidaris & Barto, 2009 (https://arxiv.org/html/2606.00336#bib.bib28); Queisser & Steil, 2018 (https://arxiv.org/html/2606.00336#bib.bib48); Sutton et al., 1999 (https://arxiv.org/html/2606.00336#bib.bib54); Frans et al., 2018 (https://arxiv.org/html/2606.00336#bib.bib14); Vezhnevets et al., 2017 (https://arxiv.org/html/2606.00336#bib.bib55))。PDP 将这些经典概念扩展到现代生成范式,通过学习一个连续的行为语义流形来参数化扩散去噪过程。

## 3 背景

##### 扩散模型。设 x0 ∈ R^D 表示一个数据向量(例如,维度为 D 的动作块)。去噪扩散概率模型 (DDPMs) 定义了一个前向加噪过程 (Ho et al., 2020 (https://arxiv.org/html/2606.00336#bib.bib20)):
q(xk ∣ xk-1) = N(√αk xk-1, (1-αk)I),   (1)
其中 k = 1, ..., K 是扩散时间步索引,xk 表示对 x0 应用前向扩散过程 k 步后样本的状态。设 ᾱk ≜ ∏_{s=1}^k αs。那么边缘分布具有以下封闭形式:
xk = √ᾱk x0 + √(1-ᾱk) ε, ε ∼ N(0, I)。   (2)
条件扩散模型学习一个噪声预测器 εθ(xk, k, c),其中 c 表示任意条件变量,使用标准噪声预测目标:
L_DDPM(θ) = E_{x0, k, ε} [ || ε - εθ(xk, k, c) ||_2^2 ]。   (3)

##### 用于动作块的扩散策略。一个机器人示范轨迹是 τ = {(ot, at)}_{t=0}^{T-1},其中 ot 是观测,at ∈ R^{da} 是连续动作。扩散策略将长度为 H 的*动作块* (Chi et al., 2023 (https://arxiv.org/html/2606.00336#bib.bib4)) 建模为 At = {at, at+1, ..., a_{t+H-1}},并以上下文特征 ct 为条件,例如最近观测的编码。扩散策略 πθ(At ∣ ct) 将 (2) 和 (3) 中的 x0 ≡ At 实例化,通过迭代去噪生成块。

相似文章

无漂移扩散策略优化

arXiv cs.LG

DiPOD通过交错自蒸馏与策略梯度更新来稳定扩散策略优化,保持紧凑的ELBO,防止双重漂移现象,在语言和连续控制任务中均能获得更高奖励。

通过扩散策略优化扩展世界模型强化学习

arXiv cs.LG

提出模型基扩散策略优化(MBDPO)框架,该框架通过扩散策略表示统一了世界模型中的搜索与策略优化,在离线与在线强化学习任务中实现一致的扩展行为和卓越性能。

面向掩码扩散的自适应顺序策略

arXiv cs.LG

提出使用轻量级策略网络学习掩码扩散模型中的去掩码顺序,通过加权损失在组合任务和蛋白质设计上优于启发式方法。

通过参数噪声实现更好的探索

OpenAI Blog

OpenAI 提出了参数噪声技术,该方法向神经网络策略参数添加自适应噪声,而不是向动作空间添加噪声,使得智能体能够比传统动作噪声方法快得多地学习任务。该方法在 HalfCheetah 上实现了 2 倍的学习速度提升,代表了进化策略与 TRPO、DDPG 等深度强化学习方法之间的平衡点。