@starlitmatcha:今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是……的实现
摘要
Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。
查看缓存全文
缓存时间: 2026/08/05 10:22
今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是生成模型理论的实现。模仿学习存在一个根本性问题:由于一次只预测一个动作,会导致误差累积和运动抖动。这些策略通过动作分块(action chunking)来解决这个问题,即一次性预测整个未来的动作序列并执行它们。
这两种方法基于相同的核心思想:动作分块。它们只是使用了不同的生成器。
- ACT 基本上是 Conditional VAE + Transformer + action chunking,因此它可以在网络的单次前向传播中生成一整块动作序列。因此它速度更快,在廉价硬件上表现也非常出色(它是 ALOHA / SO-100 设置的首选方法)。ACT 还在推理时使用时间集成(temporal ensembling)来使运动更平滑。
- Diffusion Policy 也使用了相同的思路,但用的是扩散模型(diffusion)而不是 VAE。它从一整块纯噪声开始,以当前观察为条件,通过迭代去噪生成一个干净的动作序列。扩散模型比 VAE 能更好地捕捉多模态分布(VAE 的样本有点模糊,扩散的样本更清晰),这使得它成为最可靠的 BC(行为克隆)方法之一。但代价是推理速度较慢,因为需要许多去噪步骤。
我们通过优化推理(Optimized Inference)来解决这个问题。生成动作块需要时间,但真实机器人以更高频率工作。因此我们将规划与执行解耦,分别为它们运行独立的进程:一个进程运行策略来生成动作块(规划器),另一个进程按所需速率(即高速)将这些动作流式传输给机器人。这样机器人就不会因等待模型思考而卡住,运动也会很平滑。
接下来我会介绍通用型机器人策略(generalist robot policies)和基础模型(foundation models)。
Khushi (@starlitmatcha): 阅读了有关生成模型的内容,以及为什么我们在机器人技术中首先需要它们。朴素的 BC(行为克隆)由于其确定性行为,无法处理多模态演示,所以显而易见的直觉是停止预测单个动作,而是学习好动作的整个分布,
相似文章
@svlevine: 动作分块是一种神秘而有效的方法。现代大规模模仿学习没有它基本无法工作……
Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。
@svlevine: 如何使用实时分块(RTC)运行强化学习?在这项工作中,我们找到了方法,用小型强化学习策略配合大型机器人基础模型……
一项研究合作介绍了ARLI,这是一种通过异步推理使用实时分块来启用视觉-语言-动作模型的强化学习微调的方法,通过让强化学习策略观察更近期的图像来改善机器人行为。
@askalphaxiv: “实时视觉-语言-动作策略的强化学习” VLA 模型通常对实时机器人控制来说太慢...
本文介绍了一种方法,将视觉-语言-动作模型中的动作生成分离为慢层和快层,从而实现实时反应式机器人控制,并将成功率从42%提高到97%,仅需10分钟的在线数据。
扩散语言模型的动态分块
本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。
离线到在线强化学习的自适应 Q 分块
本文介绍了自适应 Q 分块(AQC),这是一种强化学习方法,能够动态选择动作分块大小,以平衡反应式控制与长期规划。该方法在 OGBench 和 Robomimic 上取得了最先进的结果,提升了大规模 VLA 模型在机器人任务中的性能。