@starlitmatcha:今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是……的实现

X AI KOLs Timeline 新闻

摘要

Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。

今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是生成模型理论的实现。模仿学习有一个根本性问题:由于它一次只预测一个动作,会导致误差累积和运动抖动。这些策略通过动作分块(action chunking)来解决这个问题,即一次性预测未来动作的整个序列并执行它们。 这两种方法都基于相同的基本思想,即动作分块,只是使用了不同的生成器。 1. ACT 本质上是一个条件 VAE + Transformer + 动作分块,因此它只需通过网络一次前向传播就能生成一个动作块。因此它速度更快,在廉价硬件上表现也非常出色(它是 ALOHA / SO-100 配置的旗舰方法)。ACT 还在推理时使用时间集成(temporal ensembling)来实现更平滑的运动。 2. Diffusion Policy 使用相同的思路,但用扩散模型代替 VAE。它从一个纯噪声块开始,以当前观测为条件,迭代地去噪,得到干净的动作序列。扩散模型比 VAE 能更好地捕捉多模态分布(VAE 生成的样本有些模糊,扩散生成的样本更锐利),这使它成为最可靠的 BC 方法之一。但代价是推理速度慢,因为需要许多去噪步骤。 我们通过优化推理(Optimized Inference)来解决这个问题。生成动作块需要时间,但真实机器人的工作频率更高。因此我们将规划与执行解耦,为两者分别运行独立进程:一个进程运行策略来生成动作块(规划器),另一个进程以所需频率(很快)将这些动作流式传输给机器人。这样机器人就不会因为等待模型思考而卡顿,运动也保持流畅。 接下来我会介绍通用机器人策略和基础模型。
查看原文
查看缓存全文

缓存时间: 2026/08/05 10:22

今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是生成模型理论的实现。模仿学习存在一个根本性问题:由于一次只预测一个动作,会导致误差累积和运动抖动。这些策略通过动作分块(action chunking)来解决这个问题,即一次性预测整个未来的动作序列并执行它们。

这两种方法基于相同的核心思想:动作分块。它们只是使用了不同的生成器。

  1. ACT 基本上是 Conditional VAE + Transformer + action chunking,因此它可以在网络的单次前向传播中生成一整块动作序列。因此它速度更快,在廉价硬件上表现也非常出色(它是 ALOHA / SO-100 设置的首选方法)。ACT 还在推理时使用时间集成(temporal ensembling)来使运动更平滑。
  2. Diffusion Policy 也使用了相同的思路,但用的是扩散模型(diffusion)而不是 VAE。它从一整块纯噪声开始,以当前观察为条件,通过迭代去噪生成一个干净的动作序列。扩散模型比 VAE 能更好地捕捉多模态分布(VAE 的样本有点模糊,扩散的样本更清晰),这使得它成为最可靠的 BC(行为克隆)方法之一。但代价是推理速度较慢,因为需要许多去噪步骤。

我们通过优化推理(Optimized Inference)来解决这个问题。生成动作块需要时间,但真实机器人以更高频率工作。因此我们将规划与执行解耦,分别为它们运行独立的进程:一个进程运行策略来生成动作块(规划器),另一个进程按所需速率(即高速)将这些动作流式传输给机器人。这样机器人就不会因等待模型思考而卡住,运动也会很平滑。

接下来我会介绍通用型机器人策略(generalist robot policies)和基础模型(foundation models)。

Khushi (@starlitmatcha): 阅读了有关生成模型的内容,以及为什么我们在机器人技术中首先需要它们。朴素的 BC(行为克隆)由于其确定性行为,无法处理多模态演示,所以显而易见的直觉是停止预测单个动作,而是学习好动作的整个分布,

相似文章

扩散语言模型的动态分块

arXiv cs.CL

本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。

离线到在线强化学习的自适应 Q 分块

arXiv cs.LG

本文介绍了自适应 Q 分块(AQC),这是一种强化学习方法,能够动态选择动作分块大小,以平衡反应式控制与长期规划。该方法在 OGBench 和 Robomimic 上取得了最先进的结果,提升了大规模 VLA 模型在机器人任务中的性能。

@dair_ai: https://x.com/dair_ai/status/2068724104815890889

X AI KOLs Following

重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。