πR^2:反应式实时流策略

Hugging Face Daily Papers 论文

摘要

πR^2 提出了一种面向机器人操作的反应式实时流策略,将条件输入分为快速通道和慢速通道,并采用延迟自适应流调度,使得闭环重规划速度比基线策略快约4倍,成功率最高提升30%。

通用操作策略越来越趋向于基于大型预训练主干构建的动作分块流策略。这类分块以开环方式运行,因此策略无法响应执行过程中到达的感知输入,从而牺牲了反应能力。更频繁地重规划可以恢复反应性,但感知到动作的流水线(一个大型主干加上多个去噪步骤)速度过慢:这种延迟阻碍了频繁重规划,并使得已提交的动作过时,导致此类策略不适合动态闭环控制。我们提出 πR^2,它在保留大型主干、表达能力强的多模态策略和多动作预测的同时,使这些策略具备反应性和实时性。基于扩散强制的逐位置噪声调度,πR^2 贡献了两个想法。首先,它将条件输入分为快速通道(本体感知,每周期更新)和异步更新的慢速通道(视觉语言特征),从而使策略能在分块内对本体感知做出反应,同时容忍视觉信息的陈旧。其次,一种延迟自适应流调度将正在执行的动作视为补全条件,并在每次调用时通过一步去噪输出动作,使一个训练好的模型能够适应不同的硬件延迟。πR^2 只需对现有架构进行最小修改,即可从预训练策略微调而来:应用于实际 xArm6+XHand 平台上的 GR00T-N1.7,它实现了闭环重规划速度约为基础策略的 4 倍(在 A5000 GPU 上约 25Hz),每 40ms 基于新的观测执行动作。在模拟和真实世界的操作任务中,πR^2 的成功率相比最强基线在模拟中提升高达 23%,在真实世界中提升高达 30%。项目页面:https://pi-r2-flow.github.io/
查看原文
查看缓存全文

缓存时间: 2026/07/30 17:49

论文页面 - πR^2: 响应式实时流策略

来源:https://huggingface.co/papers/2607.26055

摘要

通用操作策略日益采用基于大型预训练骨干构建的动作分块流策略。此类分块以开环方式运行,因此策略无法响应执行中途到达的感知输入,牺牲了响应性。更频繁地重新规划可以恢复响应性,但感知-动作流水线(大型骨干加上多个去噪步骤)速度过慢:这种延迟禁止频繁重规划,导致已执行的动作过时,使得此类策略不适用于动态闭环控制。我们提出 πR^2,使这些策略既具响应性又具实时性,同时保留大型骨干、富有表现力的多模态策略以及多动作预测。基于扩散强制的逐位置噪声调度,πR^2 贡献了两个想法。首先,它将条件输入分为快速通道(本体感觉,每 tick 刷新)和异步更新的慢速通道(视觉-语言特征),从而使策略能在分块内对本体感觉作出响应,同时容忍过时的视觉信息。其次,一种延迟自适应流调度将在执行中的动作视为修复条件,并在每次调用时通过一个去噪步骤发射动作,使单个训练模型能适应不同的硬件延迟。πR^2 需要对现有架构进行最小改动,可从预训练策略微调得到:应用于真实 xArm6 + XHand 平台上的 GR00T-N1.7,它基本策略以约 4 倍的频率进行闭环重规划(A5000 GPU 上约 25Hz),每 40ms 对新鲜观测作出响应。在仿真和真实世界操作任务中,πR^2 相比最强基线在仿真中成功率提升高达 23%,在真实世界中提升高达 30%。项目页面:https://pi-r2-flow.github.io/

查看 arXiv 页面 (https://arxiv.org/abs/2607.26055)查看 PDF (https://arxiv.org/pdf/2607.26055)项目页面 (https://pi-r2-flow.github.io/)GitHub12 (https://github.com/pi-r2-flow/pi-r2-flow)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26055)

在您的 agent 中获取此论文:

hf papers read 2607.26055

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。

包含此论文的集合0

无集合包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Warp RL: 重塑基础策略分布以适应动力学变化

arXiv cs.LG

Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。