πR^2:反应式实时流策略
摘要
πR^2 提出了一种面向机器人操作的反应式实时流策略,将条件输入分为快速通道和慢速通道,并采用延迟自适应流调度,使得闭环重规划速度比基线策略快约4倍,成功率最高提升30%。
查看缓存全文
缓存时间: 2026/07/30 17:49
论文页面 - πR^2: 响应式实时流策略
来源:https://huggingface.co/papers/2607.26055
摘要
通用操作策略日益采用基于大型预训练骨干构建的动作分块流策略。此类分块以开环方式运行,因此策略无法响应执行中途到达的感知输入,牺牲了响应性。更频繁地重新规划可以恢复响应性,但感知-动作流水线(大型骨干加上多个去噪步骤)速度过慢:这种延迟禁止频繁重规划,导致已执行的动作过时,使得此类策略不适用于动态闭环控制。我们提出 πR^2,使这些策略既具响应性又具实时性,同时保留大型骨干、富有表现力的多模态策略以及多动作预测。基于扩散强制的逐位置噪声调度,πR^2 贡献了两个想法。首先,它将条件输入分为快速通道(本体感觉,每 tick 刷新)和异步更新的慢速通道(视觉-语言特征),从而使策略能在分块内对本体感觉作出响应,同时容忍过时的视觉信息。其次,一种延迟自适应流调度将在执行中的动作视为修复条件,并在每次调用时通过一个去噪步骤发射动作,使单个训练模型能适应不同的硬件延迟。πR^2 需要对现有架构进行最小改动,可从预训练策略微调得到:应用于真实 xArm6 + XHand 平台上的 GR00T-N1.7,它基本策略以约 4 倍的频率进行闭环重规划(A5000 GPU 上约 25Hz),每 40ms 对新鲜观测作出响应。在仿真和真实世界操作任务中,πR^2 相比最强基线在仿真中成功率提升高达 23%,在真实世界中提升高达 30%。项目页面:https://pi-r2-flow.github.io/
查看 arXiv 页面 (https://arxiv.org/abs/2607.26055)查看 PDF (https://arxiv.org/pdf/2607.26055)项目页面 (https://pi-r2-flow.github.io/)GitHub12 (https://github.com/pi-r2-flow/pi-r2-flow)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26055)
在您的 agent 中获取此论文:
hf papers read 2607.26055
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.26055 即可从此页面链接。
包含此论文的集合0
无集合包含此论文
将此论文添加到集合 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Warp RL: 重塑基础策略分布以适应动力学变化
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
@Haoyu_Xiong_:长期以来,成功率一直是评估机器人操作的主要指标。那么速度呢?今天,我们介绍……
介绍B-spline Policy (BSP),它将动作参数化为连续的B样条曲线,而不是离散的固定速率动作块,从而在低成本机器人臂上实现更快更平滑的操作。
@verityw_: 通用机器人策略能学习许多有用技能。面对新任务时,我们如何触发相关行为?我们…
介绍了流反转引导(FRS)方法,通过反向并重新去噪一个流匹配通用策略,将语义推理产生的粗略动作细化为精确的机器人动作,从而改进零样本控制并支持策略学习。
@svlevine: 扩散(或流)可生成出色策略,但用强化学习训练它们却出了名的困难:BPTT不稳定,RL…
新论文展示了如何通过用单位矩阵近似流去噪过程的雅可比矩阵来优化用于强化学习的流匹配行动者,使训练变得可行。
FlowR2A:学习奖励到动作分布的多模态驾驶规划
FlowR2A提出了一种新颖的方法,通过流匹配解码器将密集奖励监督与动态提议生成相结合,用于多模态驾驶规划,在NAVSIM基准测试上取得了最先进的结果。