@RuohanZhang76:很高兴介绍由 @EvansXuHan 主导的 StereoPolicy。StereoPolicy 是一种为现代机器人策略模型添加几何线索的有效方法……
摘要
介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。
查看缓存全文
缓存时间: 2026/06/04 03:58
很高兴向大家介绍 StereoPolicy,该项目由 @EvansXuHan 领导。
StereoPolicy 是一种有效的方式,能够在保留预训练 2D 编码器优势的同时,为现代机器人策略模型添加几何线索。
为什么机器人操作需要立体视觉?
单目 RGB 通常缺乏精确操作所需的深度线索,而 RGB-D 和点云可能噪音大且脆弱,尤其是在实际部署中处理反光和透明物体时。
StereoPolicy 不显式重建视差、深度或点云,而是直接融合同步的左右 RGB 视图来学习隐式立体线索,避免了可能会妨碍实时操作的额外重建延迟。
项目页面:https://stereopolicy.github.io
StereoPolicy:通过立体感知改进机器人操作策略
来源:https://stereopolicy.github.io/ 黄煌¹,谢建文³,吴佳俊¹,李飞飞¹,张若涵¹,²
¹ 斯坦福大学 ² 西北大学 ³ Lambda, Inc
预印本
摘要
近期机器人模仿学习的进展产生了强大的视觉运动策略,能够从视觉输入操作多种物体。然而,单目观测缺乏深度信息,而深度信息对于在杂乱或几何复杂场景中进行精确操作至关重要。显式的深度图和点云在实际操作中往往噪音大且脆弱。我们提出了 StereoPolicy,一个视觉运动策略学习框架,它直接利用同步的立体图像对来改进几何推理,而无需构建显式的 3D 表示。StereoPolicy 使用预训练的 2D 视觉编码器处理每张图像,并通过基于交叉注意力的立体 Transformer 融合左右特征,隐式地捕获空间对应和视差线索。该框架与基于扩散的策略和预训练的视觉-语言-动作(VLA)策略集成,在三个模拟基准测试以及七个真实机器人桌面和双臂移动操作任务上,相较于 RGB、RGB-D、点云和多视角基线,均取得了持续的改进。我们的结果表明,立体视觉为机器人操作连接了 2D 预训练表示和 3D 几何理解。
StereoPolicy 的动机
RGB-D 和点云在实际部署中很脆弱
悬停可缩放
常规杯子悬挂
外部视角立体 RGB 参考
左相机右相机 常规杯子悬挂任务深度可视化
深度可视化深度丢失了杯子把手和薄架子几何结构。
常规杯子悬挂任务点云可视化
点云可视化点云使杯子和架子结构变形。
玻璃杯悬挂
外部视角立体 RGB 参考
左相机右相机 玻璃杯悬挂任务深度可视化
深度可视化深度丢失了透明杯子表面。
玻璃杯悬挂任务点云可视化
点云可视化点云丢失了大部分玻璃杯几何结构。
StereoPolicy 概述
悬停某个模块,然后点击高亮并阅读其工作原理。
StereoPolicy 管线概述
点击管线中的一个模块
StereoPolicy 直接将同步的立体图像转化为具有几何感知的策略特征,桥接了预训练的 2D 视觉表示与隐式的 3D 空间推理。
StereoPolicy 的管线。 一个立体感知模块,用于提取机器人策略的几何感知特征。得到的表示可以无缝集成到扩散策略和 VLA 模型中,无需修改它们的主干架构。
- StereoPolicy-DP 将立体编码器集成到扩散策略中,在每个基准测试任务上从头训练。
- StereoPolicy-VLA 将立体编码器与预训练的 VLA 模型相结合,并对系统进行微调。
真实世界部署
双臂移动操作
打开收音机
PnP 吐司
双臂移动操作
StereoPolicy-VLA (Pi0.5) 在双臂移动操作任务上的性能(真实环境和模拟环境,成功次数/20 次试验)。
桌面操作
交互式演示
选择一个桌面任务来查看其同步的第三人称和手腕立体视图。
视频按原始 3x 速度录制。
PnP 香蕉
外部立体视图
左相机右相机
手腕立体视图
左相机右相机
性能
桌面操作
方法香蕉 PnP吐司 插入塑料 杯子悬挂钢 杯子悬挂玻璃 杯子悬挂平均成功率 (%)RGB12/207/2012/2010/201/2042.0%RGBD14/208/2011/208/200/2041.0%RGBD-3DDA13/209/2013/2010/200/2045.0%PCD-PointNet7/200/205/202/200/2014.0%PCD-DP311/203/208/205/200/2027.0%多视角13/208/2013/209/201/2044.0%StereoPolicy-DP16/2012/2015/2013/203/2059.0% 真实世界桌面任务性能。 StereoPolicy-DP 始终优于其他视觉模态。PCD 在所有实际任务中表现最差;RGBD 和 PCD 在玻璃杯悬挂任务上均失败。
基线模态失败案例
移动操作
失败案例 1
收音机把手抓取不精确。
失败案例 2
按钮按压不精确。
失败案例 3
吐司抓取不精确。
桌面操作
桌面失败视频以 2 倍速度显示。
失败案例 1
吐司未对准插槽。
失败案例 2
插入未对准。
失败案例 3
杯子抓取未成功。
失败案例 4
把手插入不精确。
失败案例 5
透明杯子未成功。
模拟基准测试
跨 OmniGibson、RoboCasa 和 RoboMimic 的模拟基准测试#### 扩散策略性能
方法OmniGibsonRoboMimic草莓倒水开门打开收音机工具悬挂方块运输100200100200100200200300100200200300100200100200100200RGB59.0%88.0%10.0%46.0%26.0%77.0%42.0%71.0%53.0%90.0%74.0%98.0%92.0%94.0%RGB-D63.0%85.0%16.0%52.0%31.0%80.0%47.0%73.0%56.0%88.0%79.0%92.0%**94.0%**94.0%RGBD-3DDA74.0%93.0%26.0%61.0%48.0%**100.0%**46.0%75.0%84.0%92.0%83.0%97.0%**94.0%****96.0%**PCD-DP345.0%63.0%3.0%31.0%30.0%69.0%35.0%64.0%40.0%76.0%69.0%88.0%63.0%72.0%多视角68.0%89.0%21.0%52.0%31.0%75.0%43.0%71.0%54.0%92.0%78.0%96.0%92.0%94.0%StereoPolicy-DP82.0%100.0%34.0%70.0%57.0%100.0%55.0%82.0%94.0%96.0%88.0%100.0%94.0%96.0% 不同视觉模态下扩散策略的模拟任务性能。 立体输入持续提升性能,尤其是在低数据量情况下。
VLA 在 RoboCasa-Kitchen 24 项任务上的平均性能
Pi0.575%40%48.7151.7267.6471.5470.3174.4030100300演示数量RGB立体GROOT-N1.575%40%44.9847.1263.5866.1764.3067.5030100300演示数量RGB立体StereoPolicy-VLA 在 RoboCasa-Kitchen 24 项任务上的平均性能。
引用
@misc{han2026stereopolicyimprovingroboticmanipulation, title={StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception}, author={Evans Han and Yunfan Jiang and Yingke Wang and Haoyue Xiao and Huang Huang and Jianwen Xie and Jiajun Wu and Li Fei-Fei and Ruohan Zhang}, year={2026}, eprint={2605.09989}, archivePrefix={arXiv}, primaryClass={cs.RO}, url={https://arxiv.org/abs/2605.09989}, }
相似文章
@HuggingPapers:用于机器人策略学习的几何动作模型,复用几何基础模型作为感知的骨干网络…
几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。
@artemZholus:谢谢!在第二篇论文(https://arxiv.org/abs/2605.06388)中,我们采用了您(和RAE)的方案,效果不错。
本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
αDepth:学习单次软边界分解用于立体转换
αDepth 引入了一种带有圆形Alpha表示(CAR)的分层表示,以解决立体转换中的软边界挑战,无需手动指导即可实现最先进的性能。
SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型
介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。