PAIWorld: 面向机器人操作的三维一致世界基础模型
摘要
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
查看缓存全文
缓存时间: 2026/06/18 03:55
论文页面 - PAIWorld: 面向机器人操作的3D一致世界基础模型
来源: https://huggingface.co/papers/2606.18375 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
PAIWorld 通过几何感知和跨视角注意力增强了扩散变换器世界模型,提升了机器人操作任务中的多视角3D一致性。
世界基础模型 (https://huggingface.co/papers?q=World%20foundation%20models) (WFM) 是强大的模拟器,但它们主要运行在单视角设置下,缺乏机器人操作 (https://huggingface.co/papers?q=robotic%20manipulation) 所需的多视角3D一致性 (https://huggingface.co/papers?q=3D%20consistency)。虽然机器人系统依赖多摄像头(第一人称、眼到手和手腕安装)进行策略学习,但当前的多视角世界模型只是简单拼接视角标记,缺乏显式的几何推理。这导致了跨视角物体漂移、深度不一致和纹理错位。我们将这些失败归因于两个不足:缺乏显式的视角间通信机制和缺少3D几何先验。我们认为同时解决这两个问题既必要又充分。为此,我们提出了 PAIWorld,一个通过三个核心组件增强扩散变换器 (https://huggingface.co/papers?q=diffusion-transformer) 世界模型的框架:(1) 几何感知跨视角注意力 (https://huggingface.co/papers?q=Cross-View%20Attention) 模块,建立跨视角的显式通路;(2) 几何旋转位置编码 (https://huggingface.co/papers?q=Geometric%20Rotary%20Position%20Embedding),将相机射线方向和外部位姿编码到注意力机制中;(3) 潜在3D-REPA (https://huggingface.co/papers?q=Latent%203D-REPA),从冻结的3D基础模型中提取3D感知特征以确保3D一致性 (https://huggingface.co/papers?q=3D%20consistency)。基于 DiT 世界基础模型构建的 PAIWorld 在机器人操作 (https://huggingface.co/papers?q=robotic%20manipulation) 基准上实现了最先进的多视角3D一致性 (https://huggingface.co/papers?q=3D%20consistency),在 WorldArena (https://huggingface.co/papers?q=WorldArena) 排行榜上排名第一,在 AgiBot-Challenge2026 (https://huggingface.co/papers?q=AgiBot-Challenge2026) 排行榜上排名第二,同时支持下游应用,如基于模型的规划、世界行动模型和多视角策略后训练。
查看 arXiv 页面 (https://arxiv.org/abs/2606.18375)查看 PDF (https://arxiv.org/pdf/2606.18375)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.18375)
在你的代理中获取此论文:
hf papers read 2606\.18375
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.18375 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.18375 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.18375 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
WEAVER:更好、更快、更长 —— 一种有效的机器人操作世界模型
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。
InternW0:用于高效真实世界交互的基础物理世界模型
InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。
RynnWorld-4D: 面向机器人操作的4D具身世界模型
RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。
GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。