μ_0: 一种可扩展的3D交互轨迹世界模型

Hugging Face Daily Papers 论文

摘要

μ_0是一种可扩展的世界模型,可预测交互点的平滑3D轨迹,通过使用TraceExtract系统进行监督,实现无需动作标签的、与具身无关的机器人学习。

能够捕捉动作如何引发物理变化的世界模型,使得可扩展的机器人学习成为可能,且无需依赖特定具身的动作标签。像素空间的视频模型提供了广泛的视觉先验,但将模型能力消耗在密集的外观重建上;而直接的动作模型则需要特定具身的标签,这阻碍了可扩展性。我们提出μ_0,一种基于3D轨迹的可扩展世界模型。μ_0不是预测密集像素或直接建模动作,而是预测显著交互点(如物体、工具、手部和接触区域)的平滑3D轨迹,从而生成一种紧凑且与具身无关的运动接口。为了能够从多样化的视频源中进行训练,我们的TraceExtract系统通过选择关键点、构建全局对齐的轨迹并将运动片段与分层语言描述关联,自动提取3D监督信号。这种TraceExtract监督通过将预训练的视觉语言骨干网络与模块化轨迹专家相结合来预训练μ_0,其中轨迹专家通过B样条控制点表示每个查询并预测未来的轨迹。实验表明,μ_0在2D和3D轨迹预测方面均优于基线方法,包括轨迹预测模型和分词化VLM方法。由于μ_0是冻结且可复用的,它可以与动作专家配对,用于下游机器人具身。尽管进行了无动作预训练,但所得的轨迹条件策略在性能上与使用动作监督预训练的VLA模型(如π_0)相当。这些结果确立了3D轨迹作为跨具身操作的一种可扩展且可迁移的表征。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:05

论文页面 - μ_0:一种可扩展的3D交互轨迹世界模型

来源:https://huggingface.co/papers/2606.13769

摘要

一种名为 μ₀ 的可扩展世界模型,利用 3D 轨迹预测关键交互点的平滑运动轨迹,实现了无需动作标签的、与具身形态无关的机器人学习。

能够捕捉动作如何引发物理变化的世界模型(https://huggingface.co/papers?q=World%20models)使得可扩展的机器人学习成为可能,无需依赖特定具身形态的动作标签。像素空间视频模型提供了广泛的视觉先验,但将模型能力消耗在密集的外观重建上;而直接动作模型则需要特定具身形态的标签,阻碍了可扩展性。我们提出了 μ₀,一种基于 3D 轨迹(https://huggingface.co/papers?q=3D%20traces)的可扩展世界模型。不同于预测密集像素或直接建模动作,μ₀ 预测物体、工具、手和接触区域等显著交互点的平滑 3D 轨迹,从而形成一个紧凑且与具身形态无关的运动接口。为了能够从多样化的视频源进行训练,我们的 TraceExtract(https://huggingface.co/papers?q=TraceExtract)系统通过选择关键点、构建全局对齐的轨迹,并将运动片段与分层语言描述相关联,自动提取 3D 监督信号。这种 TraceExtract(https://huggingface.co/papers?q=TraceExtract)监督信号通过将预训练的视觉-语言骨干网络(https://huggingface.co/papers?q=vision-language%20backbone)与模块化轨迹专家(https://huggingface.co/papers?q=modular%20trace%20expert)相结合来预训练 μ₀,其中每个查询通过 B 样条控制点(https://huggingface.co/papers?q=B-spline%20control%20points)表示,并预测未来轨迹。实验表明,μ₀ 在 2D 和 3D 轨迹预测方面均优于基线方法,包括轨迹预测模型和分词化的 VLM 方法。由于 μ₀ 是冻结且可重用的,它可以与动作专家配对,用于下游机器人的具身形态。尽管采用了无动作预训练(https://huggingface.co/papers?q=action-free%20pretraining),最终得到的轨迹条件策略(https://huggingface.co/papers?q=trace-conditioned%20policies)在性能上可与使用动作监督预训练的 VLA 模型(https://huggingface.co/papers?q=VLA%20models)(例如 π₀)相媲美。这些结果确立了 3D 轨迹(https://huggingface.co/papers?q=3D%20traces)作为一种可扩展且可迁移的跨具身操控表示。

查看 arXiv 页面(https://arxiv.org/abs/2606.13769)查看 PDF(https://arxiv.org/pdf/2606.13769)项目页面(https://mu0-wm.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13769)

在您的智能体中获取此论文:

hf papers read 2606.13769

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.13769 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.13769 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.13769 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

ABot-M0.5: 统一移动与操作的世界动作模型

Hugging Face Daily Papers

ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

PhiZero:一个围绕物理语言构建的世界模型

Hugging Face Daily Papers

PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。