反事实视频生成实现可扩展的人形机器人行走-操作技能

Hugging Face Daily Papers 论文

摘要

PRISM 是一个 real-to-sim-to-real(真实-仿真-真实)框架,通过视频到视频(V2V)生成将少量真实的人-物交互视频放大为数百个多样的反事实视频,随后重建物理上合理的动作,从而训练出可泛化的人形机器人行走-操作策略,并直接部署在真实机器人上,无需真实世界微调。

通过视觉模仿向人形机器人教授行走-操作技能(如搬运多种物体),是实现通用机器人的有前景的路径。然而,收集多样且高质量的交互视频——例如清晰展示人体全貌、且与物体交互无遮挡的片段——构成了扩展这一方法的实际障碍。我们提出 PRISM,这是一个 real-to-sim-to-real(真实-仿真-真实)框架,通过将少量真实视频放大为大规模、多样化的训练集来克服这一局限。PRISM 首先从少量真实的示例视频出发,通过视频到视频(V2V)生成数百个多样的“反事实”人-物交互视频。随后,我们基于接触锚定的 real-to-sim 流水线同时重建人体与物体的运动,将这些不完美的视频数据重定向为物理上合理的轨迹。这些反事实视频之间所包含的类内多样性,使我们能够训练出单一策略,并泛化到每一类别中未见过的物体。我们通过将该策略部署到真实机器人上且不进行任何真实世界微调,展示了完整的流水线。仅使用机载深度观测,我们的人形机器人即可在全新的实例、尺寸和初始构型下拾取、搬运并放置物体,包括箱子、桶、收纳箱和球。
查看原文
查看缓存全文

缓存时间: 2026/10/01 04:22

论文页面 - 反事实视频生成实现可扩展的类人机器人操作运动控制

来源:https://huggingface.co/papers/2609.38172

摘要

通过视觉模仿来教授类人机器人操作运动控制技能(如搬运各类物体),是迈向通用型机器人的一个有前景的路径。然而,收集多样且高质量的交互视频——例如能清晰展示人体全身、且与物体的交互过程无遮挡的片段——给该方法的规模化带来了实际障碍。我们提出 PRISM,一个“真实到仿真再到真实“(real-to-sim-to-real)框架,通过将少量真实视频扩充为大规模、多样化的训练集来突破这一限制。PRISM 首先利用视频到视频(video-to-video, V2V)生成技术,从少量真实示例视频中生成数百个多样化的“反事实“人-物交互视频。随后,我们基于接触锚定的“真实到仿真“管线重建人体与物体的运动,将这些不完美的视频数据重定向为物理上合理的运动轨迹。这些反事实视频之间的类内变化性,使我们能够训练单一策略,并使其泛化到每个类别中未见过的物体。我们在真实机器人上部署该策略(无需任何真实世界微调),展示了完整管线的有效性。仅依靠机载深度观测,我们的类人机器人即可在全新的实例、尺寸和初始配置下拾起、搬运并放下箱子、桶、容器和球等各类物体。

查看 arXiv 页面(https://arxiv.org/abs/2609.38172) 查看 PDF(https://arxiv.org/pdf/2609.38172) 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2609%38172)

在你的 agent 中获取本文:

hf papers read 2609.38172

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.38172 即可从本页面链接它。

引用本文的数据集 1

Amazon-FAR/far-prism-data 约 3 小时前更新 • 5 • 1(https://huggingface.co/datasets/Amazon-FAR/far-prism-data)

引用本文的 Spaces 0

没有 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.38172 即可从本页面链接它。

包含本文的收藏夹 0

没有收藏夹包含本文

将本文添加到收藏夹(https://huggingface.co/new-collection)即可从本页面链接它。

相似文章