反事实视频生成实现可扩展的人形机器人行走-操作技能
摘要
PRISM 是一个 real-to-sim-to-real(真实-仿真-真实)框架,通过视频到视频(V2V)生成将少量真实的人-物交互视频放大为数百个多样的反事实视频,随后重建物理上合理的动作,从而训练出可泛化的人形机器人行走-操作策略,并直接部署在真实机器人上,无需真实世界微调。
查看缓存全文
缓存时间: 2026/10/01 04:22
论文页面 - 反事实视频生成实现可扩展的类人机器人操作运动控制
来源:https://huggingface.co/papers/2609.38172
摘要
通过视觉模仿来教授类人机器人操作运动控制技能(如搬运各类物体),是迈向通用型机器人的一个有前景的路径。然而,收集多样且高质量的交互视频——例如能清晰展示人体全身、且与物体的交互过程无遮挡的片段——给该方法的规模化带来了实际障碍。我们提出 PRISM,一个“真实到仿真再到真实“(real-to-sim-to-real)框架,通过将少量真实视频扩充为大规模、多样化的训练集来突破这一限制。PRISM 首先利用视频到视频(video-to-video, V2V)生成技术,从少量真实示例视频中生成数百个多样化的“反事实“人-物交互视频。随后,我们基于接触锚定的“真实到仿真“管线重建人体与物体的运动,将这些不完美的视频数据重定向为物理上合理的运动轨迹。这些反事实视频之间的类内变化性,使我们能够训练单一策略,并使其泛化到每个类别中未见过的物体。我们在真实机器人上部署该策略(无需任何真实世界微调),展示了完整管线的有效性。仅依靠机载深度观测,我们的类人机器人即可在全新的实例、尺寸和初始配置下拾起、搬运并放下箱子、桶、容器和球等各类物体。
查看 arXiv 页面(https://arxiv.org/abs/2609.38172) 查看 PDF(https://arxiv.org/pdf/2609.38172) 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2609%38172)
在你的 agent 中获取本文:
hf papers read 2609.38172
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.38172 即可从本页面链接它。
引用本文的数据集 1
Amazon-FAR/far-prism-data 约 3 小时前更新 • 5 • 1(https://huggingface.co/datasets/Amazon-FAR/far-prism-data)
引用本文的 Spaces 0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.38172 即可从本页面链接它。
包含本文的收藏夹 0
没有收藏夹包含本文
将本文添加到收藏夹(https://huggingface.co/new-collection)即可从本页面链接它。
相似文章
GRAIL: 基于3D资产和视频先验的人形机器人运动操控生成
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。
OASIS:从仿真数据收集到现实世界人形机器人全身操控
OASIS是一个仿真数据驱动的框架,用于人形机器人全身操控,它使用3D生成模型和分层视运动策略。通过利用仿真中的域随机化,它在零样本迁移上取得了比真实机器人训练更好的性能。
LUCID:基于想象动力学的潜在技能统一控制,用于长时域人形机器人移动操作
本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。
ReImagine:以图像为先的可控高质量人体视频生成新思路
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。
CoInteract:通过空间结构化协同生成实现物理一致的人-物交互视频合成
CoInteract 提出端到端 Diffusion Transformer 框架,联合建模 RGB 外观与 HOI 几何,在零推理开销下生成物理合理、手脸稳定的人-物交互视频。