HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略

Hugging Face Daily Papers 论文

摘要

HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。

学习可部署的操作策略受限于既高保真又可扩展的数据稀缺。真实机器人遥操作虽精准但成本高难以扩展;无机器人的UMI采集易于扩展,当前实践主要将所得数据用于预训练,并在后训练阶段添加少量真实机器人“锚点”。我们探究是否可以通过提升无机器人UMI数据的保真度(而非缩小真实机器人数据比例)来消除这一锚点。我们提出HiFi-UMI,一种便携式UMI数据生产系统,协同设计了轨迹精度、夹爪间相对位姿、同步与视野:头戴式离线立体惯性SLAM、原生而非重建的相对位姿、共享微秒级GPIO触发信号,以及每只手覆盖约200度的两个广角摄像头。该系统在无外部跟踪基础设施的情况下达到了3毫米工作空间内末端执行器精度。利用这一数据集,我们实现了零机器人后训练:仅依靠HiFi-UMI演示数据后训练的策略可直接部署到真实机器人上,并在三个涵盖视觉-语言-动作与世界-动作-模型家族的骨干网络上与域内遥操作性能相当,在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA上的成功率差异分别为-2.5、+3.1和-0.6个百分点;最强策略在精确插入任务上达到85%的成功率,尽管遥操作基线是在评估场景中采集的,而HiFi-UMI轨迹并非如此。在同一数据集上进行4000小时的预训练使十个未见任务的动作误差降低了41%,并在StarVLA-QwenPI上将真实机器人成功率进一步提升了18.1个百分点。我们开源了HiFi-UMI-2K——2000小时的微秒同步、超宽视野演示数据,每条轨迹均通过仿真回放自动重建与验证,为机器人学习社区提供了大规模、高保真的资源。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

论文页面 - HiFi-UMI: 仅从高保真UMI数据学习可部署的操作策略

来源:https://huggingface.co/papers/2607.25895 发布于 7月28日

#2 今日论文 (https://huggingface.co/papers/date/2026-07-29) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

学习可部署的操作策略受限于既高保真又可扩展的数据的稀缺性。真实机器人遥操作精确但扩展成本高;无机器人UMI易于扩展,当前实践主要将此类数据用于预训练,并在后训练阶段添加少量真实机器人“锚点“。我们探究:提升无机器人UMI数据的保真度,而非缩减真实机器人数据的比例,是否能够移除这一锚点。我们提出HiFi-UMI,一种便携式UMI数据生产系统,协同设计了轨迹精度、夹爪间相对位姿、同步和视场:头戴式离线立体惯性SLAM、原生而非重建的相对位姿、共享微秒级GPIO触发器,以及每只手配备两个覆盖约200度的广角相机。它在无需外部跟踪基础设施的情况下,达到了3mm的局部工作空间末端执行器精度。利用这一语料库,我们展示了零机器人后训练:仅基于HiFi-UMI演示数据后训练的策略可直接部署于真实机器人,并在涵盖视觉-语言-动作和世界-动作模型家族的三个骨干网络上与领域内遥操作性能相当,在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA上的成功率差异分别为-2.5、+3.1和-0.6个百分点;最强的策略在精密插入任务上达到85%,尽管遥操作基线是在评估场景中采集的,且没有HiFi-UMI轨迹来自该场景。在来自同一语料库的4000小时数据上进行预训练,使十个未见任务的动作误差降低了41%,并且在StarVLA-QwenPI上,真实机器人成功率额外提升了18.1个百分点。我们开源了HiFi-UMI-2K,包含2000小时的微秒级同步、超宽视场演示,每个演示都通过仿真回放自动重建和验证,为机器人学习社区提供了一个大规模、高保真的资源。

查看 arXiv 页面 (https://arxiv.org/abs/2607.25895)查看 PDF (https://arxiv.org/pdf/2607.25895)项目页面 (https://cloud.simpleai.tech/simple-world-lab/hifi-umi/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25895)

在您的代理中获取此论文:

hf papers read 2607.25895

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.25895 以从此页面链接。

引用该论文的数据集1

simple-world-lab/HiFi-UMI-2K 查看器• 约2小时前更新 • 192M • 3.05k • 4 (https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K)

引用该论文的Space0

没有Space链接此论文

请在Space README.md中引用 arxiv.org/abs/2607.25895 以从此页面链接。

包含该论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成

Hugging Face Daily Papers

小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。

openbmb/MiniCPM-RobotManip

Hugging Face Models Trending

OpenBMB发布了MiniCPM-RobotManip,这是一个1.5B参数的视觉-语言-动作模型,用于设备端机器人操控,通过高效的流式推理和长时视觉记忆,性能超越较大模型。