HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略
摘要
HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。
查看缓存全文
缓存时间: 2026/07/29 03:50
论文页面 - HiFi-UMI: 仅从高保真UMI数据学习可部署的操作策略
来源:https://huggingface.co/papers/2607.25895 发布于 7月28日
#2 今日论文 (https://huggingface.co/papers/date/2026-07-29) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
学习可部署的操作策略受限于既高保真又可扩展的数据的稀缺性。真实机器人遥操作精确但扩展成本高;无机器人UMI易于扩展,当前实践主要将此类数据用于预训练,并在后训练阶段添加少量真实机器人“锚点“。我们探究:提升无机器人UMI数据的保真度,而非缩减真实机器人数据的比例,是否能够移除这一锚点。我们提出HiFi-UMI,一种便携式UMI数据生产系统,协同设计了轨迹精度、夹爪间相对位姿、同步和视场:头戴式离线立体惯性SLAM、原生而非重建的相对位姿、共享微秒级GPIO触发器,以及每只手配备两个覆盖约200度的广角相机。它在无需外部跟踪基础设施的情况下,达到了3mm的局部工作空间末端执行器精度。利用这一语料库,我们展示了零机器人后训练:仅基于HiFi-UMI演示数据后训练的策略可直接部署于真实机器人,并在涵盖视觉-语言-动作和世界-动作模型家族的三个骨干网络上与领域内遥操作性能相当,在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA上的成功率差异分别为-2.5、+3.1和-0.6个百分点;最强的策略在精密插入任务上达到85%,尽管遥操作基线是在评估场景中采集的,且没有HiFi-UMI轨迹来自该场景。在来自同一语料库的4000小时数据上进行预训练,使十个未见任务的动作误差降低了41%,并且在StarVLA-QwenPI上,真实机器人成功率额外提升了18.1个百分点。我们开源了HiFi-UMI-2K,包含2000小时的微秒级同步、超宽视场演示,每个演示都通过仿真回放自动重建和验证,为机器人学习社区提供了一个大规模、高保真的资源。
查看 arXiv 页面 (https://arxiv.org/abs/2607.25895)查看 PDF (https://arxiv.org/pdf/2607.25895)项目页面 (https://cloud.simpleai.tech/simple-world-lab/hifi-umi/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25895)
在您的代理中获取此论文:
hf papers read 2607.25895
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.25895 以从此页面链接。
引用该论文的数据集1
simple-world-lab/HiFi-UMI-2K 查看器• 约2小时前更新 • 192M • 3.05k • 4 (https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K)
引用该论文的Space0
没有Space链接此论文
请在Space README.md中引用 arxiv.org/abs/2607.25895 以从此页面链接。
包含该论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
实时全模态交互驱动的全身移动操作
Unitree发布UnifoLM-OminiA-0.3,一个用于全身移动操作的单一AI模型,具备实时全模态交互,可实现自主家庭护理与健康任务。
Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成
小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。
小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
openbmb/MiniCPM-RobotManip
OpenBMB发布了MiniCPM-RobotManip,这是一个1.5B参数的视觉-语言-动作模型,用于设备端机器人操控,通过高效的流式推理和长时视觉记忆,性能超越较大模型。
3D HAMSTER:通过三维轨迹引导连接分层视觉-语言-动作模型中的规划与控制
3D HAMSTER利用带深度编码的视觉-语言模型生成用于点云控制的三维轨迹,从而增强机器人操作能力,其表现优于二维引导的基线方法。