Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成
摘要
小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。
查看缓存全文
缓存时间: 2026/07/14 16:16
论文页面 - Xiaomi-Robotics-U0:基于世界基础模型的统一具身合成
来源:https://huggingface.co/papers/2607.11643 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
近期的基础图像与视频生成模型展现出强大的泛化能力和可控性,但其在具身场景中的直接应用受到多视图一致性、几何连贯性和机器人具身约束等要求的限制。现有方法通常采用有限的机器人数据对基础模型进行微调,往往牺牲了大规模预训练期间获得的视觉知识。我们提出了Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一的具身合成。该模型将具身生成视为基础图像和视频生成的扩展,并联合优化了文本到图像生成、图像编辑、具身场景生成、具身迁移以及具身视频生成。这一统一框架在保留预训练世界基础模型泛化能力的同时,使其适应具身场景。Xiaomi-Robotics-U0是首个支持跨多个机器人具身的高质量多视图场景生成,并引入结构化、可控的具身迁移以实现细粒度编辑,同时保持多视图一致性与交互动态的模型。它在单步生成和序列生成任务上取得了最先进的结果,在具身场景生成与迁移的人类评估中优于GPT-Image-2.0,在World Arena具身视频生成排名中位列第一,并在具有挑战性的真实世界操作任务中,将pi_0.5的分布外成功率从36.9%提升至63.2%。这些结果表明,基础世界模型既可以作为具身世界模型,也可以作为具身智能的可扩展数据引擎。代码和检查点可在 https://robotics.xiaomi.com/xiaomi-robotics-u0.html 获取。
查看arXiv页面 (https://arxiv.org/abs/2607.11643) 查看PDF (https://arxiv.org/pdf/2607.11643) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11643)
引用此论文的模型2
XiaomiRobotics/Xiaomi-Robotics-U0 Robotics• 34B• 更新约9小时前 • 13 • 3 (https://huggingface.co/XiaomiRobotics/Xiaomi-Robotics-U0)
XiaomiRobotics/Xiaomi-Robotics-U0-FlashAR Robotics• 38B• 更新约9小时前 • 5 • 3 (https://huggingface.co/XiaomiRobotics/Xiaomi-Robotics-U0-FlashAR)
引用此论文的数据集0
暂无数据集链接此论文
请在数据集的README.md中引用 arxiv.org/abs/2607.11643 以将其链接至此页面。
引用此论文的Spaces0
暂无Space链接此论文
请在Space的README.md中引用 arxiv.org/abs/2607.11643 以将其链接至此页面。
包含此论文的集合0
暂无集合包含此论文
添加此论文至一个集合 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
小米开源具身智能基础模型Xiaomi-Robotics-1(4分钟阅读)
小米开源了Xiaomi-Robotics-1,这是一个在超过10万小时的UMI数据上预训练,并在1万小时以上的跨具身数据上后训练的具身AI基础模型。此次发布包含完整的真实机器人后训练与部署流程,旨在挑战Figure AI和Tesla的专有机器人模型。
Xiaomi-Robotics-1
小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
Enfold:将世界模型想象折叠为预测表示,实现超高效具身控制
提出Enfold方法,将世界模型中的多层级未来生成状态转移到预测表示中,用于超高效具身控制,在LIBERO和RoboTwin基准测试中取得高分,并显著降低动作延迟。