Xiaomi-Robotics-1:新一代机器人模型发布

Reddit r/LocalLLaMA 模型

摘要

小米发布了 XR-1,这是一个机器人基础模型,基于超过 10 万小时的真实世界操作轨迹进行训练。它基于 Qwen3-VL 和 Diffusion Transformer 构建,能够在未见过的环境中实现开箱即用的移动操作。

Xiaomi-Robotics-1 是一个机器人基础模型,基于超过 10 万小时的真实世界操作轨迹进行训练。它是一个视觉-语言-动作(Vision-Language-Action, VLA)模型,专为在未见环境中实现开箱即用的移动操作以及高效适应新任务而设计。XR-1 采用受大型语言模型启发的两阶段训练范式——先进行预训练以获取广度,再进行后训练以实现对齐。它展示了预训练的扩展行为能够可靠地通过后训练迁移到真实世界机器人性能上,且没有饱和迹象。XR-1 通过 Transformer 混合(Mixture-of-Transformers, MoT)将预训练的 VLM(Qwen3-VL)与 Diffusion-Transformer(DiT)耦合在一起——DiT 的层数与 VLM 相同,但使用更小的隐藏尺寸以实现更快的推理。HugginFace: https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-1 GitHub: https://github.com/XiaomiRobotics/Xiaomi-Robotics-1 Paper: https://arxiv.org/abs/2607.15330
查看原文

相似文章

Xiaomi-Robotics-1

Hacker News Top

小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。

小米开源具身智能基础模型Xiaomi-Robotics-1(4分钟阅读)

TLDR AI

小米开源了Xiaomi-Robotics-1,这是一个在超过10万小时的UMI数据上预训练,并在1万小时以上的跨具身数据上后训练的具身AI基础模型。此次发布包含完整的真实机器人后训练与部署流程,旨在挑战Figure AI和Tesla的专有机器人模型。