Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
Summary
Xiaomi Robotics introduces U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis, treating embodied generation as an extension of image and video generation. It achieves state-of-the-art results on multiple embodied tasks, outperforming GPT-Image-2.0 and improving real-world manipulation success rates.
View Cached Full Text
Cached at: 07/14/26, 04:16 PM
Paper page - Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
Source: https://huggingface.co/papers/2607.11643 Authors:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
Abstract
Recentfoundationimageandvideogenerationmodelsofferstronggeneralizationandcontrollability,buttheirdirectapplicationtoembodiedscenariosislimitedbyrequirementsformulti-viewconsistency,geometriccoherence,androbotembodimentconstraints.Existingmethodstypicallyadaptfoundationmodelswithlimitedrobotdata,oftensacrificingvisualknowledgeacquiredduringlarge-scalepre-training.WepresentXiaomi-Robotics-U0,a38-billion-parametermultimodalautoregressivemodelforunifiedembodiedsynthesis.Ittreatsembodiedgenerationasanextensionoffoundationimageandvideogenerationandjointlyoptimizestext-to-imagegeneration,imageediting,embodiedscenegeneration,embodiedtransfer,andembodiedvideogeneration.Thisunifiedframeworkpreservesthegeneralizationofthepre-trainedworldfoundationmodelwhileadaptingittoembodiedsettings.Xiaomi-Robotics-U0isthefirstmodeltosupporthigh-qualitymulti-viewscenegenerationacrossmultiplerobotembodimentsandtointroducestructured,controllableembodiedtransferforfine-grainededitingwhilepreservingmulti-viewconsistencyandinteractiondynamics.Itachievesstate-of-the-artresultsonsingle-stepandsequentialgenerationtasks,outperformingGPT-Image-2.0inhumanevaluationsofembodiedscenegenerationandtransfer,rankingfirstonWorldArenaforembodiedvideogeneration,andimprovingtheout-of-distributionsuccessrateofpi_0.5from36.9%to63.2%onchallengingreal-worldmanipulationtasks.Theseresultsshowthatfoundationworldmodelscanservebothasembodiedworldmodelsandscalabledataenginesforembodiedintelligence.Codeandcheckpointsareavailableathttps://robotics.xiaomi.com/xiaomi-robotics-u0.html.
View arXiv pageView PDFAdd to collection
Models citing this paper2
#### XiaomiRobotics/Xiaomi-Robotics-U0 Robotics• 34B• Updatedabout 9 hours ago • 13 • 3
#### XiaomiRobotics/Xiaomi-Robotics-U0-FlashAR Robotics• 38B• Updatedabout 9 hours ago • 5 • 3
Datasets citing this paper0
No dataset linking this paper
Cite arxiv.org/abs/2607.11643 in a dataset README.md to link it from this page.
Spaces citing this paper0
No Space linking this paper
Cite arxiv.org/abs/2607.11643 in a Space README.md to link it from this page.
Collections including this paper0
No Collection including this paper
Add this paper to acollectionto link it from this page.
Similar Articles
Xiaomi Open-Sources Embodied AI Foundation Model Xiaomi-Robotics-1 (4 minute read)
Xiaomi open-sourced Xiaomi-Robotics-1, an embodied AI foundation model pretrained on over 100,000 hours of UMI data and post-trained on 10,000+ hours of cross-embodiment data. The release includes the full real-robot post-training and deployment pipeline, aiming to challenge proprietary robotics models from Figure AI and Tesla.
Xiaomi-Robotics-1
Xiaomi presents Robotics-1, a robot policy model trained via embodiment-free pre-training on 100,000 hours of data, showing clean scaling behavior and strong generalization to real-world tasks.
Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
Qwen-RobotWorld is a language-conditioned video world model that predicts future visual trajectories across multiple robotic domains using a double-stream diffusion transformer and an 8.6M video-text corpus. It unifies embodied world modeling for robotic manipulation, autonomous driving, indoor navigation, and human-to-robot transfer, achieving top benchmarks on EWMBench and DreamGen Bench.
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi introduces Xiaomi-Robotics-1, a vision-language-action foundation model trained on over 100,000 hours of real-world manipulation trajectories, demonstrating clear scaling laws and achieving high success rates on real-world tasks with minimal fine-tuning data.
@AdinaYakup: Xiaomi Robotics just released a smol embodied world model on @huggingface https://huggingface.co/collections/XiaomiRobo…
Xiaomi Robotics has released a compact embodied world model, including a 4B version and sequence variants, on Hugging Face with Apache 2.0 license.