Enfold:将世界模型想象折叠为预测表示,实现超高效具身控制
摘要
提出Enfold方法,将世界模型中的多层级未来生成状态转移到预测表示中,用于超高效具身控制,在LIBERO和RoboTwin基准测试中取得高分,并显著降低动作延迟。
查看缓存全文
缓存时间: 2026/08/11 02:18
论文页面 - Enfold:将世界模型想象折叠进预测表示,实现超高效具身控制
来源:https://huggingface.co/papers/2607.26657 🚀 Enfold:将世界模型想象折叠进预测表示,实现超高效具身控制
世界模型真的需要在每个控制步骤都生成一个未来吗?
Enfold 探索了一个不同的思路:世界生成器最可复用的资产,或许不是它产出的未来,而是构建那个未来所需的计算过程。
在训练期间,Enfold 将多层级未来生成状态迁移到仅由当前观测和指令推断出的预测表示中。在部署时,动作预测不再运行世界生成器。
亮点:• LIBERO 上达到 97.8% • RoboTwin2.0 上达到 92.02% • Enfold-Flash 动作延迟仅 49 ms • 比基于生成的世界-动作建模延迟最高降低 10.1× • 包含 OOD 场景和人为扰动的真实机器人实验
我们希望能探索的更广泛问题:想象能否被内化为表示,而不是在推理时反复物化?
论文:arXiv:2607.26657 代码:github.com/zwl666666/enfold 项目主页:zwl666666.github.io/enfold
相似文章
Embodied-R1.5: 通过具身基础模型进化物理智能
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成
小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构
LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。
RynnWorld-4D: 面向机器人操作的4D具身世界模型
RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。