Enfold:将世界模型想象折叠为预测表示,实现超高效具身控制

Hugging Face Daily Papers 论文

摘要

提出Enfold方法,将世界模型中的多层级未来生成状态转移到预测表示中,用于超高效具身控制,在LIBERO和RoboTwin基准测试中取得高分,并显著降低动作延迟。

世界生成模型通常通过它们生成的内容来使用:渲染的未来、视频条件动作,或由昂贵的生成分支计算的潜在上下文。我们认为,它们更具可复用性的资产是构建未来的计算过程。当生成器将损坏的未来转换为连贯轨迹时,其中间状态在多个抽象层次上组织外观、空间布局和交互。这种未来生成计算能否被内化到仅从当前信息推断出的表示中?我们提出Enfold,它将这种计算转移到从当前视觉上下文和语言指令预测的表示中。在训练期间,生成器处理观察到的未来时暴露出的多层级状态监督一个仅使用当前信息的编码器。学习到的表示被反馈以条件化未来生成,并由任务头读取,而不允许任务梯度重塑编码器。在部署时,动作预测不再执行生成器。在LIBERO、RoboTwin2.0和真实机器人任务上,Enfold在支持强大控制的同时,相对于Fast--WAM将动作延迟降低了3.7倍,Enfold-Flash达到10.1倍。表示分析表明,它抑制了干扰变化,并优先捕获在更长时域中涌现的变化。当当前场景因人工干预而改变时,生成的延续和执行的动作都会适应,这与固定轨迹回放不一致。这些结果将世界生成器重新定义为预测控制表示的来源:如果其内部结构可以折叠到当下,则无需在每一步都将未来实体化。
查看原文
查看缓存全文

缓存时间: 2026/08/11 02:18

论文页面 - Enfold:将世界模型想象折叠进预测表示,实现超高效具身控制

来源:https://huggingface.co/papers/2607.26657 🚀 Enfold:将世界模型想象折叠进预测表示,实现超高效具身控制

世界模型真的需要在每个控制步骤都生成一个未来吗?

Enfold 探索了一个不同的思路:世界生成器最可复用的资产,或许不是它产出的未来,而是构建那个未来所需的计算过程。

在训练期间,Enfold 将多层级未来生成状态迁移到仅由当前观测和指令推断出的预测表示中。在部署时,动作预测不再运行世界生成器。

亮点:• LIBERO 上达到 97.8% • RoboTwin2.0 上达到 92.02% • Enfold-Flash 动作延迟仅 49 ms • 比基于生成的世界-动作建模延迟最高降低 10.1× • 包含 OOD 场景和人为扰动的真实机器人实验

我们希望能探索的更广泛问题:想象能否被内化为表示,而不是在推理时反复物化?

论文:arXiv:2607.26657 代码:github.com/zwl666666/enfold 项目主页:zwl666666.github.io/enfold

相似文章

Embodied-R1.5: 通过具身基础模型进化物理智能

Hugging Face Daily Papers

Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。

Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成

Hugging Face Daily Papers

小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。

LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构

Papers with Code Trending

LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。

RynnWorld-4D: 面向机器人操作的4D具身世界模型

Hugging Face Daily Papers

RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。