LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构

Papers with Code Trending 论文

摘要

LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。

联合嵌入预测架构(JEPAs)为在紧凑潜在空间中学习世界模型提供了一个极具前景的框架,然而现有方法仍然脆弱,依赖复杂的多项损失、指数移动平均、预训练编码器或辅助监督来避免表征坍塌。在本工作中,我们引入了 LeWorldModel(LeWM),这是首个能够从原始像素稳定进行端到端训练的 JEPA,仅使用两项损失:下一嵌入预测损失,以及强制潜在嵌入服从高斯分布的正则化项。与现有唯一的端到端替代方案相比,这将可调的损失超参数从六个减少到一个。LeWM 拥有约 1500 万个参数,可在单张 GPU 上几小时内完成训练,其规划速度比基于基础模型的世界模型快达 48 倍,同时在多种 2D 和 3D 控制任务中保持竞争力。除控制任务外,我们还通过物理量的探测实验表明,LeWM 的潜在空间编码了有意义的物理结构。惊奇度评估证实,该模型能够可靠地检测物理上不可信的事件。
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:00

论文页面 - LeWorldModel:基于像素的稳定端到端联合嵌入预测架构

来源:https://huggingface.co/papers/2603.19312

以下是 LeWorldModel (LeWM) 的主要成果,按关键贡献组织:

https://huggingface.co/papers/2603.19312#1-stable-end-to-end-training-with-minimal-hyperparameters1. 最少超参数实现稳定端到端训练

创新点: LeWM 是首个仅使用两项损失就能从原始像素稳定地进行端到端训练的 JEPA(Joint-Embedding Predictive Architecture)世界模型:

  • 下一嵌入预测损失(MSE)
  • SIGReg:通过随机投影和 Epps-Pulley 正态性检验强制潜在嵌入服从高斯分布的正则化项

意义所在: 先前工作需要复杂的多项损失(PLDM 使用 7 项)、指数移动平均、停止梯度技巧或冻结的预训练编码器来防止表征崩溃。LeWM 消除了这些启发式方法,同时提供了可证明的防崩溃保证。

图 1:训练流程 (https://arxiv.org/html/2603.19312v1/x1.png) 图 1:LeWM 联合训练编码器和预测器。SIGReg 将潜在嵌入投影到随机方向并应用正态性检验,无需停止梯度或 EMA 即可防止崩溃。

关键对比(图 2):

方法端到端任务无关基于像素崩溃保证超参数数量
PLDM6(不稳定)
DINO-WM✗(冻结编码器)少量
LeWM1 (λ)

https://huggingface.co/papers/2603.19312#2-planning-performance-and-efficiency2. 规划性能与效率

LeWM 实现了比基于基础模型的方法快 48 倍的规划速度,同时保持竞争力能:

图 3:效率与性能 (https://arxiv.org/html/2603.19312v1/x3.png) 图 3:左图:规划时间对比。LeWM 比 DINO-WM 少用约 200 倍 token,达到与 PLDM 相当的速度,同时比 DINO-WM 快约 50 倍。中/右图:在固定计算预算下,LeWM 在 Push-T 和 OGBench-Cube 上优于 DINO-WM。

定量结果(图 6):

  • Push-T:比 PLDM(唯一其他端到端方法)成功率高 18%;即使 DINO-WM 使用额外本体感觉输入,LeWM 仍能超越
  • Reacher:与所有基线相比具有竞争力或更优
  • OGBench-Cube:略低于 DINO-WM(可能由于 3D 视觉复杂性),但远高于 PLDM
  • Two-Room:低于基线(已知局限:SIGReg 的高斯先验对于低维简单环境可能过强)

图 6:规划性能 (https://arxiv.org/html/2603.19312v1/x8.png) 图 6:各环境成功率。LeWM 始终优于 PLDM,在大多数任务上达到或超过 DINO-WM,除了简单的 Two-Room 导航任务。

计算效率:

  • 1500 万参数(微型 ViT 编码器 + 预测器)
  • 单 GPU 上数小时完成训练(对比大型基础模型)
  • 规划在一秒内完成

https://huggingface.co/papers/2603.19312#3-physical-understanding-in-latent-space3. 潜在空间中的物理理解

LeWM 的潜在空间无需显式监督即可捕捉有意义的物理结构:

探测结果(表 1,图 7): 在冻结的 LeWM 嵌入上训练的线性和非线性探针能准确预测物理量(智能体位置、方块位置/速度、末端执行器姿态)。LeWM 始终优于 PLDM,在大多数指标上接近 DINOv2(在 1.24 亿张图像上训练)。

图 7:预测器推演 (https://arxiv.org/html/2603.19312v1/x12.png) 图 7:开环潜在预测解码回像素。模型准确预测未来状态(智能体/方块运动),确认潜在空间保留了物理动态。

图 9:潜在空间可视化 (https://arxiv.org/html/2603.19312v1/x15.png) 图 9:Push-T 嵌入的 t-SNE 可视化。潜在空间保留了空间邻域结构——2D 工作空间中相近的点在潜在空间中仍保持相近。

违反预期(图 10): LeWM 可靠地检测物理上不可行的事件(物体瞬移),但忽略视觉扰动(颜色变化),展示了真正的物理理解而非表面视觉匹配。

图 10:VoE 结果 (https://arxiv.org/html/2603.19312v1/x16.png) 图 10:当物体瞬移(物理违反)时,惊讶信号显著飙升,但当物体颜色变化(视觉扰动)时则不飙升,在三个环境(TwoRoom、PushT、OGBench Cube)中均是如此。

https://huggingface.co/papers/2603.19312#4-training-stability-and-ablations4. 训练稳定性与消融实验

训练动态: 与 PLDM 嘈杂、非单调的七项目标不同,LeWM 表现出平滑、稳定的收敛(附录 I)。SIGReg 项在训练早期急剧下降然后趋于平稳,表明潜在分布快速匹配目标高斯分布。

鲁棒性(附录 G):

  • 单一超参数:仅需调节 λ(SIGReg 权重);在 λ ∈ [0.01, 0.2] 范围内性能保持高位
  • 架构无关:适用于 ViT 和 ResNet-18 编码器
  • 低方差:跨种子成功率方差低于 PLDM
  • 时间平直自然涌现:潜在轨迹随训练变得越来越直(连续速度向量间余弦相似度高于 PLDM,尽管没有显式的时间平滑损失)

https://huggingface.co/papers/2603.19312#summary总结

LeWM 证明,通过合理的两项式目标,从像素进行稳定、端到端的世界建模是可能的。它消除了先前 JEPA 方法的工程复杂性(将可调损失超参数从六个减少到一个),实现比基础模型方法快 48 倍的规划速度,并学习了编码真正物理结构的潜在空间,该空间通过探测和违反预期测试得到验证。

相似文章

Fast LeWorldModel

Hugging Face Daily Papers

Fast-LeWM 通过并行动作前缀预测替代自回归展开,加速视觉规划,减少长期预测中的计算成本和延迟累积。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。