Fast LeWorldModel

Hugging Face Daily Papers 论文

摘要

Fast-LeWM 通过并行动作前缀预测替代自回归展开,加速视觉规划,减少长期预测中的计算成本和延迟累积。

联合嵌入预测架构(JEPAs),包括最新的 LeWorldModel(LeWM),已成为无需重建的视觉世界模型的有前景基础。然而,在视觉规划中,LeWM 通过反复应用局部的单步潜在状态转移模型来评估候选动作序列。这种自回归展开使得规划计算成本高昂,并随着规划范围的增长,使得预测轨迹遭受累积的潜在误差。我们提出 Fast LeWorldModel(Fast-LeWM),一种快速的潜在世界模型,用动作前缀预测替代重复的局部展开。给定当前潜在状态和一个候选动作序列,Fast-LeWM 编码其前缀,并并行预测执行这些前缀后到达的未来潜在状态。通过将动作前缀作为基本预测单元,Fast-LeWM 直接建模不同范围下积累的不同程度的动作效果。这种前缀级监督迫使模型学习状态如何在不同的动作前缀下连续演化,而不仅仅是拟合单步状态转移。在规划过程中,预测器可以使用编码动作序列中的最后一个前缀标记来评估对应的未来潜在状态,而无需显式遍历每个中间想象的步骤。在多个任务上,Fast-LeWM 在保持平均成功率优于 LeWM 的同时,大幅减少了规划时间,实现了更低的开环潜在损失,且随着展开范围的增加,损失增长显著变慢。
查看原文
查看缓存全文

缓存时间: 2026/06/26 02:03

论文页面 - Fast-LeWorldModel

来源:https://huggingface.co/papers/2606.26217

摘要

Fast-LeWM 通过将自回归展开替换为并行动作前缀预测来加速视觉规划,从而降低计算成本并减少长期预测中的延迟累积。

联合嵌入预测架构(https://huggingface.co/papers?q=Joint-Embedding%20Predictive%20Architectures)(JEPA),包括最新的 LeWorldModel(https://huggingface.co/papers?q=LeWorldModel)(LeWM),已成为无重建视觉世界模型的有前景基础。然而,在视觉规划(https://huggingface.co/papers?q=visual%20planning)中,LeWM 通过反复应用局部单步潜在转移模型(https://huggingface.co/papers?q=latent%20transition%20model)来评估候选动作序列。这种自回归展开(https://huggingface.co/papers?q=autoregressive%20rollout)使得规划计算成本高昂,并且随着规划时域的增长,预测轨迹会累积潜在误差。我们提出 Fast-LeWorldModel(https://huggingface.co/papers?q=LeWorldModel)(Fast-LeWM),一种快速潜在世界模型(https://huggingface.co/papers?q=latent%20world%20model),它用动作前缀预测(https://huggingface.co/papers?q=action-prefix%20prediction)替代重复的局部展开。给定当前潜在状态和候选动作序列,Fast-LeWM 编码其前缀,并并行预测执行这些前缀后所到达的未来潜在状态。通过将动作前缀作为基本预测单元,Fast-LeWM 直接建模了动作效果在不同时域上的累积程度。这种前缀级监督(https://huggingface.co/papers?q=prefix-level%20supervision)迫使模型学习状态如何在不同动作前缀下连续演化,而不仅仅是拟合单步状态转移。在规划过程中,预测器可以直接使用编码动作序列中的最后一个前缀 token 来评估对应的未来潜在状态,而无需显式遍历每个中间想象状态。在多个任务中,Fast-LeWM 相比 LeWM 提高了平均成功率,同时大幅减少了规划时间,实现了更低的开环潜在损失(https://huggingface.co/papers?q=open-loop%20latent%20loss),且其增长随着展开时域的增加而显著变慢。

查看 arXiv 页面(https://arxiv.org/abs/2606.26217)查看 PDF(https://arxiv.org/pdf/2606.26217)GitHub(https://github.com/Yuntian-Gao/Fast-LeWorldModel)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26217)

在你的 agent 中获取这篇论文:

hf papers read 2606.26217

没有安装最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用这篇论文的模型 0

暂无模型关联这篇论文

在模型的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。

引用这篇论文的数据集 0

暂无数据集关联这篇论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。

引用这篇论文的 Spaces 0

暂无 Space 关联这篇论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。

包含这篇论文的收藏集 0

暂无收藏集包含这篇论文

将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。

相似文章

LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构

Papers with Code Trending

LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

Looped World Models

Hugging Face Daily Papers

Looped World Models 通过共享的Transformer块引入迭代潜在状态细化,实现了100倍的参数效率,同时根据预测复杂度自适应调整计算深度。