Fast LeWorldModel
摘要
Fast-LeWM 通过并行动作前缀预测替代自回归展开,加速视觉规划,减少长期预测中的计算成本和延迟累积。
查看缓存全文
缓存时间: 2026/06/26 02:03
论文页面 - Fast-LeWorldModel
来源:https://huggingface.co/papers/2606.26217
摘要
Fast-LeWM 通过将自回归展开替换为并行动作前缀预测来加速视觉规划,从而降低计算成本并减少长期预测中的延迟累积。
联合嵌入预测架构(https://huggingface.co/papers?q=Joint-Embedding%20Predictive%20Architectures)(JEPA),包括最新的 LeWorldModel(https://huggingface.co/papers?q=LeWorldModel)(LeWM),已成为无重建视觉世界模型的有前景基础。然而,在视觉规划(https://huggingface.co/papers?q=visual%20planning)中,LeWM 通过反复应用局部单步潜在转移模型(https://huggingface.co/papers?q=latent%20transition%20model)来评估候选动作序列。这种自回归展开(https://huggingface.co/papers?q=autoregressive%20rollout)使得规划计算成本高昂,并且随着规划时域的增长,预测轨迹会累积潜在误差。我们提出 Fast-LeWorldModel(https://huggingface.co/papers?q=LeWorldModel)(Fast-LeWM),一种快速潜在世界模型(https://huggingface.co/papers?q=latent%20world%20model),它用动作前缀预测(https://huggingface.co/papers?q=action-prefix%20prediction)替代重复的局部展开。给定当前潜在状态和候选动作序列,Fast-LeWM 编码其前缀,并并行预测执行这些前缀后所到达的未来潜在状态。通过将动作前缀作为基本预测单元,Fast-LeWM 直接建模了动作效果在不同时域上的累积程度。这种前缀级监督(https://huggingface.co/papers?q=prefix-level%20supervision)迫使模型学习状态如何在不同动作前缀下连续演化,而不仅仅是拟合单步状态转移。在规划过程中,预测器可以直接使用编码动作序列中的最后一个前缀 token 来评估对应的未来潜在状态,而无需显式遍历每个中间想象状态。在多个任务中,Fast-LeWM 相比 LeWM 提高了平均成功率,同时大幅减少了规划时间,实现了更低的开环潜在损失(https://huggingface.co/papers?q=open-loop%20latent%20loss),且其增长随着展开时域的增加而显著变慢。
查看 arXiv 页面(https://arxiv.org/abs/2606.26217)查看 PDF(https://arxiv.org/pdf/2606.26217)GitHub(https://github.com/Yuntian-Gao/Fast-LeWorldModel)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26217)
在你的 agent 中获取这篇论文:
hf papers read 2606.26217
没有安装最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用这篇论文的模型 0
暂无模型关联这篇论文
在模型的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。
引用这篇论文的数据集 0
暂无数据集关联这篇论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。
引用这篇论文的 Spaces 0
暂无 Space 关联这篇论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.26217 即可从本页链接。
包含这篇论文的收藏集 0
暂无收藏集包含这篇论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。
相似文章
LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构
LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
通过残差潜在动作学习基于视觉特征的世界模型
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
Looped World Models
Looped World Models 通过共享的Transformer块引入迭代潜在状态细化,实现了100倍的参数效率,同时根据预测复杂度自适应调整计算深度。