作为意图的潜在动作为世界动作模型提供高效未来想象
摘要
LAWA是一个世界动作模型,使用潜在动作来实现机器人控制的高效未来想象,在降低推理延迟的同时达到最先进的性能。它无需生成未来观测即可在泛化能力和效率上优于基线。
查看缓存全文
缓存时间: 2026/08/26 11:11
论文页面 - 潜在动作作为意图:为世界动作模型实现高效未来想象
来源:https://huggingface.co/papers/2608.24882 作者:、 、 、 、 、 、 、 、 、 、
摘要
LAWA 通过使用紧凑的潜在动作,在无需生成观测的情况下保持高效的未来想象,从而提升机器人控制能力,并以更低的延迟实现强大性能。
世界动作模型 (https://huggingface.co/papers?q=World%20action%20models)(WAMs)通过对观测如何演变进行建模来改进机器人控制,但在测试时生成未来观测会带来显著的延迟。Fast-WAM 为了效率去掉了这一过程;然而,我们的匹配实现表明,Fast-WAM 的泛化能力低于感知未来的替代方案,尤其是在机器人示范数据稀缺和分布外场景中。为弥合这一差距,我们引入了 LAWA,这是一种 WAM 架构,它使用紧凑的潜在动作 (https://huggingface.co/papers?q=latent%20actions) 作为未来意图的操作表示,从而在无需生成未来观测的情况下实现高效的测试时未来想象。具体来说,一个经由无动作预训练 (https://huggingface.co/papers?q=action-free%20pre-training) 增强的离散分词器 (https://huggingface.co/papers?q=discrete%20tokenizer) 生成以操作为中心的码本 (https://huggingface.co/papers?q=codebook) 目标。LAWA 联合去噪一个锚定到这些目标的连续潜在状态 (https://huggingface.co/papers?q=latent%20state) 和可执行的动作块 (https://huggingface.co/papers?q=action%20chunks),同时在推理时省略了未来视频分支 (https://huggingface.co/papers?q=future-video%20branch)。在 RoboCasa 上,LAWA 在少样本和全数据设置下分别取得了 65.6% 和 80.8% 的最先进平均成功率,相比匹配的 Fast-WAM 基线分别提升了 9.6 和 4.5 个百分点。它还保持了匹配的 Joint-WAM 变体的性能水平,同时将推理延迟 (https://huggingface.co/papers?q=inference%20latency) 降低了 42.9%。LAWA 在 LIBERO-Plus 上也展现了有竞争力的零样本鲁棒性,并在真实世界任务中表现出卓越的性能。这些结果表明,未来想象无需被抛弃:通过紧凑的潜在动作 (https://huggingface.co/papers?q=latent%20actions) 来保留它,能在性能、泛化和延迟之间取得有效的权衡。代码和模型将会发布。
查看 arXiv 页面 (https://arxiv.org/abs/2608.24882)查看 PDF (https://arxiv.org/pdf/2608.24882)项目页面 (https://getterupper.github.io/LAWA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24882)
在您的代理中获取此论文:
hf papers read 2608\.24882
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
未见先觉:世界行动模型的潜在未来
提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。
@aimalysheva: 潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏…
潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。
使用潜空间世界模型预测后果并强化导航策略
本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。