作为意图的潜在动作为世界动作模型提供高效未来想象

Hugging Face Daily Papers 论文

摘要

LAWA是一个世界动作模型,使用潜在动作来实现机器人控制的高效未来想象,在降低推理延迟的同时达到最先进的性能。它无需生成未来观测即可在泛化能力和效率上优于基线。

世界动作模型(WAMs)通过建模观测如何演变来改进机器人控制,但在测试时生成未来观测会带来显著的延迟。Fast-WAM为了效率去除了这个过程;然而,我们的匹配实现显示,Fast-WAM的泛化能力低于未来感知的替代方案,尤其是在机器人示范稀缺和分布外场景中。为了弥合这一差距,我们引入了**LAWA**,一个WAM架构,它使用紧凑的潜在动作作为未来意图的操作表示,无需生成未来观测即可实现高效的测试时未来想象。具体来说,一个由无动作预训练增强的离散分词器产生以操作为中心的码本目标。LAWA在推理时联合去噪一个锚定到这些目标的连续潜在状态与可执行动作块,同时省略未来视频分支。在RoboCasa上,LAWA在少样本和全数据设置中分别达到65.6%和80.8%的平均成功率,比匹配的Fast-WAM基线分别提高了9.6和4.5个百分点。它还保持了匹配的Joint-WAM变体的性能水平,同时推理延迟降低了42.9%。LAWA在LIBERO-Plus上也展示了有竞争力的零样本鲁棒性,并在真实世界任务中表现出色。这些结果表明,未来想象不一定需要被抛弃:通过紧凑的潜在动作保留它可以在性能、泛化和延迟之间产生有效的权衡。代码和模型将会发布。
查看原文
查看缓存全文

缓存时间: 2026/08/26 11:11

论文页面 - 潜在动作作为意图:为世界动作模型实现高效未来想象

来源:https://huggingface.co/papers/2608.24882 作者:、 、 、 、 、 、 、 、 、 、

摘要

LAWA 通过使用紧凑的潜在动作,在无需生成观测的情况下保持高效的未来想象,从而提升机器人控制能力,并以更低的延迟实现强大性能。

世界动作模型 (https://huggingface.co/papers?q=World%20action%20models)(WAMs)通过对观测如何演变进行建模来改进机器人控制,但在测试时生成未来观测会带来显著的延迟。Fast-WAM 为了效率去掉了这一过程;然而,我们的匹配实现表明,Fast-WAM 的泛化能力低于感知未来的替代方案,尤其是在机器人示范数据稀缺和分布外场景中。为弥合这一差距,我们引入了 LAWA,这是一种 WAM 架构,它使用紧凑的潜在动作 (https://huggingface.co/papers?q=latent%20actions) 作为未来意图的操作表示,从而在无需生成未来观测的情况下实现高效的测试时未来想象。具体来说,一个经由无动作预训练 (https://huggingface.co/papers?q=action-free%20pre-training) 增强的离散分词器 (https://huggingface.co/papers?q=discrete%20tokenizer) 生成以操作为中心的码本 (https://huggingface.co/papers?q=codebook) 目标。LAWA 联合去噪一个锚定到这些目标的连续潜在状态 (https://huggingface.co/papers?q=latent%20state) 和可执行的动作块 (https://huggingface.co/papers?q=action%20chunks),同时在推理时省略了未来视频分支 (https://huggingface.co/papers?q=future-video%20branch)。在 RoboCasa 上,LAWA 在少样本和全数据设置下分别取得了 65.6% 和 80.8% 的最先进平均成功率,相比匹配的 Fast-WAM 基线分别提升了 9.6 和 4.5 个百分点。它还保持了匹配的 Joint-WAM 变体的性能水平,同时将推理延迟 (https://huggingface.co/papers?q=inference%20latency) 降低了 42.9%。LAWA 在 LIBERO-Plus 上也展现了有竞争力的零样本鲁棒性,并在真实世界任务中表现出卓越的性能。这些结果表明,未来想象无需被抛弃:通过紧凑的潜在动作 (https://huggingface.co/papers?q=latent%20actions) 来保留它,能在性能、泛化和延迟之间取得有效的权衡。代码和模型将会发布。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24882)查看 PDF (https://arxiv.org/pdf/2608.24882)项目页面 (https://getterupper.github.io/LAWA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24882)

在您的代理中获取此论文:

hf papers read 2608\.24882

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.24882 以从此页面链接它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

未见先觉:世界行动模型的潜在未来

arXiv cs.AI

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

使用潜空间世界模型预测后果并强化导航策略

arXiv cs.AI

本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。