WALL-WM:在事件节点上雕琢世界动作建模
摘要
WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。
查看缓存全文
缓存时间: 2026/06/03 23:40
论文页面 - WALL-WM:在事件接合处雕琢世界动作模型
来源:https://huggingface.co/papers/2606.01955
发布于6月1日
·
由 https://huggingface.co/RuiliFeng 于6月3日提交
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
WALL-WM 通过将语义事件作为学习单元而非固定动作片段,推进了视频-动作学习,实现了更灵活、可扩展的视觉-语言-动作训练与推理。
WALL-WM 是一种世界动作模型(World Action Model,https://huggingface.co/papers?q=World%20Action%20Model),它将视频-动作学习从以片段为中心的优化转变为以事件为基础的视觉-语言-动作(Vision-Language-Action,https://huggingface.co/papers?q=Vision-Language-Action)预训练,将语义连贯的动作事件作为学习原子单元。现有的世界动作模型通常从多模态或视频基础模型初始化,然后直接基于当前观测和指令对固定长度的动作片段(fixed-length action chunks,https://huggingface.co/papers?q=fixed-length%20action%20chunks)进行优化。这种方法虽然便捷,但以片段为中心的设计导致了根本性的粒度不匹配:语言描述语义目标和事件,视觉通过连续场景动态演变,而动作在控制层面的时间尺度上运行;将三者强制塞入同一固定长度的预测窗口,会使视觉-语言-动作训练(VLA training,https://huggingface.co/papers?q=VLA%20training)退化为短视的相关性拟合。WALL-WM 通过围绕语义事件(semantic events,https://huggingface.co/papers?q=semantic%20events)组织监督信号和数据,解决了这一不匹配问题。具体而言,它将基于事件的视觉-语言-动作预训练与基于事件级描述(event-level captions,https://huggingface.co/papers?q=event-level%20captions)和聚类平衡采样(cluster-balanced sampling,https://huggingface.co/papers?q=cluster-balanced%20sampling)构建的数据生态系统(data ecosystem,https://huggingface.co/papers?q=data%20ecosystem)相结合,从而在多样化行为、场景和任务结构上实现可扩展学习。基于相同的预训练骨干,WALL-WM 支持两种互补的推理模式:事件模式接收下一事件描述,实现可变长度执行(variable-length execution,https://huggingface.co/papers?q=variable-length%20execution)片段;统一模式(unified mode,https://huggingface.co/papers?q=unified%20mode)则利用带有阶梯解码(Staircase Decoding,https://huggingface.co/papers?q=Staircase%20Decoding)的视觉语言模型,在保留梯度连续视觉-语言-动作路径的同时,对传统固定长度片段推理进行条件约束。结合基于 Muon 优化器(Muon-optimizer,https://huggingface.co/papers?q=Muon-optimizer)的大规模预训练(large-scale pretraining,https://huggingface.co/papers?q=large-scale%20pretraining)基础设施,WALL-WM 为通用世界动作模型提供了一套实用的规模化方案。实验表明,WALL-WM 在语言、场景和任务上具有广泛的泛化能力,在大规模真实世界泛化(generalization,https://huggingface.co/papers?q=generalization)评估中达到了最先进性能(state-of-the-art performance,https://huggingface.co/papers?q=state-of-the-art%20performance)。
查看 arXiv 页面(https://arxiv.org/abs/2606.01955)
查看 PDF(https://arxiv.org/pdf/2606.01955)
项目页面(https://x2robot.com/pages/wm)
GitHub(1.04k,https://github.com/X-Square-Robot/wall-x)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01955)
将本文收录到您的智能体中:
hf papers read 2606.01955
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型(0)
没有模型引用本文
请在模型 README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。
引用本文的数据集(0)
没有数据集引用本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。
引用本文的 Spaces(0)
没有 Space 引用本文
请在 Space README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。
包含本文的收藏(0)
没有收藏包含本文
请将本文添加到收藏(https://huggingface.co/new-collection)中,以便从本文页面链接。
相似文章
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
GameWAM:一种用于视频游戏的统一世界动作模型
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。
RepWAM:基于表征视觉-动作分词器的世界动作建模
RepWAM 提出了一种使用表征视觉-动作分词器的世界动作建模方法,旨在学习用于规划与控制的统一视觉和动作表征。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
SimWAM是一种简单而有效的世界动作模型,用于端到端自动驾驶,它将视频生成纯粹用作训练信号,在NAVSIM上实现了最先进的91.5 PDMS,同时降低了推理延迟。