WALL-WM:在事件节点上雕琢世界动作建模

Hugging Face Daily Papers 论文

摘要

WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。

WALL-WM 是一种世界动作模型,它将视频-动作学习从以块为中心的优化转变为基于事件的视觉-语言-动作预训练,使用语义连贯的动作事件作为学习的基本单元。现有的 WAM 通常从多模态或视频基础模型初始化,然后直接基于当前观察和指令对固定长度的动作块进行优化。尽管方便,但这种以块为中心的方式造成了基本的粒度不匹配。语言描述语义目标和事件,视觉通过连续场景动态演变,而动作在控制级别的时间尺度上操作;将三者强制纳入同一固定长度的预测窗口使 VLA 训练变成短视相关性拟合。WALL-WM 通过围绕语义事件组织监督和数据来解决这种不匹配。具体来说,它将基于事件的 VLA 预训练与由事件级描述和聚类平衡采样构建的数据生态系统相结合,从而在多样化行为、场景和任务结构上实现可扩展学习。从同一事件预训练骨干出发,WALL-WM 支持两种互补的推理模式。事件模式消耗下一事件描述,并支持可变长度的执行块;统一模式使用带有阶梯式解码的 VLM,对传统的固定长度块推理进行条件化,同时保持梯度连续的 VLA 路径。结合基于 Muon 优化器的大规模预训练基础设施,WALL-WM 为通用 WAM 提供了一套实用的规模化方案。实验表明,WALL-WM 在语言、场景和任务上广泛泛化,在大规模真实世界泛化评估中达到了最先进的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/03 23:40

论文页面 - WALL-WM:在事件接合处雕琢世界动作模型

来源:https://huggingface.co/papers/2606.01955
发布于6月1日

·

由 https://huggingface.co/RuiliFeng 于6月3日提交

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

WALL-WM 通过将语义事件作为学习单元而非固定动作片段,推进了视频-动作学习,实现了更灵活、可扩展的视觉-语言-动作训练与推理。

WALL-WM 是一种世界动作模型(World Action Model,https://huggingface.co/papers?q=World%20Action%20Model),它将视频-动作学习从以片段为中心的优化转变为以事件为基础的视觉-语言-动作(Vision-Language-Action,https://huggingface.co/papers?q=Vision-Language-Action)预训练,将语义连贯的动作事件作为学习原子单元。现有的世界动作模型通常从多模态或视频基础模型初始化,然后直接基于当前观测和指令对固定长度的动作片段(fixed-length action chunks,https://huggingface.co/papers?q=fixed-length%20action%20chunks)进行优化。这种方法虽然便捷,但以片段为中心的设计导致了根本性的粒度不匹配:语言描述语义目标和事件,视觉通过连续场景动态演变,而动作在控制层面的时间尺度上运行;将三者强制塞入同一固定长度的预测窗口,会使视觉-语言-动作训练(VLA training,https://huggingface.co/papers?q=VLA%20training)退化为短视的相关性拟合。WALL-WM 通过围绕语义事件(semantic events,https://huggingface.co/papers?q=semantic%20events)组织监督信号和数据,解决了这一不匹配问题。具体而言,它将基于事件的视觉-语言-动作预训练与基于事件级描述(event-level captions,https://huggingface.co/papers?q=event-level%20captions)和聚类平衡采样(cluster-balanced sampling,https://huggingface.co/papers?q=cluster-balanced%20sampling)构建的数据生态系统(data ecosystem,https://huggingface.co/papers?q=data%20ecosystem)相结合,从而在多样化行为、场景和任务结构上实现可扩展学习。基于相同的预训练骨干,WALL-WM 支持两种互补的推理模式:事件模式接收下一事件描述,实现可变长度执行(variable-length execution,https://huggingface.co/papers?q=variable-length%20execution)片段;统一模式(unified mode,https://huggingface.co/papers?q=unified%20mode)则利用带有阶梯解码(Staircase Decoding,https://huggingface.co/papers?q=Staircase%20Decoding)的视觉语言模型,在保留梯度连续视觉-语言-动作路径的同时,对传统固定长度片段推理进行条件约束。结合基于 Muon 优化器(Muon-optimizer,https://huggingface.co/papers?q=Muon-optimizer)的大规模预训练(large-scale pretraining,https://huggingface.co/papers?q=large-scale%20pretraining)基础设施,WALL-WM 为通用世界动作模型提供了一套实用的规模化方案。实验表明,WALL-WM 在语言、场景和任务上具有广泛的泛化能力,在大规模真实世界泛化(generalization,https://huggingface.co/papers?q=generalization)评估中达到了最先进性能(state-of-the-art performance,https://huggingface.co/papers?q=state-of-the-art%20performance)。

查看 arXiv 页面(https://arxiv.org/abs/2606.01955)
查看 PDF(https://arxiv.org/pdf/2606.01955)
项目页面(https://x2robot.com/pages/wm)
GitHub(1.04k,https://github.com/X-Square-Robot/wall-x)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01955)

将本文收录到您的智能体中:

hf papers read 2606.01955

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型(0)

没有模型引用本文

请在模型 README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。

引用本文的数据集(0)

没有数据集引用本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。

引用本文的 Spaces(0)

没有 Space 引用本文

请在 Space README.md 中引用 arxiv.org/abs/2606.01955,以便从本文页面链接。

包含本文的收藏(0)

没有收藏包含本文

请将本文添加到收藏(https://huggingface.co/new-collection)中,以便从本文页面链接。

相似文章

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。