通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers 论文

摘要

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

世界模型通过观测与动作预测未来的状态转移。现有工作主要仅专注于图像生成。相比之下,基于视觉特征的世界模型直接预测未来的视觉特征而非原始视频像素,提供了一种更高效且不易产生幻觉的极具潜力的替代方案。然而,当前的特征基方法依赖直接回归,在复杂交互中容易导致预测模糊或分布崩溃;同时,在高维特征空间中进行生成式建模仍具挑战。在本研究中,我们发现一种新型潜在动作表示(我们称之为 *Residual Latent Action* (RLA)),可以轻易从 DINO 残差中学习得到。我们还证明,RLA 具备预测能力、可泛化性,并能编码时间演化过程。基于 RLA,我们提出 *RLA World Model* (RLA-WM),该模型通过流匹配(flow matching)预测 RLA 值。在仿真与现实数据集上,RLA-WM 的性能均优于当前最先进的特征基与视频扩散世界模型,且速度比视频扩散模型快出数个数量级。此外,我们开发了两种利用 RLA-WM 提升策略学习的机器人学习技术。第一种是基于 RLA 的极简世界动作模型,仅从无动作演示视频中进行学习。第二种是首个视觉强化学习框架,完全在仅从离线视频学习到的世界模型内部进行训练,采用视频对齐奖励,且无需任何在线交互或人工设计奖励。项目主页:https://mlzxy.github.io/rla-wm
查看原文
查看缓存全文

缓存时间: 2026/05/11 18:55

论文页面 - 通过残差潜在动作学习基于视觉特征的世界模型

来源:https://huggingface.co/papers/2605.07079

摘要

通过残差潜在动作表示预测未来视觉特征的视觉世界模型,在性能和效率上均优于现有方法,并催生了新颖的机器人学习方法。

世界模型 (https://huggingface.co/papers?q=World%20models) 根据观察和动作预测未来状态转移。现有工作大多仅专注于图像生成。而基于视觉特征的世界模型 (https://huggingface.co/papers?q=world%20models) 预测未来的视觉特征而非原始视频像素,提供了一种更高效且不易产生幻觉的替代方案。然而,当前基于特征的方法依赖直接回归,导致在复杂交互中预测结果模糊或崩溃,而在高维特征空间中进行生成建模仍具挑战。本工作中,我们发现一种新型潜在动作表示 (https://huggingface.co/papers?q=latent%20action%20representation),我们称之为 残差潜在动作 (https://huggingface.co/papers?q=Residual%20Latent%20Action) (RLA),可以轻易从 DINO 残差 (https://huggingface.co/papers?q=DINO%20residuals) 中学到。我们还证明 RLA 具有预测性、泛化性,并能编码时序推进过程。在此基础上,我们提出 RLA 世界模型 (https://huggingface.co/papers?q=RLA%20Latent%20Action) (RLA-WM),它通过流匹配 (https://huggingface.co/papers?q=flow%20matching) 预测 RLA 值。RLA-WM 在模拟和真实世界数据集上,性能均优于最先进的基于特征的世界模型和视频扩散世界模型 (https://huggingface.co/papers?q=video-diffusion%20world%20models),且速度比视频扩散快数个量级。此外,我们开发了两种机器人学习技术,利用 RLA-WM 改进策略学习 (https://huggingface.co/papers?q=policy%20learning)。第一种是极简的世界动作模型,使用 RLA 从无动作示范视频 (https://huggingface.co/papers?q=actionless%20demonstration%20videos) 中学习。第二种是首个完全在仅由离线视频学到的世界模型内部训练的视觉强化学习框架 (https://huggingface.co/papers?q=visual%20RL%20framework),它使用视频对齐奖励 (https://huggingface.co/papers?q=video-aligned%20reward),无需在线交互或手工设计奖励。项目页面:https://mlzxy.github.io/rla-wm

查看 arXiv 页面 (https://arxiv.org/abs/2605.07079) 查看 PDF (https://arxiv.org/pdf/2605.07079) 项目页面 (https://mlzxy.github.io/rla-wm) GitHub9 (https://github.com/mlzxy/rla-wm) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.07079)

在您的 agent 中获取这篇论文:

hf papers read 2605.07079

没有最新的命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 1

xyzhang368/RLA-WM 机器人学 • 更新于约 5 小时前 (https://huggingface.co/xyzhang368/RLA-WM)

引用此论文的数据集 1

xyzhang368/RLA-WM 更新于约 5 小时前 • 37 (https://huggingface.co/datasets/xyzhang368/RLA-WM)

引用此论文的空间 0

目前没有空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2605.07079,即可在此页面建立链接。

包含此论文的合集 0

目前没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以在此页面建立链接。

相似文章