iMaC:将动作转化为运动与接触图像,用于具身世界模型

Hugging Face Daily Papers 论文

摘要

iMaC提出了一种统一控制范式,将原始视觉图像作为具身世界模型的原生动作表示,通过基于图像的动作令牌实现更具表现力和泛化能力的机器人控制。

具身世界模型已成为视觉机器人决策和交互环境模拟的关键范式。然而,传统的具身框架依赖于低维结构化动作向量(例如关节角度和末端执行器姿态),这些向量在表达能力、跨不同具身形态的泛化能力以及复杂物理交互的动力学建模方面存在局限。为了解决这些限制,本文提出iMac(图像即动作控制),一种新颖的统一控制范式,将原始视觉图像视为具身世界模型的原生动作表示。与传统的显式运动学动作编码不同,iMac将连续的视觉操作表述为基于图像的动作令牌,这些令牌天然蕴含空间运动意图、交互几何约束和细微的物理动力学。我们构建了一个双分支具身架构,包括图像动作编码器和动态世界预测器:编码器将目标驱动的视觉图像压缩为紧凑的动作嵌入,而预测器学习以图像动作为条件的环境转移规则,以实现高保真的未来状态预测和闭环具身控制。在公开的具身操作基准和真实机器人场景上进行了大量实验。结果表明,iMac在预测精度、任务成功率和跨场景泛化能力方面均优于基于向量的动作控制基线。此外,我们的图像动作设计消除了对手工定义动作空间的依赖,实现了对异构具身代理的灵活通用控制。这项工作为具身世界模型提供了创新的视觉-动作视角,为可扩展的机器人感知与操作提供了一种简单而有效的范式。
查看原文
查看缓存全文

缓存时间: 2026/06/15 16:59

论文页面 - iMaC:将动作转化为运动与接触图像,用于具身世界模型

来源:https://huggingface.co/papers/2606.09813 作者:

摘要

iMac 提出了一种统一控制范式,将原始视觉图像作为具身世界模型的固有动作表示,通过基于图像的动作令牌实现更具表现力和泛化能力的机器人控制。

具身世界模型已成为视觉机器人决策与交互环境模拟的关键范式。然而,传统具身框架依赖低维结构化动作向量(例如关节角度和末端执行器位姿),这些方法存在表达能力有限、跨不同形态泛化能力差、以及对复杂物理交互的动态建模不自然等问题。为解决这些局限,本文提出 iMac(Image as Action Control,图像即动作控制),一种新颖的统一控制范式,将原始视觉图像作为具身世界模型的固有动作表示。与传统的显式运动学动作编码不同,iMac 将连续视觉操作形式化为基于图像的动作令牌,这些令牌天然蕴含空间运动意图、交互几何约束以及细微的物理动力学。我们构建了一个双分支具身架构,由图像-动作编码器动态世界预测器组成:编码器将目标驱动视觉图像压缩为紧凑的动作嵌入,而预测器则学习以图像动作为条件的环境转移规则,从而实现高保真未来状态预测与闭环具身控制。我们在公开的具身操作基准和真实机器人场景上进行了广泛实验。结果表明,iMac 在预测精度、任务成功率和跨场景泛化能力方面均优于基于向量的动作控制基线。此外,我们的图像动作设计消除了对人工定义动作空间的依赖,实现了对异构具身智能体的灵活通用控制。这项工作为具身世界模型提供了一种创新的视觉-动作视角,为可扩展的机器人感知与操作提供了一种简单而有效的范式。

查看 arXiv 页面 (https://arxiv.org/abs/2606.09813)
查看 PDF (https://arxiv.org/pdf/2606.09813)
项目页面 (https://imac-wm.github.io/)
GitHub (https://github.com/imac-wm/iMac)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.09813)

在您的智能体中获取该论文:

hf papers read 2606.09813

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.09813 可从本页链接。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.09813 可从本页链接。

引用此论文的 Spaces 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.09813 可从本页链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

将本论文添加到一个收藏集中可从本页链接。

相似文章

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

世界行动模型:具身智能的下一个前沿

Hugging Face Daily Papers

本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。

ABot-M0.5: 统一移动与操作的世界动作模型

Hugging Face Daily Papers

ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。

翻译作为桥梁动作:将人类操作技能迁移至机器人

Hugging Face Daily Papers

本文提出了一种基于头戴相机坐标系中相对手腕平移的桥梁动作表征,利用带有交错动作令牌和注意力掩码的视觉-语言-动作模型来处理具身差异,从而将人类操作技能迁移至双臂机器人。