N_0-TWAM:面向接触丰富操作的触觉原生世界-动作模型规模化
摘要
N₀-TWAM 是一个面向接触丰富操作的触觉原生世界-动作模型,基于来自 6 个具身和 450 个任务的视触觉数据进行了规模化训练。作者公开了代码和预训练检查点,将其定位为首个规模化训练的触觉世界-动作模型。
查看缓存全文
缓存时间: 2026/08/03 09:31
论文页面 - N_0-TWAM:扩展触觉原生世界-动作模型,用于接触丰富操作
大家好——我是作者本人!👋
很高兴分享 N0-TWAM,一个面向接触丰富操作的触觉原生世界-动作模型。代码和预训练检查点已经发布:
代码:https://github.com/neoteai/N0-TWAM 项目页面:https://research.neoteai.com/n0-twam/
我们不是将触觉视为辅助输入通道,而是让模型在相同的目标和因果步骤下,与未来视觉一起预测未来的接触,并从联合预测的未来中读取动作。
触觉原生世界模型!据我们所知,这是第一个大规模训练的触觉世界-动作模型——在跨越6种具身和450个任务的丰富触觉演示上进行视觉-触觉联合预训练。
很高兴在这里或 GitHub 上回答问题,也非常欢迎反馈或批评,尤其是来自从事触觉感知、VLA 或世界模型研究的朋友们。🙌
相似文章
N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
DeltaWAM: 双臂操作 Delta 世界行动模型
DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。
ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。