即插即用的二维运动接口用于真实世界的运动语言模型
摘要
本文介绍了一种即插即用的二维运动接口,它使预训练的运动语言模型无需重新训练即可处理来自单目视频的二维输入,从而提高真实世界的适用性。
查看缓存全文
缓存时间: 2026/08/18 11:52
论文页面 - 面向真实世界运动语言模型的即插即用二维运动接口
来源:https://huggingface.co/papers/2608.15984
摘要
一种即插即用的二维运动接口,使预训练的运动语言模型能够在不重新训练的情况下处理二维输入,从而提升其实际应用价值。
运动语言模型(https://huggingface.co/papers?q=Motion%20Language%20Models)通常通过对三维运动进行分词,并利用语言模型处理这些分词数据来理解人体动作。然而,从单目视频(https://huggingface.co/papers?q=monocular%20video)中获取精确的三维运动数据极具挑战性,这限制了它们在现实场景中的应用。为解决这一问题,我们提出了一种即插即用的二维运动接口(https://huggingface.co/papers?q=2D%20Motion%20Interface),它允许预训练于三维数据的运动语言模型直接接收二维运动输入,无需修改或微调原始模型。在公共数据集上的实验表明,我们的方法在多个运动语言模型上达到了与三维运动输入相当的性能,并且优于从头开始在二维运动上训练的模型。我们进一步构建了一个基于真实单目视频的运动评估数据集,并引入了真实视频适配器(https://huggingface.co/papers?q=real-video%20adapter),证明了在评估的单目姿态估计设置下,二维运动比三维运动更具实用性。这些结果表明,二维运动为在真实世界运动理解场景中部署运动语言模型提供了一种实用接口。代码已开源:https://github.com/irajisamurai/2D-Motion-Interface\。
查看arXiv页面(https://arxiv.org/abs/2608.15984) 查看PDF(https://arxiv.org/pdf/2608.15984) GitHub仓库(https://github.com/irajisamurai/2D-Motion-Interface) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.15984)
引用本文的模型1
KanameYOkoYAMA/2d-motion-interface 其他• 更新于约10小时前(https://huggingface.co/KanameYOkoYAMA/2d-motion-interface)
引用本文的数据集0
没有链接到本文的数据集
在数据集的README.md中引用 arxiv.org/abs/2608.15984,即可从本页面建立链接。
引用本文的项目空间1
包含本文的收藏集0
没有包含本文的收藏集
将本文添加到收藏集(https://huggingface.co/new-collection),即可从本页面建立链接。
相似文章
VideoMDM: 基于2D监督的3D人体运动生成方法
VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。
MotionVLA:用于人形机器人运动的视觉-语言-动作模型
提出MotionVLA,一种用于人形运动生成的视觉-语言-动作模型,采用双流频率分词器分别编码姿态和物理动态,实现了更高的多样性和一致性。
MolmoMotion:语言引导的3D运动预测
MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
打破视觉-行动捷径:可泛化机器人基础模型的潜在接口训练 (LIT)
本文提出潜在接口训练(LIT),一种两阶段策略,通过姿态监督的潜在接口缓解视觉-行动捷径,以增强机器人基础模型的泛化能力。