即插即用的二维运动接口用于真实世界的运动语言模型

Hugging Face Daily Papers 论文

摘要

本文介绍了一种即插即用的二维运动接口,它使预训练的运动语言模型无需重新训练即可处理来自单目视频的二维输入,从而提高真实世界的适用性。

运动语言模型(MoLMs)通常通过对三维运动进行分词,并使用语言模型处理分词结果来理解人体运动。然而,从单目视频中获取精确的三维运动具有挑战性,限制了其在真实世界的应用性。为了解决这一问题,我们提出了一种即插即用的二维运动接口,使三维预训练的MoLMs无需修改或微调原始模型即可接受二维运动输入。 在公共数据集上的实验表明,我们的方法在多个MoLMs上实现了与三维运动输入相当的性能,并且优于从二维运动开始训练的MoLMs。我们进一步构建了一个单目真实世界视频运动评估数据集,并引入了一个真实视频适配器,证明了在评估的单目姿态估计设置下,二维运动比三维运动更有用。这些结果表明,二维运动为在真实世界运动理解设置中部署MoLMs提供了一个实用的接口。代码可在 https://github.com/irajisamurai/2D-Motion-Interface 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/18 11:52

论文页面 - 面向真实世界运动语言模型的即插即用二维运动接口

来源:https://huggingface.co/papers/2608.15984

摘要

一种即插即用的二维运动接口,使预训练的运动语言模型能够在不重新训练的情况下处理二维输入,从而提升其实际应用价值。

运动语言模型(https://huggingface.co/papers?q=Motion%20Language%20Models)通常通过对三维运动进行分词,并利用语言模型处理这些分词数据来理解人体动作。然而,从单目视频(https://huggingface.co/papers?q=monocular%20video)中获取精确的三维运动数据极具挑战性,这限制了它们在现实场景中的应用。为解决这一问题,我们提出了一种即插即用的二维运动接口(https://huggingface.co/papers?q=2D%20Motion%20Interface),它允许预训练于三维数据的运动语言模型直接接收二维运动输入,无需修改或微调原始模型。在公共数据集上的实验表明,我们的方法在多个运动语言模型上达到了与三维运动输入相当的性能,并且优于从头开始在二维运动上训练的模型。我们进一步构建了一个基于真实单目视频的运动评估数据集,并引入了真实视频适配器(https://huggingface.co/papers?q=real-video%20adapter),证明了在评估的单目姿态估计设置下,二维运动比三维运动更具实用性。这些结果表明,二维运动为在真实世界运动理解场景中部署运动语言模型提供了一种实用接口。代码已开源:https://github.com/irajisamurai/2D-Motion-Interface\。

查看arXiv页面(https://arxiv.org/abs/2608.15984) 查看PDF(https://arxiv.org/pdf/2608.15984) GitHub仓库(https://github.com/irajisamurai/2D-Motion-Interface) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.15984)

引用本文的模型1

KanameYOkoYAMA/2d-motion-interface 其他• 更新于约10小时前(https://huggingface.co/KanameYOkoYAMA/2d-motion-interface)

引用本文的数据集0

没有链接到本文的数据集

在数据集的README.md中引用 arxiv.org/abs/2608.15984,即可从本页面建立链接。

引用本文的项目空间1

包含本文的收藏集0

没有包含本文的收藏集

将本文添加到收藏集(https://huggingface.co/new-collection),即可从本页面建立链接。

相似文章

VideoMDM: 基于2D监督的3D人体运动生成方法

Hugging Face Daily Papers

VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。