AnyMo:几何感知的安装无关的真实环境中人体运动建模
摘要
AnyMo是一个几何感知的框架,用于安装无关的人体运动建模,它利用基于物理的IMU模拟和图编码,在零样本活动识别、跨模态检索和运动描述等多个数据集上实现了显著改进。
查看缓存全文
缓存时间: 2026/05/22 18:21
论文页面 - AnyMo:几何感知的野外人体运动建模(与设置无关)
来源:https://huggingface.co/papers/2605.22715
摘要
AnyMo 是一个几何感知框架,通过基于物理的 IMU 模拟和图编码实现与设置无关的人体运动建模,可用于跨数据集活动识别和跨模态检索。
随着可穿戴和移动设备日益融入日常生活,它们为在野外连续感知人体运动提供了一种实用途径。但惯性信号高度依赖于传感设置,包括身体位置、佩戴位置、传感器方向、设备硬件和采样协议。这种对设置的依赖使得学到的运动表征难以跨设备和跨数据集迁移,也限制了可穿戴 IMU 在封闭集识别之外的广泛应用。我们提出 AnyMo,一个几何感知框架(https://huggingface.co/papers?q=geometry-aware%20framework),用于与设置无关的人体运动建模。AnyMo 使用基于物理的 IMU 模拟(https://huggingface.co/papers?q=physics-grounded%20IMU%20simulation)在密集的体表放置位置上生成多样且逼真的合成信号;从配对合成放置视图和掩码部分观测(https://huggingface.co/papers?q=masked%20partial%20observations)中预训练图编码器(https://huggingface.co/papers?q=graph%20encoder);将多位置 IMU(https://huggingface.co/papers?q=multi-position%20IMU)标记化为全身运动令牌(https://huggingface.co/papers?q=full-body%20motion%20tokens),并将这些令牌与LLM(https://huggingface.co/papers?q=LLM)对齐以进行运动-语言理解(https://huggingface.co/papers?q=motion-language%20understanding)。我们在三个互补任务上评估 AnyMo:跨 14 个未见下游数据集的零样本活动识别(https://huggingface.co/papers?q=zero-shot%20activity%20recognition)、跨模态检索(https://huggingface.co/papers?q=cross-modal%20retrieval)和可穿戴 IMU 运动描述(https://huggingface.co/papers?q=wearable%20IMU%20motion%20captioning),在 HAR 上平均 Accuracy/F1/R@2 分别提升 11.7%/11.6%/22.6%;零样本 IMU 到文本和文本到 IMU 检索的 MRR 分别提升 15.9% 和 28.6%;零样本描述的 BERT-F1 提升 18.8%。这些结果支持 AnyMo 作为野外可穿戴运动理解的通用模型。项目页面:https://baiyuchen.com/project/AnyMo。
查看 arXiv 页面(https://arxiv.org/abs/2605.22715)查看 PDF(https://arxiv.org/pdf/2605.22715)项目页面(https://baiyuchen.com/project/AnyMo)GitHub0(https://github.com/Breezelled/AnyMo)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22715)
在你的 agent 中获取这篇论文:
hf papers read 2605.22715
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。
包含此论文的合集1
相似文章
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。
MoCapAnything V2: 面向任意骨骼的端到端动作捕捉
MoCapAnything V2 提出了一种面向任意骨骼单目视频动作捕捉的完全端到端框架,通过联合优化视频到姿态以及姿态到旋转的预测,解决旋转歧义性问题。
MolmoMotion:语言引导的3D运动预测
MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。
unsloth/MiMo-V2.5-GGUF · Hugging Face
MiMo-V2.5 是一款原生全模态 AI 模型,具备强大的智能体(agentic)能力,在统一稀疏混合专家(MoE)架构下支持文本、图像、视频和音频的理解。
Motion Beyond Morphology:从抽象运动表示引导跨类别运动迁移
介绍了 Motion Beyond Morphology,一个通过学习抽象运动表示来在不同形态物体间迁移运动的框架,以及用于跨类别运动迁移的新 OpenVMT 数据集和基准。