AnyMo:几何感知的安装无关的真实环境中人体运动建模

Hugging Face Daily Papers 论文

摘要

AnyMo是一个几何感知的框架,用于安装无关的人体运动建模,它利用基于物理的IMU模拟和图编码,在零样本活动识别、跨模态检索和运动描述等多个数据集上实现了显著改进。

随着可穿戴和移动设备日益融入日常生活,它们提供了一种在真实环境中持续感知人体运动的实用方式。然而,惯性信号高度依赖于传感设置,包括身体位置、安装位置、传感器方向、设备硬件和采样协议。这种依赖性使得学习能够跨设备和数据集迁移的运动表征变得困难,并限制了可穿戴 IMU 在封闭集识别之外的更广泛应用。我们提出了 AnyMo,一个几何感知的安装无关的人体运动建模框架。AnyMo 利用基于物理的 IMU 模拟,在密集的身体表面位置生成多样且合理的合成信号,从配对的合成放置视图和掩蔽部分观测中预训练一个图编码器,将多位置 IMU 标记化为全身运动标记,并将这些标记与 LLM 对齐以进行运动-语言理解。我们在三个互补任务上评估 AnyMo:跨越14个未见过的下游数据集的零样本活动识别、跨模态检索以及可穿戴 IMU 运动描述,其中在 HAR 上平均 Accuracy/F1/R@2 提升了 11.7\%/11.6\%/22.6\%,零样本 IMU 到文本和文本到 IMU 检索的 MRR 分别提高了 15.9\% 和 28.6\%,零样本描述的 BERT-F1 提高了 18.8\%。这些结果支持 AnyMo 作为真实环境中可穿戴运动理解的通用模型。项目页面:https://baiyuchen.com/project/AnyMo。
查看原文
查看缓存全文

缓存时间: 2026/05/22 18:21

论文页面 - AnyMo:几何感知的野外人体运动建模(与设置无关)

来源:https://huggingface.co/papers/2605.22715

摘要

AnyMo 是一个几何感知框架,通过基于物理的 IMU 模拟和图编码实现与设置无关的人体运动建模,可用于跨数据集活动识别和跨模态检索。

随着可穿戴和移动设备日益融入日常生活,它们为在野外连续感知人体运动提供了一种实用途径。但惯性信号高度依赖于传感设置,包括身体位置、佩戴位置、传感器方向、设备硬件和采样协议。这种对设置的依赖使得学到的运动表征难以跨设备和跨数据集迁移,也限制了可穿戴 IMU 在封闭集识别之外的广泛应用。我们提出 AnyMo,一个几何感知框架(https://huggingface.co/papers?q=geometry-aware%20framework),用于与设置无关的人体运动建模。AnyMo 使用基于物理的 IMU 模拟(https://huggingface.co/papers?q=physics-grounded%20IMU%20simulation)在密集的体表放置位置上生成多样且逼真的合成信号;从配对合成放置视图和掩码部分观测(https://huggingface.co/papers?q=masked%20partial%20observations)中预训练图编码器(https://huggingface.co/papers?q=graph%20encoder);将多位置 IMU(https://huggingface.co/papers?q=multi-position%20IMU)标记化为全身运动令牌(https://huggingface.co/papers?q=full-body%20motion%20tokens),并将这些令牌与LLM(https://huggingface.co/papers?q=LLM)对齐以进行运动-语言理解(https://huggingface.co/papers?q=motion-language%20understanding)。我们在三个互补任务上评估 AnyMo:跨 14 个未见下游数据集的零样本活动识别(https://huggingface.co/papers?q=zero-shot%20activity%20recognition)、跨模态检索(https://huggingface.co/papers?q=cross-modal%20retrieval)和可穿戴 IMU 运动描述(https://huggingface.co/papers?q=wearable%20IMU%20motion%20captioning),在 HAR 上平均 Accuracy/F1/R@2 分别提升 11.7%/11.6%/22.6%;零样本 IMU 到文本和文本到 IMU 检索的 MRR 分别提升 15.9% 和 28.6%;零样本描述的 BERT-F1 提升 18.8%。这些结果支持 AnyMo 作为野外可穿戴运动理解的通用模型。项目页面:https://baiyuchen.com/project/AnyMo。

查看 arXiv 页面(https://arxiv.org/abs/2605.22715)查看 PDF(https://arxiv.org/pdf/2605.22715)项目页面(https://baiyuchen.com/project/AnyMo)GitHub0(https://github.com/Breezelled/AnyMo)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22715)

在你的 agent 中获取这篇论文:

hf papers read 2605.22715

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.22715 以链接到此页面。

包含此论文的合集1

相似文章

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。

unsloth/MiMo-V2.5-GGUF · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.5 是一款原生全模态 AI 模型,具备强大的智能体(agentic)能力,在统一稀疏混合专家(MoE)架构下支持文本、图像、视频和音频的理解。