ReMoMask-2:潜在检索增强掩码动作生成

Hugging Face Daily Papers 论文

摘要

ReMoMask-2通过将检索直接嵌入生成器的潜在空间来改进文本到动作生成,消除表示差距,并在KIT-ML和SnapMoGen等基准测试上实现最先进的结果。

文本到动作(T2M)生成将自然语言映射到人体关节运动,助力游戏、VR和机器人技术。检索增强文本到动作(RAG-T2M)通过以检索到的运动-文本对为条件,改进对复杂描述的生成。然而,现有RAG-T2M模型面临两个挑战:粗粒度的检索和融合机制忽略了人体运动的层级化、时空拓扑结构;并且存在表示差距,因为检索到的证据位于与生成器潜在空间分离的语义空间中。为解决第一个问题,我们提出了ReMoMask,一个结构感知的RAG框架,结合层级双向动量(HBM)对比学习以对齐全局和部分级别特征与文本;语义时空注意力(SSTA)用于拓扑感知融合;以及拓扑结构掩码(TSM)通过自适应掩码强制稳健的部分级别定位。为解决第二个问题,我们引入了ReMoMask-2,它在生成器的预量化潜在空间中直接重建检索数据库,并通过蒸馏的轻量级投影器对齐文本查询,使生成器能够直接消费检索到的运动的语义内容。在HumanML3D、KIT-ML和SnapMoGen上的广泛实验表明,我们的检索器达到了最先进的准确性,而ReMoMask-2在KIT-ML和SnapMoGen上实现了最低的FID;值得注意的是,其单一的掩码-Transformer阶段超越了ReMoMask的完整两阶段流程,并提供了最快的推理。
查看原文
查看缓存全文

缓存时间: 2026/09/15 02:39

论文页面 - ReMoMask-2:潜在检索增强掩码动作生成

来源:https://huggingface.co/papers/2609.08365

摘要

ReMoMask通过层级对比检索与拓扑感知融合技术改进了文本到动作生成,而ReMoMask-2通过将检索直接嵌入生成器的潜在空间,消除了表征差距。

文本到动作(T2M)生成将自然语言映射为人体关节运动,可应用于游戏、VR和机器人领域。检索增强文本到动作(RAG-T2M)通过检索动作-文本对作为条件,提升了复杂描述的生成效果。然而现有RAG-T2M模型面临两大挑战:粗粒度的检索与融合机制忽略了人体运动的层级化时空拓扑结构;同时存在表征差距问题——检索证据所处的语义空间与生成器的潜在空间相互分离。为应对第一项挑战,我们提出ReMoMask这一结构感知RAG框架,其核心创新包括:层级双向动量对比学习技术,用于对齐全局与局部特征与文本的对应关系;语义时空注意力模块,实现拓扑感知融合;以及拓扑结构化掩码策略,通过自适应掩码强制模型学习鲁棒的局部特征定位。为解决表征差距,我们引入ReMoMask-2,该模型直接在生成器预量化潜在空间内重建检索数据库,并通过蒸馏轻量级投影器对齐文本查询,使生成器能直接摄取检索动作的语义内容。在HumanML3D、KIT-ML和SnapMoGen数据集上的大量实验证明,我们的检索器达到了最先进的准确度,而ReMoMask-2在KIT-ML和SnapMoGen上取得了最低的FID分数;值得注意的是,其单掩码Transformer架构不仅超越了ReMoMask的完整两阶段流程,还实现了最快的推理速度。

查看arXiv页面 (https://arxiv.org/abs/2609.08365) 查看PDF (https://arxiv.org/pdf/2609.08365) 项目主页 (https://aigeeksgroup.github.io/ReMoMask-2) GitHub0 (https://github.com/AIGeeksGroup/ReMoMask-2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08365)

通过智能助手获取此论文:

hf papers read 2609.08365

尚未安装最新版CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用本文的模型0

无模型关联此论文

在模型README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。

引用本文的数据集0

无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。

引用本文的Spaces0

无Space关联此论文

在Space README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。

包含本文的收藏0

无收藏包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。

MotiMotion:基于视觉推理的运动控制视频生成

Hugging Face Daily Papers

MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。