ReMoMask-2:潜在检索增强掩码动作生成
摘要
ReMoMask-2通过将检索直接嵌入生成器的潜在空间来改进文本到动作生成,消除表示差距,并在KIT-ML和SnapMoGen等基准测试上实现最先进的结果。
查看缓存全文
缓存时间: 2026/09/15 02:39
论文页面 - ReMoMask-2:潜在检索增强掩码动作生成
来源:https://huggingface.co/papers/2609.08365
摘要
ReMoMask通过层级对比检索与拓扑感知融合技术改进了文本到动作生成,而ReMoMask-2通过将检索直接嵌入生成器的潜在空间,消除了表征差距。
文本到动作(T2M)生成将自然语言映射为人体关节运动,可应用于游戏、VR和机器人领域。检索增强文本到动作(RAG-T2M)通过检索动作-文本对作为条件,提升了复杂描述的生成效果。然而现有RAG-T2M模型面临两大挑战:粗粒度的检索与融合机制忽略了人体运动的层级化时空拓扑结构;同时存在表征差距问题——检索证据所处的语义空间与生成器的潜在空间相互分离。为应对第一项挑战,我们提出ReMoMask这一结构感知RAG框架,其核心创新包括:层级双向动量对比学习技术,用于对齐全局与局部特征与文本的对应关系;语义时空注意力模块,实现拓扑感知融合;以及拓扑结构化掩码策略,通过自适应掩码强制模型学习鲁棒的局部特征定位。为解决表征差距,我们引入ReMoMask-2,该模型直接在生成器预量化潜在空间内重建检索数据库,并通过蒸馏轻量级投影器对齐文本查询,使生成器能直接摄取检索动作的语义内容。在HumanML3D、KIT-ML和SnapMoGen数据集上的大量实验证明,我们的检索器达到了最先进的准确度,而ReMoMask-2在KIT-ML和SnapMoGen上取得了最低的FID分数;值得注意的是,其单掩码Transformer架构不仅超越了ReMoMask的完整两阶段流程,还实现了最快的推理速度。
查看arXiv页面 (https://arxiv.org/abs/2609.08365) 查看PDF (https://arxiv.org/pdf/2609.08365) 项目主页 (https://aigeeksgroup.github.io/ReMoMask-2) GitHub0 (https://github.com/AIGeeksGroup/ReMoMask-2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08365)
通过智能助手获取此论文:
hf papers read 2609.08365
尚未安装最新版CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用本文的模型0
无模型关联此论文
在模型README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。
引用本文的数据集0
无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。
引用本文的Spaces0
无Space关联此论文
在Space README.md中引用arxiv.org/abs/2609.08365即可从此页面建立链接。
包含本文的收藏0
无收藏包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从此页面建立链接。
相似文章
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。
ARDY: 混合表示的自回归扩散用于交互式人体运动生成
ARDY 引入了一个流式生成框架,用于实时、高保真度的 3D 人体运动生成,通过文本和运动学约束进行控制,采用混合表示和两阶段自回归 Transformer 去噪器。
MolmoMotion:语言引导的3D运动预测
MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。
MotiMotion:基于视觉推理的运动控制视频生成
MotiMotion提出了一种先推理后生成的框架,用于运动控制的视频生成。该框架利用视觉语言推理来优化运动轨迹,并采用置信度感知的控制方案来提高合理性,在新基准上优于现有方法。
重掩码,而非替换:掩码扩散语言模型中的 Token-to-Mask 精修
提出 Token-to-Mask(T2M)重掩码,在掩码扩散 LM 中通过将可疑 token 重置为掩码状态而非直接覆盖来修正生成错误,在 CMATH 上最高提升 5.92 准确率,无需额外训练或参数。