标签
HOI-Retarget 介绍了一种以接触为中心的重定向方法,用于将人与物体交互转移到人形机器人上,从而能够从单次演示和单目视频接触中生成大规模运动数据。
Kirin通过从野外视频重建3D动物运动来创建AiM3D数据集,并生成基于文本和图像条件的运动以动画化3D网格。
Sorceress 3D Studio 提供了一站式AI流水线,将文本描述转换为游戏级3D动画,支持自动绑骨和多种动作生成,可直接导出到游戏引擎。
PRISM是一个拥有14亿参数的文本生成动作模型,能够从文本命令生成精确的动作序列,返回SMPL-X参数,可用于3D绑定。
本文研究使用基于Transformer的生成模型从日本演员的动作捕捉数据中学习情感身体运动,生成基于离散情感标签的运动。评估表明,生成的运动在用于数据增强时能提升情感识别性能,并实现情感强度间的平滑过渡。
PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。
本文识别出由以人为中心的管道导致的人形机器人共语动作生成中的具身差距,并提出PhysDrift,一种具身感知框架,直接从语音预测可执行的人形机器人关节轨迹,改善了语音-动作对齐和物理合理性。
提出MotionVLA,一种用于人形运动生成的视觉-语言-动作模型,采用双流频率分词器分别编码姿态和物理动态,实现了更高的多样性和一致性。
VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。