标签
本文研究使用基于Transformer的生成模型从日本演员的动作捕捉数据中学习情感身体运动,生成基于离散情感标签的运动。评估表明,生成的运动在用于数据增强时能提升情感识别性能,并实现情感强度间的平滑过渡。
PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。
本文识别出由以人为中心的管道导致的人形机器人共语动作生成中的具身差距,并提出PhysDrift,一种具身感知框架,直接从语音预测可执行的人形机器人关节轨迹,改善了语音-动作对齐和物理合理性。
提出MotionVLA,一种用于人形运动生成的视觉-语言-动作模型,采用双流频率分词器分别编码姿态和物理动态,实现了更高的多样性和一致性。
VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。