标签
提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。
本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。