标签
PD-GS提出了一种用于音频驱动说话头的音素驱动3D高斯泼溅方法,利用语言融合模块改善嘴唇发音并减少闭合违例。
这篇推文指出,开源方案已经可以用一张照片和一段音频生成说话的视频,无需付费订阅AI头像平台,仓库链接在回复中。
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
NVIDIA Audio2Face-3D 从音频生成高保真3D面部动画,提供准确的唇形同步和情感表达。它以开源SDK形式发布,包含预训练模型以及Maya和Unreal Engine 5的插件。
LongCat-Video-Avatar 1.5 是一个升级的开源框架,用于音频驱动的人像视频生成,具备更优的唇形同步、生产级稳定性及高效的8步推理能力。