标签
Seedance 2.5 已发布,支持 30 秒单次生成视频、音频参考口型同步,以及异步任务和 webhooks 等 API 功能。其突出之处在于失败生成不收费,且参考视频可获得更低的 token 费率,但输出最高仅为 720p。
谷歌重点介绍了博士生实习生Khoi的研究,该研究旨在将唇部动作与配音音频同步,为YouTube制作自然流畅的多语言视频。
Duix.Avatar 是一款本地 AI 头像工具包,能够根据视频、语音和脚本输入生成口型同步的头像视频,无需将数据发送到云端。它支持八种语言,并在 GitHub 上以社区许可证发布。
NVIDIA Audio2Face-3D 从音频生成高保真3D面部动画,提供准确的唇形同步和情感表达。它以开源SDK形式发布,包含预训练模型以及Maya和Unreal Engine 5的插件。
讨论AI社交应用从文字聊天到实时视频交互的演变,重点介绍了Mel的多模态交互栈以及延迟、唇形同步和协调等技术挑战。
美团开源了LongCat-Video-Avatar-1.5模型,支持单张照片和语音生成逼真的说话视频,支持多语言、长视频,性能超越商业闭源方案。
LongCat-Video-Avatar 1.5 是一个升级的开源框架,用于音频驱动的人像视频生成,具备更优的唇形同步、生产级稳定性及高效的8步推理能力。
像sync.so这样的AI唇同步工具可以重新绘制嘴部动作以匹配配音音频,可能化解长期以来关于配音因嘴部动作不匹配而破坏沉浸感的争论。