标签
UniSwap 是一个用于说话视频中联合音视频身份交换的新框架,利用统一的流式音视频扩散 Transformer 来替换外观和嗓音音色,同时保留源内容与动态。
这篇推文指出,开源方案已经可以用一张照片和一段音频生成说话的视频,无需付费订阅AI头像平台,仓库链接在回复中。