audio-driven

标签

Cards List
#audio-driven

PD-GS:音素驱动的3DGS用于音频驱动说话头

arXiv cs.AI · 2026-08-07 缓存

PD-GS提出了一种用于音频驱动说话头的音素驱动3D高斯泼溅方法,利用语言融合模块改善嘴唇发音并减少闭合违例。

0 人收藏 0 人点赞
#audio-driven

@iluciddreaming: 别急着给 AI avatar 交月费。 开源已经能做到: 一张照片 + 一段音频 = 会说话的视频。 免费,自己架。 平台卖的,本质就是这个。 仓库链接在 reply。

X AI KOLs Timeline · 2026-08-03 缓存

这篇推文指出,开源方案已经可以用一张照片和一段音频生成说话的视频,无需付费订阅AI头像平台,仓库链接在回复中。

0 人收藏 0 人点赞
#audio-driven

@DanKornas:构建个性化数字人不应需要从不同项目中拼凑预处理、训练和推理……

X AI KOLs Timeline · 2026-07-25 缓存

Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。

0 人收藏 0 人点赞
#audio-driven

@tom_doerr: 从音频生成高保真3D面部动画,具有准确的唇形同步和细腻的情感表达…

X AI KOLs Following · 2026-07-15 缓存

NVIDIA Audio2Face-3D 从音频生成高保真3D面部动画,提供准确的唇形同步和情感表达。它以开源SDK形式发布,包含预训练模型以及Maya和Unreal Engine 5的插件。

0 人收藏 0 人点赞
#audio-driven

meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face

Reddit r/LocalLLaMA · 2026-05-23 缓存

LongCat-Video-Avatar 1.5 是一个升级的开源框架,用于音频驱动的人像视频生成,具备更优的唇形同步、生产级稳定性及高效的8步推理能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈