@DanKornas:构建个性化数字人不应需要从不同项目中拼凑预处理、训练和推理……
摘要
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
查看缓存全文
缓存时间: 2026/07/25 22:13
构建一个特定人物的讲话头部模型,不应需要从不同的项目中拼凑预处理、训练和推理流程。
超轻量数字人是一个Python项目,用于从一段短视频中训练一个特定人物的、音频驱动的数字人。
它能帮助你通过提取面部地标和音频特征,然后进行UNet训练和推理,将一段3-5分钟的全脸视频转化为训练好的讲话头部工作流。
主要特点: • 特定人物工作流 – 为源视频中的身份训练一个专用的模型。 • 双音频路径 – 支持25帧/秒的HuBERT和20帧/秒的WeNet。 • 端到端指导 – 涵盖预处理、训练、推理以及最终的音频/视频合并。 • ONNX导出检查 – 导出检查点,并对比ONNX Runtime输出与PyTorch。 • 流式演示 – 使用WeNet和ONNX Runtime处理10毫秒的PCM帧。
免费的公开GitHub仓库。
链接见回复
GitHub: https://github.com/anliyuan/Ultralight-Digital-Human…
如果你对AI、机器学习、智能体和构建真实系统感兴趣,请订阅我的新闻通讯(免费):http://dankornas.substack.com
如果AI编程助手无法看到项目的最新文档,它可能会猜错API。
GitMCP 是一个远程模型上下文协议服务器,适用于希望AI助手与公开GitHub仓库和GitHub Pages文档一起工作的构建者。
它通过将文档获取、文档搜索、链接页面检索以及GitHub代码搜索暴露为MCP工具,帮助你将编程答案基于当前项目资料。
主要特点: • 仓库特定的端点 – 让助手专注于选定的一个项目。 • 通用端点 – 在不同公开仓库之间切换,无需为每个仓库配置单独的服务器。 • 文档优先级 – 首先检查llms.txt,然后是AI优化文档,接着是README或根页面。 • 定向搜索 – 检索相关文档和代码,而不是加载整套文档集。 • 托管或自托管 – 使用无需注册的云服务,或自行部署开源项目。
它是开源的(Apache License 2.0),不过package.json当前声明为ISC。
链接见回复
相似文章
@victormustar: https://x.com/victormustar/status/2059264598407033062
这篇文章描述了如何使用Hugging Face的ZeroGPU和一个编码代理,以有限的预算自主部署AI模型,特别是LongCat说话头像模型。
@tom_doerr: 从音频生成高保真3D面部动画,具有准确的唇形同步和细腻的情感表达…
NVIDIA Audio2Face-3D 从音频生成高保真3D面部动画,提供准确的唇形同步和情感表达。它以开源SDK形式发布,包含预训练模型以及Maya和Unreal Engine 5的插件。
@DanKornas: 想要生成头像视频但不想将面部和语音数据发送到云端服务?Duix.Avatar 是一款本地 AI 工具…
Duix.Avatar 是一款本地 AI 头像工具包,能够根据视频、语音和脚本输入生成口型同步的头像视频,无需将数据发送到云端。它支持八种语言,并在 GitHub 上以社区许可证发布。
@victormustar: 新消息:LongCat 刚刚发布了一个优秀的开源说话头像模型(可能是 SOTA)+ MIT 许可,制作了一个 Hugging F…
LongCat 发布了一个开源说话头像模型(可能是最先进的),采用 MIT 许可,并提供了 Hugging Face 演示,可应用于 AI 导师、配音、编码智能体等多种场景。
@DanKornas: 当推理、模型配置和集成路径集中在一处时,构建视频生成工作流程会更加容易。L…
LTX-Video 是 Lightricks 开发的一个开源 Python 仓库,用于在本地使用 LTX-Video 模型生成和调节视频,支持文本/图像输入、多条件工作流程,并与 ComfyUI 和 Diffusers 集成。