@DanKornas:构建个性化数字人不应需要从不同项目中拼凑预处理、训练和推理……

X AI KOLs Timeline 工具

摘要

Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。

构建一个面向特定人物的数字人不应需要从不同项目中拼凑预处理、训练和推理。 Ultralight Digital Human 是一个 Python 项目,用于从短视频中训练面向特定人物的音频驱动数字人。 它帮助你将一段 3–5 分钟的全脸视频转化为经过训练的数字人工作流:先提取人脸关键点和音频特征,再进行 UNet 训练和推理。 主要特性: • 面向特定人物的工作流 – 为源视频中的人物训练一个专用模型。 • 双音频路径 – 支持 25 帧/秒的 HuBERT 和 20 帧/秒的 WeNet。 • 端到端指导 – 涵盖预处理、训练、推理以及最终的音频/视频合并。 • ONNX 导出检查 – 导出检查点,并对比 ONNX Runtime 与 PyTorch 的输出。 • 流式演示 – 使用 WeNet 和 ONNX Runtime 处理 10 ms 的 PCM 帧。 免费公开的 GitHub 仓库。 回复中的链接
查看原文
查看缓存全文

缓存时间: 2026/07/25 22:13

构建一个特定人物的讲话头部模型,不应需要从不同的项目中拼凑预处理、训练和推理流程。

超轻量数字人是一个Python项目,用于从一段短视频中训练一个特定人物的、音频驱动的数字人。

它能帮助你通过提取面部地标和音频特征,然后进行UNet训练和推理,将一段3-5分钟的全脸视频转化为训练好的讲话头部工作流。

主要特点: • 特定人物工作流 – 为源视频中的身份训练一个专用的模型。 • 双音频路径 – 支持25帧/秒的HuBERT和20帧/秒的WeNet。 • 端到端指导 – 涵盖预处理、训练、推理以及最终的音频/视频合并。 • ONNX导出检查 – 导出检查点,并对比ONNX Runtime输出与PyTorch。 • 流式演示 – 使用WeNet和ONNX Runtime处理10毫秒的PCM帧。

免费的公开GitHub仓库。

链接见回复

GitHub: https://github.com/anliyuan/Ultralight-Digital-Human…

如果你对AI、机器学习、智能体和构建真实系统感兴趣,请订阅我的新闻通讯(免费):http://dankornas.substack.com

如果AI编程助手无法看到项目的最新文档,它可能会猜错API。

GitMCP 是一个远程模型上下文协议服务器,适用于希望AI助手与公开GitHub仓库和GitHub Pages文档一起工作的构建者。

它通过将文档获取、文档搜索、链接页面检索以及GitHub代码搜索暴露为MCP工具,帮助你将编程答案基于当前项目资料。

主要特点: • 仓库特定的端点 – 让助手专注于选定的一个项目。 • 通用端点 – 在不同公开仓库之间切换,无需为每个仓库配置单独的服务器。 • 文档优先级 – 首先检查llms.txt,然后是AI优化文档,接着是README或根页面。 • 定向搜索 – 检索相关文档和代码,而不是加载整套文档集。 • 托管或自托管 – 使用无需注册的云服务,或自行部署开源项目。

它是开源的(Apache License 2.0),不过package.json当前声明为ISC。

链接见回复

相似文章