标签
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
Duix.Avatar 是一款本地 AI 头像工具包,能够根据视频、语音和脚本输入生成口型同步的头像视频,无需将数据发送到云端。它支持八种语言,并在 GitHub 上以社区许可证发布。
本文介绍了PolyInterview,一个基于LLM的平台,通过唇形同步的数字人进行沉浸式模拟面试,并对回答内容、声音表达和非语言行为提供全面的多模态评估。该系统生成针对角色的定制问题,并利用与KSA和STAR框架相关的13个行为特征对考生进行评估。
Fay是一个完全开源、商用免费的数字人框架,支持全离线运行、模块化设计、MCP工具调用和仿生记忆,内置Web管理界面,可快速搭建虚拟主播、智能客服、个人AI助理等应用。
SpatialAvatar-0 提出了一种基于共享 FLAME 网格绑定高斯表示的多阶段重建方法,用于高质量4D头部虚拟形象,在多个基准测试中实现了更优性能,且迭代次数更少。
介绍开源项目Pixelle-Video:一个全自动AI短视频引擎,输入主题即可自动生成带文案、配图、语音和背景音乐的视频,支持本地和云端模型,模块化设计可灵活替换各环节模型。
美团开源了LongCat-Video-Avatar-1.5模型,支持单张照片和语音生成逼真的说话视频,支持多语言、长视频,性能超越商业闭源方案。