@DanKornas: 编写双人音频演示不应只是拼接独立的语音片段。Dia 是一个1.6B参数的文本到…
摘要
Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。
查看缓存全文
缓存时间: 2026/07/22 16:34
编写双人音频演示不应该意味着要拼接单独的语音片段。
Dia 是一个 1.6B 参数文本转语音模型,面向研究人员和开发者,能将剧本直接生成英语对话。
它通过交替使用 [S1] 和 [S2] 标记来创建脚本式对话,并支持可选的音频提示,用于控制声音、情感和语调。
主要特性: • 双人语音生成 – 将带标记的剧本转化为对话音轨 • 音频条件控制 – 接受 5–10 秒的提示音频及其转录文本 • 非语言提示 – 支持笑声、咳嗽、叹气、掌声等提示 • 灵活接口 – 示例涵盖 Transformers、CLI 和 Gradio 界面 • 公开资源 – 包含推理代码和预训练检查点链接
该仓库开源(Apache 2.0 许可证)。README 指出模型目前仅支持英语,且仅在 GPU 上测试过;同时禁止身份误用、虚假内容及非法或恶意使用。
回复中附链接
GitHub: https://github.com/nari-labs/dia
如果你对 AI、机器学习、智能体以及构建实际系统感兴趣,欢迎订阅我的免费 newsletter:http://dankornas.substack.com
相似文章
@DanKornas:构建实时语音智能体需要协调音频流、轮次检测、中断、模型调用和媒体路由…
VideoSDK AI Agents 是一个开源 Python 框架,用于构建生产可用的实时语音和多模态 AI 智能体,这些智能体可以以参与者身份加入 VideoSDK 房间,支持统一 Pipeline 配置和多种执行模式。
@DanKornas: myshell-ai/OpenVoice 即时语音克隆,支持风格和语言控制 GitHub: 存档:
OpenVoice 是一个开源的即时语音克隆模型,具备风格和语言控制能力,现已在 GitHub 上可用。
@DanKornas:构建个性化数字人不应需要从不同项目中拼凑预处理、训练和推理……
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
SpeechDx:临床语音AI的多任务基准
SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。
@DanKornas: 实时语音智能体需要的不仅仅是 LLM 调用——它们还需要传输、语音组件、通话处理以及部署路径。
TEN 是一个用于构建实时多模态对话式 AI 智能体的框架,提供可配置的 STT、LLM 和 TTS 组件、可视化设计器,以及包括自托管和拆分部署在内的部署选项。