@DanKornas: 编写双人音频演示不应只是拼接独立的语音片段。Dia 是一个1.6B参数的文本到…

X AI KOLs Timeline 模型

摘要

Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。

编写双人音频演示不应只是拼接独立的语音片段。 Dia 是一个1.6B参数的文本转语音模型,面向研究人员和开发者,可根据转录文本生成英语对话。 它通过交替使用 [S1] 和 [S2] 标签来创建脚本式对话,并可选的音频提示可用于声音、情感和语调的条件控制。 主要特性: • 双说话人生成 – 将带标签的转录文本转换为对话音轨 • 音频条件控制 – 接受5–10秒的提示音频及其转录文本 • 非语言提示 – 支持笑声、咳嗽、叹气、掌声等提示 • 灵活接口 – 示例涵盖 Transformers、CLI 和 Gradio UI • 公开资源 – 包含推理代码和预训练检查点链接 该仓库开源(Apache 2.0 许可)。README 指出当前模型仅支持英语,并仅在 GPU 上测试过;同时禁止身份滥用、欺骗性内容以及非法或恶意使用。 回复中的链接
查看原文
查看缓存全文

缓存时间: 2026/07/22 16:34

编写双人音频演示不应该意味着要拼接单独的语音片段。

Dia 是一个 1.6B 参数文本转语音模型,面向研究人员和开发者,能将剧本直接生成英语对话。

它通过交替使用 [S1] 和 [S2] 标记来创建脚本式对话,并支持可选的音频提示,用于控制声音、情感和语调。

主要特性: • 双人语音生成 – 将带标记的剧本转化为对话音轨 • 音频条件控制 – 接受 5–10 秒的提示音频及其转录文本 • 非语言提示 – 支持笑声、咳嗽、叹气、掌声等提示 • 灵活接口 – 示例涵盖 Transformers、CLI 和 Gradio 界面 • 公开资源 – 包含推理代码和预训练检查点链接

该仓库开源(Apache 2.0 许可证)。README 指出模型目前仅支持英语,且仅在 GPU 上测试过;同时禁止身份误用、虚假内容及非法或恶意使用。

回复中附链接

GitHub: https://github.com/nari-labs/dia

如果你对 AI、机器学习、智能体以及构建实际系统感兴趣,欢迎订阅我的免费 newsletter:http://dankornas.substack.com

相似文章

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。