标签
Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。
这是一份详尽、非赞助的 ElevenLabs 评测,评分为 8.1/10,突出其情感范围和低延迟等优势,但提醒普通用户和高产量发布者注意高昂的成本和‘再生税’。
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。
FreyaTTS 是一款紧凑型、无需分词器的土耳其语优先文本转语音模型,基于非自回归条件流匹配扩散变换器,以远小于大型系统的参数量实现了最先进的性能,并基于 Apache-2.0 许可发布。
本文识别了最佳N选择TTS评估中的一个混淆因素:ASR验证器的表面质量强烈依赖于用作评估器的ASR族。作者提出了跨族排名集成方法,在多个评估器上实现了更低的词错误率。
一份关于测试AI流水线的报告,该流水线能根据给定主题自动生成完整的播客剧集,无需任何手动编辑。
本文介绍Kokoro,一个轻量级82M参数的文本转语音模型,可在本地CPU上运行,提供跨多种语言的高质量语音合成,同时保护隐私。文章解释了如何通过Docker容器设置Kokoro,并使用兼容OpenAI的API进行简单集成。
Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。
GRAFT是一种用于零样本文本到语音的逐词发音调节机制,它利用目标单词的语音样本来控制其发音,在多种语言中显著降低了目标单词的音素错误率,同时保持了说话人相似度。
本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。
作者分享了将语音代理中的TTS替换为专为双语(阿拉伯语和英语)对话设计的自定义模型(Banter 1)的经验,这显著降低了感知延迟。
Kyutai 发布了 Pocket TTS,这是一个文本转语音模型,只需 5 秒音频即可克隆声音,可在 CPU 上运行,并以 MIT 许可证发布。该模型在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。
这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。
LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。
Alexandria 是一个开源工具,利用 AI 驱动的脚本注释和文本转语音技术将书籍转化为全语音有声书,支持本地/云端大语言模型、语音克隆以及内置的 Qwen3-TTS 引擎。
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
一位开发者记录了在NVIDIA Jetson Orin Nano上使用Kokoro-82M和持久化流构建自托管文本转语音应用的过程,实现了可靠的本地AI推理和可共享的音频输出。
TTS Arena 作为语音合成模型的盲测基准上线,用户比较匿名的 TTS 输出并投票选出更逼真的声音,实时更新排行榜。