text-to-speech

标签

Cards List
#text-to-speech

@Sumanth_077:用于构建实时语音AI Agent的开源框架!Pipecat是一个Python框架,用于编排音频、视频……

X AI KOLs Timeline · 2026-07-16 缓存

Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。

0 人收藏 0 人点赞
#text-to-speech

​ElevenLabs 评测 (2026) —— 为什么我给它打 8.1/10(以及谁应该避免付费)

Reddit r/ArtificialInteligence · 2026-07-15

这是一份详尽、非赞助的 ElevenLabs 评测,评分为 8.1/10,突出其情感范围和低延迟等优势,但提醒普通用户和高产量发布者注意高昂的成本和‘再生税’。

0 人收藏 0 人点赞
#text-to-speech

推出 Real World VoiceEQ:衡量语音AI的拟人化质量

Hugging Face Blog · 2026-07-15 缓存

Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。

0 人收藏 0 人点赞
#text-to-speech

VocalVia

Product Hunt · 2026-07-13

VocalVia 是一款将文档和文章转换为可编辑的多语音音频的工具。

0 人收藏 0 人点赞
#text-to-speech

FreyaTTS 技术报告

arXiv cs.CL · 2026-07-13 缓存

FreyaTTS 是一款紧凑型、无需分词器的土耳其语优先文本转语音模型,基于非自回归条件流匹配扩散变换器,以远小于大型系统的参数量实现了最先进的性能,并基于 Apache-2.0 许可发布。

0 人收藏 0 人点赞
#text-to-speech

最佳-$N$ TTS评估受到ASR族对齐的混淆

arXiv cs.CL · 2026-07-10 缓存

本文识别了最佳N选择TTS评估中的一个混淆因素:ASR验证器的表面质量强烈依赖于用作评估器的ASR族。作者提出了跨族排名集成方法,在多个评估器上实现了更低的词错误率。

0 人收藏 0 人点赞
#text-to-speech

我测试了一个AI流水线,它可以将一个主题转化为完整的播客剧集,无需手动编辑

Reddit r/ArtificialInteligence · 2026-07-07

一份关于测试AI流水线的报告,该流水线能根据给定主题自动生成完整的播客剧集,无需任何手动编辑。

0 人收藏 0 人点赞
#text-to-speech

使用Kokoro实现本地、CPU友好、高质量的文本转语音(TTS)

Hacker News Top · 2026-07-07 缓存

本文介绍Kokoro,一个轻量级82M参数的文本转语音模型,可在本地CPU上运行,提供跨多种语言的高质量语音合成,同时保护隐私。文章解释了如何通过Docker容器设置Kokoro,并使用兼容OpenAI的API进行简单集成。

0 人收藏 0 人点赞
#text-to-speech

Gepard:面向实时对话的0.6B流式TTS模型——20倍实时因子、约50ms首音延迟、vLLM原生支持、Apache 2.0许可

Reddit r/LocalLLaMA · 2026-07-07 缓存

Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。

0 人收藏 0 人点赞
#text-to-speech

GRAFT:用于零样本文本到语音中细粒度发音的嫁接参考音频

arXiv cs.LG · 2026-07-07 缓存

GRAFT是一种用于零样本文本到语音的逐词发音调节机制,它利用目标单词的语音样本来控制其发音,在多种语言中显著降低了目标单词的音素错误率,同时保持了说话人相似度。

0 人收藏 0 人点赞
#text-to-speech

LuxSQA: 用卢森堡语问我——基于TTS增强的语音问答

arXiv cs.CL · 2026-07-07 缓存

本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。

0 人收藏 0 人点赞
#text-to-speech

我给我的语音代理更换了TTS,结果它比任何其他方式都更有效地减少了人们实际感受到的延迟

Reddit r/AI_Agents · 2026-07-06

作者分享了将语音代理中的TTS替换为专为双语(阿拉伯语和英语)对话设计的自定义模型(Banter 1)的经验,这显著降低了感知延迟。

0 人收藏 0 人点赞
#text-to-speech

Kyutai 的 Pocket TTS 能在 CPU 上运行,仅需 5 秒音频即可克隆声音,采用 MIT 许可证发布。在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。

Reddit r/LocalLLaMA · 2026-07-06

Kyutai 发布了 Pocket TTS,这是一个文本转语音模型,只需 5 秒音频即可克隆声音,可在 CPU 上运行,并以 MIT 许可证发布。该模型在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。

0 人收藏 0 人点赞
#text-to-speech

统一音频智能,且不牺牲文本智能

Hugging Face Daily Papers · 2026-07-06 缓存

这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。

0 人收藏 0 人点赞
#text-to-speech

@NFTCPS: 电诈园区又有新武器用了,语音克隆这块又被卷到新高度了。 LuxTTS,一个轻量级 TTS 模型,我看完只想说三个字:真离谱。 快:单卡 150 倍实时,连 CPU 都能跑得比真人说话还快 清:直接 48khz,大部分模型还卡在 24khz…

X AI KOLs Timeline · 2026-07-05 缓存

LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。

0 人收藏 0 人点赞
#text-to-speech

@tom_doerr: Alexandria 使用 AI 从书籍生成有声书 https://github.com/Finrandojin/alexandria-audiobook…

X AI KOLs Timeline · 2026-07-04 缓存

Alexandria 是一个开源工具,利用 AI 驱动的脚本注释和文本转语音技术将书籍转化为全语音有声书,支持本地/云端大语言模型、语音克隆以及内置的 Qwen3-TTS 引擎。

0 人收藏 0 人点赞
#text-to-speech

SPARCLE:基于对比语言嵌入的说话者感知对齐表示

arXiv cs.CL · 2026-07-03 缓存

SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。

0 人收藏 0 人点赞
#text-to-speech

@cevenif: 兄弟们,那些还得掏钱才能用的语音工具,是时候跟它们说88了! 开源免费的 Voicebox 已经杀出来了,直接把 ElevenLabs 和 WisprFlow 这两家付费巨头按在地上摩擦。 功能: 声音克隆,秒变任何人 全局语音输入,随时…

X AI KOLs Timeline · 2026-07-02 缓存

一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。

0 人收藏 0 人点赞
#text-to-speech

通过持久化流在Jetson上部署本地AI服务

Lobsters Hottest · 2026-06-30 缓存

一位开发者记录了在NVIDIA Jetson Orin Nano上使用Kokoro-82M和持久化流构建自托管文本转语音应用的过程,实现了可靠的本地AI推理和可共享的音频输出。

0 人收藏 0 人点赞
#text-to-speech

@realmrfakename: TTS Arena 已上线。从头重建的语音合成盲测基准 - 听取两个匿名模型,p…

X AI KOLs Following · 2026-06-29 缓存

TTS Arena 作为语音合成模型的盲测基准上线,用户比较匿名的 TTS 输出并投票选出更逼真的声音,实时更新排行榜。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈