tts

标签

Cards List
#tts

@mattpocockuk: 在我的课程创建过程中尝试新事物 - 动画草图 - AI生成的静态图+语音(通过TTS)帮助我预见……

X AI KOLs Following ↗ · 昨天 缓存

作者描述了在课程视频制作中实验使用AI生成的静态图像和文本转语音技术创建动画草图,这有助于在拍摄前规划并识别问题。

0 人收藏 0 人点赞
#tts

@Gorden_Sun: NotebookLM 已集成 Gemini 3.8 TTS,能够完美朗读中文,毫无问题——这也是一个快速的方式去……

X AI KOLs Timeline ↗ · 昨天 缓存

NotebookLM 已集成 Gemini 3.8 TTS,使得中文阅读完美无瑕,并为知识创作者提供快速视频制作能力,同时讨论了多种 AI 视频内容方案。

0 人收藏 0 人点赞
#tts

深入sanoTTS — 一个拥有294,279个参数的TTS系统 [P]

Reddit r/MachineLearning ↗ · 2026-09-20

文章介绍了sanoTTS,一个紧凑的294,279参数TTS系统,并展示了一个交互式网站来探索其内部机制。

0 人收藏 0 人点赞
#tts

Voice Acting Arena

Reddit r/LocalLLaMA ↗ · 2026-09-15

Voice Acting Arena的推出,这是一个通过用户比较来评估配音AI模型的平台,旨在评估其在表演、指导和真实性方面的表现。

0 人收藏 0 人点赞
#tts

HN上展示:Nari Qwen3-TTS 和 Qwen3-ASR – 高准确率、低延迟和低成本

Hacker News Top ↗ · 2026-09-14 缓存

Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。

0 人收藏 0 人点赞
#tts

@nikola_mr64990: 这简直太疯狂了!一个独立开发者刚刚开源了一个100%免费的ElevenLabs替代品,它完全在你自己的机器上运行……

X AI KOLs Timeline ↗ · 2026-09-13 缓存

一位独立开发者开源了一款免费的本地AI工具,作为ElevenLabs的替代品,支持语音克隆、646种语言的视频配音等功能,且所有数据均不离开用户设备。

0 人收藏 0 人点赞
#tts

LoudKit:本地TTS,支持声音克隆、10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK

Reddit r/LocalLLaMA ↗ · 2026-09-10

LoudKit是一款开源的本地TTS工具,支持声音克隆和10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK,专为在边缘设备上高效运行而设计。

0 人收藏 0 人点赞
#tts

@TeksEdge: 腾讯开源了一个小型1.5B AI模型,能替代多个独立音频工具,击败Qwen3-TTS!Thi…

X AI KOLs Timeline ↗ · 2026-09-10 缓存

腾讯开源了一个名为AuK的1.5B参数AI模型,可以替代多个音频工具,通过自然语言指令处理TTS、语音克隆和降噪等任务。

0 人收藏 0 人点赞
#tts

X2-NativeCursor:原生令牌文本进度跟踪,用于增量文本流式编解码器TTS

arXiv cs.CL ↗ · 2026-09-10 缓存

X2-NativeCursor是一个轻量级观察器,用于在使用原生语音令牌的增量文本流式TTS系统中跟踪文本进度,与基于波形的基线相比,实现了更低的错误和更快的对齐。

0 人收藏 0 人点赞
#tts

@gonzalo_io:语音AI基准测试。一站式。我搭建了这个:https://voicebenchmarks.com 一个你可以找到最佳基准测试的地方……

X AI KOLs Timeline ↗ · 2026-09-07 缓存

一个名为 voicebenchmarks.com 的开源网站,旨在集中语音AI基准测试,包括TTS、LLM、STT等,提供用户友好界面,并欢迎社区贡献。

0 人收藏 0 人点赞
#tts

构建与评估基于合成语音的固定语音泰语TTS

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。

0 人收藏 0 人点赞
#tts

在修复流式传输后,语音代理延迟还隐藏在哪里?

Reddit r/AI_Agents ↗ · 2026-09-01

本文讨论了在启用流式传输后,语音代理系统中隐藏的延迟来源,并寻求关于实时代理关键性能指标的建议。

0 人收藏 0 人点赞
#tts

@neilzegh:大多数语音提供商都提供“max”和“flash”版本,其中“max”版本可靠,而“flash”版本……

X AI KOLs Timeline ↗ · 2026-08-31 缓存

Gradium发布了一款新的文本转语音模型,该模型结合了高准确率和低延迟,通过智能上下文处理和静音修剪,实现了低于250毫秒的首次音频时间。

0 人收藏 0 人点赞
#tts

@Huahuazo: 这声音克隆工具我试完直接愣住了。 随手截了8秒自己说话的录音扔进去,出来的声音——语气、停顿、那种欠欠的调调,简直跟我本人在抬杠一模一样。 最绝的是完全本地跑,音频不用上传,隐私安全直接拉满。说实话第一反应不是厉害,是头皮发麻:以后光凭一…

X AI KOLs Timeline ↗ · 2026-08-30 缓存

介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。

0 人收藏 0 人点赞
#tts

@leeoxiang: 确实非常轻量的 TTS 实现,尝试用 2000 个小时数据复现了一下 Audio8的从头训练,在 H200上训了不到 10 个小时 SIM 指标就已经达到 0.72了。

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。

0 人收藏 0 人点赞
#tts

TontaubeV1 - 本地长篇生成开放语音合成模型发布

Reddit r/LocalLLaMA ↗ · 2026-08-28

TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。

0 人收藏 0 人点赞
#tts

Is there an uncanny valley for AI voices?

Reddit r/ArtificialInteligence ↗ · 2026-08-27 缓存

Bland团队探讨AI语音的恐怖谷效应,并开发能模拟人类不完美特质的TTS模型,以提升电话交互的自然感和人性化体验。

0 人收藏 0 人点赞
#tts

[audio.cpp] 版本 0.7:62 个音频模型家族(85+ 变体)、模型比较的 Arena UI、MiniMax Music 3、FireRed TTS3/Audio、ControlFoley、Personaplex 等更多内容

Reddit r/LocalLLaMA ↗ · 2026-08-27

audio.cpp 版本 0.7 引入了一个新的 Arena UI,用于本地比较音频模型,扩展至 62 个模型家族,拥有超过 85 个变体,并支持在边缘硬件如 NVIDIA Jetson Orin 上部署。

0 人收藏 0 人点赞
#tts

@krandiash: 我们的新TTS模型Sonic-3.6现已全面上线。上周作为AA上的第一模型进入预览,很高兴看到…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

Cartesia的TTS模型Sonic-3.6现已全面上线,从架构层面进行了重建,并在预览阶段收到了积极反馈。

0 人收藏 0 人点赞
#tts

我们将3个公开的TTS排行榜合并为一个包含110个模型的综合排名

Reddit r/AI_Agents ↗ · 2026-08-26

一个新的综合排名将三个公开的TTS排行榜合并为一个统一的排名,涵盖110个模型和46个提供商,每周更新并采用固定方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈