深入sanoTTS — 一个拥有294,279个参数的TTS系统 [P]
摘要
文章介绍了sanoTTS,一个紧凑的294,279参数TTS系统,并展示了一个交互式网站来探索其内部机制。
sanoTTS是如何工作的?我以直觉编码的方式制作了这个网站来展示sanoTTS内部是什么?页面上显示的每一个张量都是从发布的int8模型中捕获的真实中间值,在它合成一个实际句子时;没有模拟数据,没有替代数据。看看这个:https://ampixa.github.io/sanotts-anatomy/ 创建这个是为了探索sanoTTS处理句子的深入机制。这就是我为什么喜欢用直觉编码来学习;通过交互式可视化理解核心。
相似文章
我推出了 sanoTTS:最小的完整TTS栈,拥有294k参数(337 KB),可在$3微控制器上运行;还有一个1.46m版本,性能超越了3倍和10倍大小的模型。
sanoTTS 是一系列紧凑的TTS模型,其中最小的拥有294k参数,专为微控制器优化,并在基准测试中超越更大的模型。
IndexTTS: 一个工业级可控高效的零样本 文本转语音系统
IndexTTS 是一个增强型文本转语音系统,结合了 XTTS 和 Tortoise 模型,采用混合字符-拼音建模和优化的向量量化,在自然度、发音可控性和推理速度上优于现有的开源 TTS 系统。
文本转语音(TTS)基准测试更新:引入客观标准和盲投票(已涵盖46个模型,持续增加中)
更新后的TTS基准测试引入了客观标准和实时盲投票机制,为46+模型创建ELO排名,并向社区开放参与。
CPU TTS基准测试与UTMOS MOS评分:Kokoro、Supertonic、Inflect-Nano和Kyutai的新Pocket TTS [P]
一项CPU TTS基准测试使用UTMOS MOS评分对比了Kokoro、Supertonic、Inflect-Nano和Kyutai的Pocket TTS,揭示了关于RTF缩放、UTMOS在小声码器上的局限性以及未记录的输出上限的有趣发现。Pocket TTS在CPU上提供了独特的零样本声音克隆能力。
@AlphaSignalAI:一个66M参数的模型刚刚在树莓派上击败了ElevenLabs。文本转语音多年来一直存在于云端。每个语音…
Supertonic 3是一个99M参数的开源TTS模型,完全在设备上运行,在树莓派上击败了ElevenLabs,在笔记本电脑CPU上的性能是实时的167倍。