我们构建了NeuTTS-2E,一个支持7种可控情感的开源设备端TTS模型
摘要
NeuTTS-2E是一个支持7种可控情感的开源设备端TTS模型。
暂无内容
相似文章
@multimodalart: 他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,实现了SOTA级别的TTS情感控制???试试看……
LTX-2.3模型音频组件的微调版本在文本转语音中实现了最先进的情感控制,现已在Hugging Face Space上以DramaBox(由ResembleAI提供)的形式提供。
@akshay_pachaar: 这个TTS模型生成语音的速度比人耳听到快167倍。Supertonic 是一款通过ONNX实现跨平台推理的设备端TTS引擎…
Supertonic 是一款新的开源TTS引擎,通过ONNX在设备上运行,支持31种语言,在速度上超越ElevenLabs,即使在无GPU的树莓派上也能运行。
Aratako/Irodori-TTS-500M-v3
Irodori-TTS-500M-v3是一个基于Rectified Flow Diffusion Transformer的日语TTS模型,支持零样本语音克隆以及独特的基于表情符号的风格/音效控制。
@AlphaSignalAI:一个66M参数的模型刚刚在树莓派上击败了ElevenLabs。文本转语音多年来一直存在于云端。每个语音…
Supertonic 3是一个99M参数的开源TTS模型,完全在设备上运行,在树莓派上击败了ElevenLabs,在笔记本电脑CPU上的性能是实时的167倍。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。