@rohanpaul_ai:我没想到 Soniox TTS v2(一个文本转语音模型)会听起来这么自然。他们刚刚发布这个 TTS v2 > 真…
摘要
Soniox TTS v2 是一款新的文本转语音模型,提供优质语音质量、通过音频标签实现的表现力控制、高保真语音克隆、支持 60 多种语言,以及低延迟流式传输,定价为每生成小时 0.70 美元。
查看缓存全文
缓存时间: 2026/08/12 08:46
我没想到Soniox TTS v2(一种文本转语音模型)听起来会这么自然。
他们刚刚发布了这个TTS v2
真正优质的语音质量,价格却大幅降低(每生成小时仅需0.70美元)
同时让同一个模型依然适用于实时AI代理、多语言语音、表现力控制和克隆。
卓越的精确度、高保真语音克隆
60多种语言、自然语言混用以及低延迟流式输出,全部集成在一个模型中。
一个模型取代了大量语音技术栈的底层管道:表现力控制、语音克隆、60+种语言、语言混用、发音精确度以及流式输出,全都集成在同一个系统中。
它为实时AI代理做了异常出色的设计:低延迟流式输出加上字符级时间戳,让代理可以提前开始说话,被打断时干净利落地停止,并在恢复时不会重复已说过的内容。
语音表现变得可编程:开发者可以在生成的文本中插入音频标签,以实现低语、兴奋、笑声、停顿以及其他表达方式的变化。
Soniox(@soniox_ai): 隆重推出Soniox TTS v2,这是我们有史以来最强大的文本转语音模型。
Soniox TTS v2带来了非凡的语音质量、通过音频标签实现的表达控制、卓越的精确度、高保真语音克隆、60多种语言、自然语言混用以及低延迟
相似文章
@ZyphraAI: 今天我们发布 ZONOS2,我们的下一代实时 TTS 模型,具有高保真语音克隆功能。ZONOS2 是最…
Zyphra 发布了 ZONOS2,一个开源的实时 TTS 模型,具有高保真语音克隆功能,采用 Apache 2.0 许可,可在基于 AMD 的 Zyphra Cloud 上使用。
@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
@akshay_pachaar: 这个TTS模型生成语音的速度比人耳听到快167倍。Supertonic 是一款通过ONNX实现跨平台推理的设备端TTS引擎…
Supertonic 是一款新的开源TTS引擎,通过ONNX在设备上运行,支持31种语言,在速度上超越ElevenLabs,即使在无GPU的树莓派上也能运行。
@0x0SojalSec: 别再为ElevenLabs或云端TTS付费了。只需3秒即可在笔记本电脑上完全本地克隆声音,将你的文档转…
一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。
@MosiAI_Official: MOSS-TTS Local Transformer v1.5 现已推出。克隆任意声音。说任何语言。听到每一个细节。30多种语言,48 kHz …
MosiAI发布了MOSS-TTS Local Transformer v1.5,这是一款支持语音克隆、30多种语言以及48 kHz高质量输出的文本转语音模型。