@rohanpaul_ai:我没想到 Soniox TTS v2(一个文本转语音模型)会听起来这么自然。他们刚刚发布这个 TTS v2 > 真…

X AI KOLs Following 模型

摘要

Soniox TTS v2 是一款新的文本转语音模型,提供优质语音质量、通过音频标签实现的表现力控制、高保真语音克隆、支持 60 多种语言,以及低延迟流式传输,定价为每生成小时 0.70 美元。

我没有预料到 Soniox TTS v2(一个文本转语音模型)会听起来这么自然。 他们刚刚发布了这个 TTS v2 > 真正优质的语音质量,价格却大幅降低(每生成小时 0.70 美元) > 同时保持同一模型适用于实时智能体、多语言语音、表现力控制和克隆。 > 卓越的精确度,高保真语音克隆 > 超过 60 种语言、自然语言混合和低延迟流式传输集中在一个模型中。 > 一个模型替代了大量语音栈的管道:表达控制、语音克隆、60+ 语言、语言混合、发音精度和流式传输都在同一个系统中。 > 它为实时 AI 智能体设计得异常出色:低延迟流式传输加上字符级时间戳,让智能体能够提前开始说话,被打断时干净地停止,并在不重复的情况下恢复。 > 语音表现变得可编程:开发者可以在生成的文本中插入音频标签,用于耳语、兴奋、笑声、停顿和其他表达方式变化。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:46

我没想到Soniox TTS v2(一种文本转语音模型)听起来会这么自然。

他们刚刚发布了这个TTS v2

真正优质的语音质量,价格却大幅降低(每生成小时仅需0.70美元)

同时让同一个模型依然适用于实时AI代理、多语言语音、表现力控制和克隆。

卓越的精确度、高保真语音克隆

60多种语言、自然语言混用以及低延迟流式输出,全部集成在一个模型中。

一个模型取代了大量语音技术栈的底层管道:表现力控制、语音克隆、60+种语言、语言混用、发音精确度以及流式输出,全都集成在同一个系统中。

它为实时AI代理做了异常出色的设计:低延迟流式输出加上字符级时间戳,让代理可以提前开始说话,被打断时干净利落地停止,并在恢复时不会重复已说过的内容。

语音表现变得可编程:开发者可以在生成的文本中插入音频标签,以实现低语、兴奋、笑声、停顿以及其他表达方式的变化。

Soniox(@soniox_ai): 隆重推出Soniox TTS v2,这是我们有史以来最强大的文本转语音模型。

Soniox TTS v2带来了非凡的语音质量、通过音频标签实现的表达控制、卓越的精确度、高保真语音克隆、60多种语言、自然语言混用以及低延迟

相似文章