@RemiCadene: Gradium 比 ElevenLabs 和 Cartesia 更好?
摘要
Gradium 发布了新的 TTS 模型公测版,能原生准确读取电话号码、邮件地址、IBAN 以及时间表达式,并提供 API 接口和 100 万积分用于测试。
查看缓存全文
缓存时间: 2026/07/30 22:00
Gradium 比 ElevenLabs 和 Cartesia 更强?😮
Gradium(@GradiumAI): 全新的 Gradium TTS 模型现处于公开测试阶段。它能够原生正确地读出电话号码、电子邮件、IBAN 及时间表达式。
通过 API 进行测试,针对你的生产场景发送反馈,即可获得 100 万额度积分。
几秒钟之内为你的编程助手配好 Prompt:
相似文章
Gepard:面向实时对话的0.6B流式TTS模型——20倍实时因子、约50ms首音延迟、vLLM原生支持、Apache 2.0许可
Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。
@GoJun315: 本地跑的开源 TTS,把 ElevenLabs 干掉了。 Supertonic,完全跑在本地的语音合成模型,不联网、零 API 费用。 - 仅 99M 参数,M4 Pro 上比实时快 167 倍,树莓派也能跑 - 支持 31 种语言,覆盖…
Supertonic is a lightning-fast, on-device TTS model with 99M parameters, supporting 31 languages. It runs locally with no API costs, outperforms cloud TTS on accuracy for numbers, phone numbers, and technical terms, and can be installed via Python, Node.js, Rust, Go, and more.
@AlphaSignalAI:一个66M参数的模型刚刚在树莓派上击败了ElevenLabs。文本转语音多年来一直存在于云端。每个语音…
Supertonic 3是一个99M参数的开源TTS模型,完全在设备上运行,在树莓派上击败了ElevenLabs,在笔记本电脑CPU上的性能是实时的167倍。
使用 Gemini 2.5 进行高级音频对话和生成
Google 宣布 Gemini 2.5 具备先进的原生音频功能,可实现实时对话型 AI,支持自然语音生成、风格控制和 24 种以上语言的多模态理解。
Gemini 3.1 Flash TTS
Google 发布了 Gemini 3.1 Flash TTS,这是一个新的文本转语音模型,可通过 Gemini API 访问,支持基于提示的高级控制,以实现详细的语音方向、口音和说话风格。该模型能够生成复杂的音频,包括多说话人对话和特定角色的语音表演。