@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…
摘要
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
Qwen-Audio-3.0-TTS来了。
我们最新的文本转语音模型,提供两个版本:
• Flash:实时交互
• Plus:高质量生成
新特性:
• 支持16种语言的多语言覆盖
• 用自然语言进行风格控制
• 用于非语言细节的细粒度标签
• 从有瑕疵的音频中实现更稳健的语音克隆
查看缓存全文
缓存时间: 2026/07/20 19:31
Qwen-Audio-3.0-TTS 现已发布。
我们的最新文本转语音模型,提供两种版本: • Flash:实时互动 • Plus:高质量生成
新增功能: • 覆盖 16 种语言的多语言支持 • 自然语言风格控制 • 非语言细节的精细标签 • 从不完美音频中实现更稳健的语音克隆
相似文章
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一
开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。
Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
HN上展示:Nari Qwen3-TTS 和 Qwen3-ASR – 高准确率、低延迟和低成本
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。