@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…

X AI KOLs Timeline 模型

摘要

阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。

Qwen-Audio-3.0-TTS来了。 我们最新的文本转语音模型,提供两个版本: • Flash:实时交互 • Plus:高质量生成 新特性: • 支持16种语言的多语言覆盖 • 用自然语言进行风格控制 • 用于非语言细节的细粒度标签 • 从有瑕疵的音频中实现更稳健的语音克隆
查看原文
查看缓存全文

缓存时间: 2026/07/20 19:31

Qwen-Audio-3.0-TTS 现已发布。

我们的最新文本转语音模型,提供两种版本: • Flash:实时互动 • Plus:高质量生成

新增功能: • 覆盖 16 种语言的多语言支持 • 自然语言风格控制 • 非语言细节的精细标签 • 从不完美音频中实现更稳健的语音克隆

相似文章

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

Hugging Face Models Trending

阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。