@0xLogicrw: Qwen 发布了实时同声传译模型 Qwen3.8-LiveTranslate。它降低了平均延迟…

X AI KOLs Timeline 模型

摘要

Qwen 发布了 Qwen3.8-LiveTranslate,这是一款实时同声传译模型,将平均延迟从 2.8 秒降低到 2.3 秒,并新增了说话人识别和长上下文消歧等功能。

Qwen 发布了实时同声传译模型 Qwen3.8-LiveTranslate。它将每个单词的平均延迟(LAAL,衡量同声传译中的平均滞后时间)从前一代的 2.8 秒降低到 2.3 秒,并新增了实时说话人识别、原文与译文同步输出以及长上下文消歧等功能。 该模型现在可以区分不同的说话人,将翻译映射到特定的语句,并使译文更稳定地保留每个说话人的音色。原文和译文也将以流式方式同步返回。模型还会结合先前的上下文来判断名称、术语和引用,减少仅凭当前句子产生的歧义。 API 定价与上一代基本保持不变。Alibaba Cloud 的价目表显示,在北京地区,Qwen3.8-LiveTranslate 的音频输入、图像输入、文本输出和音频输出价格与 Qwen3.5-LiveTranslate 完全相同;在新加坡地区,这四项价格甚至略有下降。
查看原文
查看缓存全文

缓存时间: 2026/09/19 21:09

通义千问推出了实时同声传译模型Qwen3.8-LiveTranslate。该模型将同声传译中的平均延迟(LAAL,衡量同传平均滞后时间)从上一代的2.8秒降至2.3秒,并新增了实时说话人分离、原文与译文同步输出以及长上下文消歧等功能。

该模型现可区分不同说话人、将翻译对应到具体语句,并能更稳定地让译文语音保留每位说话人的音色特点。原文与译文也将以流式方式同步返回。模型还能结合上下文来判断人名、术语和指代关系,减少仅凭单句判断产生的歧义。

API定价基本与上一代保持一致。阿里云价格列表显示,在北京地域,Qwen3.8-LiveTranslate的音频输入、图像输入、文本输出及音频输出价格与Qwen3.5-LiveTranslate完全相同;在新加坡地域,这四项价格甚至略有下降。

通义千问 (@Alibaba_Qwen): 隆重推出 Qwen3.8-LiveTranslate——通义千问新一代实时同声传译模型!📢

基于交错架构构建,在提升翻译忠实度、流畅度与简洁性的同时,将跨60种语言的平均滞后时间(LAAL)从2.8秒缩短至2.3秒。

全新

相似文章

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

Hugging Face Models Trending

阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。