@0xLogicrw: Qwen 发布了实时同声传译模型 Qwen3.8-LiveTranslate。它降低了平均延迟…
摘要
Qwen 发布了 Qwen3.8-LiveTranslate,这是一款实时同声传译模型,将平均延迟从 2.8 秒降低到 2.3 秒,并新增了说话人识别和长上下文消歧等功能。
查看缓存全文
缓存时间: 2026/09/19 21:09
通义千问推出了实时同声传译模型Qwen3.8-LiveTranslate。该模型将同声传译中的平均延迟(LAAL,衡量同传平均滞后时间)从上一代的2.8秒降至2.3秒,并新增了实时说话人分离、原文与译文同步输出以及长上下文消歧等功能。
该模型现可区分不同说话人、将翻译对应到具体语句,并能更稳定地让译文语音保留每位说话人的音色特点。原文与译文也将以流式方式同步返回。模型还能结合上下文来判断人名、术语和指代关系,减少仅凭单句判断产生的歧义。
API定价基本与上一代保持一致。阿里云价格列表显示,在北京地域,Qwen3.8-LiveTranslate的音频输入、图像输入、文本输出及音频输出价格与Qwen3.5-LiveTranslate完全相同;在新加坡地域,这四项价格甚至略有下降。
通义千问 (@Alibaba_Qwen): 隆重推出 Qwen3.8-LiveTranslate——通义千问新一代实时同声传译模型!📢
基于交错架构构建,在提升翻译忠实度、流畅度与简洁性的同时,将跨60种语言的平均滞后时间(LAAL)从2.8秒缩短至2.3秒。
全新
相似文章
Qwen3.8-LiveTranslate:标注说话者,传达含义(3分钟阅读)
Qwen3.8-LiveTranslate 是一款 AI 模型,采用交错音频文本架构,减少翻译延迟并提升质量,支持实时说话人分离和语音克隆,涵盖60种语言。
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。
HN上展示:Nari Qwen3-TTS 和 Qwen3-ASR – 高准确率、低延迟和低成本
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。
Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一
开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。