借助 Gemini 3.5 Live Translate 实现流畅自然的语音翻译
摘要
Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。
Gemini 3.5 Live Translate 为 Google AI Studio、Google Translate 和 Google Meet 带来了近乎实时的自然语音翻译。
查看缓存全文
缓存时间: 2026/06/10 00:13
# 使用 Gemini 3.5 Live Translate 实现流畅自然的语音翻译
来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-live-3-5-translate/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=
Gemini 3.5 Live Translate 是我们最新的音频模型,支持以近乎实时的方式在 70 多种语言之间进行语音到语音的翻译。
Tony Lu
高级员工软件工程师
"Gemini 3.5 Live Translate" 文字旁的闪光图标
您的浏览器不支持音频元素。
收听本文
此内容由 Google AI 生成。生成式 AI 具有实验性。
\[\[时长\]\] 分钟
二十年前,Google 翻译(https://blog.google/products-and-platforms/products/translate/fun-facts-google-translate-20-years/)作为我们开创性的机器学习实验之一起步,旨在将语言科学转化为人与人之间的神奇连接。如今,这项实验已取得长足进步,每月为我们的产品中数十亿用户翻译超过一万亿个词汇。
今天,我们迈出下一步,发布了 Gemini 3.5 Live Translate——我们用于实时语音到语音翻译的最新音频模型。
该模型能自动检测 70 多种语言,生成流畅自然的翻译语音,同时保留说话者的语调、节奏和音高。与需要等说话者说完再回应的逐轮系统不同,3.5 Live Translate 持续生成语音,在等待上下文以提升质量和立即翻译以跟上说话者节奏之间取得平衡。它能够输出流畅的音频,没有尴尬的停顿,在整个会话过程中仅比说话者慢几秒钟。
Gemini 3.5 Live Translate 即日起在 Google 产品中逐步上线:
- 面向开发者:通过 Gemini Live API(https://ai.google.dev/gemini-api/docs/live-api/live-translate)和 Google AI Studio(https://aistudio.google.com/live?model=gemini-3.5-live-translate-preview)提供公开预览
- 面向企业:本月起在 Google Meet(https://workspace.google.com/products/meet/)中提供私有预览
- 面向所有用户:通过 Android(https://play.google.com/store/apps/details?id=com.google.android.apps.translate&26hl=en)和 iOS(https://apps.apple.com/us/app/google-translate/id414706506)上的 Google 翻译应用提供
## 使用 3.5 Live Translate 进行构建
Gemini 3.5 Live Translate 在处理流式输入的语音时,能够在不同语言之间实现更无缝的连接。该模型无需手动配置设置即可处理多语言输入。同时,其噪声鲁棒性确保应用程序能够应对嘈杂、不可预测的环境。您可以使用其功能来帮助实现多语言通话、会议、课程、直播等的实时口译。
观看 Gemini Live API 的实际应用,它支持配音和同步多语言翻译。深入了解 Gemini Cookbook 中的演示(https://github.com/google-gemini/gemini-live-api-examples/tree/main/gemini-live-translate-livekit)或更多示例代码(https://github.com/google-gemini/gemini-live-api-examples)。
通过使用 Gemini Live API,开发者平台如 Agora(https://docs.agora.io/en/conversational-ai/models/mllm/gemini)、Fishjam(https://docs.fishjam.io/tutorials/gemini-live-integration)、LiveKit(https://docs.livekit.io/agents/models/realtime/plugins/gemini/)、Pipecat(https://docs.pipecat.ai/guides/features/gemini-live)和 Vision Agents(https://visionagents.ai/integrations/gemini)使开发者能够轻松构建和部署语音翻译应用。这些集成处理了复杂的实时媒体流基础设施,因此开发者可以专注于用户体验。
我们的合作伙伴 Grab 正在测试该模型,以便在司机与乘客的接送过程中实现近乎实时的多语言沟通。这些用户每月通过 Grab 进行超过 1000 万次语音通话。
## 阅读早期评价
除了 Grab,CJ ENM、LiveKit 等公司也对 3.5 Live Translate 给予了积极反馈,称赞其出色的翻译质量、准确性和低延迟:
## 在视频会议中体验 3.5 Live Translate
Google Meet(https://support.google.com/meet/answer/16221730?hl=en)中的语音翻译功能即将采用 3.5 Live Translate,通过以下方式提升体验:
- 支持 70 多种语言,相比之前仅限五种语言有了显著提升
- 一次会议中可实现超过 2000 种语言组合的对话,而之前仅支持与英语互译
- 更新界面,提供语音翻译的即时访问
我们将在本月内向部分企业 Google Workspace 客户提供此更新的私有预览,随后于今年晚些时候进行更广泛的推广。
## 在 Android 或 iOS 上的 Google 翻译应用中使用 3.5 Live Translate
该模型也正在逐步推广到全球的 Google 翻译应用,包括 Android(https://play.google.com/store/apps/details?id=com.google.android.apps.translate)和 iOS(https://apps.apple.com/us/app/google-translate/id414706506)。使用实时翻译功能时,只需连接任意一副耳机,即可在 70 多种语言中体验更无缝的翻译,同时保留说话者的语气。
对于 Android 用户,我们还开始推出新的“收听模式”,该模式采用 3.5 Live Translate,让您可以直接通过手机听筒听到翻译结果。像普通通话一样将手机贴近耳朵,翻译后的音频便会直接传输给您。当您想快速听到翻译又不希望他人听到,并且手边没有耳机时,这种新体验会非常有用。
使用新的收听模式,用户可以通过手机听筒直接听到西班牙语导游讲解的近乎实时的英语翻译。
## 使用 SynthID 添加水印
我们模型生成的所有音频均使用 SynthID 添加了水印。这种不可察觉的水印直接嵌入到音频输出中,确保 AI 生成的内容可被检测,从而有助于防止虚假信息。有关我们安全与责任方法的详细信息,请查看模型卡片(https://deepmind.google/models/model-cards/gemini-3-5-audio/)。
## 在收件箱中获取更多 Google 故事。
完成。只需再一步。
请检查收件箱以确认订阅。
您已订阅我们的新闻通讯。
您也可以使用以下方式订阅
### 相关故事
相似文章
Google发布Gemini 3.5 Live Translate,实现即时语音到语音翻译
Google发布Gemini 3.5 Live Translate,这是一种语音到语音模型,可在70多种语言中提供即时语音翻译,并正在Google生态系统中推广。
Gemini 3.5 Live Translate
Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。
Gemini 音频模型升级,打造更强大的语音体验
Google 更新了 Gemini 2.5 Flash Native Audio,以提升实时语音智能体的能力,包括更精准的函数调用、更好的指令遵循能力,以及更流畅的对话上下文检索。此次更新还在 Google Translate 应用 beta 版中引入了实时语音翻译功能,可在 70 多种语言中保留语音语调。
Gemini 3.8 Live 和 3.5 Transcribe(1分钟阅读)
Google 发布了新的 Gemini 模型,包括 Gemini 3.8 Live 和 3.5 Transcribe,旨在增强实时语音应用,为开发者提供改进的对话式 AI 和多语言转录功能。
Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠
Google 发布了 Gemini 3.1 Flash Live,这是一款全新的高质量音频模型,专为更自然、更可靠的实时语音交互而设计,具备更低的延迟和更强的推理能力。