Gemini 3.5 Transcribe 智能转录
摘要
Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。
现在您可以使用 Gemini 3.5 Transcribe 获得更智能的语音转文本转录。
查看缓存全文
缓存时间: 2026/08/26 18:13
# 使用 Gemini 3.5 Transcribe 进行智能转录
来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
我们最新推出的语音转文字模型,专为精准且智能的实时转录而设计。
---
工程高级总监,Gemini Audio
Luke Leonhard
Gemini Audio 首席幕僚,代表 Gemini Audio 团队
---
蓝色背景上,Gemini 星形标志旁显示“Gemini 3.5 Transcribe”文字
您的浏览器不支持音频元素。
收听文章
\[\[duration\]\] 分钟
本内容由 Google AI 生成。生成式 AI 属于实验性技术。
今天,我们推出 Gemini 3.5 Transcribe——这是我们迄今为止最精准的语音转文字模型,专为智能语音交互而设计。与传统语音识别模型在应对背景噪音、复杂术语和口语修正方面存在困难不同,Gemini 3.5 Transcribe 能直接将原始音频转换为准确、精炼且格式规范的文本。
在 Gemini 应用和 Android 等产品中,我们已经看到消费者通过新的语音功能(如 Android 上的 Rambler 功能和 macOS 上的 Gemini 应用)受益于这款转录模型。现在,开发者可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用 Gemini 3.5 Transcribe 构建类似功能。
我们将 3.5 Transcribe 设计为能够无缝融入开发者的工作流程,无论您是在构建语音助手、实时字幕工具还是通话后分析流程。该模型通过两个独立的 API 提供:
- **实时流式处理**:通过 Live API 使用 **`gemini-3.5-transcribe-live`**,提供亚秒级延迟的持续双向流式传输,适用于交互式语音应用。
- **预录音频处理**:通过 Interactions API 使用 **`gemini-3.5-transcribe`**,支持转录录制音频、会议、通话记录等,并提供说话人识别和单词级时间戳。
## 获得更精准智能的转录
Gemini 3.5 Transcribe 旨在捕捉您自然的说话风格,以便更好地理解您的意图并识别自定义词汇,让您能够用声音执行任务。
- **智能转录**:无缝处理自我修正(例如“我们周二见——不,周三”),移除填充词(“嗯”和“啊”),并自动格式化文本。
- **函数调用**:该模型可以通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前可在 Gemini macOS 应用中使用。
- **更精准的转录**:根据 Artificial Analysis 的测量,流式转录的平均单词错误率(WER)为 4.0%,非流式用例为 2.6%。它在嘈杂的真实环境中表现出色,能准确捕获邮政编码和订单 ID 等字母数字实体。
- **自定义词汇**:通过无缝适应您提供的自定义词汇来识别专业术语和独特拼写。
- **全球语言支持**:自动检测并转录超过 85 种语言,无缝处理地区口音和多样方言。
- **多说话人识别**:在预录音频中准确归属说话人,并提供最多三位说话人的时间戳(对 3 位以上说话人的支持属于实验性功能)。
Gemini 3.5 Transcribe 的性能代表了我们从之前的转录模型 Chirp 3 的重大进步,提供了新功能、改进的单词错误率和显著降低的延迟。例如,根据 Artificial Analysis 的测量,最终转录时间提高了 70%。在 FLEURS 基准测试中,针对一组主要语言和区域设置,该模型提供了精准的多语言性能,优于 Chirp 3,在流式模式下实现 5.50% 的单词错误率,在非流式用例中为 5.04%。
流式语音识别准确率图表
流式语音识别准确率图表
## 体验智能转录与高级听写
除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,3.5 Transcribe 超越了标准语音转文字功能,使跨 Google 产品的工作感觉更加自然和直观。通过将上下文感知理解直接融入日常界面(如 Gboard、Antigravity、Gemini 应用和 Chrome),它能轻松捕捉细微差别、意图和行内编辑。
- 在 **Android 的 Gboard** 上,通过新的 Rambler 功能,3.5 Transcribe 将口头想法转化为格式规范的文本,过滤掉填充词。您还可以使用语音进行编辑、纠正拼写错误和更改写作风格。
- 在 **Google Antigravity** 上,在获得您的许可后,3.5 Transcribe 结合屏幕上下文和聊天历史,确保对文件名、智能体想法和活动文档的精准转录。
- 在 **Google AI Studio** 中,您可以在构建模式中访问 3.5 Transcribe,通过语音快速进行应用编程。
- 在 **macOS 的 Gemini 应用**中,3.5 Transcribe 不仅将您的自由自然语音转录为干净的格式化文本,还支持语音命令,可与屏幕上下文无缝结合,驱动复杂工作流程。通过在后台调用其他 Gemini 模型处理繁重任务,该模型使总结本地文件、跨应用重用文本或就在光标位置生成图像变得毫不费力——只需使用您的语音。
- 即将登陆 **Chrome**,您将能够在任何网页字段中语音输入——使您能够更自然轻松地口述回复、起草帖子或在 Chrome 中提示 Gemini。
## 阅读早期评价
通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。
Vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给出了积极反馈,强调了其令人印象深刻的延迟、准确性和广泛的语言支持。
Vivo 推荐语
IntelliTek 推荐语
Lingopal 推荐语
Stream 推荐语
Agora 推荐语
fishjam 推荐语
### 今天就开始使用 3.5 Transcribe
- **开发者**:在 Google AI Studio 通过 Gemini API 和 Google Antigravity 提供公开预览。
- **企业**:通过 Gemini Enterprise Agent Platform 提供公开预览,即将登陆 Gemini Enterprise for Customer Experience。
- **所有人**:在 macOS 的 Gemini 应用中支持英语,在特定国家和地区支持 Android 上的 Rambler 功能,并即将登陆 Chrome。
## 在您的收件箱获取 Google 最新消息
注册我们的通讯,获取产品更新、活动信息、特别优惠等。
您的信息将根据 Google 的隐私政策使用。您可以随时选择退出。
相似文章
@GoogleDeepMind: Gemini 3.5 Transcribe 是我们最新的语音转文本模型,用于精确和智能的转录。
Google DeepMind 宣布 Gemini 3.5 Transcribe,这是一个新的语音转文本模型,用于精确和智能的转录。
Gemini 3.1 Flash TTS
Google 发布了 Gemini 3.1 Flash TTS,这是一个新的文本转语音模型,可通过 Gemini API 访问,支持基于提示的高级控制,以实现详细的语音方向、口音和说话风格。该模型能够生成复杂的音频,包括多说话人对话和特定角色的语音表演。
Google发布Gemini 3.5 Live Translate,实现即时语音到语音翻译
Google发布Gemini 3.5 Live Translate,这是一种语音到语音模型,可在70多种语言中提供即时语音翻译,并正在Google生态系统中推广。
借助 Gemini 3.5 Live Translate 实现流畅自然的语音翻译
Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。
Gemini 3.5 Live Translate
Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。