Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog 模型

摘要

Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。

现在您可以使用 Gemini 3.5 Transcribe 获得更智能的语音转文本转录。
查看原文
查看缓存全文

缓存时间: 2026/08/26 18:13

# 使用 Gemini 3.5 Transcribe 进行智能转录 来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ 我们最新推出的语音转文字模型,专为精准且智能的实时转录而设计。 --- 工程高级总监,Gemini Audio Luke Leonhard Gemini Audio 首席幕僚,代表 Gemini Audio 团队 --- 蓝色背景上,Gemini 星形标志旁显示“Gemini 3.5 Transcribe”文字 您的浏览器不支持音频元素。 收听文章 \[\[duration\]\] 分钟 本内容由 Google AI 生成。生成式 AI 属于实验性技术。 今天,我们推出 Gemini 3.5 Transcribe——这是我们迄今为止最精准的语音转文字模型,专为智能语音交互而设计。与传统语音识别模型在应对背景噪音、复杂术语和口语修正方面存在困难不同,Gemini 3.5 Transcribe 能直接将原始音频转换为准确、精炼且格式规范的文本。 在 Gemini 应用和 Android 等产品中,我们已经看到消费者通过新的语音功能(如 Android 上的 Rambler 功能和 macOS 上的 Gemini 应用)受益于这款转录模型。现在,开发者可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用 Gemini 3.5 Transcribe 构建类似功能。 我们将 3.5 Transcribe 设计为能够无缝融入开发者的工作流程,无论您是在构建语音助手、实时字幕工具还是通话后分析流程。该模型通过两个独立的 API 提供: - **实时流式处理**:通过 Live API 使用 **`gemini-3.5-transcribe-live`**,提供亚秒级延迟的持续双向流式传输,适用于交互式语音应用。 - **预录音频处理**:通过 Interactions API 使用 **`gemini-3.5-transcribe`**,支持转录录制音频、会议、通话记录等,并提供说话人识别和单词级时间戳。 ## 获得更精准智能的转录 Gemini 3.5 Transcribe 旨在捕捉您自然的说话风格,以便更好地理解您的意图并识别自定义词汇,让您能够用声音执行任务。 - **智能转录**:无缝处理自我修正(例如“我们周二见——不,周三”),移除填充词(“嗯”和“啊”),并自动格式化文本。 - **函数调用**:该模型可以通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前可在 Gemini macOS 应用中使用。 - **更精准的转录**:根据 Artificial Analysis 的测量,流式转录的平均单词错误率(WER)为 4.0%,非流式用例为 2.6%。它在嘈杂的真实环境中表现出色,能准确捕获邮政编码和订单 ID 等字母数字实体。 - **自定义词汇**:通过无缝适应您提供的自定义词汇来识别专业术语和独特拼写。 - **全球语言支持**:自动检测并转录超过 85 种语言,无缝处理地区口音和多样方言。 - **多说话人识别**:在预录音频中准确归属说话人,并提供最多三位说话人的时间戳(对 3 位以上说话人的支持属于实验性功能)。 Gemini 3.5 Transcribe 的性能代表了我们从之前的转录模型 Chirp 3 的重大进步,提供了新功能、改进的单词错误率和显著降低的延迟。例如,根据 Artificial Analysis 的测量,最终转录时间提高了 70%。在 FLEURS 基准测试中,针对一组主要语言和区域设置,该模型提供了精准的多语言性能,优于 Chirp 3,在流式模式下实现 5.50% 的单词错误率,在非流式用例中为 5.04%。 流式语音识别准确率图表 流式语音识别准确率图表 ## 体验智能转录与高级听写 除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,3.5 Transcribe 超越了标准语音转文字功能,使跨 Google 产品的工作感觉更加自然和直观。通过将上下文感知理解直接融入日常界面(如 Gboard、Antigravity、Gemini 应用和 Chrome),它能轻松捕捉细微差别、意图和行内编辑。 - 在 **Android 的 Gboard** 上,通过新的 Rambler 功能,3.5 Transcribe 将口头想法转化为格式规范的文本,过滤掉填充词。您还可以使用语音进行编辑、纠正拼写错误和更改写作风格。 - 在 **Google Antigravity** 上,在获得您的许可后,3.5 Transcribe 结合屏幕上下文和聊天历史,确保对文件名、智能体想法和活动文档的精准转录。 - 在 **Google AI Studio** 中,您可以在构建模式中访问 3.5 Transcribe,通过语音快速进行应用编程。 - 在 **macOS 的 Gemini 应用**中,3.5 Transcribe 不仅将您的自由自然语音转录为干净的格式化文本,还支持语音命令,可与屏幕上下文无缝结合,驱动复杂工作流程。通过在后台调用其他 Gemini 模型处理繁重任务,该模型使总结本地文件、跨应用重用文本或就在光标位置生成图像变得毫不费力——只需使用您的语音。 - 即将登陆 **Chrome**,您将能够在任何网页字段中语音输入——使您能够更自然轻松地口述回复、起草帖子或在 Chrome 中提示 Gemini。 ## 阅读早期评价 通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。 Vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给出了积极反馈,强调了其令人印象深刻的延迟、准确性和广泛的语言支持。 Vivo 推荐语 IntelliTek 推荐语 Lingopal 推荐语 Stream 推荐语 Agora 推荐语 fishjam 推荐语 ### 今天就开始使用 3.5 Transcribe - **开发者**:在 Google AI Studio 通过 Gemini API 和 Google Antigravity 提供公开预览。 - **企业**:通过 Gemini Enterprise Agent Platform 提供公开预览,即将登陆 Gemini Enterprise for Customer Experience。 - **所有人**:在 macOS 的 Gemini 应用中支持英语,在特定国家和地区支持 Android 上的 Rambler 功能,并即将登陆 Chrome。 ## 在您的收件箱获取 Google 最新消息 注册我们的通讯,获取产品更新、活动信息、特别优惠等。 您的信息将根据 Google 的隐私政策使用。您可以随时选择退出。

相似文章

Gemini 3.1 Flash TTS

Simon Willison's Blog

Google 发布了 Gemini 3.1 Flash TTS,这是一个新的文本转语音模型,可通过 Gemini API 访问,支持基于提示的高级控制,以实现详细的语音方向、口音和说话风格。该模型能够生成复杂的音频,包括多说话人对话和特定角色的语音表演。

借助 Gemini 3.5 Live Translate 实现流畅自然的语音翻译

Google DeepMind Blog

Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。

Gemini 3.5 Live Translate

Product Hunt

Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。