Gemini 3.8 Live 和 3.5 Transcribe(1分钟阅读)
摘要
Google 发布了新的 Gemini 模型,包括 Gemini 3.8 Live 和 3.5 Transcribe,旨在增强实时语音应用,为开发者提供改进的对话式 AI 和多语言转录功能。
Google 发布了 Gemini 3.8 Live 和 Gemini 3.5 Transcribe,用于开发实时语音应用。这些工具提供了增强的语音识别、转录和实时交互功能,旨在提高语音驱动应用的准确性和用户体验。
查看缓存全文
缓存时间: 2026/09/16 14:25
# 使用 Gemini 3.8 Live 和 3.5 Transcribe 构建实时语音应用
来源:https://blog.google/innovation-and-a/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
全新的 Gemini 音频模型现已向开发者开放,可通过 Gemini API 和 Google AI Studio 构建更智能的对话体验。
---
Thor Schaeff
Google DeepMind 技术人员(DevX)
---
立即在 ai.studio/live 体验模型
您的浏览器不支持音频元素。
收听文章
[[时长]] 分钟
此内容由 Google AI 生成。生成式 AI 属于实验性技术
今天,我们在 Gemini API (https://ai.google.dev/gemini-api/docs/live) 和 Google AI Studio (http://ai.studio/live) 中发布了新的 Gemini Live 模型 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/),扩展了我们的开发者工具集,用于构建实时、语音优先的产品体验:
**Gemini 3.8 Live** (https://aistudio.google.com/live?model=gemini-3.8-live) **和 3.8 Live Extended Thinking** (https://aistudio.google.com/live?model=gemini-3.8-live-extended-thinking):Gemini 3.8 Live 为我们的原生语音转语音模型带来了质的飞跃,能够在维持对话的同时执行任务。对于复杂请求,3.8 Live Extended Thinking 提供了更深度的推理能力,在 Artificial Analysis 的语音转语音排行榜上排名第一。
**Gemini 3.5 Transcribe** (https://aistudio.google.com/live?model=gemini-3.5-transcribe-live):我们专用的语音转文本模型在 85+ 种语言中实现了高精度的转录。它于上个月发布,流式转录的平均词错率 (WER) 为 4.0%,非流式转录为 2.6%。
## Gemini 3.8 Live & 3.8 Live Extended Thinking:构建更智能的对话代理
我们的新模型 Gemini 3.8 Live (https://aistudio.google.com/live?model=gemini-3.8-live) 和 3.8 Live Extended Thinking (https://aistudio.google.com/live?model=gemini-3.8-live-extended-thinking) 使开发者能够构建既能在对话中保持流畅,又能进行推理和执行任务的语音代理。关键能力包括:
- **异步函数调用:** 在后台执行 API 和工具调用,同时继续向用户流式传输音频响应
- **视觉上下文:** 基于实时视觉输入进行对话,帮助实现代理既能理解用户所说的*内容*,也能理解用户*看到的*内容
- **字母数字精度:** 准确解析确认码、索赔编号和技术数据
- **多语言支持:** 支持 97+ 种语言,并保持口音一致性,以触及全球受众
- **增量内容更新:** 无缝地将实时音频与结构化数据融合,以返回具有上下文感知能力的响应
3.8 Live Extended Thinking 还支持可配置的思考 (https://ai.google.dev/gemini-api/docs/live-api/thinking),以帮助在后台处理复杂的、多步骤的推理,同时在主对话中进行响应或叙述其进展。这些模型相比我们之前的实时模型代表着一次飞跃,并为级联架构提供了一种更精简的替代方案。
Ambr AI 的联合创始人兼技术与产品负责人 Jamie Wood 表示:“Ambr AI 通过逼真的 AI 模拟训练企业团队进行谈判、领导并解决困难的客户对话。切换到 Gemini 3.8 Live Extended Thinking 使我们的模拟更快、更具表现力,并且更擅长处理复杂对话。它还使我们能够通过单一集成提供 70 多种语言的培训,帮助我们的客户在其全球员工队伍中培养这些技能。”
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 可通过 Live API (https://ai.google.dev/gemini-api/docs/live) 获得。其定价具有竞争力 (http://ai.google.dev/gemini-api/docs/pricing#gemini-3.8-live),音频输入为每分钟 0.005 美元,音频输出为每分钟 0.018 美元¹ (https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/#footnote-1),使开发者能够以行业领先的性能扩展语音应用。
Artificial Analysis 语音转语音指数基准测试
智能体性能基准测试
Tau-bench 排行榜基准测试
Artificial Analysis 音频总成本
开发者还可以通过 Agora (https://docs.agora.io/en/ai/models/mllm/gemini)、Fishjam (https://docs.fishjam.io/tutorials/gemini-live-integration)、LiveKit (https://docs.livekit.io/agents/models/realtime/plugins/gemini/)、LangChain (https://docs.langchain.com/langsmith/trace-gemini-live)、Pipecat (https://docs.pipecat.ai/pipecat/features/gemini-live)、Vercel (https://vercel.com/docs/ai-gateway/modalities/realtime) 和 Vision Agents (https://visionagents.ai/integrations/realtime/gemini) 访问这些模型。它们是我们的 Live API 集成合作伙伴,负责处理实际部署的媒体流基础设施。
Live API 合作伙伴包括 Pipecat、LiveKit、LangChain、Agora、Fishjam、Voximplant、Vercel 和 VisionAgents。
## Gemini 3.5 Transcribe:将流式语音转换为文本
实时语音理解对于语音优先的界面至关重要。上个月,我们发布了 Gemini 3.5 Transcribe,用于低延迟、高精度的转录,实现了 4.0% 的词错率,并具备实用功能:
- **自动语码转换:** 无需手动配置,即可处理句内和句间的语码和语言切换
- **自定义词汇表偏向:** 通过传递最多包含 1,000 个术语的 custom_vocabulary 列表,将语音识别导向特定领域的术语、不常见的专业术语、公司名称和专有名词
- **智能转录模式:** 提供结构化格式、自我修正和去除口语填充词的精炼转录稿,可直接阅读
3.5 Transcribe 支持 85+ 种语言,为语音体验和无状态任务(如亚秒级字幕、客服坐席和实时音频分析)提供了强大的听觉引擎。您也可以通过 Interactions API 访问该模型,转录最长 1 小时的音频文件,并附带结构化时间戳和说话人标识。请阅读我们的开发者指南 (https://aistudio.google.com/learn/gemini-3-5-transcribe-developer-guide) 了解更多信息。
## 我们为开发者提供的完整音频套件
要开始使用,请在 ai.studio/live (https://ai.studio/live) 中试用模型,从 GitHub (https://github.com/google-gemini/gemini-live-api-examples) 克隆示例应用,或为您的代理装备我们的 live api 技能 (https://ai.google.dev/gemini-api/docs/coding-agents#gemini-live-api-dev)。
您还可以使用我们的语音和音乐生成模型创建音频体验,这些模型均可在 Gemini API 中获取:
- **Gemini 3.5 Live Translate** (https://ai.google.dev/gemini-api/docs/live-api/live-translate):跨 70 多种语言的语音转语音翻译
- **Gemini 3.1 Flash TTS** (https://ai.google.dev/gemini-api/docs/speech-generation):高度可配置的语音生成(即将有更多更新)
- **Lyria 3.5** (https://ai.google.dev/gemini-api/docs/music-generation):生产级音乐生成
舞台已备好,我们迫不及待想听到您的创造!
## 在收件箱中获取 Google 最新动态
注册我们的通讯,获取产品更新、活动信息、特别优惠等更多内容。
您的信息将根据 Google 的隐私政策 (https://policies.google.com/privacy) 使用。您可以随时选择退出。
相似文章
Gemini 3.5 Transcribe 智能转录
Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。
Gemini 实时音频
Google 推出了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 这两款新的语音到语音AI模型,作者利用这些模型开发了一个用于语音对话的网页界面工具。
Gemini 3.5 Live Translate
Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。
Google宣布推出Gemini 3.5 Transcribe,用于AI驱动的语音转文本
Google已宣布Gemini 3.5 Transcribe,这是一款用于语音转文本的AI模型,通过移除如“嗯”这样的填充词并支持85种语言来提高速度和准确性,正在其生态系统中推出。
Gemini 3.5 Transcribe
Gemini 3.5 Transcribe 被宣布为目前最精确的语音转文本模型,并在Product Hunt上提供了讨论链接。