推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

Google DeepMind Blog 模型

摘要

Google 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是一组先进的AI模型,专为实时推理和语音代理设计,在各项基准测试中均取得了最高分。

查看原文
查看缓存全文

缓存时间: 2026/09/15 17:58

# 推出 Gemini 3.8 Live 与 3.8 Live 扩展思维版本 来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ Gemini 3.8 Live 和 Gemini 3.8 Live 扩展思维版本是我们迄今最先进的实时对话模型。智能与并行推理方面的重大升级,使其在协作使用和执行复杂语音任务时更为直观高效。 --- Malini Jaganathan 技术团队成员,代表 Gemini 音频团队 --- 文字介绍“推出 Gemini 3.8 Live 与 3.8 Live 扩展思维版本”,配以 Gemini 星火标识,浅蓝色背景呈现 您的浏览器不支持音频播放元素。 收听文章 \[\[时长\]\] 分钟 此内容由 Google AI 生成。生成式 AI 仍处于实验阶段 今天,我们推出两款新模型,它们在近实时推理方面取得进展,能更高效地支持语音智能体,并让与 AI 的对话变得更直观、更智能。 - **Gemini 3.8 Live**:专为规模化与成本效益设计,融合对话智能、流畅对话与视觉定位能力。 - **Gemini 3.8 Live 扩展思维版本**:专为高复杂度任务构建,具备增强的智能与多步推理能力。 对开发者和企业而言,这些模型提供了构建可靠、生产就绪型语音智能体的核心组件。同时,它们也能在 Gemini 应用、Google Workspace 和搜索中实现更流畅、更协作的语音交互——助您仅凭语音即可完成复杂任务。 ## 体验更流畅、更智能的对话 Gemini 3.8 Live 扩展思维版本提供企业级的任务完成能力与智能水平,在 Artificial Analysis 的语音到语音质量指数中以 82.6 分位居榜首,在智能体任务完成方面表现领先:τ-Voice 得分 68.6%,Sierra τ-Voice-banking 基准测试得分 35.1%。其推理能力同样出色,在 Big Bench Audio 评估中获得 97.7% 的高分,同时相较于其他前沿模型保持极具竞争力的价格。 Gemini 3.8 Live 在用户中获得了高度青睐,在语音智能体竞技场(https://artificialanalysis.ai/speech-to-speech?api-benchmarks=agentic-performance-vs-cost-to-run#speech-to-speech-arena-results-tabs)中位列第二。除卓越性能外,其成本效益依然出色——为开发者和企业提供了一款强大、高效且面向规模化部署的模型。 展示 Artificial Analysis 语音到语音指数的图表 展示 Artificial Analysis 智能体性能的图表 展示 Sierra 测试结果的图表 展示 Artificial Analysis 每小时输入音频成本的图表 在 ServiceNow 的 EVA-Bench(https://servicenow.github.io/eva/#results)语音智能体评估基准测试中,我们的模型通过精准平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。 注:此项测试在 Gemini 企业智能体平台的实时 API 上运行。 展示 EVA-Bench 体验与任务完成度的图表 Gemini 3.8 Live 可近实时处理视觉输入,为对话提供上下文信息以生成更有用的回复。它能在对话中自动检测并切换 97 种受支持语言。模型可在后台执行工具和 API 调用,同时保持对话进行,因此既能确认用户请求,又能在任务后台处理时持续交互。 对于需要深度推理的任务,3.8 Live 扩展思维版本能同步进行推理与语音输出。它在维持不间断对话流的同时,为复杂工作流提供更强智能——通过 *“让我查一下……”* 等早期语音线索自然响应提示,并通过实时进度叙述引导用户了解多步后台任务的完成进展。 在 Google Workspace 和搜索中,我们的实时模型提供了更直观、更协作的体验——尤其当您处理最复杂的任务时。 ## 通过搜索实时功能,获取由 Gemini 3.8 Live 驱动的逐步实时故障排除帮助。 ## 赋能开发者与企业语音生态系统 通过使用 Gemini Live API(https://ai.google.dev/gemini-api/docs/live-api),Agora(https://docs.agora.io/en/ai/models/mllm/gemini)、Fishjam(https://docs.fishjam.io/tutorials/gemini-live-integration)、LiveKit(https://docs.livekit.io/agents/models/realtime/plugins/gemini/)、Pipecat(https://docs.pipecat.ai/pipecat/features/gemini-live)、Vercel(https://vercel.com/docs/ai-gateway/modalities/realtime)和 Vision Agents(https://visionagents.ai/integrations/realtime/gemini)等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台处理复杂的实时媒体流基础设施,让开发者可专注于打造用户体验。 我们还与 Salesforce、Genspark、Lumeris 等公司展开合作,这些企业对 3.8 Live 和 3.8 Live 扩展思维版本表现出浓厚兴趣,并赞赏其出色的延迟表现、流畅性与工具调用能力。 Salesforce 引言 11Sight 引言 Equal AI 引言 ServiceNow 引言 Genspark 引言 Lenskart 引言 Lumeris 引言 Agora 引言 Ambr AI 引言 LiveKit 引言 Casuu 引言 ## 通过 SynthID 水印确保透明性 我们所有 AI 产品生成的音频均通过 SynthID(https://deepmind.google/models/synthid/)添加水印。这种不可感知的水印直接嵌入音频输出,确保 AI 生成内容可被检测,有助于防止虚假信息传播。如需了解我们在安全与责任方面的处理方法,请查阅模型说明文档(https://deepmind.google/models/model-cards/gemini-3-8-audio/)。 ## 开始使用我们最新的 Gemini 音频模型: 3.8 Live 从今日起逐步推出: - **面向开发者**:通过 Gemini API(https://ai.google.dev/gemini-api/docs/live-api)和 Google AI Studio(https://aistudio.google.com/live) - **面向企业**:在 Gemini 企业版(https://console.cloud.google.com/vertex-ai/studio/multimodal-live)中进行私有预览,即将登陆 Gemini 企业级客户体验版(https://cloud.google.com/gemini-enterprise-cx) - **面向所有用户**:在搜索实时功能中使用 3.8 Live 扩展思维版本从今日起逐步推出: - **面向开发者**:通过 Gemini API(https://ai.google.dev/gemini-api/docs/live-api)和 Google AI Studio(https://aistudio.google.com/live) - **面向企业**:在 Gemini 企业版(https://console.cloud.google.com/vertex-ai/studio/multimodal-live)中进行私有预览,即将登陆 Gemini 企业级客户体验版(https://cloud.google.com/gemini-enterprise-cx)及 Google Workspace 商业客户 - **面向所有用户**:在 Gemini Live 中可用,Google Workspace 中的 Google AI Pro 与 Ultra 订阅者可在文档、Gmail 和 Keep 中使用 ## 通过电子邮件接收 Google 最新动态 订阅我们的通讯,获取产品更新、活动信息、特别优惠等内容。 您的信息将依据 Google 隐私政策(https://policies.google.com/privacy)使用。您可随时取消订阅。

相似文章

Gemini 实时音频

Simon Willison's Blog

Google 推出了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 这两款新的语音到语音AI模型,作者利用这些模型开发了一个用于语音对话的网页界面工具。

Gemini 3 开启智能新时代

Google DeepMind Blog

Google 发布了其迄今为止最智能的模型 Gemini 3,具备增强的推理能力和多模态功能。该模型现已集成到 Google 各产品中,面向 Ultra 订阅用户的「深度思考」复杂问题求解模式即将推出。

Gemini 3.8 Flash

Product Hunt

Google 发布 Gemini 3.8 Flash,这是一款先进的 AI 模型,在编程、智能体能力和多步推理方面有显著改进,提供入门价格。