Gemini API 中平衡成本与可靠性的新途径

Google AI Blog 产品

摘要

Google 为 Gemini API 推出了 Flex 和 Priority 推理层,为开发者提供了对同步请求成本与可靠性的精细控制。Flex 可为对延迟不敏感的任务节省 50% 的成本,而 Priority 则可确保关键应用的高可靠性。

<img src="https://storage.googleapis.com/gweb-uniblog-publish-prod/images/cost_reliability_Gemini_API-soc.max-600x600.format-webp.webp">Google 正在为 Gemini API 引入两个新的推理层:Flex 和 Priority, 以实现成本与延迟之间的平衡。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:09

# Gemini API 中平衡成本与可靠性的新方式 来源:https://blog.google/innovation-and-ai/technology/developers-tools/introducing-flex-and-priority-inference/ 介绍 Flex 和 Priority 推理:为开发者提供高级控制,通过统一界面优化成本与可靠性。 Hussein Hassan Harrirou 工程,Gemini API 抱歉,您的浏览器不支持嵌入视频,但别担心,您可以下载它 (https://storage.googleapis.com/gweb-uniblog-publish-prod/original_videos/cost_reliability_Gemini_API-hero_circle.mp4) 并用您喜欢的视频播放器观看! 您的浏览器不支持音频元素。 收听文章 本内容由 Google AI 生成。生成式 AI 处于实验阶段 \[\[duration\]\] 分钟 今天,我们在 Gemini API 中新增了两个服务层级:Flex 和 Priority (https://ai.google.dev/gemini-api/docs/optimization#inference-tiers)。这些新选项让您能通过单一、统一的界面精细控制成本与可靠性。 随着 AI 从简单的聊天演变为复杂、自主的智能体,开发者通常需要管理两种截然不同的逻辑: - **后台任务**:如数据增强或“思考”过程等高吞吐量工作流,无需即时响应。 - **交互式任务**:如聊天机器人和副驾驶等面向用户的功能,需要高可靠性。 在此之前,同时支持这两种场景意味着必须在标准同步服务和异步 Batch API 之间拆分架构。Flex 和 Priority 有助于弥合这一差距。现在,您可以将后台任务路由到 Flex,将交互式任务路由到 Priority,两者均使用标准的同步端点。这消除了异步任务管理的复杂性,同时让您享受专业化层级带来的经济和性能优势。 ## Flex 推理 (https://ai.google.dev/gemini-api/docs/flex-inference):以半价扩展创新 Flex 推理是我们新的成本优化层级,专为对延迟不敏感的工作负载设计,且无需承担批处理的开销。 - **节省 50% 成本:** 通过降低请求的关键性(从而降低可靠性并增加延迟),只需支付标准 API 一半的费用。 - **同步简便性:** 与 Batch API 不同,Flex 是同步接口。您使用相同熟悉的端点,无需管理输入/输出文件或轮询任务完成状态。 - **理想用例:** 后台 CRM 更新、大规模研究模拟,以及模型在后台“浏览”或“思考”的智能体工作流。 只需在请求中配置 `service_tier` 参数即可快速开始: Flex 层级将适用于所有付费层级,并可用于 GenerateContent 和 Interactions API 请求。 ## Priority 推理 (https://ai.google.dev/gemini-api/docs/priority-inference):为关键应用提供最高可靠性 新的 Priority 推理层级以溢价价格提供我们最高级别的服务保障。这有助于确保即使在平台使用高峰期,您的重要流量也不会被抢占。 - **最高关键性:** Priority 请求获得最高关键性,从而在高峰负载期间提供更高的可靠性。 - **优雅降级:** 如果您的流量超出 Priority 限额,溢出请求将自动在 Standard 层级提供服务,而不是失败。这有助于保持应用程序在线并确保业务连续性。 - **透明响应:** API 响应会指示哪个层级服务了您的请求,让您对性能和计费拥有完全可见性。 - **理想用例:** 实时客户支持机器人、实时内容审核流水线以及时间敏感型请求。 要使用 Priority 推理,只需相应设置 `service_tier` 参数: Priority 推理将向在 Tier 2 / 3 付费项目的用户开放,适用于 `GenerateContent` API 和 Interactions API (https://ai.google.dev/gemini-api/docs/interactions) 端点。 访问 Gemini API 文档 (https://ai.google.dev/gemini-api/docs/pricing) 查看完整的定价明细,并立即开始优化您的生产层级。若要查看实际操作示例,请查阅 cookbook (https://github.com/google-gemini/cookbook/blob/main/quickstarts/Inference_tiers.ipynb) 中的可运行代码示例。 ### 相关文章

相似文章

我们正在扩展 Gemini 2.5 系列模型

Google DeepMind Blog

Google 宣布 Gemini 2.5 Flash 和 Pro 模型正式推出,并推出预览版 Gemini 2.5 Flash-Lite——一个新的成本高效且最快的变种,针对高吞吐量、低延迟的任务进行了优化。

Gemini 2.5:思维模型家族的更新

Google DeepMind Blog

Google 宣布 Gemini 2.5 Pro 和 Flash 模型的稳定正式发布,推出新的 Gemini 2.5 Flash-Lite 预览版,具有更低的延迟和成本,并更新 Flash 系列的定价,调整输入/输出令牌费率。