Gemini API 中平衡成本与可靠性的新途径
摘要
Google 为 Gemini API 推出了 Flex 和 Priority 推理层,为开发者提供了对同步请求成本与可靠性的精细控制。Flex 可为对延迟不敏感的任务节省 50% 的成本,而 Priority 则可确保关键应用的高可靠性。
<img src="https://storage.googleapis.com/gweb-uniblog-publish-prod/images/cost_reliability_Gemini_API-soc.max-600x600.format-webp.webp">Google 正在为 Gemini API 引入两个新的推理层:Flex 和 Priority,
以实现成本与延迟之间的平衡。
查看缓存全文
缓存时间: 2026/05/08 08:09
# Gemini API 中平衡成本与可靠性的新方式
来源:https://blog.google/innovation-and-ai/technology/developers-tools/introducing-flex-and-priority-inference/
介绍 Flex 和 Priority 推理:为开发者提供高级控制,通过统一界面优化成本与可靠性。
Hussein Hassan Harrirou
工程,Gemini API
抱歉,您的浏览器不支持嵌入视频,但别担心,您可以下载它 (https://storage.googleapis.com/gweb-uniblog-publish-prod/original_videos/cost_reliability_Gemini_API-hero_circle.mp4) 并用您喜欢的视频播放器观看!
您的浏览器不支持音频元素。
收听文章
本内容由 Google AI 生成。生成式 AI 处于实验阶段
\[\[duration\]\] 分钟
今天,我们在 Gemini API 中新增了两个服务层级:Flex 和 Priority (https://ai.google.dev/gemini-api/docs/optimization#inference-tiers)。这些新选项让您能通过单一、统一的界面精细控制成本与可靠性。
随着 AI 从简单的聊天演变为复杂、自主的智能体,开发者通常需要管理两种截然不同的逻辑:
- **后台任务**:如数据增强或“思考”过程等高吞吐量工作流,无需即时响应。
- **交互式任务**:如聊天机器人和副驾驶等面向用户的功能,需要高可靠性。
在此之前,同时支持这两种场景意味着必须在标准同步服务和异步 Batch API 之间拆分架构。Flex 和 Priority 有助于弥合这一差距。现在,您可以将后台任务路由到 Flex,将交互式任务路由到 Priority,两者均使用标准的同步端点。这消除了异步任务管理的复杂性,同时让您享受专业化层级带来的经济和性能优势。
## Flex 推理 (https://ai.google.dev/gemini-api/docs/flex-inference):以半价扩展创新
Flex 推理是我们新的成本优化层级,专为对延迟不敏感的工作负载设计,且无需承担批处理的开销。
- **节省 50% 成本:** 通过降低请求的关键性(从而降低可靠性并增加延迟),只需支付标准 API 一半的费用。
- **同步简便性:** 与 Batch API 不同,Flex 是同步接口。您使用相同熟悉的端点,无需管理输入/输出文件或轮询任务完成状态。
- **理想用例:** 后台 CRM 更新、大规模研究模拟,以及模型在后台“浏览”或“思考”的智能体工作流。
只需在请求中配置 `service_tier` 参数即可快速开始:
Flex 层级将适用于所有付费层级,并可用于 GenerateContent 和 Interactions API 请求。
## Priority 推理 (https://ai.google.dev/gemini-api/docs/priority-inference):为关键应用提供最高可靠性
新的 Priority 推理层级以溢价价格提供我们最高级别的服务保障。这有助于确保即使在平台使用高峰期,您的重要流量也不会被抢占。
- **最高关键性:** Priority 请求获得最高关键性,从而在高峰负载期间提供更高的可靠性。
- **优雅降级:** 如果您的流量超出 Priority 限额,溢出请求将自动在 Standard 层级提供服务,而不是失败。这有助于保持应用程序在线并确保业务连续性。
- **透明响应:** API 响应会指示哪个层级服务了您的请求,让您对性能和计费拥有完全可见性。
- **理想用例:** 实时客户支持机器人、实时内容审核流水线以及时间敏感型请求。
要使用 Priority 推理,只需相应设置 `service_tier` 参数:
Priority 推理将向在 Tier 2 / 3 付费项目的用户开放,适用于 `GenerateContent` API 和 Interactions API (https://ai.google.dev/gemini-api/docs/interactions) 端点。
访问 Gemini API 文档 (https://ai.google.dev/gemini-api/docs/pricing) 查看完整的定价明细,并立即开始优化您的生产层级。若要查看实际操作示例,请查阅 cookbook (https://github.com/google-gemini/cookbook/blob/main/quickstarts/Inference_tiers.ipynb) 中的可运行代码示例。
### 相关文章
相似文章
我们正在扩展 Gemini 2.5 系列模型
Google 宣布 Gemini 2.5 Flash 和 Pro 模型正式推出,并推出预览版 Gemini 2.5 Flash-Lite——一个新的成本高效且最快的变种,针对高吞吐量、低延迟的任务进行了优化。
Gemini 2.5:思维模型家族的更新
Google 宣布 Gemini 2.5 Pro 和 Flash 模型的稳定正式发布,推出新的 Gemini 2.5 Flash-Lite 预览版,具有更低的延迟和成本,并更新 Flash 系列的定价,调整输入/输出令牌费率。
Google 为 Gemini 推出 “AI Ultra Lite” 套餐及明确的 “使用限制”
Google 正筹备推出新的 Gemini “AI Ultra Lite” 订阅层级,以填补 Pro 版和 Ultra 版之间的空白,同时还将上线一个用于追踪 Token 使用额度的仪表板。
通过 Gemini API 中的 Webhook 减少长时间运行任务的摩擦和延迟
Google 为 Gemini API 推出了事件驱动的 Webhook,以减少 Deep Research 和批处理等长时间运行任务的延迟和摩擦。该功能用基于推送的通知取代了低效的轮询,从而提升了代理式应用程序的开发者体验。
Google 已正式发布 Gemini 3.1 Flash-Lite(2 分钟阅读)
Google 现已公开发布 Gemini 3.1 Flash-Lite,提供超低延迟、高吞吐处理能力以及多模态功能,主要面向企业级应用。