@GoogleCloudTech:https://x.com/GoogleCloudTech/status/2099507349828350285

X AI KOLs Timeline 产品

摘要

本文介绍了如何在 Google Cloud 的 Gemini Enterprise Agent Platform 上结合使用 Claude Fable 5.1 和 Gemini 3.8 Flash,通过匹配模型能力与任务要求来优化任务路由并降低成本。

https://t.co/exflBWGzmS
查看原文
查看缓存全文

缓存时间: 2026/09/15 05:44

让Claude Fable 5.1与Gemini 3.8 Flash协同工作

有位同事在工作中问了我一个无关紧要的问题,我使用智能助手查阅了最近的聊天记录和文档,它确实找到了正确答案,但这次查询竟然花费了我38美元!这个投入产出比太不划算了。虽然我的时间确实宝贵,但我原本并不会花那么多时间处理这个任务,而且这个任务根本不需要昂贵的规划能力。

我们可以做得更好。

Google Cloud的Gemini Enterprise Agent Platform提供模型花园,能便捷地通过API访问多种顶级模型,包括Google自家、Anthropic甚至xAI的模型。事实上,Huggingface上的所有模型都可以自行部署,但本文我们将重点介绍Anthropic新推出的Claude Fable 5.1和Google的Gemini 3.8 Flash。现在开发者可以通过完全相同的企业API界面,使用这两种形态不同的前沿模型。

Claude Fable 5.1提供神谕级自主规划能力、百万级令牌上下文窗口和深度多步骤处理能力。Gemini 3.8 Flash则具备接近前沿水平的推理能力、惊人的令牌处理速度,以及极具竞争力的经济效益(输入每百万令牌0.75美元,输出每百万令牌3.75美元),并支持可调节的思考控制功能。

选择单一模型并处理所有任务看似简单,但这其实是个错误。

如果让深度规划模型处理日常开发工作,相当于用前沿模型的费率去解析git差异。而如果强迫快速模型在没有正式规划的情况下处理不可逆的数据库迁移,它会贸然行动,在你喝完咖啡前就把系统搞崩溃。

通过使用两个模型并合理分配任务,我们能大幅提升“令牌经济”效率。

作者:Alan Blount (@zeroasterisk)

以下是实现这一目标的完整指南:

  • 在统一治理平面后端配置两个模型
  • 在选定默认模型前先对常规任务进行基准测试
  • 将快速模型作为前线协调器,仅在需要更强处理能力或快速模型需要升级时调用深度规划模型
  • 建立任务投资回报率的心智模型,理解令牌的价值(不仅是成本)

1. 在统一治理平面后端配置两个模型

选择LLM推理平台需要综合考虑多方面设计要素:成本、容量、安全性、模型选择、服务特性、开发便捷性,以及更强的安全保障(API密钥存在风险)。Gemini Enterprise Agent Platform(原Vertex AI)是功能全面的独特选项,由于它将Gemini和Anthropic模型都作为托管API提供,单一的安全认证即可覆盖所有工作负载。

但坦率地说,有些流程比预期更繁琐。我常开玩笑说“不可能的事容易,容易的事却很难”,这也是我撰写本文的部分原因。

在配置模型前,请先登录gcloud,查阅文档了解不同区域的差异。

要获取Claude Fable 5.1的访问权限,需启用API,然后开启Claude Fable 5.1并填写简短的用例说明表格。但这还不是全部。

现在Fable纳入了Google Cloud的《高级AI安全补充条款》。在向aiplatform.googleapis.com发送任何提示词之前,必须在项目级别显式配置提示-响应共享设置并接受发布者条款。

以下是全球端点的具体操作说明,区域差异请查阅文档。

首先设置几个辅助变量。注意URL路径中的模型名称应使用连字符格式的claude-fable-5-1,填入项目ID和位置信息,根据所在区域调整端点地址:

接着调用setPublisherModelConfig API,将dataSharingEnabledProvider设置为全大写的ANTHROPIC:

初始调用返回已完成的确认对象,表明数据共享已激活:

若已进行过此设置,会收到HTTP 409错误提示设置已存在:

这个409错误完全正常。

测试模型访问权限,应收到成功响应:

若设置不正确,会出现如下HTTP 403错误:

要获取Gemini 3.8 Flash的访问权限,需确认其在模型卡片中显示为已启用状态:

…太好了!配置完成🎉!

需要更多配额?您可以为任何模型管理配额,部分模型还支持预购吞吐量服务。

2. 不要轻信基准测试,自己运行验证

如果询问五位工程师在智能体场景该使用哪个模型,根据Twitter氛围和合成排行榜,你将得到超过五种矛盾建议。

公开基准测试提供了优质资源,但它们只在孤立提示或日益复杂的真空任务中进行测试。生产环境用例或你本地的智能体开发生命周期,永远无法与公开基准完全匹配。你的工作形态与任何现有基准都不同。

你可以构建自己的基准测试(Agent Ops与Evals组合更佳!)并实现规模化自动化,或者只需简单并行执行自己的任务。只要不改变任务文件内容,几乎无需额外投入就能获得对任务的直观感受。

以下是使用promptfoo驱动opencode对每个模型执行相同两个任务的示例。需要调整任务描述并配置环境才能运行,但应该不难。

配置Promptfoo以比较opencode智能体任务执行效果,而不仅是单次提示词和模型表现。

使用Promptfoo运行并行对比测试:

promptfoo eval -c promptfooconfig.yaml –no-cache

这是我在纯净开发容器中运行评估的结果:

检查PR分支时,Claude Fable 5.1进行了多轮元反思,重新检查未变化的树哈希值。耗时近6秒且成本高出23倍。Gemini 3.8 Flash则立即识别意图,调用git工具,仅用1.1秒完成回答,成本不足十分之一美分。

在复杂数据库迁移任务中,情况发生逆转。Gemini 3.8 Flash在3秒内生成了简洁有序的线性序列。而Fable 5.1花费12秒生成了完整的正式有向无环图(DAG),识别了双写时钟偏斜风险,生成了幂等键需求,并定义了可逆回滚关卡。

这只是个示例,你应该用自己的任务进行对比测试。

3. 日常实践与生产环境应用

无论使用现成编码工具还是构建定制智能体服务,成功的模式是建立非对称协调机制:前线执行采用廉价快速模型,架构级检查点则使用深思熟虑的深度模型。将昂贵的令牌用于棘手问题或规划工作,常规任务则默认使用更经济的令牌。

编码智能体工具(OpenCode、Aider等)

不要强制使用单一模型作为通用默认选择。配置专门映射到不同模型的子智能体。使用统一提供商具有安全与成本优势,而采用不同模型家族则可形成交叉校验优势。

使用深度思考智能体识别问题根因并规划解决方案,再由工作智能体处理具体任务并报告状态。深度规划器检查工作成果,确认成功或重新分配。

定制化“即服务”智能体(Google ADK、LangGraph、自定义代码等)

构建自有智能体框架与服务时,你拥有完全的架构自由度:

  • 为模型优化框架结构:为Gemini 3.8 Flash配置3-5个专注工具(读写文件、运行测试),并设置严格的JSON模式。快速模型擅长聚焦执行,但50个工具会导致参数混淆和上下文浪费。为Claude Fable 5.1提供架构文档、模式定义和指南,但移除直接文件写入权限。

  • 基于评估构建:不要猜测模型与节点的适配性。针对你的代码库任务运行包含确定性断言检查的自动化评估套件,寻找能以10%成本达成95%质量的小型模型应用场景。这说来容易执行难,关键是如何确定评估场景。参考我们的Kaggle五日课程(智能体、视频编码)获取更多指导。

  • 使用“请求协助”升级模式:将所有新请求交由快速工作模型处理。为工作模型配备明确工具:ask_for_help(原因,失败次数,上下文)。工作模型直接处理85%-90%的请求,仅在存在歧义、不可逆操作或连续两次工具失败时进行升级。

自动化“智能”模型路由器的现实检验

智能路由器在预测性机器学习(广告技术、欺诈检测)领域已有悠久历史。多臂老虎机与成本质量路由器技术成熟,因为特征呈表格化,输入受限,反馈(点击、拒付)既即时又能在长时间维度上衡量。

在生成式AI领域,多轮智能体的情况则不同。动态路由器面临三大生产现实挑战:

  • 单轮上下文可能缺乏足够信号来判断任务类型
  • 成功指标难以明确关联到特征,导致路由器无法快速“学习”
  • 错误选择需要在另一路径重新运行,既消耗潜在节省又增加延迟

结论:保持简单明了。显式构建智能体组合,按任务边界进行路由。定义清晰角色,通过具体代码断言或人类意图控制任务交接。

4. 令牌投资回报率公式:你究竟在为什么付费?

原始价格表($/百万令牌)不能很好映射生产价值。成本计算只是公式的一部分。无法给出普适于编码、产品、制造等所有待完成工作的计算方式。

起点可以是思考你获得的商业价值:

  • 节省的人力时间成本,员工完成更多工作,减少机械性劳动和自动化任务时间
  • 更快将功能交付生产的价值,以及因功能改进带来的客户满意度与留存率提升
  • 通过改进安全措施和工程实践减少的错误和避免的生产故障

减去令牌成本以及团队构建管理智能体的技能提升成本,即可得到粗略的投资回报率计算。

你可以通过使用更少更廉价的令牌来影响这些计算,但通过更快完成更多工作可能影响更大。选择高杠杆任务,选择能带来可验证的开销节省或收入增长且值得自动化的任务。在分解这些任务时,有些可能需要深度思考与规划并愿意支付更高成本和等待时间,有些则需要快速可靠执行。这两种需求都会出现。

令牌经济是当前热门话题,降低成本、最大化价值的选择日益丰富。本文的核心观点是:在两个具有不同特性的模型上配置多个智能体并自主分配任务,其实非常简单。这是最易上手的起点。

如果本分析对您有所帮助,请参阅我们之前关于AI工程师必知的智能体沙箱五大要点的文章。关注@GoogleCloudTech和@zeroasterisk获取更多来自开发者实战的深度解析。

相似文章

Gemini 3.5 Flash

Reddit r/openclaw

用户询问社区对Google Gemini 3.5 Flash模型的反馈,以及如何通过Google One或AI Studio API访问该模型。

Gemini 3.5 Flash 中的计算机使用

Hacker News Top

Google 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,使开发者能够构建可在浏览器、移动设备和桌面环境中进行观察、推理和操作的智能体。

Google 正在推出自己的 OpenClaw 版本

The Verge

Google 推出 Gemini Spark,一款由 Gemini 3.5 Flash 驱动的始终在线 AI 代理,支持后台运行、通过 MCP 集成 Workspace 和第三方应用,并更新了 Antigravity。