@svpino: 生产环境中的流量并不均匀。你会遇到一些需要最佳模型的请求,但大多数是简单问题和……

X AI KOLs Timeline 工具

摘要

本文讨论了通过根据请求复杂度将请求路由到适当模型来优化生产环境中AI模型的使用,使用TrueFoundry的Auto Routing可将成本降低高达80%,同时保持高质量。

生产环境中的流量并不均匀。 你会遇到一些需要最佳模型的请求,但大多数是简单的问题和查询,你可以用更便宜、更快的模型来解决。 今天你能犯的最昂贵的错误就是将每个请求都发送到你最强的模型。 你需要路由。就是这样。 这是改进你所构建的任何系统架构的最简单技巧。 请不要自己实现路由。你不必这样做。 我目前在使用TrueFoundry的Auto Routing。它读取每个请求,将其分类为简单、中等或复杂,然后发送到分配给该层级的模型。 你有两个选择: 1. 将每个请求发送到免费的启发式分类器,对技术词汇、代码、提示长度和多步推理等信号进行评分。 2. 当请求的难度需要更细致的判断时,将其发送到LLM分类器。 使用路由的好处是你的代码无需更改。你仍然调用单个端点模型,但路由在幕后工作,将每个请求与最佳模型配对。 TrueFoundry用两种不同的设置进行了几次实验: 1. 将每个请求发送到Claude Opus 2. 将每个请求发送到一个包含Haiku、Sonnet和Opus的路由器 第一个实验在每种设置下运行了550个确定性评分的学术提示。Auto Routing便宜了69%,同时保留了98%的基线质量。 第二个实验在每种设置下运行了三个生产形状的工作负载,使用用户聊天、开发者聊天和长时间代理任务。Auto Routing便宜了80%。 感谢TrueFoundry团队与我合作完成这篇文章。
查看原文
查看缓存全文

缓存时间: 2026/09/11 22:41

生产环境流量并不均匀。

有些请求需要你使用最强模型来处理,但大多数是简单查询和基础检索任务,完全可以用更经济、更快速的模型解决。

当今你可能犯下的最昂贵错误,就是将所有请求都发送给最强模型。

必须建立路由机制,这是优化任何系统架构最直接的技巧。

请不要自行实现路由功能——你无需重复造轮子。

我目前使用的是TrueFoundry的自动路由方案。它会读取每个请求,将其分类为简单、中等或复杂,然后路由到对应层级的模型。

你有两种路由选择:

  1. 将所有请求发送到免费的启发式分类器,通过技术术语、代码含量、提示词长度和多步推理需求等维度进行评分

  2. 当请求复杂度需要更精细判断时,调用LLM分类器进行评估

路由机制最妙之处在于:你的代码无需任何改动。你仍然调用单个端点模型,但路由层会在后台为每个请求智能匹配最合适的模型。

TrueFoundry通过两种配置进行了多组实验:

  1. 所有请求均使用Claude Opus模型
  2. 所有请求通过路由自动分配给Haiku、Sonnet和Opus模型

首次实验对550个经过严格评分的学术提示词进行全配置测试:自动路由方案在保持98%基线质量的同时,成本降低了69%。

第二次实验针对三种生产环境工作负载(用户对话、开发者对话和长程智能体任务)进行全配置测试:自动路由方案成本降低了80%。

感谢TrueFoundry团队与我合作完成本文。

相似文章

我们是否默认过度配置了AI智能体?

Reddit r/AI_Agents

文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。