@svpino: 生产环境中的流量并不均匀。你会遇到一些需要最佳模型的请求,但大多数是简单问题和……
摘要
本文讨论了通过根据请求复杂度将请求路由到适当模型来优化生产环境中AI模型的使用,使用TrueFoundry的Auto Routing可将成本降低高达80%,同时保持高质量。
查看缓存全文
缓存时间: 2026/09/11 22:41
生产环境流量并不均匀。
有些请求需要你使用最强模型来处理,但大多数是简单查询和基础检索任务,完全可以用更经济、更快速的模型解决。
当今你可能犯下的最昂贵错误,就是将所有请求都发送给最强模型。
必须建立路由机制,这是优化任何系统架构最直接的技巧。
请不要自行实现路由功能——你无需重复造轮子。
我目前使用的是TrueFoundry的自动路由方案。它会读取每个请求,将其分类为简单、中等或复杂,然后路由到对应层级的模型。
你有两种路由选择:
-
将所有请求发送到免费的启发式分类器,通过技术术语、代码含量、提示词长度和多步推理需求等维度进行评分
-
当请求复杂度需要更精细判断时,调用LLM分类器进行评估
路由机制最妙之处在于:你的代码无需任何改动。你仍然调用单个端点模型,但路由层会在后台为每个请求智能匹配最合适的模型。
TrueFoundry通过两种配置进行了多组实验:
- 所有请求均使用Claude Opus模型
- 所有请求通过路由自动分配给Haiku、Sonnet和Opus模型
首次实验对550个经过严格评分的学术提示词进行全配置测试:自动路由方案在保持98%基线质量的同时,成本降低了69%。
第二次实验针对三种生产环境工作负载(用户对话、开发者对话和长程智能体任务)进行全配置测试:自动路由方案成本降低了80%。
感谢TrueFoundry团队与我合作完成本文。
相似文章
当模型能力、策略、成本和延迟冲突时,如何路由代理请求?
作者讨论了当模型能力、策略、成本和延迟冲突时,路由AI代理请求的设计方法,询问生产经验中的权衡和策略。
@cryptopunk7213: 这真是天才。在AI模型越来越昂贵且日益丰富的世界里,这样的产品简直是梦想中的AI护城河……
Factory Router 为每个任务自动选择最佳AI模型,声称能在保持前沿性能的同时削减25%的成本,对大企业来说是一款前景广阔的工具。
我们是否默认过度配置了AI智能体?
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
前沿模型是否正在成为不需要它们的任务的默认选择?
文章讨论了大多数AI流量由简单、可重复的任务组成,如分类和提取,然而前沿模型常常被用于所有事情。它质疑将任务路由到较小的专用模型是否会成为降低成本和延迟的标准做法。
@rabois: 同意。推荐 https://Factory.ai.
Factory.ai 被推荐作为一款代理原生的软件开发工具,用于优化企业AI任务中的模型路由,提高准确性和成本效率。