最佳模型路由因任务而异(6分钟阅读)
摘要
模型路由是降低推理成本的热门趋势,但最佳路由高度依赖具体任务。Harvey和Factory等团队通过专注于单一工作流而非通用路由器,实现了显著的成本节约。
查看缓存全文
缓存时间: 2026/07/20 09:44
模型路由是当下热门话题,因为没人愿意为每个 token 都付出前沿模型的价格。最佳的路由方式高度依赖于特定任务。你对单个工作流的关注越聚焦,在准确性和成本方面可挖掘的阿尔法就越大。问题在于,在成本/延迟约束下,找出哪些模型能满足哪些任务的门槛。
最佳模型路由是任务特定的
模型路由现在太火了。在过去大约1.5个月内,OpenRouter推出了Fusion,这是一个复合模型,将你的提示分发到一组前沿模型并综合出一个答案;Cognition推出了Devin Fusion,这是一个框架,并行运行一个前沿模型和一个廉价的“副手”,并通过分类器在两者之间切换;Factory则推出了一款路由器,在Terminal-Bench 2上保持了Claude Opus 4.7约99%的通过率,同时成本降低了20%;就连Vercel现在也在其AI网关中加入了路由规则。最近,ShortcutAI发表了一篇文章,展示了他们如何调整框架和模型组合,创建了一个电子表格代理,与Claude for Excel相比,准确率更高且 token 消耗更少。
这些方案都趋于一个共同模式:没人愿意为每个 token 都支付前沿模型的价格。
我认为这一趋势是真实的。在此基础上,我确实认为最佳路由是高度任务特定的,你对单个工作流的关注越聚焦,在准确性和成本方面可挖掘的阿尔法就越大。你不需要为每个任务都动用前沿智能——但要找出哪个模型能满足哪个任务的门槛,同时满足你的成本/延迟约束,这只能由专注于该任务的人来解决。
模型智能是参差不齐的,而什么是“足够好”(以及你愿意为最后几个百分点的准确性付出什么)完全取决于任务。一个不了解你任务的路由器,在猜测这两方面时都会失准。
成本故事,以及为什么通用路由器不够用
前沿模型在大规模应用时,每个 token 都太贵了——像Fable这样的模型,在满负载推理下每小时能烧掉600美元,而大部分工作并不需要那么强的算力。成本曲线提供了帮助:在接近前沿的位置,成本急剧下降,而质量几乎不变,因为首先离开前沿模型的工作正是那些更便宜的模型也能处理得一样好的任务。Factory就运作在这个平坦区域,在保持通过率的同时削减了20%-25%的成本;Cognition的Devin Fusion则宣称“使用单一模型完成所有工作的时代即将结束”,它以35%的低成本保持了Fable 5级别的性能,其用户88%的合并PR直接来自路由器。
OpenRouter在这方面确实很出色,我在Fusion推出时也这么说。但Fusion是一个集成模型,旨在最大化在困难、开放性问题上的质量,在这些问题上你愿意为多个补全结果付费,因为犯错成本很高。任务特定路由解决的是另一个问题:给定这个特定的输入,哪条是最便宜的路径,能最大化该任务的质量门槛?一个通用网关可以在不同提供商之间进行路由,并在端点降级时回退,但它无法知道你扫描的贷款文件的第三页是一个密集的表格,需要专门的视觉模型,而第一、二页是纯文本,你应该用便宜的纯文本抽取方式处理。它没有对输入的理解,因为它并不专注于任何一个任务。
路由做得出色的团队,都深入一个工作流
编码代理只是最明显的例子。看看那些推出严肃垂直AI产品的团队,你会发现同样的模式:每个团队都在单个工作流内部进行路由,并且每个团队都足够深入地理解了其任务,知道哪个模型能满足门槛。
在法律领域的Harvey是最清晰的例子。他们的多模型系统将请求分解为子任务,为每个子任务选择模型,然后综合结果——“没有单个模型在所有方面都是最好的”,因此他们将高容量的Vault工作路由到更快的模型,如Sonnet 4.6和Gemini 3 Flash,这些模型在延迟重要且质量足够好的场景下表现出色,同时他们还在后训练自己的开源模型,以更低的成本达到接近前沿的法律性能。
Decagon在客服领域也采用了同样的方法,Jesse的阐述是我读过的最精练的论证:当一个用例是新的时,你需要最聪明的通用模型,但“一旦用例完全建立起来……通用智能就成了开销”,你需要的是“最小、最快、经过微调、能出色完成特定任务的模型”。Decagon现在大约90%的工作负载都运行在微调后的开源模型上。
这两家都不是寄希望于单个模型。它们各自都在一个任务上,使用自己深刻理解的模型组合进行爬山优化,而这种理解正是通用路由器无法买到的。这是Sarah Guo所说的“不可训练”最具体的体现:难度模型和为其打分的评估集是私有的真实基准,是来自真实业务量的积累,下一个季度更聪明的前沿模型并不能直接给你这些。这就是阿尔法所在,而且会不断累积。
文档AI:差距很大,而且会一直很大
很多人曾以为前沿模型会完全取代文档解析。但并没有。在我们开源的基准测试ParseBench上,前沿VLM在视觉理解方面表现出色,但在布局方面却很差——GPT-5-mini和Haiku在视觉定位上得分低于10%,而专门的解析器得分在55-80%,并且没有单一方法能在所有五个维度上达到顶尖。Gemini从最低思考量增加到最高思考量,以4倍的成本换来了大约5分的提升,而你却在那些从未需要VLM的纯文本页面上浪费了视觉 token。
文档OCR的正确架构涉及一个复杂的“路由器”(更准确地说,是一个复杂的引擎),它由许多协同工作的部件组成,并且针对特定的数据领域和任务分布进行了精细调优。LlamaParse在内部就包含了这一点:一个代理式框架,用于在每页上自动在前沿模型和专门模型之间进行路由,并带有一个自我改进的文档复杂度模型;自定义的文档引擎,在纯文本情况下可将视觉 token 减少50-90%;专门为表格和图表后训练的VLM;以及一个验证输出的代理式裁判。在成本-准确性平面上,它位于前沿——我们的代理模式以84.9%的准确率领先,并在5个维度中赢得4个;我们的成本效益模式以每页大约三分之一美分的成本接近顶部。
在文档理解的帕累托曲线上,相对于前沿模型的视觉能力,永远会存在一个巨大的差距。我们设计LlamaParse就是为了让它始终最佳地利用这个差距。
两层,不同职责
这两层承担着不同的角色。像OpenRouter这样的通用网关负责广泛的、提供商级别的路由和集成(哪些模型在线、当前哪个最便宜、何时为困难的通用问题召集专家组)。任务特定层则是超额收益的所在地,这些收益流向那些在工作流上走得最深的团队:软件工程领域流向Factory和Cognition,法律领域流向Harvey,客服领域流向Decagon。对于文档领域,我们希望这个团队是我们自己。如果你正在为前沿和开源VLM进行路由,以从每一分钱中榨出文档准确性的每一个百分点,那就和我们一起构建吧。
相似文章
模型路由很简单,直到它变得复杂。
IBM Research 解释了为什么智能体系统中的模型路由比简单的分类问题更复杂,指出缓存和隐藏因素(如实际工作负载成本和任务难度评估)使路由成为一个系统优化挑战。
模型路由的第一性原理
本文概述了有效AI模型路由的第一性原理,强调保持模型差异化、限制池大小、使用相对实际基准以及评估过去的路由决策以实现更好的性能。
@tomas_hk: 是的,我们在此分享了我们的经验:
这是一份全面指南,解释了模型路由技术,该技术能够智能地为每个请求选择最合适的AI模型,以优化成本、质量和延迟。文章将模型路由与AI网关进行了对比,并强调了其在代理型AI工作负载中的重要性。
@omarsar0: Google DeepMind关于有效模型路由策略的杰出论文。
Google DeepMind发布了一篇关于有效模型路由策略的论文,讨论了LLM路由器在准确性和成本方面的评估,但如果模型回答完全相同,这种评估可能毫无意义。
你更愿意调整一个模型的推理深度,还是在两个模型之间切换?
这是对使用单个可调深度的万亿参数推理模型(如 Ring-2.6-1T)与在多个专用模型之间切换这两种方案的权衡思考,探讨哪种方法对代理工作流更简洁或更具成本效益。