推荐系统应多久调用一次LLM?价值加权路由、监控与季节性鲁棒性
摘要
本文介绍了Value-Router,一项针对推荐系统中廉价启发式方法与昂贵LLM调用之间成本感知路由的仿真研究,表明价值加权路由提高了精确度,并通过自适应预算处理季节性需求激增。
arXiv:2607.25068v1 Announce Type: new
摘要:在廉价启发式方法与昂贵大型语言模型(LLM)之间的路由决策通常被表述为一个难度问题:将困难案例发送到昂贵路径。我们认为这种表述不完整,因为难度和业务价值是不同的维度——困难且廉价的物品与困难且昂贵的物品具有不同的错误成本。我们提出了Value Router,一个完全合成的零售商品管道仿真,它仅使用估计难度和估计价值来路由物品,从不依赖真实值。研究分为三个阶段。首先,在一个品类数量与价值呈负相关的合成目录上,将价值加权阈值路由器与仅基于难度和随机基线进行比较。价值加权在召回真高价值物品(60%)方面与仅基于难度的基线相当,同时实现了显著更高的精确率(98.3% vs 94.3%)。其次,决策记录器和监视器揭示了一种被汇总指标隐藏的失败模式,表明汇总结果几乎完全由类别间差异驱动,而非逐项区分能力。第三,模拟的黑色星期五需求激增(2.5倍数量,并转向更高价值类别)比较了静态路由器、季节性调优路由器以及两种慢路径预算策略。所有结果均来自受控合成仿真,具有实验者定义的真实值,并展示了成本感知路由系统的设计原则,而非经过验证的实际应用主张。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 推荐系统应多久调用一次大语言模型?价值加权路由、监控与季节性鲁棒性 来源:https://arxiv.org/html/2607.25068 ###### 摘要。 在廉价启发式方法与昂贵的大语言模型(LLM)调用之间进行路由决策,通常被表述为一个难度问题:将困难案例发送到昂贵路径。我们认为这种表述是不完整的,因为难度和业务价值是独立的两个维度——一个四美元的困难物品和一个两千美元的困难物品,犯错的代价是不同的。我们提出 **value-router**,一个全合成的零售商品管理流水线模拟研究,该流水线同时使用估计的难度和估计的价值(而非真实值)将物品路由到快速或慢速决策路径。该系统分三个阶段构建并评估。首先,将价值加权阈值路由器与仅基于难度的基线和随机基线进行比较,使用一个故意在类别销量和类别价值之间引入反向相关性的合成商品目录;价值加权在召回真正高价值物品方面与仅基于难度的基线相当(≈60%),同时实现了显著更高的精确率(98.3% vs. 94.3%),即,它更少地将昂贵路径浪费在困难但廉价的物品上。其次,一个决策记录器和监视器揭示了一个聚合指标无法察觉的故障模式:一个具有可观整体估计-真实值相关性(0.792)的难度估计器,在按每个商品目录类别内部测量时,相关性骤降至接近零,表明聚合数字几乎完全是类别间效应,而非真正的逐物品区分能力。第三,一个模拟的黑五式需求激增(2.5倍销量,混合转向更高价值类别)用于比较一个忽视季节性的静态路由器、一个手动校准季节性阈值的路由器,以及两种慢速路径预算策略。一个固定的每日预算在激增下导致高价值召回率从70.1%暴跌至16.2%,而一个弹性预算仅根据当日自身价值估计进行缩放(对峰值发生一无所知),自动跟踪激增并与无约束路由器几乎完全匹配。所有结果均来自受控的合成模拟,具有实验者定义的真实值,旨在展示成本感知路由系统的设计原则,而非构成经过验证的真实世界声明。 LLM路由,成本感知推理,级联系统,模型路由,决策监控,校准,季节性鲁棒性,电子商务商品管理,成本感知LLM,置信度校准,LLM级联路由,推理成本 ## 1. 引言 随着大型语言模型嵌入到个性化和决策流水线中,每次额外的LLM调用都会带来延迟、令牌和计算方面的真实成本。这引出了一个基本的系统问题:系统何时应该花费昂贵的推理调用,何时廉价启发式方法同样足够? 一个常见的初步答案是“在更困难的案例上花费更多推理”。这是一个不完整的答案。考虑两个进入零售商品目录的物品:一个4美元的手机壳,类别确实模糊;一个2000美元的皮夹克,同样模糊。这两个物品在相同意义上是**困难**的——一个简单的规则可能会错误地处理任何一个——但在夹克上的错误决策价值远高于手机壳上的错误决策。难度告诉我们决策的不确定性有多大;价值告诉我们错误的代价有多大。一个仅关注难度的路由策略无法区分这两种情况,并且会同样频繁地将昂贵推理花费在廉价但困难的物品和昂贵但困难的物品上。 本文提出了 **value-router**,一个围绕这一区别构建的模拟研究,分三个阶段开发,每个阶段都设计为独立有用: - • **核心路由**(第3节):一个合成商品目录模拟器,包含可观测字段(类别、价格)和隐藏的真实值字段(价值、难度);一个难度评分器和一个价值估计器,它们仅能看到可观测字段;以及一个路由器,仅当物品同时超过**估计难度**和**估计价值**阈值时才将其发送到昂贵路径。这与仅基于难度的基线和随机基线进行比较。 - • **监控**(第4节):一个决策记录器和一个监视器,检查聚合指标可能隐藏的两件事——路由花费是否如预期集中在罕见的高价值细分市场,以及为路由器提供输入的估计器在每个类别内部是否校准良好,而不仅仅是在整个商品目录上。 - • **季节性鲁棒性**(第5节):一个模拟需求激增(替代真实季节性事件,如黑五)的多日模拟,用于比较一个忽视季节性的路由器、一个手动校准的日历感知路由器,以及两种限制昂贵路径预算的方式——一种固定,一种对当日自身估计具有弹性。 我们希望明确范围:本文中的每个数字均来自完全合成的模拟,具有实验者定义的真实值,除非另有说明,每个配置使用单个随机种子运行,由一人构建的设计练习。贡献是一组设计模式以及一些具体且有时反直觉的发现,这些发现来自针对我们故意对被测系统隐藏的真实值进行测试——而不是一个预期能直接迁移到生产部署的基准结果。第6节将回到这一点。 ## 2. 相关工作 通过仅将一部分输入路由到昂贵模型来降低大规模LLM流水线成本,是一个活跃的研究领域。FrugalGPT(Chen 等,2023)学习一个跨多个成本递增的LLM API的级联,仅当廉价模型的答案被认为不足时才升级查询,这建立在早期FrugalML(Chen 等,2020)在预算约束下跨付费预测API级联的公式基础上。围绕中间推理表示构建的LLM级联(Yue 等,2023)和混合模型方法如 AutoMix(Madaan 等,2023)追求类似目标:仅当廉价阶段的输出不可信时才花费昂贵模型的推理。模型级联也被更广泛地研究作为联合提高NLP系统效率和准确性的方法(Varshney and Baral, 2022),以及系统级实现如 Tabi(Wang 等,2023)表明多级级联在部署的LLM服务基础设施中带来可测量的延迟优势。RouteLLM(Ong 等,2024)和 Hybrid LLM(Ding 等,2024)则直接从偏好或质量标记数据学习一个路由器,将路由表述为基于查询特征的分类问题;EcoAssistant(Zhang 等,2023)将类似的成本-质量升级策略应用于工具增强的LLM助手。 第二个相关线索是置信度校准,因为上述大多数级联基于廉价路径的某种不确定性概念进行升级。神经网络校准的经典工作(Guo 等,2017)确立了聚合校准指标可能掩盖数据子群体内的系统性误校准——我们在第4节为我们的难度估计器揭示的同一类故障模式,这里是在LLM路由而非图像分类设置中。更近期的研究询问LLM自身是否知道自己不知道的内容,无论通过内部概率估计(Kadavath 等,2022)还是通过引导出的语言化置信度(Tian 等,2023);这两条工作线都是在非合成部署中,我们的级联路由器将使用的难度/不确定性信号的自然来源。更广泛意义上的成本敏感学习——根据错误的实际成本加权,而不是同等对待所有误分类(Elkan, 2001)——是我们价值维度的经典决策理论框架,在这里应用于推理时路由而非模型训练。 最后,我们将这条工作线与那些降低单次昂贵调用成本而非决定是否调用一次的技术区分开来:推测性解码(Leviathan 等,2023)通过使用较小的草稿模型加速来自大模型的自回归生成;稀疏激活架构如 Switch Transformers(Fedus 等,2022)将每个令牌路由到单个模型自身参数的子集。这两者与外部级联路由器是互补而非竞争关系:一个部署可以使用上述调查的机制在快速和慢速路径之间路由,而每个路径内部可以使用推测性解码或稀疏路由以进一步削减成本。 这组工作几乎完全围绕一个轴组织:廉价路径的输出是否足够好,或者这个查询是否需要昂贵路径?**value-router** 提出了一个相关但不同的问题,受商品/电子商务环境而非开放领域查询回答的启发:即使仅关注廉价启发式方法很可能出错的输入,考虑到在这个特定输入上犯错对业务的代价,是否值得为昂贵路径付费?这两个问题是互补的——一个生产系统可能同时使用学习到的级联路由器和其上的价值门控——但据我们所知,上述路由文献未将犯错成本作为与难度并列的一流第二轴处理。**value-router** 在评估方法上也不同:由于环境完全合成,每个路由决策都可以对照路由器从未看到的实验者定义真实值进行评分,这使得第4节的校准分析和第5节的需求激增分析成为可能,而无需部署流量。 结合上述系统,我们认为 **value-router** 的贡献是三个具体、可测试的想法,这些想法在引用的工作中没有共同出现: - • **与不确定性轴正交的价值轴**。级联和路由系统(Chen 等,2023, 2020;Yue 等,2023;Madaan 等,2023;Ong 等,2024;Ding 等,2024;Varshney and Baral, 2022;Wang 等,2023;Zhang 等,2023)和校准/置信度引导工作(Guo 等,2017;Kadavath 等,2022;Tian 等,2023)都操作在一个标量上——廉价路径是否足够好?成本敏感学习(Elkan, 2001)按代价加权**训练**错误,但据我们所知,尚未与基于不确定性的推理时升级决策相结合。第3节显示这种组合并非多余:在一个具有现实销量/价值结构的商品目录上,在仅基于不确定性的路由器上增加价值门控,在相同召回率下将精确率提高了4个百分点,即,即使两者恰好相关,价值也不仅仅是难度的代理。 - • **分段内校准作为路由诊断,而不仅仅是训练时检查**。校准文献(Guo 等,2017)确立了聚合校准可能隐藏子群体误校准;我们表明这不是一个理论担忧,而是为路由决策提供输入的具体估计器的主导故障模式(0.792的聚合相关性在每个类别内崩溃至≈0,第4节),并且我们将其框架为部署路由器应针对自身细分市场持续运行的监控检查,而非部署前的一次性审计。 - • **一种无需被告知季节发生就能适应负载的预算策略**。在先前系统要么固定成本预算要么离线学习路由器的地方,第5节中的弹性预算将花费限制为路由器自身运行价值估计的一部分而非固定数值,并且经验上吸收了2.5倍需求激增而无需季节性特定逻辑——优于被明确赋予日历知识的路由器(表6)。我们不知道有先前的级联或路由工作在这种非平稳流量变化下评估预算策略。 这三个想法中的每一个都故意简单——第二个阈值、一个分组、一个比率——我们将其视为特征而非限制:论文的声明是,价值感知、分段条件监控和负载自适应预算是当前LLM路由系统中未充分利用的设计原语,而实现它们并不需要新的建模机制。 ## 3. 核心路由系统 ### 3.1. 商品目录模拟器 模拟器跨五个类别生成物品——**commodity, accessory, mid_tier, premium, luxury**——每个类别具有自己的销量权重和价格与利润率的类别内范围。对于一个物品i,其采样价格p_i和利润率m_i,真实值确定性地定义为: (1) value_i = p_i ⋅ m_i. 难度 d_i ∈ [0,1] 在类别特定范围内独立于价值采样,代表真实世界中关于该物品的商品管理决策有多难做对——它不建模任何具体的真实世界机制,只表示某些物品比其他物品更难决策。 类别配置故意编码了销量与价值之间的**反向**相关性(表1):最高流量类别(commodity)具有最低的单品价值,而最稀有类别(luxury)具有最高价值。这反映了常见的电子商务形态,是使朴素路由器紧张的条件:优化“最好地处理最多物品”的策略会倾向于高销量、低价值类别,并可能默默忽视稀有、高价值的长尾。一个 `--no-inverse` 控制标志将所有类别权重相等,为比较移除此效应。 表1. 默认合成商品目录,n=2,000,种子42。luxury占销量的3.1%,但平均价值约是commodity的700倍。 ### 3.2. 难度评分器和价值估计器 路由器从不直接看到价值或难度。相反,两个估计器产生近似值。
相似文章
面向成本高效的LLM路由的在线学习(6分钟阅读)
Ramp Router 使用 EWMA 评估故障率,通过 Thompson 采样评估延迟,从而选择最便宜的、能在截止时间前完成任务的 LLM 模型和服务层级,在不损失性能的情况下实现 30% 的成本节省。
超越准确性与成本:面向动态工作负载的延迟感知LLM查询路由
一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。
LLM服务中多目标路由的在线线性规划
本文提出了一种用于LLM服务路由的多目标优化框架,采用带出价-价格控制的在线线性规划来平衡延迟、吞吐量和尾部性能,并通过Vidur模拟器展示了相对于启发式方法的改进。
VDAR-Router: 通过语言化查询难度分析检索的自适应LLM路由
一篇新论文提出了VDAR-Router,这是一个面向LLM的难度感知的基于检索的路由框架,能够根据查询难度自适应选择模型,实现更好的成本-性能权衡。
跨四个LLM层级的代理工作路由:编排器、顾问、深度推理、Premier
作者分享了一个实用的四层LLM路由栈,用于代理工作。其中,快速的编排器处理大部分请求,仅在需要深度推理时才会升级到昂贵的模型,显著降低了成本并提升了交互体验。