UCCI: 校准不确定性实现成本最优的LLM级联路由
摘要
UCCI提出了一种校准优先的路由器,用于LLM级联,它使用等渗回归将令牌级别的边际不确定性映射到错误概率,在生产级NER任务中实现了31%的成本降低,同时保持微F1=0.91,并将期望校准误差从0.12降至0.03。
arXiv:2605.18796v1 公告类型:新
摘要:LLM级联和模型路由通过将简单查询发送给小模型、将困难查询升级到大模型,承诺降低推理成本,但大多数已部署的路由器使用未校准的置信度分数,并且需要针对每个工作负载调整阈值。我们提出了UCCI,一种校准优先的路由器,它通过等渗回归将令牌级别的边际不确定性映射到每个查询的错误概率,并通过约束成本最小化选择升级阈值。在三个显式假设下,基于校准分数的阈值策略是成本最优的,等渗校准对于期望校准误差(ECE)实现了O(n^{-1/3})的样本复杂度。在一个生产级命名实体识别工作负载中,该工作负载包含75,000个查询,由4B和12B指令调优的LLM在H100 GPU上提供服务,UCCI在微F1=0.91的情况下将推理成本降低了31%(95%置信区间:[27%, 35%]),同时将ECE从0.12降至0.03。在相同的操作点,UCCI优于熵阈值法、分离保形路由和FrugalGPT风格的学习阈值。所有级联结果都基于实际模型输出的端到端路由和实测的H100延迟,而非基于全局精度或标称API价格的模拟路由。
查看缓存全文
缓存时间: 2026/05/20 08:34
# UCCI:面向成本最优LLM级联路由的校准不确定性
来源:https://arxiv.org/abs/2605.18796
查看 PDF (https://arxiv.org/pdf/2605.18796) HTML(实验性)(https://arxiv.org/html/2605.18796v1)
> **摘要:** LLM级联和模型路由通过将简单查询发送至小模型、将困难查询升级至大模型,有望降低推理成本。然而,大多数已部署的路由器使用未校准的置信度分数,并且需要针对每项工作负载进行阈值调优。我们提出 UCCI,一种校准优先的路由器,通过保序回归将令牌级别的边际不确定性映射为每个查询的误差概率,并通过约束成本最小化来选择升级阈值。在三个显式假设下,基于校准分数的阈值策略是成本最优的,且保序校准在期望校准误差(ECE)上达到了 O(n^{-1/3}) 的样本复杂度。在一个包含 75,000 个查询的生产命名实体识别工作负载上(由基于 H100 GPU 的 4B 和 12B 指令微调 LLM 提供服务),UCCI 在微 F1 = 0.91 时削减了 31% 的推理成本(95% 置信区间:[27%, 35%]),同时将 ECE 从 0.12 降低至 0.03。在同一工作点,UCCI 优于熵阈值、分裂保形路由以及类 FrugalGPT 的学习式阈值。所有级联结果均基于实际模型输出的端到端路由及实测的 H100 延迟,而非基于全局准确率或名义 API 价格的模拟路由。
## 提交历史
来自:Varun Kotte [查看邮件](https://arxiv.org/show-email/0b72375b/2605.18796) **\[v1\]** 2026年5月11日星期一 07:06:57 UTC (197 KB)相似文章
聚类、路由、升级:面向成本感知的LLM服务的级联框架
提出了一种面向成本感知的LLM服务的两阶段级联框架,该框架将查询聚类并路由至最具成本效益的模型,然后将低质量输出升级至更强的模型。在降低推理成本的同时,保留了97-99%的准确率。
先校准,再路由:面向分离式LLM服务的学习型请求路由实测研究
本文针对分离式LLM服务的学习型请求路由进行了实测研究,评估了一种利用准入时特征分配请求的校准路由器,在实际vLLM/NIXL集群上取得了比传统方法更高的平均有效吞吐量。
超越准确性与成本:面向动态工作负载的延迟感知LLM查询路由
一篇论文提出了一种延迟感知的LLM查询路由器,通过轻量级延迟估计器联合优化延迟、准确性和成本,在保持可比延迟的同时,准确率-成本效用提升高达40%。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
面向成本高效的LLM路由的在线学习(6分钟阅读)
Ramp Router 使用 EWMA 评估故障率,通过 Thompson 采样评估延迟,从而选择最便宜的、能在截止时间前完成任务的 LLM 模型和服务层级,在不损失性能的情况下实现 30% 的成本节省。