SCX Router: 流式零样本模型选择——基于解码器-KV分类器和现实世界任务本体
摘要
SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。
arXiv:2609.02292v1 Announce Type: new
摘要:大型语言模型(LLMs)的快速普及及其应用日益多样化,带来了一个独特的优化机会:为任务选择合适的模型,同时在每个任务级别优化速度、成本和质量。然而,推理端点在质量、价格、延迟、上下文支持、工具使用、领域专业知识和推理行为方面可能存在很大差异。这种异构性使得手动启发式方法难以维护,并且不太可能单独实现持续有利的速度-成本-质量权衡。我们引入了 \router{},一个基于GLiClass的轻量级路由器,它为每个推理时模型标签分配一个适用性分数,而无需自回归生成。发布的0.6B参数检查点结合了Qwen3解码器和一个浅层双向评分器。其解码器-KV执行路径在会话中保留一个仅文本键值缓存,仅编码新的对话轮次,并评估瞬态候选标签令牌而不将其添加到持久缓存中。相同的检查点还预测任务类型、难度、推理模式和预期输出长度,并支持自定义零样本标签。对于任务生成,我们构建了一个任务本体,包含23个族、115种任务类型、345个可路由子类型、1,173个合成示例和30个领域的正交轴。利用此结构,我们生成了150,000个验证器评分任务和15,000个开放式任务。然后,我们在这些任务上训练Qwen3解码器,同时明确将学习到的请求预测与每个任务的属性策略(如资格、成本、缓存重用、安全性和主权)分开。在六个LiveBench子集上,路由器优于平均候选模型;在选定的1,000任务子集上,它实现了0.707的综合top-1分数,而最强固定模型为0.696,具体增益取决于基准测试。
查看缓存全文
缓存时间: 2026/09/03 06:04
# SCX路由器:基于解码器-KV分类器与现实任务本体的流式零样本模型选择
来源:https://arxiv.org/html/2609.02292
Aleksandr Smechov 所属机构:SCX.ai Holdings Limited
Mykhailo Shtopko 所属机构:Knowledgator
Dmytro Vodianytskyi 所属机构:Knowledgator
Oleksandr Lukashov 所属机构:Knowledgator
###### 摘要
大型语言模型(LLMs)的快速普及及其应用日益多样化,带来了一个独特的优化机遇:为任务选择合适模型,同时在速度、成本和质量上实现任务级优化。然而,推理端点在质量、价格、延迟、上下文支持、工具使用、领域专长和推理行为等方面差异显著。这种异质性使得手动启发式方法难以维护,且难以持续实现速度、成本与质量的有利权衡。我们推出**SCX路由器**,一种基于GLiClass的轻量级路由器,能在非自回归生成的情况下,为每个推理时模型标签分配适用性评分。发布的0.6B参数检查点[^1]结合了Qwen3解码器与浅层双向评分器。其解码器-KV执行路径在会话中保留纯文本键值缓存,仅编码新的对话轮次,并评估临时候选标签令牌而不将其添加至持久缓存。同一检查点还能预测任务类型、难度、推理模式和预期输出长度,并支持自定义零样本标签。对于任务生成,我们构建了一个包含23个族、115种任务类型、345个可路由子类型、1,173个合成示例以及30个正交领域轴的任务本体。利用该结构,我们生成了150,000个验证器评分任务和15,000个开放式任务。随后,我们在这些任务上训练Qwen3解码器,同时将学习到的请求预测与用于资格、成本、缓存重用、安全和主权等属性的每任务策略显式分离。在六个LiveBench子集上,路由器表现优于均值候选模型;在所选的1,000个任务子集上,其聚合top-1得分为0.707,而最强固定模型为0.696,且在不同基准上收益各异。
关键词:大语言模型路由;模型选择;GLiClass;零样本分类;解码器KV缓存;任务本体;智能体评估;成本感知推理;多轮路由。
## 1 引言
闭源前沿LLMs继续在通用智能排行榜[^2]上争夺主导地位。但开源模型家族在推理、编码、指令遵循、多语言覆盖等方面能力各异,同时在价格、延迟、上下文长度、工具访问和操作限制上也存在差异。这为用户提供了从大量智能池中选择的优势,但也带来了困境:如何为任务选择合适的模型?现有的路由系统学习二元强弱决策、评估答案质量,或从低成本模型级联到高成本模型[^3][^4][^5][^6]。RouterBench形式化了更广泛的多模型场景,并展示了在共享结果矩阵上评估的价值与难度[^7]。在生产环境中,问题更为棘手:候选模型名单变化、对话历史增长、缓存重用改变切换的增量成本,且某些请求需要无法简化为标量偏好的严格策略约束。**SCX路由器**专为此类场景设计。它将源自GLiNER[^9]的通用标签-文本分类器GLiClass[^8],适配到具有持久KV缓存的因果解码器。路由器无需提示另一个LLM生成路由令牌,而是在非生成前向传播中联合处理请求和自然语言候选标签,为每个标签返回一个逻辑值。由于标签是输入而非固定输出神经元,同一接口支持模型名称、任务分类体系、难度级别、推理模式、输出长度桶、安全信号和部署特定标签。这种架构选择在对话场景中最为关键。无状态编码器在每条新消息到来时必须处理完整对话。生成式路由器可重用其前缀缓存,但仍需解码和解析路由令牌。**SCX路由器**的解码器-KV路径在轮次间仅保留请求上下文的键和值。新请求令牌扩展该缓存;随后,候选标签根据缓存上下文进行评分,且其KV张量被丢弃。这产生的是一个流式分类器,而非第二个对话生成器。模型评分本身并非路由策略。因此,我们将学习到的预测器与确定性决策层分离。后者可排除违反上下文、工具、模态、驻留、隐私或安全要求的端点,然后权衡预测性能与增量令牌成本、平均延迟和缓存状态。这种分离也使得经验性模型性能配置文件无需重新训练语义分类器即可替换。
### 1.1 贡献
我们做出以下贡献。
1. **流式零样本路由器。**我们提出一种解码器-KV GLiClass架构,结合推理时标签语义、聊天对齐的因果骨干网络、非生成式分类头和纯文本会话缓存重用。
2. **多信号路由接口。**单一检查点可估计模型适用性、任务类型、难度、推理模式、预期输出长度和任意自定义标签。学习到的预测与硬性资格和业务策略保持分离。
3. **任务本体与合成数据套件。**我们构建了一个包含23个任务族、115种任务类型、345个可路由子类型、1,173个合成示例和30个正交领域轴的本体。它构建了150,000个验证器评分和15,000个由gpt5.6-sol评判的合成任务,具有现实工作流结构。
4. **模型路由模式分类法。**我们引入了直接端点路由、属性介导性能路由、混合约束路由以及用于智能体工作流的分层规划者-工作者路由,同时区分了发布路径、已实现组件和提议的组合。
5. **路由质量评估。**我们评估了发布的分类头,并区分了均值候选和固定模型端到端基线。对于扩展的11个端点集合,观察掩码保留了不均匀覆盖,防止缺失结果成为负标签。
## 2 相关工作
### 2.1 LLM间的路由与级联
FrugalGPT在预算约束下学习级联,并表明异构API模型可以改善成本-质量前沿[^3]。AutoMix类似地基于自验证和部分可观察决策过程进行升级[^4]。RouteLLM从偏好数据学习强弱路由,并研究底层配对变化时的迁移[^5]。最近的工作统一了路由与级联,并将质量估计确定为中心统计问题[^6]。RouterBench提供超过405,000个推理结果,并强调常见任务覆盖以实现可靠比较[^7]。**SCX路由器**沿三个轴不同。首先,它在可配置的名单上执行多标签适用性预测,而非固定二元门控。其次,自然语言标签允许语义迁移到新候选模型和辅助分类体系。第三,持久状态属于基于因果解码器构建的分类器:它可以重用对话令牌而不生成路由。语义零样本迁移并不消除对结果数据的需求;新端点名称可能被机械接受,但在经验上校准不良。
### 2.2 高效零样本分类
GLiNER联合表示文本和实体标签,用于通用命名实体识别[^9]。GLiClass将此范式扩展到序列分类,支持零样本和少样本分类,同时避免每个类别的文本-标签前向传递[^8]。原始GLiClass系列主要使用双向编码器。**SCX路由器**保留了其标签条件评分器,但将其置于Qwen3因果骨干网络之后[^10]。浅层DeBERTa风格编码器[^11]在分类前恢复了对临时标签后缀的双向交互。嵌入和双编码器方法预计算了廉价的标签表示,但暴露了有限的令牌级标签-文本交互。成对交叉编码器以与标签数量成比例的成本提供更强的交互。提示式生成路由器灵活且原生支持聊天,但增加了解码延迟和输出格式方差。解码器-KV设计占据中间位置:标签保持动态,骨干是因果且可缓存的,输出是判别式的。
### 2.3 现实与智能体评估
静态问答是路由真实应用的不完整代理。GAIA强调结合推理、浏览、多模态和工具的问题[^12];AgentBench在交互环境中评估LLMs[^13];SWE-bench需要仓库级代码修改和测试执行[^14];OSWorld将现实任务与初始状态配置、文件和基于执行的评估器配对[^15]。这些基准促使了我们的任务包:仅提示对于许多工作负载是不够的,因此生成包括评估结果所需的上下文、工件、标准和检查。开放式评估通常依赖LLM评判者。MT-Bench记录了它们的可扩展性以及系统性的立场、冗长和自我增强偏差[^16]。异构评判者面板可以减少单一模型偏差[^17]。因此,当语义允许时,我们优先考虑确定性验证器,并要求主观任务提供评判者身份、提示、评分标准和覆盖范围元数据。
## 3 任务形式化
设$x_t$为第$t$轮的新请求内容,$h$、$<$、$>$和$<$ $>$为令牌。评分器是一个无自身嵌入层的两层DeBERTa-v2编码器,后接投影和宽度为$2h \rightarrow 1024 \rightarrow 512 \rightarrow 1$的共享MLP。图1总结了学习到的请求信号与选择合格端点的部署策略之间的分离。

### 4.1 序列与评分
规范实现将持久上下文和临时标签格式化为:
$c_{\leq t} = \texttt{format}(\text{prompt}, \text{examples}, h > \ell_1 < > \cdots \ell_K < > < >)$
$= \texttt{< >} \; \ell_1 \; \texttt{< >} \; \cdots \; \ell_K \; \texttt{< >} \; \texttt{< >} \; (6)$
因此标签文本位于其$<$ $>$标记之前,与数据处理和流式实现相匹配。对于无状态调用,因果解码器处理$[c_{\leq t}; q(\mathcal{L})]$。对于会话,令$\Delta c_t$表示自上次缓存调用以来附加的仅持久上下文令牌。这些新令牌更新持久纯文本缓存:
$(H_t^x, K_t, V_t) = D_\theta(\Delta c_t; K_{t-1}, V_{t-1}) \quad (7)$
标签令牌被有条件地评估:
$H_t^\ell = D_\theta(q(\mathcal{L}); K_t, V_t) \quad (8)$
标签阶段的键和值不被写回$(K_t, V_t)$。因此,重复分类可以更改标签名单而不污染对话状态。临时隐藏状态通过双向评分器编码器$B_\phi$传递:
$Z = B_\phi(H_t^\ell) \quad (9)$
评分器从最终分隔符表示中提取联合表示$z_t$,从$<$ $>$位置提取标签表示$z_k$。由于$B_\phi$是双向的,最终分隔符总结了整个临时标签部分以及解码器条件化的请求上下文;它并非仅仅是最后一个请求令牌状态。投影的请求和标签表示被连接并评分:
$\tilde{z}_t = W_t z_t, \quad \tilde{z}_k = W_\ell z_k \quad (10)$
$a_{t,k} = \text{MLP}_\psi([\tilde{z}_t; \tilde{z}_k]) \quad (11)$
这种持久-临时分离产生两个特性。首先,缓存重用摊销了请求侧的表示,而非整个路由决策。如果一轮贡献$\Delta n$个上下文令牌,当前名单占用$L$个标签令牌,则缓存路径用$\Delta n$个令牌扩展状态,并在触发时执行临时$L$个令牌后缀和评分器。后缀仍能注意到保留的历史,因此延迟可能取决于缓存长度和名单大小;重用避免了重新计算早期隐藏状态,但不会使路由成本独立于历史。其次,标签是带内输入而非固定输出神经元:相同的投影和MLP对每个标记进行评分。因此,该头部允许可变名单和对多个可接受端点的独立适用性评分。训练期间的标签随机化阻碍了位置特定的捷径,但新标签在获得结果证据支持之前只是语义上可评分的——并非自动校准的。图2可视化了完整的文本-标签评分路径。

### 4.2 流式执行
每个会话拥有一个缓存和一个分类触发器。实现支持在每个块、每$n$个令牌后、在分隔符上、从不或在滑动窗口上进行分类。缓存长度不等的会话进行左填充。相似文章
TSRouter:用于时间序列推理的动态模态-模型选择
介绍TSRouter,一种基于图的动态路由框架,能够为时间序列推理任务选择最佳模态(LLM或VLM)和模型,相较于基线实现了16%到46%的相对改进,并展示了零样本泛化能力。
Switchcraft:用于智能体工具调用的 AI 模型路由
本文介绍了 Switchcraft,这是首个专为智能体工具调用优化的 AI 模型路由器,旨在降低推理成本。通过使用轻量级的 DistilBERT 分类器,它在保持高工具使用准确性的同时,实现了显著的成本节约。
VectraYX-Vision-1B:面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,具有结构化视觉推理和原生工具使用能力
介绍了VectraYX-Vision-1B,这是一个面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合;然而,尽管流水线功能完全正常,它却报告了近乎为零的视觉基础能力,并提供了开源权重和修复计划。
@cursor_ai: 引入 Cursor Router,我们的智能模型路由器,可为当前任务选择合适的模型。Router 提供……
Cursor AI 推出了 Cursor Router,这是一个智能模型路由器,可为每个任务选择最佳模型,以降低 60% 的成本提供前沿质量的结果。
@HarshalsinghCN:介绍tinyrouter——我逆向工程了Skana AI的Fugu背后的路由架构,并为其构建了复制…
TinyRouter是一个微型的10K参数LLM路由器,它通过进化训练学习将每个问题路由到开源LLM池中最佳的专家模型。在MMLU和数学基准测试上,其性能达到或超过单个模型。