标签
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。
This paper introduces SpecDrop, a parameter-free category-conditioned routing scheme for modular networks, showing that on vision tasks it achieves competitive accuracy while on fuzzy language partitions it reduces to no-routing baselines, suggesting granularity alignment matters more than router design.
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。
本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。
本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。
LlamaIndex 推出了 Parse Gateway,这是一个页面级文档 OCR 路由器,能够估算每一页的复杂度,并将其路由到相应的解析层级(LiteParse 或 LlamaParse),在成本、延迟和质量之间取得平衡。
本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。
本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。
介绍了 cMoLLM,一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由,在匹配计算下提高了困惑度和下游任务准确率。
一种针对地理分布式无服务器云提出的受SLA约束的碳感知路由策略,在真实的AWS部署评估中,实现了高达46.8%的碳减排,同时保持零SLA违规。
MCPHub是一个开源集中管理和路由中心,用于将多个MCP服务器连接到AI客户端,提供统一仪表盘、灵活路由和访问控制。
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
揭示了LLM中的MoE路由遵循类似于哈夫曼编码的频率-多样性定律,并提出了子集差异剪枝(Subset Difference Pruning)来消除功能冗余,实现最优压缩。
本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。