标签
Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
模型路由是降低推理成本的热门趋势,但最佳路由高度依赖具体任务。Harvey和Factory等团队通过专注于单一工作流而非通用路由器,实现了显著的成本节约。
一位开发者用 Sent 替换了 Twilio,Sent 是一个统一消息 API,能根据成本和用户参与度自动路由短信、WhatsApp 或 RCS 消息,将消息账单减少了 40%。
A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。
本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。
一位开发者用单一API替换了Twilio,该API根据用户响应将消息路由到SMS、WhatsApp或RCS,首周就将消息成本削减了40%。
本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。
StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。
Google Research 在《Nature Cities》上发表了一项研究,表明通过导航应用的干预协调一小部分行程,可以在整个城市范围内显著减少交通拥堵和排放。
Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。
OpenSquilla 发布 v0.5.0,通过智能路由和多模型集成实现性能超越 Fable5 并降低 67% 成本;同时新增 MetaSkills 和 Coding mode 功能。
LlamaIndex 宣布在 LlamaParse 中改进了路由机制,该机制为简单的文本密集型 PDF 选择轻量级解析,而为包含表格或图表的复杂页面选择更重的基于 VLM 的解析,从而优化成本和准确性。
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
本文提出了一种用于LLM服务路由的多目标优化框架,采用带出价-价格控制的在线线性规划来平衡延迟、吞吐量和尾部性能,并通过Vidur模拟器展示了相对于启发式方法的改进。
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。
SupraLabs 发布了 Supra-Router-51M,这是一个拥有 5170 万个参数的微型 LLM,用于多任务基础设施路由,旨在决定是将提示词在边缘设备上本地处理还是发送到云端模型。在一个小型数据集上进行微调后,它使用多任务序列生成来实现稳健的路由。
一篇新的AI研究论文描述了一个微型模型作为管理者,将任务路由到更大的模型,通过在困难编程基准上编排一组模型而非依赖单一模型,超越了ChatGPT、Gemini和Claude等前沿模型。
本文研究垂直联邦学习中的选择性升级问题,提出一种基于期望增益的评分方法,在低成本的本地预测和高成本的嵌入融合之间进行路由,以优化通信与准确率之间的权衡。
Clement Delangue 强调了 vLLM 的新语义路由器,这是一个开源系统,用于将LLM查询路由到最合适的模型,旨在将价值从昂贵的前沿模型转移到多样化的开源模型生态系统。