标签
Julia 1 是一个拥有1.443亿参数的AI模型,用于分类、路由和决策任务。基准测试结果显示,它在如AG News和Emotion等明确选择任务上表现强劲,但在知识和推理方面存在局限性。
这篇预印本论文提出了一种可定制的路由器,用于企业中的AI编程代理,通过智能路由请求来优化成本,为大型公司每年节省14-21%的模型开销。
本文介绍了一项关于长上下文多项选择问答中学习上下文规划的控制研究,表明在各种实验设置下,该方法并未稳健地超越如BM25和混合检索等强检索方法。
分析了600多个使用Jev构建的案例后,作者发现最有趣的方面并非炫酷的演示,而是对日常任务的成本效益自动化,从而实现大规模经济高效的AI应用。
本文提出 Attention-Aware Routing(AAR)方法,通过将注意力权重集成到路由器中来增强混合专家模型,显著提升数学推理性能,并揭示了路由与注意力之间存在的耦合动力学。
本文测试了一个名为Jev的AI模型,来自TypeSafe AI,它专为快速、结构化决策而非生成而设计,旨在通过将决策与通用大语言模型任务分离来提高AI工作流的效率。
介绍了SWRouter,一种用于多轮大型语言模型对话的相似度约束窗口路由器,解决了上下文分割和路由评估中的挑战。
一篇关于 LLM 推理请求在实际生产环境中到达 GPU 集群后如何进行路由的技术解释。
R2Adapter 是一个轻量级的路由与重写适配器,能够动态地在传统RAG和基于图的RAG之间分配查询,将基于图的RAG使用率降低高达59%,同时在多跳问答基准测试中保持准确性。
NVIDIA PAIR 是一款测试版工具,允许用户通过连接本地设备(如 DGX Spark、RTX 系统和 Mac)来组建个人AI推理集群,以实现高效、私密的工作流路由。
本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。
OpenAI的提示缓存将请求成本降低了90%,但缓存密钥限制为每秒15次请求。Unify GTM构建了一个自定义路由解决方案来绕过这个限制,实现了95%的缓存命中率。
论文介绍了GATNextHop,这是一个图注意力网络模型,用于近似最短路径路由并在网络拓扑间泛化,通过在实际ISP网络上与Dijkstra算法进行评估。
本文介绍了一种配对精确重置评估协议,用于确定何时从中型世界模型预测器切换到全量世界模型预测器能够改善任务特定的决策损失,并在PushT和PyBullet中的实验表明,增量路由具有优势。
Red Hat的AI博客系列第三部分详细介绍了在他们的托管Kubernetes平台(Amazon EKS)中,llm-d如何利用Kubernetes资源和Envoy集成来路由模型推理流量,并做出实时决策。
本文研究Transformer如何组织因果知识,表明类型级监督会诱导一种类型化的路由结构,该结构在功能上与答案读出解耦,并具有精确的局部可编辑性和位精确的可还原性。
本文研究了混合专家模型中 4-bit KV 缓存量化如何导致路由翻转,发现检测翻转是可能的,但预测翻转是否有害却不可行,并提出了一种因果测量装置而非缓解措施。
This paper presents a cost-efficient routing pipeline for multilingual short-text classification that selectively translates low-resource languages into English before zero-shot classification using small language models, showing quality gains on SIB-200 and MASSIVE benchmarks.
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。