routing

标签

Cards List
#routing

SupersonicLabs/Julia-1 · Hugging Face

Reddit r/LocalLLaMA ↗ · 昨天 缓存

Julia 1 是一个拥有1.443亿参数的AI模型,用于分类、路由和决策任务。基准测试结果显示,它在如AG News和Emotion等明确选择任务上表现强劲,但在知识和推理方面存在局限性。

1 人收藏 1 人点赞
#routing

控制驾驭,控制成本:企业中AI编程代理的路由与治理

arXiv cs.AI ↗ · 3天前 缓存

这篇预印本论文提出了一种可定制的路由器,用于企业中的AI编程代理,通过智能路由请求来优化成本,为大型公司每年节省14-21%的模型开销。

0 人收藏 0 人点赞
#routing

当学习的上下文规划未能超越强检索:一项针对规划、路由和重排序在长上下文问答中的控制研究

arXiv cs.CL ↗ · 4天前 缓存

本文介绍了一项关于长上下文多项选择问答中学习上下文规划的控制研究,表明在各种实验设置下,该方法并未稳健地超越如BM25和混合检索等强检索方法。

0 人收藏 0 人点赞
#routing

我研究了超过600个Jev构建,有趣之处不在炫酷的演示。

Reddit r/artificial ↗ · 2026-09-21

分析了600多个使用Jev构建的案例后,作者发现最有趣的方面并非炫酷的演示,而是对日常任务的成本效益自动化,从而实现大规模经济高效的AI应用。

0 人收藏 0 人点赞
#routing

Attention-Aware Routing: Coupling Routing and Attention in MoEs

arXiv cs.AI ↗ · 2026-09-21 缓存

本文提出 Attention-Aware Routing(AAR)方法,通过将注意力权重集成到路由器中来增强混合专家模型,显著提升数学推理性能,并揭示了路由与注意力之间存在的耦合动力学。

0 人收藏 0 人点赞
#routing

我测试了一个不生成任何内容的AI模型——它只做决策

Reddit r/ArtificialInteligence ↗ · 2026-09-19

本文测试了一个名为Jev的AI模型,来自TypeSafe AI,它专为快速、结构化决策而非生成而设计,旨在通过将决策与通用大语言模型任务分离来提高AI工作流的效率。

0 人收藏 0 人点赞
#routing

SWRouter:面向多轮大型语言模型对话的相似度约束窗口路由

arXiv cs.CL ↗ · 2026-09-11 缓存

介绍了SWRouter,一种用于多轮大型语言模型对话的相似度约束窗口路由器,解决了上下文分割和路由评估中的挑战。

0 人收藏 0 人点赞
#routing

@navaneethvb: 对于想知道 LLM 推理在实际生产环境中究竟是如何运作的人,尤其是路由部分,这就是当请求到达 GPU 集群时的样子……

X AI KOLs Timeline ↗ · 2026-09-06 缓存

一篇关于 LLM 推理请求在实际生产环境中到达 GPU 集群后如何进行路由的技术解释。

0 人收藏 0 人点赞
#routing

R$^{2}$Adapter:用于高效混合RAG的路由与重写适配器

arXiv cs.CL ↗ · 2026-09-04 缓存

R2Adapter 是一个轻量级的路由与重写适配器,能够动态地在传统RAG和基于图的RAG之间分配查询,将基于图的RAG使用率降低高达59%,同时在多跳问答基准测试中保持准确性。

0 人收藏 0 人点赞
#routing

Nvidia PAIR 对于拥有多台推理服务器的人来说似乎很不错

Reddit r/LocalLLaMA ↗ · 2026-09-03 缓存

NVIDIA PAIR 是一款测试版工具,允许用户通过连接本地设备(如 DGX Spark、RTX 系统和 Mac)来组建个人AI推理集群,以实现高效、私密的工作流路由。

0 人收藏 0 人点赞
#routing

学习保留内容:面向多智能体LLM系统高效协作的Gated-Memory Routing

arXiv cs.AI ↗ · 2026-09-02 缓存

本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。

0 人收藏 0 人点赞
#routing

@LangChain: OpenAI的提示缓存使请求成本降低90%,但缓存密钥的上限约为每秒15次请求。@HeggieCon…

X AI KOLs Timeline ↗ · 2026-09-01 缓存

OpenAI的提示缓存将请求成本降低了90%,但缓存密钥限制为每秒15次请求。Unify GTM构建了一个自定义路由解决方案来绕过这个限制,实现了95%的缓存命中率。

0 人收藏 0 人点赞
#routing

GATNextHop:一种用于最短路径路由的图注意力网络,具有跨拓扑泛化能力

arXiv cs.LG ↗ · 2026-08-26 缓存

论文介绍了GATNextHop,这是一个图注意力网络模型,用于近似最短路径路由并在网络拓扑间泛化,通过在实际ISP网络上与Dijkstra算法进行评估。

0 人收藏 0 人点赞
#routing

配对精确重置评估:基于预测的中型到全量世界模型级联

arXiv cs.LG ↗ · 2026-08-18 缓存

本文介绍了一种配对精确重置评估协议,用于确定何时从中型世界模型预测器切换到全量世界模型预测器能够改善任务特定的决策损失,并在PushT和PyBullet中的实验表明,增量路由具有优势。

0 人收藏 0 人点赞
#routing

@alexa_griffith_: Red Hat AI博客系列第三部分现已发布!本部分重点介绍Red Hat的托管Kubernetes AI推理如何使用llm-d...

X AI KOLs Timeline ↗ · 2026-08-17 缓存

Red Hat的AI博客系列第三部分详细介绍了在他们的托管Kubernetes平台(Amazon EKS)中,llm-d如何利用Kubernetes资源和Envoy集成来路由模型推理流量,并做出实时决策。

0 人收藏 0 人点赞
#routing

因果结构可诱导但功能解耦:类型化机制库中的路由/读出边界

arXiv cs.CL ↗ · 2026-08-13 缓存

本文研究Transformer如何组织因果知识,表明类型级监督会诱导一种类型化的路由结构,该结构在功能上与答案读出解耦,并具有精确的局部可编辑性和位精确的可还原性。

0 人收藏 0 人点赞
#routing

检测路由翻转比判断是否修复更容易:量化混合专家模型中的因果路由介导损伤

arXiv cs.AI ↗ · 2026-08-13 缓存

本文研究了混合专家模型中 4-bit KV 缓存量化如何导致路由翻转,发现检测翻转是可能的,但预测翻转是否有害却不可行,并提出了一种因果测量装置而非缓解措施。

0 人收藏 0 人点赞
#routing

A Cost-Efficient Routing Pipeline for Multilingual Short-Text Classification Using Small Language Models

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper presents a cost-efficient routing pipeline for multilingual short-text classification that selectively translates low-resource languages into English before zero-shot classification using small language models, showing quality gains on SIB-200 and MASSIVE benchmarks.

0 人收藏 0 人点赞
#routing

先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架

arXiv cs.LG ↗ · 2026-08-12 缓存

本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。

0 人收藏 0 人点赞
#routing

大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

arXiv cs.CL ↗ · 2026-08-11 缓存

一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈