routing

标签

Cards List
#routing

Kimi K3 与 Fable 相当;Kimi K3 和 Fable 达到最先进水平

Hacker News Top ↗ · 2026-07-21 缓存

Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。

0 人收藏 0 人点赞
#routing

面向混合专家模型中一致专家选择的多层级上下文建模

arXiv cs.CL ↗ · 2026-07-21 缓存

本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。

0 人收藏 0 人点赞
#routing

最佳模型路由因任务而异(6分钟阅读)

TLDR AI ↗ · 2026-07-17 缓存

模型路由是降低推理成本的热门趋势,但最佳路由高度依赖具体任务。Harvey和Factory等团队通过专注于单一工作流而非通用路由器,实现了显著的成本节约。

0 人收藏 0 人点赞
#routing

@PrajwalTomar_: 老兄,Twilio 完蛋了。我刚刚在我们机构用 Sent 把它替换了。→ 传入一个电话号码 → 传入一条消息 → Sent 自动路…

X AI KOLs Following ↗ · 2026-07-16 缓存

一位开发者用 Sent 替换了 Twilio,Sent 是一个统一消息 API,能根据成本和用户参与度自动路由短信、WhatsApp 或 RCS 消息,将消息账单减少了 40%。

0 人收藏 0 人点赞
#routing

A.L.F.R.E.D.: 带模板的2B模型能以4倍更低速度匹配35B模型

Reddit r/LocalLLaMA ↗ · 2026-07-15

A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。

0 人收藏 0 人点赞
#routing

信念与现实分离存在于语言模型中对共享值槽的路由中

arXiv cs.CL ↗ · 2026-07-15 缓存

本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。

0 人收藏 0 人点赞
#routing

@PrajwalTomar_: 这简直是神器。我用一个API替换了代理机构里的Twilio,结果我们的消息账单在第一周就下降了40%……

X AI KOLs Following ↗ · 2026-07-14 缓存

一位开发者用单一API替换了Twilio,该API根据用户响应将消息路由到SMS、WhatsApp或RCS,首周就将消息成本削减了40%。

0 人收藏 0 人点赞
#routing

面向可解释、鲁棒且可审计的临床预测的多模态路由

arXiv cs.LG ↗ · 2026-07-14 缓存

本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。

0 人收藏 0 人点赞
#routing

粘性路由:训练MoE模型以实现内存高效推理

arXiv cs.LG ↗ · 2026-07-13 缓存

StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。

0 人收藏 0 人点赞
#routing

合作的力量:如何减少交通拥堵

Hacker News Top ↗ · 2026-07-12 缓存

Google Research 在《Nature Cities》上发表了一项研究,表明通过导航应用的干预协调一小部分行程,可以在整个城市范围内显著减少交通拥堵和排放。

0 人收藏 0 人点赞
#routing

@alex_prompter: 这个开源代理无需改动一行代码就能降低你的AI agent成本。Plano位于你的agent和你的…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。

0 人收藏 0 人点赞
#routing

@lxfater: https://x.com/lxfater/status/2075518516690915585

X AI KOLs Timeline ↗ · 2026-07-10 缓存

OpenSquilla 发布 v0.5.0,通过智能路由和多模型集成实现性能超越 Fable5 并降低 67% 成本;同时新增 MetaSkills 和 Coding mode 功能。

0 人收藏 0 人点赞
#routing

@jerryjliu0: 对纯文本PDF进行OCR不需要重型VLM。这就像用火箭筒去参加刀战,……

X AI KOLs Following ↗ · 2026-07-08 缓存

LlamaIndex 宣布在 LlamaParse 中改进了路由机制,该机制为简单的文本密集型 PDF 选择轻量级解析,而为包含表格或图表的复杂页面选择更重的基于 VLM 的解析,从而优化成本和准确性。

0 人收藏 0 人点赞
#routing

LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]

Reddit r/MachineLearning ↗ · 2026-07-07

作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。

0 人收藏 0 人点赞
#routing

LLM服务中多目标路由的在线线性规划

arXiv cs.AI ↗ · 2026-07-07 缓存

本文提出了一种用于LLM服务路由的多目标优化框架,采用带出价-价格控制的在线线性规划来平衡延迟、吞吐量和尾部性能,并通过Vidur模拟器展示了相对于启发式方法的改进。

0 人收藏 0 人点赞
#routing

@dangerm00se: 我让 fable 做的主要事情是路由跨越本地 API 和 cerebras 的 moa 和 rlm 实验。让你的 agent 去…

X AI KOLs Following ↗ · 2026-07-06 缓存

作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。

0 人收藏 0 人点赞
#routing

SupraLabs/Supra-Router-51M

Hugging Face Models Trending ↗ · 2026-07-05 缓存

SupraLabs 发布了 Supra-Router-51M,这是一个拥有 5170 万个参数的微型 LLM,用于多任务基础设施路由,旨在决定是将提示词在边缘设备上本地处理还是发送到云端模型。在一个小型数据集上进行微调后,它使用多任务序列生成来实现稳健的路由。

0 人收藏 0 人点赞
#routing

@EXM7777:这项新AI研究刚刚发布,如果你使用AI智能体,它简直疯狂……一个连单一问题都无法回答的微型模型……

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一篇新的AI研究论文描述了一个微型模型作为管理者,将任务路由到更大的模型,通过在困难编程基准上编排一组模型而非依赖单一模型,超越了ChatGPT、Gemini和Claude等前沿模型。

0 人收藏 0 人点赞
#routing

垂直联邦学习中基于期望增益的升级策略

arXiv cs.LG ↗ · 2026-07-01 缓存

本文研究垂直联邦学习中的选择性升级问题,提出一种基于期望增益的评分方法,在低成本的本地预测和高成本的嵌入融合之间进行路由,以优化通信与准确率之间的权衡。

0 人收藏 0 人点赞
#routing

@ClementDelangue: 超级兴奋于开源路由器系统和路由模型,比如 @vllm_project 的语义路由器:https://huggingfa…

X AI KOLs Timeline ↗ · 2026-06-30 缓存

Clement Delangue 强调了 vLLM 的新语义路由器,这是一个开源系统,用于将LLM查询路由到最合适的模型,旨在将价值从昂贵的前沿模型转移到多样化的开源模型生态系统。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈