routing

标签

Cards List
#routing

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG ↗ · 2026-08-06 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#routing

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

arXiv cs.LG ↗ · 2026-08-06 缓存

This paper introduces SpecDrop, a parameter-free category-conditioned routing scheme for modular networks, showing that on vision tasks it achieves competitive accuracy while on fuzzy language partitions it reduces to no-routing baselines, suggesting granularity alignment matters more than router design.

0 人收藏 0 人点赞
#routing

MetaRoute-Bench:评估智能体工作流路由的元决策策略

arXiv cs.LG ↗ · 2026-08-04 缓存

本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。

0 人收藏 0 人点赞
#routing

学习智能体工作流的组合式元路由:一项可执行基准

arXiv cs.LG ↗ · 2026-08-04 缓存

本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。

0 人收藏 0 人点赞
#routing

分层 Copula-Gumbel-Top-\texorpdfstring{$K$}{K} 路由:固定逐词元路由律下冻结混合专家模型的双侧依赖控制

arXiv cs.LG ↗ · 2026-08-03 缓存

本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。

0 人收藏 0 人点赞
#routing

内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法

Hugging Face Daily Papers ↗ · 2026-08-01 缓存

本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。

0 人收藏 0 人点赞
#routing

@jerryjliu0:我们创建了一个文档OCR路由器,能够估算每一页的复杂度,并以相应的模式进行解析……

X AI KOLs Following ↗ · 2026-07-31 缓存

LlamaIndex 推出了 Parse Gateway,这是一个页面级文档 OCR 路由器,能够估算每一页的复杂度,并将其路由到相应的解析层级(LiteParse 或 LlamaParse),在成本、延迟和质量之间取得平衡。

0 人收藏 0 人点赞
#routing

面向LLM安全性的在线策略蒸馏:一种基于路由的模板鲁棒对齐方法

arXiv cs.AI ↗ · 2026-07-31 缓存

本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。

0 人收藏 0 人点赞
#routing

超越几何互补性:稀疏混合专家路由中的一致性重叠

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。

0 人收藏 0 人点赞
#routing

cMoLLM 规模化:混合大语言模型的水平扩展定律

arXiv cs.AI ↗ · 2026-07-28 缓存

介绍了 cMoLLM,一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由,在匹配计算下提高了困惑度和下游任务准确率。

0 人收藏 0 人点赞
#routing

地理分布式无服务器云中基于SLA约束的碳感知路由

arXiv cs.LG ↗ · 2026-07-28 缓存

一种针对地理分布式无服务器云提出的受SLA约束的碳感知路由策略,在真实的AWS部署评估中,实现了高达46.8%的碳减排,同时保持零SLA违规。

0 人收藏 0 人点赞
#routing

@DanKornas:单独运行多个MCP服务器很快变得混乱。MCPHub是一个面向开发者的集中管理和路由中心……

X AI KOLs Timeline ↗ · 2026-07-28 缓存

MCPHub是一个开源集中管理和路由中心,用于将多个MCP服务器连接到AI客户端,提供统一仪表盘、灵活路由和访问控制。

0 人收藏 0 人点赞
#routing

MoE$^2$-LoRA:当MoE模型遇上MoE风格的低秩适配

arXiv cs.CL ↗ · 2026-07-27 缓存

MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。

0 人收藏 0 人点赞
#routing

如何在客厅中通过静态IP自托管服务器

Lobsters Hottest ↗ · 2026-07-25 缓存

一份使用L2TP隧道和静态IP在家中自托管服务器的指南,绕过CGNAT等ISP限制。

0 人收藏 0 人点赞
#routing

家庭网络中的组播电视分发

Hacker News Top ↗ · 2026-07-25 缓存

关于使用ffmpeg和组播路由协议在家庭网络上设置组播电视分发的技术指南,包含本地和路由场景的示例。

0 人收藏 0 人点赞
#routing

空间填充曲线的一些组合应用

Hacker News Top ↗ · 2026-07-25 缓存

本页描述了用于生成旅行商问题近似解的空间填充曲线启发式方法,强调了其在路径规划、物流和地图绘制中的速度、简便性及实际应用。

0 人收藏 0 人点赞
#routing

MoE路由是哈夫曼编码吗?发现思维链中的频率-多样性定律

arXiv cs.CL ↗ · 2026-07-24 缓存

揭示了LLM中的MoE路由遵循类似于哈夫曼编码的频率-多样性定律,并提出了子集差异剪枝(Subset Difference Pruning)来消除功能冗余,实现最优压缩。

0 人收藏 0 人点赞
#routing

通过相对位置编码对距离进行编码以增强基于Transformer的路由

arXiv cs.AI ↗ · 2026-07-22 缓存

本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。

0 人收藏 0 人点赞
#routing

多头注意力残差

Hugging Face Daily Papers ↗ · 2026-07-22 缓存

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。

0 人收藏 0 人点赞
#routing

Kimi K3 与 Fable 相当;Kimi K3 和 Fable 达到最先进水平

Hacker News Top ↗ · 2026-07-21 缓存

Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈