model-routing

标签

Cards List
#model-routing

我们是否默认过度配置了AI智能体?

Reddit r/AI_Agents · 2天前

文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。

0 人收藏 0 人点赞
#model-routing

MERA:面向大规模智能体系统的模型演化与技能自适应路由

arXiv cs.LG · 2天前 缓存

MERA 提出了一种面向 LLM 智能体的多周期自适应方法,通过将执行验证的演示蒸馏到 SkillBook 并对 LoRA 适配器进行微调来改进小模型,并采用基于路由器的部署和验证器支持的回退。实验表明,Qwen2.5-Coder-1.5B 在 HumanEval++MBPP 上的通过率从 28.7% 提升至 49.7%,同时以更低的成本保留了大部分质量。

0 人收藏 0 人点赞
#model-routing

Nvidia的Switchyard路由器在任务中途重新编排AI模型,自测任务成本降至三分之一(8分钟阅读)

TLDR AI · 3天前 缓存

Nvidia发布了Nemotron 3.5 Lightning,这是一个300亿参数的开源混合专家模型,以及NeMo Switchyard,一个开源路由库,可动态地将AI智能体工作流的每一步分配给最合适的模型。Nvidia声称,这种组合可以将智能体任务成本降低至约三分之一,同时保持前沿水平的性能。

0 人收藏 0 人点赞
#model-routing

@LangChain:你所有的代理都需要前沿模型吗?我们通过Deep Agents评估运行了NVIDIA的开源路由器Switchyard…

X AI KOLs Timeline · 3天前 缓存

LangChain使用Deep Agents测试了NVIDIA的开源路由器Switchyard,结果表明在模型之间进行路由可以将成本降低约70%,同时保持约90%的准确率,并推出了针对NVIDIA模型的新中间件集成。

0 人收藏 0 人点赞
#model-routing

重放差距:LLM智能体中模型切换的静态评估打分于错误的世界

arXiv cs.LG · 3天前 缓存

本文证明,基于重放的LLM智能体模型切换静态评估存在根本缺陷:在轨迹中途更换模型时,环境与后续动作会与记录的轨迹产生巨大偏差,从而使大多数基准测试结果失效。作者提出分支展开(branching rollouts)作为一种更忠实的评估方法,并公开了其测试框架与轨迹数据。

0 人收藏 0 人点赞
#model-routing

@LangChain:在最新一期Max Agency中,@cognition总裁@russelljkaplan分享了开发者为何不再追求最佳模型,而开始……

X AI KOLs Timeline · 4天前 缓存

LangChain的Max Agency播客邀请了Cognition总裁Russell Kaplan,讨论开发者为何现在将效率置于最佳模型之上,以及像Devin这样的智能体如何被大规模部署。

0 人收藏 0 人点赞
#model-routing

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

arXiv cs.CL · 4天前 缓存

LLMRouter将LLM路由统一表述为顺序决策过程,并提供了一个用于开发、评估和部署LLM路由器的开源基础设施和基准(xRouteBench)。实验结果表明,学习型路由器相比最强的固定模型基线实现了14.6%的相对提升。

0 人收藏 0 人点赞
#model-routing

Cursor Router 如何为任务选择正确的模型(6 分钟阅读)

TLDR AI · 5天前 缓存

Cursor 解释了其 Router 如何利用数据驱动的方法和 Compass 复杂度预测器,将开发任务路由到最合适的 AI 模型,在保持或提高用户满意度的同时显著降低费用。

0 人收藏 0 人点赞
#model-routing

同一AI模型。更好的结果。更低的成本。

Reddit r/AI_Agents · 2026-08-07

作者认为,AI编码工具链和模型路由与模型本身同样重要,分享了使用Oh-My-Pi和OpenCode进行的测试,这些测试减少了token使用量和错误,并推荐针对高容量、轻量级任务采用分层模型订阅。

0 人收藏 0 人点赞
#model-routing

AI engineering is becoming systems engineering

Reddit r/AI_Agents · 2026-08-07

文章认为,最大的AI转变不是更大的模型,而是围绕它们的更好系统,例如上下文、模型路由、缓存、代理工作流和评估,使模型成为引擎,系统成为产品。

0 人收藏 0 人点赞
#model-routing

AI模型路由的统一API(3分钟阅读)

TLDR AI · 2026-08-05 缓存

Google Cloud API Gateway 现已在公开预览版中提供模型路由,提供一个无服务器入口层,可接受兼容 OpenAI 的请求,并动态路由到 Gemini、Claude 或 OpenAI 模型。

0 人收藏 0 人点赞
#model-routing

@rohanpaul_ai:在他们的官方博客上阅读更多。

X AI KOLs Following · 2026-08-04 缓存

Not Diamond 宣布推出 Not Diamond Code,这是一款面向编码代理的智能模型路由器,可根据每个步骤选择最佳模型和推理工作量,声称可节省 20% 以上的成本,并在编码基准测试中实现帕累托最优性能。

0 人收藏 0 人点赞
#model-routing

@julien_c: 模型路由是多模型堆栈中缺失的一层。开源模型在编码方面不断进步,路由帮助它们…

X AI KOLs Following · 2026-08-04 缓存

Not Diamond Code 是一款面向长期编码代理的智能模型路由器,为每一步选择最佳模型和推理努力,可将成本降低 20-65%。

0 人收藏 0 人点赞
#model-routing

@googledevs:不再有硬编码端点。API Gateway 的模型路由现已进入公开预览!通过单个端点即可访问 Gemini、Claude 和 OSS 模型……

X AI KOLs Timeline · 2026-08-04 缓存

Google Cloud API Gateway 宣布模型路由公开预览,让开发者通过使用 OpenAPI 规范的单一端点访问 Gemini、Claude 和 OSS 模型。

0 人收藏 0 人点赞
#model-routing

前沿模型是否正在成为不需要它们的任务的默认选择?

Reddit r/artificial · 2026-08-04

文章讨论了大多数AI流量由简单、可重复的任务组成,如分类和提取,然而前沿模型常常被用于所有事情。它质疑将任务路由到较小的专用模型是否会成为降低成本和延迟的标准做法。

0 人收藏 0 人点赞
#model-routing

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents · 2026-08-02

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
#model-routing

我比较了2026年18个主要LLM API价格——相同的工作负载费用从0.018美元到2美元不等

Reddit r/ArtificialInteligence · 2026-07-31

比较了主要提供商的18个LLM的API标价,强调相同工作负载下100倍的成本差异,并推荐使用模型路由以提高成本效率。

0 人收藏 0 人点赞
#model-routing

LLM路由器已成为一个独立服务类别

Reddit r/ArtificialInteligence · 2026-07-30 缓存

LLM路由器正从一种小众的基础设施技巧演变为主流服务类别,随着前沿模型成本上升,使用户能够自动为每个请求选择最具成本效益的模型。

0 人收藏 0 人点赞
#model-routing

我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。

Reddit r/AI_Agents · 2026-07-29

一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。

0 人收藏 0 人点赞
#model-routing

Launch HN: Tokenless (YC S26) – 自动切换模型以节省成本

Hacker News Top · 2026-07-29 缓存

Tokenless 是一家获得 YC 支持的初创公司,提供 LLM API 调用的即插即用替代方案,自动将请求路由到最具成本效益的模型,而不牺牲质量,有望将推理成本降低一半。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈