我开发了一个本地优先的 AI Agent 技能混合路由器(低于 20 毫秒、零 Token、纯 CPU 运行)[P]
摘要
Routed 是一款开源、本地优先的 AI Agent 技能混合路由器,纯 CPU 离线运行,结合稠密向量 Embedding、BM25 和精确匹配,可在 20 毫秒内完成提示词路由,无需任何 API 调用。该工具支持 Cursor、Claude Code、MCP 服务器等主流 Agent 环境,刚发布了 v1.1.0,新增多语言支持和 MCP 服务器模式。
如果你在使用基于 Agent 的工作流,并搭配自定义技能或规则(如 Cursor Rules、Claude Code Slash Commands、OpenCode 等),你可能遇到过这样的路由权衡:把所有技能定义塞进系统提示词(这会挤爆上下文窗口并降低指令遵循能力);或者让 LLM 进行一次路由调用来分类用户提示词(既花钱,又浪费 1000+ Token,还增加 2 秒以上的网络延迟)。
为了解决这个问题,我开发了 Routed:一款开源、本地优先的 Agent 技能混合路由器,100% 离线运行在 CPU 上。
GitHub: https://github.com/bshea-1/Routed
License: MIT
https://i.redd.it/5ca68gffgxnh1.gif
底层工作原理
Routed 会索引你已安装的技能目录,并通过四段式混合评分流水线对提示词进行评估:
* 稠密向量 Embedding(60%):在本地 CPU 上运行量化 ONNX 模型(Arctic Embed S / MiniLM)。
* 词法 BM25(25%):使用 Okapi BM25 进行严格的关键词相关性计算。
* 精确 / 别名匹配(10%):直接匹配命令及其别名。
* 元数据(5%):基于最近使用和频率的启发式策略。
整个查询在 20 毫秒内完成,且不会通过网络传输任何提示词数据。
支持的环境
Routed 可自动检测并为以下环境注入适配器:Cursor、Claude Code、LM Studio、Ollama、Antigravity IDE、Windsurf、OpenCode、Continue、Codex,而且我刚刚新增了对 MCP 服务器的支持!!
虽然 v1.0 昨晚刚刚发布,但我已根据早期反馈推出了 v1.1.0,包含两项重大更新:
Model Context Protocol(MCP)服务器(routed mcp):无需将 20 多个工具 Schema 加载进 GPU 的上下文窗口,你的本地模型只会看到一个 `route_skill` 工具。Routed 在 CPU 上执行,精准选择所需技能,并按需仅注入对应的 Schema。
原生多语言理解:Embedding 流水线现已原生理解 100 多种语言的输入(德语、西班牙语、法语、日语等),并能自动拆分复合词(如德语 Speicherleck),无需语言标签或手动翻译,即可将提示词直接映射到正确的技能。
使用方法
在 Agent 对话中,你只需使用 `/route` 即可动态触发最合适的技能。它还支持处理复合意图(例如,当提示词同时要求完成两个不同任务时,可匹配多个技能)。
GitHub Releases 已提供预编译二进制文件(macOS .pkg、Linux .deb、Windows .exe),你也可以通过 Node 从源码构建。欢迎试用,并告诉我你的反馈,或者你还希望增加对哪些环境的支持!
相似文章
在测试了本地大语言模型、OpenRouter 以及市面上所有的付费方案之后……我找到了成本效益最高的编程智能体配置方案。
该文章介绍了一种通过将Claude Code接入DeepSeek API来实现低成本AI编程代理的方案,该方案利用提示词缓存技术显著降低token消耗成本,同时保持高水平的推理能力。
我构建了一个路由器来削减我的智能体费用。结果发现它只知道如何增加开销。
一位开发者构建了一个路由器以降低AI智能体成本,但发现它只会升级请求,导致开销增加;有效的节省来自缓存而非路由。
Switchcraft:用于智能体工具调用的 AI 模型路由
本文介绍了 Switchcraft,这是首个专为智能体工具调用优化的 AI 模型路由器,旨在降低推理成本。通过使用轻量级的 DistilBERT 分类器,它在保持高工具使用准确性的同时,实现了显著的成本节约。
🚀 AgentRouter 强大再升级!
AgentRouter 是一个开发者平台,提供统一 API 来访问和切换多个 AI 模型,例如 GPT 和 Claude 变体,用于编码、推理和自动化任务。
AgentRouter:用于成本最优多步骤代理工作流的异构模型路由
AgentRouter 是一个轻量级分类器,用于在代理工作流中将步骤路由到不同的模型层级,与仅使用前沿模型相比,实现了72%的成本降低且质量退化最小。