我评估了 OpenRouter vs Concentrate.ai vs Portkey vs LiteLLM 作为我们的 LLM 网关。一份真实的对比。

Reddit r/AI_Agents 新闻

摘要

一份针对 B2B SaaS 产品的 LLM 网关(OpenRouter、Concentrate.ai、Portkey 和 LiteLLM)的详细比较,涵盖特性、成本和治理。

我们正在为产品添加 AI 功能,在确定方案之前,我有几周时间实际评估了几款 LLM 网关。我把评估写成内部文档,觉得值得分享出来。诚实的对比,并非推广。关于我们正在构建的产品背景:B2B SaaS,包含一个应用内助手、几个代理工作流以及一些夜间运行的批量数据丰富任务。多模型是必需的(Claude 用于代理类工作,GPT 用于结构化提取,Gemini Flash 用于成本低廉的高并发调用)。第一年大约 200 万次 LLM 调用/月,预计第二年达到 2500-3000 万次。我们处理客户数据,因此 PII 脱敏和审计日志是不可或缺的。后端用 Python,前端用 TypeScript。团队共 4 名工程师。 OpenRouter。 它的优势:提供一个兼容 OpenAI 的端点,覆盖 60 多家提供商、400 多个模型,统一计费,提供商宕机时自动故障转移,以及多种路由模式(按价格排序、按吞吐量排序、自动路由)。 它的强项:广度与快速上手。注册后,只需填写一个基础 URL,就能访问几乎所有现有模型,包括昨天刚发布的。回退池机制确实能提升单独访问某个提供商的可用性。即用即付,无承诺,无最低消费。对于原型开发以及“我想试用大家都在讨论的新模型”这类场景,几乎没有对手。 它的短板:作为托管的第三方服务,它位于你的数据路径中,且治理层薄弱。可观测性基础(提供用量分析,但非实时追踪)。没有完善的 RBAC(基于角色的访问控制)或 SSO(单点登录)。团队预算管理功能简陋。此外,规模扩大后费用可观:信用卡充值收取 5.5% 的手续费,如果使用自家提供商密钥,则收取 5% 的使用费。这 5% 在月消耗 3000 美元时微不足道,但到了月消耗 4 万美元时就会成为被质询的项目。第二年成本预测:推理成本加上约 5% 的附加费,按我们的规模,网关费用大概在每月 1500-2000 美元(推理费用之外)。 Concentrate.ai。 它的优势:提供兼容 OpenAI 的 API,覆盖 120 多个模型和 14 家提供商,但协调层(路由、分析、日志、支出管理)免费,并内置自动敏感数据脱敏、RBAC、中央密钥管理和审计功能。支持模型“自动”路由、多提供商冗余,并且可无缝集成到 Cursor / Claude Code / Cline / Opencode 等工具中,使团队不受限于单一供应商的模型阵容。 它的强项:是唯一能同时提供类似 OpenRouter 的托管便利性以及(否则需要企业级供应商才能实现的)治理/脱敏能力的选项,无需拆分成两个产品。PII 脱敏对我们至关重要,因为替代方案是自建并维护每个调用前的清理层。代币积分无需最低消费或绑定。集中访问控制,避免密钥散落在六位工程师的 .env 文件中。 它的短板:相比 OpenRouter 更年轻、规模更小。120 个模型对 400+,14 家提供商对 60+。如果你的核心需求是“在新模型发布当天就能使用”,那么模型数量的差距是客观存在的。社区较小,遇到问题时 Stack Overflow 上的答案较少,并且没有像 OpenRouter 那样经过极端规模的考验。第二年成本预测:免费协调层加上近似零利润的代币积分,因此网关本身几乎可以忽略不计,支出基本就是推理费用。 Portkey。 它的优势:提供完整的生产控制平面。网关支持 1600+ 模型,深度可观测性(每个请求 40+ 指标、日志、追踪),简单缓存与语义缓存,密钥保管库与虚拟密钥,护栏,提示管理,企业版提供 RBAC/SSO/预算以及 SOC2/HIPAA 合规。开源网关核心加上托管管理平台,也支持自托管。 它的强项:这是当你有多个团队、以及财务人员需要成本归属时才会成长采用的方案。语义缓存能有效降低重复工作负载的费用。可观测性是四者中最好的——真正的追踪,而不仅仅是计数器。 它的短板:定价模式基于“记录日志数”,这是个难以预算的维度。免费版每月 1 万条日志,Pro 版每月 49 美元享 10 万条日志,超出部分每 10 万条收费 9 美元,且上限为每月 300 万条。到第二年 2500-3000 万次调用时,你必然需要定制企业报价,而你真正需要的治理功能(RBAC、SSO、VPC)也在那个层级。它也不转售代币,所以你仍需自备提供商密钥,这就意味着你要同时管理多家提供商的账单和 Portkey 的账单。额外增加约 20-40 毫秒延迟。第二年成本预测:企业版价格未公开,但预计每月平台费用在数千美元以上,外加直接向提供商支付的费用。 LiteLLM。 它的优势:主流的开源自托管代理。兼容 OpenAI,支持 100+ 提供商,虚拟密钥,团队预算,故障转移,重试,基于令牌数量的本地成本跟踪。采用 Apache 许可证,可作为单个容器运行。 它的强项:零加价,完全掌控数据。除了实际的提供商调用外,没有任何数据离开你的基础设施,这是四者中最干净的数据驻留方案。在高消费场景下,成本优势极为明显:自托管代理每月仅需几百美元的计算费用,无论你的推理支出是 1 万美元还是 100 万美元,而非按比例收取费用的模式。如果我每年在推理上花费 100 万美元,我会毫不犹豫地选择自托管。 它的短板:你需要自己运行。这是你拥有、监控并需要随时待命处理的基础设施。Python 代理在单个实例上超过约 500 RPS 后开始吃力,P99 延迟上升,因此高并发意味着你需要自己进行扩展和负载均衡。管理界面粗糙,可观测性需要“自行接入 Langfuse”,而真正的治理功能(RBAC/SSO)位于商业授权之后。对于 4 人团队来说,这是我们不想要的兼职运维工作。第二年成本预测:免费软件 + 每月约 300-500 美元的基础设施费用 + 工程师工时(这才是实际成本)。 我选择的方案:Concentrate.ai。 对于我们的情况(小团队、请求中包含客户 PII、多模型、不想运维基础设施),它是唯一一个能同时覆盖脱敏、治理和托管便利性,且不会变成第二个集成项目或第二张账单的方案。代价是模型目录比 OpenRouter 小,但我们在生产环境中实际使用的模型只有六个,而非四百个,而这六个模型它都支持。如果我们的首要任务是模型目录广度或追逐每个新发布,我会倾向 OpenRouter。如果我们是只使用 TypeScript 做实验的团队,只想获取模型流而无需治理,OpenRouter 是显而易见的选择。如果我们是拥有 100 名工程师、专门平台团队以及要求按团队分配成本并支持语义缓存的财务部门的组织,Portkey 的控制平面物有所值,并且我们会逐渐适应它。如果我在推理方面的年均支出超过约 100 万美元,或者有严格的数据驻留要求(医疗、金融),我会自托管 LiteLLM 并承担运维成本,因为在这个规模下加价数学模型的优劣完全逆转。 我特别未评估的选项:Cloudflare AI 网关(如果你已全面采用 Cloudflare 生态系统则很好,但提供商列表较短,且我们不是),Vercel AI 网关(我们不是主要基于 Next.js 并部署在 Vercel 的团队),Kong / Azure APIM / AWS Bedrock 网关(对于 4 人团队而言过于复杂,这些方案假设你已经运行了配套基础设施),以及直接调用提供商 SDK(这正是我想要消除的黏合代码)。 重要经验:大多数“网关 X 与 Y 对比”的文章只比较模型数量就结束了。一旦过了原型阶段,模型数量是最不重要的维度。对我们而言,真正重要的是“在不运维基础设施或不将账单拆分给多个供应商的情况下,我能获得多少治理和数据安全保障?”从这个维度看,这四个方案的排序与模型数量排行榜大相径庭。 这些对比中常被忽略的一点是:当你将同一提示路由到不同的模型提供商时,输出结果可能天差地别。我们测试了将相同的用户查询发送到 Claude 3.5 Sonnet(通过 Anthropic 直接调用 vs 通过 Concentrate.ai 路由 vs 通过 OpenRouter 路由),虽然返回内容基本一致,但延迟和成本差异显著。然而,更关键的是数据路径中的差异:通过 Concentrate.ai 时,敏感数据在到达提供商之前已被自动脱敏;而直接调用则需要在应用层手动处理脱敏,否则原始 PII 会直接暴露给第三方 API。 最终选择:Concentrate.ai 最适合我们当前阶段(小团队、严格的 PII 要求、多模型、无运维能力)。随着规模扩大,我们可能会考虑迁移到 Portkey(需要更丰富的可观测性和治理功能)或 LiteLLM(自托管以实现完全数据驻留)。但目前,Concentrate.ai 在便利性、成本和合规性之间取得了最佳平衡。
查看原文

相似文章