Launch HN: Tokenless (YC S26) – 自动切换模型以节省成本
摘要
Tokenless 是一家获得 YC 支持的初创公司,提供 LLM API 调用的即插即用替代方案,自动将请求路由到最具成本效益的模型,而不牺牲质量,有望将推理成本降低一半。
大家好,我是 Tokenless 的 Rohit(<a href="https://usetokenless.com/" rel="nofollow">https://usetokenless.com/</a>),与联合创始人 Andrew 和 Kev 一起构建这个项目。我们正在构建一个 API 网关,它可以动态地在不同模型之间逐个轮次地路由代理流量,以节省 AI 开支。<p>AI token 的成本是许多人最关心的问题。Uber 和 Salesforce 等公司一直抱怨他们的年度 AI 支出比预期更快地超出预算。<p>前沿模型在开发工作中表现出色,但价格昂贵。开源模型价格低廉且快速改进,正在缩小与前沿模型的差距,但尚未完全达到。<p>Tokenless 让您两全其美——仅在需要时才将困难的任务路由到更智能的模型,从而保持低成本。<p>在 Tokenless 之前,我在普林斯顿攻读博士学位。在使用编码/其他代理时,我经常为模型选择而苦恼,以确保我的 AI 支出在我的学术 Cursor 账户上尽可能物有所值。<p>与此同时,我正在进行 LLM 研究,在 NeurIPS 提交季的恢复期间,我开发的一个小技巧似乎很快达到了 SOTA。我很惊讶如此简单的想法就能很好地完成路由。<p>我们已经开发出一个路由器版本,能够以一半的成本达到 Claude Fable 5 的性能。我们网站上的博客文章探讨了我们如何做到这一点的技术细节(<a href="https://usetokenless.com/blog/building-tokenless/" rel="nofollow">https://usetokenless.com/blog/building-tokenless/</a>)。<p>亮点:
- 我们的方法同时查询多个模型,并利用它们的进度来做决策(据我所知,这项技术是新颖的,如果你知道还有谁在做这个,请告诉我们)。
- 如果路由算法能够感知缓存的热/冷状态,切换模型不会破坏缓存。<p>未来计划:
- 将 Kimi K3、所有其他 GPT 模型等添加到路由器中<p>请前往 usetokenless.com 注册,并尝试将 Tokenless 与您的代理一起使用,您将获得 20 美元的免费额度。这里有一个如何使用它的演示:<a href="https://youtu.be/sjZWriclcls" rel="nofollow">https://youtu.be/sjZWriclcls</a><p>Tokenless 以更低价格提供前沿级别的智能,因此我们很希望获得一些反馈:使用体验如何,路由器有任何路由错误的边缘情况,以及您是否觉得路由问题有趣!
查看缓存全文
缓存时间: 2026/07/29 18:56
# Tokenless | 让你的推理账单减半的路由器
来源:https://usetokenless.com/
只需替换 API 调用——自动路由至最合适的模型,无需更改代码。
## 相同质量,一半成本。
大多数调用并不需要前沿模型。Tokenless 将你的请求分发到一组模型,并观察它们的推理过程。一旦某个模型思路清晰,我们就会选中它并取消其他模型,你只需为实际使用的部分付费。
我们提供兼容 OpenAI 和 Anthropic 的端点。将你的模型指向我们,今天就试用!
> refactor CLI options into an enum
时间 → 置信度,按模型计费此请求$0.0000
$0.0000
发送至Fable 5$0.0000
$0.0000
−52%·$0.0101未计费
## 用数据说话,而非营销。
在公开的智能体基准测试中,按任务解决率和成本计算,与每款前沿模型的最佳已公布运行结果对比。
任务解决率
Tokenless Pro
GPT-5.6 Sol
Claude Opus 5
Tokenless Ultra Saver
Claude Fable 5
Gemini 3.6 Flash
平均 $/任务
Gemini 3.6 Flash
Claude Opus 5
Tokenless Ultra Saver
Tokenless Pro
GPT-5.6 Sol
Claude Fable 5
## 看看你能省多少。
你每月的 LLM 支出
你支付$26K/月节省$14K/月
你支付$26K/月节省$14K/月
$0$40K/月 — 你当前的账单
未来 12 个月趋势:RAMP AI 指数 · +11.0%/月
$20K/月$40K/月$60K/月$80K/月$100K/月$120K/月当前轨迹使用 tokenless$344K未来一年节省−12 月今天+12 月
*估算基于已发布的 token 价格(包括缓存费率)以及源码中可编辑的路由假设。你的实际费率取决于你的流量。支出历史与趋势:Ramp AI 指数——每位员工的 AI 支出,2025 年 6 月–2026 年 6 月,匹配你所在支出群体的数据,并按过去 12 个月的增长率进行外推。
由来自 Google DeepMind、普林斯顿大学和加州大学伯克利分校的 AI 研究人员开发。获 Y Combinator 支持。
## 降本不降质。
预约演示,我们将根据你的实际流量计算具体数字——或者只需替换两行代码,亲自验证效果。
相似文章
Show HN: Echo – 使用开放权重模型,以三分之一成本达到Fable级别效果
Echo是一个系统,通过高效地在开放权重模型间分配推理任务,以三分之一的成本达到与Fable模型相当的性能。它提供免费额度,且无需信用卡。
@DeRonin_: https://x.com/DeRonin_/status/2054235707791778034
一份实用指南,介绍了如何通过更智能的 Token 管理(包括多模型路由、提示词缓存和上下文纪律)来降低 80% 的 AI 编码成本,而不是简单地切换到更便宜的模型。
@rohanpaul_ai: TokenPilot 通过摄入感知压缩和生命周期感知驱逐来降低 LLM 智能体成本,实现了 61–87% 的成本降低。
TokenPilot 通过摄入感知压缩和生命周期感知驱逐来降低 LLM 智能体成本,在 PinchBench 和 Claw-Eval 上实现了 61–87% 的成本降低,且得分具备竞争力。
@alexatallah: 如果你是一位研究人员,希望→开展严谨的研究,探讨多个模型如何超越前沿→利…
OpenRouter 推出 Fusion API,这是一种复合模型,能以一半的价格实现高智能,利用了最大的 LLM 市场。
我认为“使用更少的token”作为LLM成本建议过于肤浅
本文认为,常见的专注于减少token的LLM成本建议过于肤浅,而在生产环境中更具影响力的策略是,将不同的工作流步骤路由到不同的模型,而不是使用单一的默认模型。