Show HN: Echo – 使用开放权重模型,以三分之一成本达到Fable级别效果
摘要
Echo是一个系统,通过高效地在开放权重模型间分配推理任务,以三分之一的成本达到与Fable模型相当的性能。它提供免费额度,且无需信用卡。
我一直在开发Echo(<a href="https://echo.tracerml.ai/" rel="nofollow">https://echo.tracerml.ai/</a>),这是一个实验,旨在从一组开放权重模型中构建一个AI系统,而不是为每个任务选择单一模型。<p>一开始只是一个简单的实验。我选取了一组模型,包括GLM-5.2、Kimi K2.7等,并对它们进行了相同的评估。然后我测量了,如果对于每个问题,你事先知道哪些模型会有用以及如何组合它们的输出,会发生什么。<p>这个假设的系统性能明显优于池中的任何单个模型。当然,这并非实际可部署的方案,因为它依赖于在看到结果后才知道哪些决策是正确的。Echo是我尝试在事先没有这些信息的情况下恢复部分优势的方法。<p>对于每个请求,Echo决定分配多少计算量,哪些模型应参与,以及如何组合它们的工作。某些提示可能只需要相对较少的推理,而其他提示则需要多个模型协同处理问题的不同部分。<p>在构建过程中,令我惊讶的一点是这些模型的互补性。一个整体上明显较弱的模型,在特定问题或组合中使用时仍然可能非常有用。<p>在我的第一个评估组合中,Echo的表现始终优于其模型池中最好的单个模型。同时,它在大约三分之一推理成本下,达到了与Fable(我用作较强对比系统之一)大致相同的总体结果。<p>仍然存在一些情况,Echo做出了错误的分配或组合决策。我目前花费大量时间分析这些失败案例,并测试相同的方法在编码和智能体任务中是否同样有效,因为这些任务中衡量每个决策的质量要困难得多。<p>我构建了一个聊天界面(echo.tracerml.ai)和一个兼容OpenAI的API(<a href="https://echo.tracerml.ai/docs/api" rel="nofollow">https://echo.tracerml.ai/docs/api</a>),因此该系统可以在评估设置之外进行测试。<p>这里有一个关于工作原理的简短/高层视频:<a href="https://www.youtube.com/watch?v=lJFJSvOdXhg" rel="nofollow">https://www.youtube.com/watch?v=lJFJSvOdXhg</a><p>我在此处撰写了评估方法、单个模型结果、成本和当前限制:<a href="https://echo.tracerml.ai/eval" rel="nofollow">https://echo.tracerml.ai/eval</a><p>非常欢迎您尝试!尤其是在遇到任何奇怪的失败情况或分配看起来不直观的地方时。
查看缓存全文
缓存时间: 2026/07/24 04:59
# Show HN:Echo – 使用开源权重模型,以1/3成本实现Fable级别结果
来源:https://news.ycombinator.com/item?id=49026810
https://news.ycombinator.com/vote?id=49030253&how=up&goto=item%3Fid%3D49026810
感谢大家花时间尝试 Echo 并分享反馈,这正是我想尽早发布的原因。
我想针对几个经常出现的话题进行回应:
- 我将持续发布更强大的评估,包括更难的编码和智能体基准测试,以更精确地绘制与 SOTA 之间的差异
- 公开评估面板会持续扩展并及时更新(也欢迎更多基准测试建议!)
- 有用户发现评估面板 UI 和注册流程中的问题,现在应该已在生产环境修复
一些重要的澄清:
- 尝试 Echo **无需**信用卡
- 每个账户包含 10 美元的免费额度,可用于 API 和聊天
关于方法本身:我探索的思路比模型路由更广泛——我正在研究如何跨开源权重模型高效分配推理计算,不仅决定使用哪些模型,还决定每个请求应获得多少计算量,以及中间工作应如何组合。
集成本身并不新鲜。自从随机森林甚至更早的统计/经典机器学习时代,我们就知道将多个模型结合在一起可以超越单个模型。Echo 面临的有趣问题是如何在不每次请求都支付完整集成成本的情况下进行建模和利用这一点。
虽然与 Fusion 或 Fugu 等系统在概念上有相似之处,但架构和优化目标有所不同。
再次感谢所有深思熟虑的反馈。
https://news.ycombinator.com/vote?id=49031151&how=up&goto=item%3Fid%3D49026810
小反馈:「创建密码」要求包含符号,但谷歌密码管理器默认不使用符号。我非常确信双位数的字母数字乱码足以作为密码(至少谷歌这么认为)。不过创意还是很棒的!
https://news.ycombinator.com/vote?id=49029061&how=up&goto=item%3Fid%3D49026810
> Fable级别结果,成本仅1/3
我猜这并非针对我们这些使用 heavily subsidized $200/月计划的人。当然,这些计划可能是暂时的,但没人知道究竟有多暂时。在此之前,公布 API 价格的三分之一并不吸引人。
https://news.ycombinator.com/vote?id=49030357&how=up&goto=item%3Fid%3D49026810
昨晚我在 $200 计划中用完了每周的 Fable 使用量。我有 $200 的推广使用积分,当时正在执行一个中等规模的编码计划。用了大约 1 小时 15 分钟的使用积分,烧掉了 $120 积分。我震惊于使用量积累得如此之快。其中一个问题是我使用了子智能体执行,多个智能体同时运行,最后发现 claude「忘记」了我要求子智能体任务适当时使用更便宜模型的指令,所以我同时运行了多个 Fable 实例。仍然难以想象按 token 付费。每月 $200 已经很高,每晚 $200 简直疯狂。
https://news.ycombinator.com/vote?id=49031298&how=up&goto=item%3Fid%3D49026810
我太年轻(这里大多数人都如此)没有经历过 60/70 年代为分时机器付费的日子,但这让我想起了为 Sprintnet/Telenet 和 Tymnet 付费的诡异回忆……还有 AOL、CompuServe、Delphi。我们真的要再次执行这种计算模式吗?
https://news.ycombinator.com/vote?id=49030852&how=up&goto=item%3Fid%3D49026810
我在子智能体导致我过快达到限额后就不再使用了。不得不创建一个单独账户并支付另一个最大计划来临时解封自己。
https://news.ycombinator.com/vote?id=49029438&how=up&goto=item%3Fid%3D49026810
所有企业用户(那些在工作中使用而非业余项目的人)都无法获得补贴计划。我想说补贴计划是少数?
https://news.ycombinator.com/vote?id=49029878&how=up&goto=item%3Fid%3D49026810
人们确实可以为工作获得补贴计划:我们使用 Claude Teams,每月 $100 的高级席位,上限 150 个席位。不是企业级,但对中小企业来说足够了。
https://news.ycombinator.com/vote?id=49029595&how=up&goto=item%3Fid%3D49026810
补贴用户群足够大,cheema 指出这个区别对其他读者来说是对的。
https://news.ycombinator.com/vote?id=49029993&how=up&goto=item%3Fid%3D49026810
我想大多数中小企业要么使用个人计划,要么使用 Teams 计划。绝大多数公司不需要超过 150 个席位,API 费率对大多数公司来说不可持续。
https://news.ycombinator.com/vote?id=49030687&how=up&goto=item%3Fid%3D49026810
如果这是真的,前沿实验室无法证明其万亿美元估值,他们在补贴计划上几乎赚不到什么。
https://news.ycombinator.com/vote?id=49030680&how=up&goto=item%3Fid%3D49026810
我相信这些计划会持续到他们 IPO,之后不久就会结束。每月 $200 计划对利润表不利,因为用户使用价值 $10000 的 API 积分。每个用户损失 98% 的利润率。
https://news.ycombinator.com/vote?id=49030949&how=up&goto=item%3Fid%3D49026810
人们通过对比等价的 API 成本来说明订阅价格很划算——花 $200 得到价值 $10000 的 token。但我怀疑事实是否相反:API 用户是否被敲竹杠?我看到 Dario 在几次采访中说他们推理业务是盈利的,也许他只想指 API 使用,但给我的印象并非如此。
如果你的用户不愿意支付之前费用的 50 倍,并且有其他选择如开源提供商,那么这不是 98% 的利润率损失。计算没那么简单,因为一部分用户会切换到 API,关键是有多少人会继续使用服务而非转向竞争对手。
我知道他们需要收回训练和数据中心的巨大成本,但仅从推理成本层面,我不认为 $200 的计划是亏损的。
https://news.ycombinator.com/vote?id=49031090&how=up&goto=item%3Fid%3D49026810
是的,这就像指着 Netflix 上所有单独电影和电视剧的租赁成本,然后得出结论说 Netflix 以数万美元补贴订阅。
https://news.ycombinator.com/vote?id=49030964&how=up&goto=item%3Fid%3D49026810
我猜想补贴是为了吸引人们提供训练数据。
你的思维模式值每月 9800 美元吗?
分析这些思维模式的回报率如何?
https://news.ycombinator.com/vote?id=49031129&how=up&goto=item%3Fid%3D49026810
我根本不相信转换成本高到他们*可以*取消这些计划。中国模型会抢走他们的饭碗。
https://news.ycombinator.com/vote?id=49031161&how=up&goto=item%3Fid%3D49026810
开源权重模型正在追赶,我看不到这会改变的理由。这将在很大程度上定义这个行业的经济学。未来人们花费数千美元购买 API 积分的可能性似乎极低。
https://news.ycombinator.com/vote?id=49031240&how=up&goto=item%3Fid%3D49026810
> 当然,这些计划可能是暂时的,但没人知道究竟有多暂时。
Anthropic 今天邮件通知我:
``
Fable 5 已于 7 月 20 日转为使用积分。它仍然可供使用,但需要按需使用积分,不包含在您的订阅速率限制中。
``
https://news.ycombinator.com/vote?id=49029078&how=up&goto=item%3Fid%3D49026810
如果你事先不知道问题的复杂性并确保所有后续对话都指向同一个模型,这种方法效果并不好。
否则,你会通过在同一对话中跨不同模型进行轮询而打破缓存。很可能最终付出的代价比使用能感知缓存的系统更高。
https://news.ycombinator.com/vote?id=49027950&how=up&goto=item%3Fid%3D49026810
所以这是 Dogpile.com 对 Ask Jeeves、AltaVista 和 Lycos 的方式?时间是个圆环吗?
https://news.ycombinator.com/vote?id=49029072&how=up&goto=item%3Fid%3D49026810
Dogpile 只有在搜索引擎大部分都是垃圾时才是个好主意。
你需要搜索所有引擎才能找到像样的东西。
这大致与今天的情况类似。忽略成本,你最好让所有大语言模型来解决一个问题(比如编码),这样你可以验证答案。
所以问题是,对于这类事情——一组模型能否超越前沿模型,尤其以合理的成本?
Fable 的价值并不高,所以除非你试图回答 Erdős 问题,否则很可能在成本上做得更好。
你通常可以同时询问 3 到 4 个顶级中国模型,得到回答的成本与 Fable 的一个问题相当……鉴于 Fable 并没有*那么*好,对于很大一部分问题,你能做得更好并不奇怪。
https://news.ycombinator.com/vote?id=49031109&how=up&goto=item%3Fid%3D49026810
大语言模型有时会以奇怪而模糊的方式(对普通观察者而言)失败。有时甚至连简单的问题("我在想的那个超级有名的 x 是谁?")这类问题都严重失败。
对于 AI 要回答的领域越模糊、越不具承诺性、越主观,结果反而越好(在我看来)。
https://news.ycombinator.com/vote?id=49031185&how=up&goto=item%3Fid%3D49026810
我敢说这是因为助手训练语料严重偏向一次性解答。
因为对该查询的正确回应是 "我不知道——你需要提供更多信息",
而 LLM Agent 在这方面很差。
https://news.ycombinator.com/vote?id=49031218&how=up&goto=item%3Fid%3D49026810
*Dogpile 只有在搜索引擎大部分都是垃圾时才是个好主意。*
嗯,搜索引擎又变成垃圾了。也许它应该回归。
https://news.ycombinator.com/vote?id=49030572&how=up&goto=item%3Fid%3D49026810
没有理由认为一个更聪明的模型不会自己构建一个内部更智能/更高效的路由器。
https://news.ycombinator.com/vote?id=49028968&how=up&goto=item%3Fid%3D49026810
没错
高质量、快速且廉价(三者兼备)——是成功的公式。
但这说起来容易做起来难。
https://news.ycombinator.com/vote?id=49028446&how=up&goto=item%3Fid%3D49026810
*模型的混合*,也许是?说句公道话,OP 所提出的设置最近也被其他 "AI 网关" 产品(如 OpenRouter、JusCode、Fireworks 等)所倡导,所以这里很可能是有用的东西。
https://news.ycombinator.com/vote?id=49026989&how=up&goto=item%3Fid%3D49026810
没有基准测试,没有使用哪些模型的信息,AI 生成的视频,只有一个注册页面,其他什么都没有。
无论如何,这让我想起了关于架构的那句名言:"我们用微服务替换了单体,这样每次宕机都更像是谋杀悬疑剧。"
https://news.ycombinator.com/vote?id=49027324&how=up&goto=item%3Fid%3D49026810
评估器在这里公开:https://echo.tracerml.ai/eval/
目前它展示了 907 条存储行,跨越七个基准测试系列,包含提示、输出、评分和成本记录。更多基准测试即将推出。
Echo 不会披露其每次请求的路由决策,因为该策略就是产品。不过,我们可以披露部分符合条件的开源权重模型池、版本日期、总体分配组合和评估设置,而不会暴露请求级别的配方。
新视频也正在制作中。
https://news.ycombinator.com/vote?id=49030006&how=up&goto=item%3Fid%3D49026810
> Echo 不会披露其每次请求的路由决策,因为该策略就是产品
我之前没有使用路由器产品的需求,所以如果这是惯例,请原谅我的无知,但如果我不被允许查看哪个模型服务了我的请求,我怎么可能使用并改进基于这种路由器的产品呢?如果我的 LLM 驱动的应用程序返回了糟糕的答案,我真的无法知道是哪个模型的责任吗?
https://news.ycombinator.com/vote?id=49030462&how=up&goto=item%3Fid%3D49026810
> Echo 不会披露其每次请求的路由决策,因为该策略就是产品
我的诚实建议:这会赶走相当数量的潜在客户,尽管我认为你的想法/概念很棒。
例如,如果我们考虑将其用于 Canva,可观察性和完全透明是关键要求;我们不能接受不知道哪个模型服务了请求。无论是出于法律/合同原因、与 API 提供商协调容量规划,还是仅仅评估我们的提示词和 harness,以及调试/追踪出错的结果。所以这使得它无法被纳入考虑;这也表明某种敌对关系,客户不被信任获得关键信息。
我完全理解你需要保持商业价值,但我不认为隐藏请求路由到的模型是正确的做法,至少如果你想扩展至更大的潜在客户或更高级的 LLM 部署。
https://news.ycombinator.com/vote?id=49027669&how=up&goto=item%3Fid%3D49026810
我一直在做一个类似的项目,我发现如果你使用饱和的基准测试,很容易复现 Fable 的结果。
在我的项目中,我浪费了大量时间试图将 GPQA Diamond 的结果提升到 ~93% 以上。当 Fable 发布时,我意识到我的错误——它在这个基准上相对于 Opus 没有任何改进。
https://news.ycombinator.com/vote?id=49029132&how=up&goto=item%3Fid%3D49026810
如果 GPQA Diamond 约 7% 的问题在真实数据中答案本身就是错误的,因此将答对这类问题判定为错误,我一点也不会感到惊讶。大多数机器学习基准测试的验证都相当糟糕。
https://news.ycombinator.com/vote?id=49027436&how=up&goto=item%3Fid%3D49026810
基本上是在试图复制 OpenRouter,后者运行得很好,并且有很多很好的特性来抽象掉任何单一提供商,例如故障转移、计量、自动切换等。实际上是一个非常智能的基础设施抽象。
我只是希望这能解决一个实际问题,而不是相当透明的尝试说些类似 "嘿 VC,OpenRouter 刚刚成为独角兽,但我基本上可以用潜意识代码搞定它" 的话。
称之为 "Fable 级别" 感觉智力上懒惰/不诚实,但话说回来,当这么多钱摆在桌面上时,你还能期待什么呢?
https://news.ycombinator.com/vote?id=49028525&how=up&goto=item%3Fid%3D49026810
这感觉更有点像 Fugu,它充当多 LLM 编排器(尽管我认为 Fugu 混合了开放和封闭权重的模型),但无法看到它们任何一个决定群中每个模型的 "层数" 的 "秘方",它们都感觉很难比较,除了大的公开基准测试……
https://github.com/SakanaAI/fugu
https://news.ycombinator.com/vote?id=49029977&how=up&goto=item%3Fid%3D49026810
老实说,不确定。我认为 Fugu 试图同时利用多个模型,而像 NotDiamond 这样的更倾向于选择最优的*单一*模型。
这个领域如此拥挤,感觉每几周就会看到一个新的 "模型路由器" 出现。
https://news.ycombinator.com/vote?id=49028051&how=up&goto=item%3Fid%3D49026810
无关——但这让我想起了 tenderlove 最爱的名言:
"微服务将函数调用变成了分布式计算问题"
https://news.ycombinator.com/vote?id=49028230&how=up&goto=item%3Fid%3D49026810
grug 想知道为什么大
相似文章
ECHO: 终端代理免费学习世界模型
ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。
Launch HN: Tokenless (YC S26) – 自动切换模型以节省成本
Tokenless 是一家获得 YC 支持的初创公司,提供 LLM API 调用的即插即用替代方案,自动将请求路由到最具成本效益的模型,而不牺牲质量,有望将推理成本降低一半。
EchoChain:面向中断场景的全双工状态更新推理基准
EchoChain 是一项全新基准测试,旨在评估 AI 模型在用户中途打断时修正正在进行中的回复的能力。该基准提炼出三种典型故障模式(上下文惯性、中断遗忘、目标偏移),结果表明,在当前评估的实时语音模型中,无一系统的通过率突破 50%。
又一个基准测试:解决相同任务,0.34美元对比27.60美元
Archestra分享了他们通过在实际客户工作流中运行弱模型来调试产品缺陷,从而对AI智能体进行基准测试的方法。结果显示,像开放权重模型这样更便宜的模型可以以极低的成本(0.34美元对比27.60美元)获得类似的结果。
Show HN: GoModel – 开源 Go 语言 AI 网关,体积仅为 LiteLLM 的 1/44
GoModel 是一款用 Go 编写的全新开源 AI 网关,提供统一的 OpenAI 兼容 API,支持多家模型提供商,宣称体积比 LiteLLM 小 44 倍。