@mattshumer_: 每次有VC发给我一家自动路由公司进行尽职调查时,我都会回复类似这样的内容。如果缓存不是个事儿……
摘要
这篇帖子批评了AI中的自动路由公司,强调频繁切换模型会使提示缓存失效,导致更高的token成本和效率低下。
查看缓存全文
缓存时间: 2026/08/26 11:22
每当有风险投资公司发来一家自动驾驶路由公司让我做尽职调查时,我总会回复类似这样的内容。
如果提示缓存不存在,自动路由会更有意义。
但问题是……缓存确实存在。
Teknium 🪽 (@Teknium): 仅供知悉。如果您在会话中频繁切换模型,那您可能用错了方法。
每次切换时,您在原模型上的所有提示缓存都会在新模型中失效,且必须为全部内容重新支付完整的输入令牌成本。
除非有充分理由,否则请停止这样做——
相似文章
@DeRonin_: https://x.com/DeRonin_/status/2054235707791778034
一份实用指南,介绍了如何通过更智能的 Token 管理(包括多模型路由、提示词缓存和上下文纪律)来降低 80% 的 AI 编码成本,而不是简单地切换到更便宜的模型。
缓存如何每月帮我们节省数百美元的AI成本
本文介绍了通过构建智能缓存网关(Hawiyat Composer)如何利用精确匹配缓存、语义缓存、模型路由和本地路由消除重复的token浪费,从而节省大量AI API成本。
@avyvar: Token-maxxing 已经失控了。大多数 AI 应用把每个请求都发给最大的模型,即便小模型就能完成任务。
该推文批评了 AI 应用过度使用大型模型,并介绍了旨在根据不同请求匹配合适模型规模以提高效率的 Dari Router 工具。
LLM 路由不是要解决的问题;token 效率才是
本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。
@mckaywrigley:看好模型路由器。相同性能更低成本是显而易见的,但通过创建“更平滑”…
一条推文强调了模型路由器和“模型融合”的前景,提到Not Diamond Code的发布,这是一种面向编码智能体的智能模型路由器,可将成本降低20-65%。