DeepSeek 前缀缓存技巧:削减 90% Token 成本并支持广告驱动的代理
摘要
一位开发者分享了他们如何通过前缀缓存优化,将 DeepSeek API 成本削减约 90%,将浏览器代理任务成本降至 0.005 美元以下,并实现了一个免费、由广告支持的浏览器代理。
我在做一个名为 Retriever AI 的浏览器代理,过去几天我们花了很多时间深入研究 DeepSeek 的前缀缓存。结果:我们的 token 账单减少了约 90%。大家都知道,缓存输入 token 比原始输入 token 便宜 50 倍。我们的缓存命中率从 24% 提升到了 87%,现在浏览器代理任务的平均成本不到 0.005 美元。有趣的是,意外破坏缓存是多么容易。我们发现了以下几点:
- 将稳定的提示词片段放在易变片段之前
- JSON 模式悄然破坏了我们的缓存
- 限制提示词中的条件判断和变量,并严格监控提示词变体
- 一个多余的时间戳可能使之后的所有内容失效
- 用制表符代替空格会增加 token 使用量
- 最新的 DeepSeek 思考冗长,可以利用思考来存储之前的状态。我们移除了历史页面树观察,只让模型在思考中记下有趣的 id
- 对于浏览器代理来说,将页面快照放在提示词的稳定部分非常重要
- 我们现在记录所有提示词片段的哈希/大小,以不断提高缓存率
这一点对代理尤其重要,因为每一步都会发送大量重复上下文。我们的架构是纯文本的,因此浏览器页面变成了可复用的语义树,而不是每一步都生成新的截图。这几乎非常适合激进缓存,也是 DeepSeek 唯一可行的路线。每个任务约 0.005 美元,我们现在可以推出一个完全由广告支持的免费浏览器代理!很想知道其他人的缓存技巧,并分享交流!
相似文章
DeepSeek reasonix,DeepSeek 原生编码代理,高缓存、低成本
DeepSeek 发布了一款名为 DeepSeek reasonix 的原生编码代理,具有高缓存和低成本特点。
DeepSeek Flash 刚刚颠覆了智能体市场:成本降低 100 倍的智能体
DeepSeek Flash 是一款新的人工智能模型,能够将构建 AI 智能体的成本大幅降低 100 倍,可能彻底改变智能体市场。
DeepSeek 宣布促销期后将永久降价75%
DeepSeek 宣布在促销期结束后将永久降价75%,使其AI服务对用户来说价格大幅降低。
@scaling01: DeepSeek 刚刚将其推理成本降低约5倍,吞吐量达50 TPS
DeepSeek 已将推理成本降低约5倍,同时保持每秒50个token的吞吐量。
DeepSeek 将 V4 Pro 价格折扣永久化
DeepSeek 已将 V4 Pro API 定价的 75% 折扣永久化,大幅降低了输入/输出令牌成本。