DeepSeek 前缀缓存技巧:削减 90% Token 成本并支持广告驱动的代理

Reddit r/AI_Agents 新闻

摘要

一位开发者分享了他们如何通过前缀缓存优化,将 DeepSeek API 成本削减约 90%,将浏览器代理任务成本降至 0.005 美元以下,并实现了一个免费、由广告支持的浏览器代理。

我在做一个名为 Retriever AI 的浏览器代理,过去几天我们花了很多时间深入研究 DeepSeek 的前缀缓存。结果:我们的 token 账单减少了约 90%。大家都知道,缓存输入 token 比原始输入 token 便宜 50 倍。我们的缓存命中率从 24% 提升到了 87%,现在浏览器代理任务的平均成本不到 0.005 美元。有趣的是,意外破坏缓存是多么容易。我们发现了以下几点: - 将稳定的提示词片段放在易变片段之前 - JSON 模式悄然破坏了我们的缓存 - 限制提示词中的条件判断和变量,并严格监控提示词变体 - 一个多余的时间戳可能使之后的所有内容失效 - 用制表符代替空格会增加 token 使用量 - 最新的 DeepSeek 思考冗长,可以利用思考来存储之前的状态。我们移除了历史页面树观察,只让模型在思考中记下有趣的 id - 对于浏览器代理来说,将页面快照放在提示词的稳定部分非常重要 - 我们现在记录所有提示词片段的哈希/大小,以不断提高缓存率 这一点对代理尤其重要,因为每一步都会发送大量重复上下文。我们的架构是纯文本的,因此浏览器页面变成了可复用的语义树,而不是每一步都生成新的截图。这几乎非常适合激进缓存,也是 DeepSeek 唯一可行的路线。每个任务约 0.005 美元,我们现在可以推出一个完全由广告支持的免费浏览器代理!很想知道其他人的缓存技巧,并分享交流!
查看原文

相似文章