我消耗了所有代币来研究如何节省代币

Hacker News Top 新闻

摘要

作者描述了如何通过多个订阅和更便宜的模型构建自定义AI研究管线以降低代币成本,并在研究代币经济学的过程中亲身体验了如何优化代币使用。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:48

# 我烧光了所有 Token,只为研究如何节省 Token 来源:https://quesma.com/blog/custom-deep-research-pipeline/ 2026 年 7 月 19 日登上 Hacker News 首页(https://news.ycombinator.com/item?id=48967355) 在 Quesma,我们正在研究 AI 代理的经济学:智能编码真正要花多少钱,以及你能做些什么。为了这项研究,我搭建了自己的深度研究流程——一个能构建真正可信知识库的代理管道。第一版这个流程在 30 分钟内就烧光了我 Claude Max 5x 计划的全部额度。这篇文章讲述了我如何仅用已有的订阅服务就解决了成本和信任问题,以及你如何也能搭建同样的系统。 我的目标是理解所谓的“代币经济学”的全貌。我想知道存在哪些监控系统,团队如何管理他们的 AI 支出,以及哪些优化工具和实践真正有效——无论是在论文里还是在实际世界中。 我一开始用了常规方法:`/deep-research`(https://code.claude.com/docs/en/commands)。我把那个大开放性问题丢给它,让它跑起来。大约 30 分钟的研究后,我触发了限制,不得不等几个小时让额度重置。而且我什么结果都没拿到。那次运行启动了 111 个代理,队列中排了 123 条需要验证的声明,但在达到限制之前只有 25 条得到了验证,最终的综合报告从未运行。 所以,这是我个人的切身体会。而且有点好笑:从第一天起,我就不得不一边优化 Token,一边还在学习如何优化 Token。边做边学。 ## 使用我已经付费的每一个订阅 如果 Claude Fable 5 在 30 分钟后就用尽额度,而 `/deep-research` 消耗这么多 Token 却不给我任何结果,我该如何让研究更有效呢?我开始思考我已经拥有并付费的工具:Claude、Codex 和 Antigravity——3 个订阅,理论上在不额外付费的情况下拥有 3 倍的 Token。如果我一起使用这些工具,并共享记忆呢? 由于我已经在使用 claude-mem(https://github.com/thedotmack/claude-mem)插件,我扩展了它以在本地支持 Codex 和 Antigravity,这样所有 3 个工具都可以在会话期间使用共享记忆。一个工具学到的东西,其他工具也能用。 ## 将更便宜的模型用作子代理 我的默认设置是 Claude Code,所以我用它作为主要编排器。在手动研究的过程中,我发现了一种模型编排模式,这正是我当时需要的。我们并不真的需要 Fable 来处理所有事情:Claude Opus 4.8、Claude Sonnet 5、GPT-5.5 和 Gemini 3.1 Pro 对于许多任务来说已经是优秀的模型了。 Claude Code 编排器 + 原生 Claude 代理 + Codex 和 Antigravity 无头子代理 + claude-mem 共享本地内存。Claude Code 作为编排器:原生 Claude 代理,Codex 和 Antigravity 作为无头子代理,全部共享 claude-mem。 所以我查了一些基准测试和成本分析,主要是 Terminal-Bench(https://www.tbench.ai/)用于终端和代理工作、SWE-bench Pro(https://scale.com/leaderboard/swe_bench_pro_public)用于端到端软件工程,以及 Artificial Analysis(https://artificialanalysis.ai/)用于性能与价格的总体概览。我没有把任何一项当作最终真理;基准测试有自己的衡量标准,数字每个月都在变。我只需要一个粗略的起点,了解谁擅长什么,而且从一开始使用多个不同模型就是实验的一部分;我预计在真正运行后还会调整分配方案。 | 角色 | 模型 | 原因 | |------|------|------| | 查找 | Claude Sonnet 5 | 在智能代理基准测试中表现强劲,且足够便宜可以批量运行 | | 验证 | Claude Opus 4.8 | 最准确的 Claude 工作模型;验证比查找需要更高的准确性 | | 判断与规划 | Claude Fable 5 | 最贵的模型,所以只做规划、分解和解决争议 | | 小任务 | Claude Haiku 4.5 | 便宜且快速,适合提取和格式化,但对于多步工作来说太弱 | | 运行工具 | Codex (GPT-5.5) | 在终端基准测试中非常强;克隆、安装、运行和检查工具 | | 第二意见 | Antigravity (Gemini 3.1 Pro) | 不同的模型家族,因此不会共享相同的盲点 | 这个分配方案不是我第一个版本;在真实运行中暴露弱点后,我调整了几次,回退规则就是来自这些失败。这里最棒的一点是,我将 Codex 和 Antigravity 准备为 Claude 的子代理,由 Fable 编排,利用两者的无头特性。为什么很酷?因为 Token 从 Codex 和 Antigravity 的订阅中扣除,所以我无需额外付费,但瞬间拥有了更多可用的智能。 整个技巧就是一个小的 Bash 脚本,我的 Claude 代理可以像调用其他命令一样调用它: ```bash # run-cli: 调用其他供应商的 CLI 作为无头子代理 # 用法: run-cli <供应商> "<提示词>" VENDOR="$1"; PROMPT="$2" case "$VENDOR" in codex) OUT="$(codex exec --sandbox read-only "$PROMPT")" ;; antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;; esac echo "$OUT" echo "$OUT" | claude-mem-save -s "$VENDOR" # 保存到共享内存(我本地扩展的 claude-mem) ``` 这个封装器还会监视输出中的“用量限制”和“信用额度不足”消息,并返回一个特殊的退出码——这正是自动回退到 Claude 模型的方式:编排器看到该信号后,改用 Claude 代理来完成工作。 另一件非常重要的事情是按角色固定模型,因为子代理默认会继承父级的模型——而这正是我 30 分钟内烧光 Fable 额度的原因。 使用这种技术,我能够连续运行研究**大约比仅用 Fable 时长了 10 倍**——衡量方式很简单,就是看在这 3 个订阅中任何一个达到限制之前,我可以让代理工作多久。**之前是 30 分钟的研究,现在变成了几小时,而我没有多花一分钱。**当 Codex 或 Antigravity 达到其自身限制时,框架会自动回退到 Claude 模型,所以研究不会中断。 ## 减少幻觉 成本只是第一个问题,第二个问题是信任。在我的研究框架之前,当一切由 Fable 完成时,我有时会得到看起来可靠但实际上并不真实的结果。例如:仓库上的错误许可证、没有来源的节省数据,或者引用页面上根本不存在的数字。 为了减少幻觉,我在研究框架中实施了明确的规则,每条发现必须通过这些规则才能被分享。其中一些: - 发现主张的人从来不去验证它,由不同的模型或代理检查链接、引用和数字。 - 没有 URL 和主要来源的引用,任何内容都不能进入知识库。 - 永远不要陈述源页面中没有的数字。 这个列表并非事先设计好的。它是在研究过程中逐渐增加的,因为每次验证捕获到新类型的错误,规则就会反馈到提示词中。而且,这样的框架只有在你持续调整时才真正有效:所以回顾发现,标记无用的,并反馈回去。 ## `/deep-research` 放到最后 解决了成本和信任问题后,最后一块就是引发这一切的 `/deep-research` 工具。它仍然在管道中,但作为最后一步,而不是第一步。每天结束时,我会对已经通过验证的发现运行它。这样它就不是盲目研究,而是基于已有的发现进行深化、消除混乱,并尝试填补框架遗漏的空白。这种方式也消耗更少的 Token,因为它处理的是一个固定列表的主张,而不是探索整个互联网。 最后一次运行用了 61 个代理,耗时 22 分钟。相比之下,第一天 111 个代理在约 30 分钟内烧光了全部额度,却从未生成报告。同样的工具,只是工作量大为减少。 研究管道:Sonnet 查找,Opus 检查,Fable 判断,Codex 运行以获得执行证据,多数投票深度验证,人工批准,然后进入知识库。 这张图概括了整个流程:查找、验证、判断、运行工具、深度验证,然后发布到知识库。 ## 结果:一个我可以信任的知识库 所有通过验证的内容都进入一个我用 Obsidian 维护的 LLM 知识库,灵感来自 Karpathy 的 LLM 知识库模式(https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f):链接的原子笔记,代理执行扫描,我制定规则。一周下来,它已经包含了数百条经过验证的关于定价、工具、基准测试和实践的笔记。 ![Obsidian 图视图,按主题聚类的链接研究笔记](https://quesma.com/images/blog/custom-deep-research-pipeline/obsidian-graph.png) 到目前为止,已有数百条关于定价、工具和基准测试的笔记。 自动化检查本身是不够的。有一次,我的分类规则悄悄拒绝了 Headroom(https://github.com/headroomlabs-ai/headroom),这是一个拥有 56k 星的项目,也是其类别中最大的项目之一。代理们做得都对,验证确认该项目是合法的,并且一条主张检查正确地标记出其标题声称的节省数字没有经过质量控制。但我的规则说“未经验证的主张意味着不能收录”,所以这个行业一半都在用的项目在我的知识库中是隐形的。两天后我问“我们怎么会错过这个?”才发现问题。修复方法是新加一条规则:拒绝主张,而不是拒绝项目。 代理可以做搜索和检查,但没有一个代理会告诉你你自己的规则就是错误。如果你想构建一个高质量的知识库,人工验证和研究补充是强制性的。纯 AI 研究质量可能非常差。纯人工研究又太慢。最好的方式是混合:代理承担繁重的研究工作,但它们运行在一个由人类精心设计并持续改进的管道上。人类还负责验证结果并填补空白。 ## 知识库中的一些发现 代币经济学这个话题比我预期的要大得多。以下是其中一小部分,最让我惊讶的发现: 1. **你的编排器可以和你的模型一样重要。** 在 Terminal-Bench(https://arxiv.org/abs/2601.11868)上,同一个模型在不同编排器之间显示出约 66 倍的 Token 消耗差异,而且更精简的设置得分反而更高,不是更低。另一项研究(https://arxiv.org/abs/2606.12344)测量出同一模型仅改变编排器就产生了约 54 个百分点的波动。我们自己也在检查“对 AI 代理说‘嗨’的真实成本”(https://quesma.com/blog/tokenflation-when-hi-triggers-33-tool-calls/)时看到了一个小规模版本。 2. **上下文压缩可能让你的账单翻倍,而不是节省。** 压缩听起来像压缩,所以很容易认为它总是好的,但它不是免费的:模型必须总结你的历史,而那个总结调用本身也消耗 Token。它还可能驱逐代理仍然需要的文件,导致代理重新读取,上下文再次填满,压缩再次触发。一个记录在案的回归问题(https://github.com/openai/codex/issues/16812)展示了这个循环有多糟糕:编排器调整压缩阈值后,每次会话的压缩次数从 4 次增加到了 12-26 次,相同任务上的 Token 使用量从 8900 万增加到了 1.6 亿到 1.85 亿。 3. **一次会话中间的工具变更会悄悄重新计费所有内容。** 缓存读取大约花费基础输入价格的 0.1 倍,但缓存是按层次结构无效化的(https://platform.claude.com/docs/en/build-with-claude/prompt-caching)(工具、然后系统、然后消息)。在会话中间添加或重新排序一个工具模式,整个缓存的提示前缀就会以全价重新计费。你不会收到错误,只会拿到更大的账单。 4. **你的 Token 计数器不是你的发票。** 在一个有记录的案例(https://www.telerik.com/blogs/ai-cost-visibility-before-the-invoice)中,计算出的每月 3.60 美元最终变成了每月 25-40 美元的发票——7-11 倍的差距源自上下文累积、重试放大、框架开销以及简单的 Token 估算从未捕捉到的评估调用。我们的框架将大多数这些标记为中等置信度(通常有 1-2 个可靠来源),并且我们保持可见,而不是假装已经确定。 ## 在你烧光下一个限制之前 如果你今天在做深度研究时不断烧光限制,试着颠倒顺序:廉价模型负责查找,准确模型负责验证,深度研究最后进行。再看看你已经付费拥有多少智能。给每个模型分配明确角色的几个订阅,比盲目使用一个前沿模型要多得多。 如果你正在构建自己的研究管道,或者你的 AI 账单增长速度超过使用量,我们非常希望听到你的声音。加入 Hacker News(https://news.ycombinator.com/item?id=48967355)或 LinkedIn(https://www.linkedin.com/feed/update/urn:li:activity:7483849103605506048/)上的讨论。敬请关注未来的文章和发布。

相似文章