像穴居人一样与智能体对话能节省65%的Token吗?我们测试了

Hacker News Top 新闻

摘要

JetBrains在Claude Code上对Caveman token压缩技能进行了基准测试,涵盖86个任务,发现实际的输出token节省约为8.5%(并非宣传的65%),且任务质量没有可检测的下降。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:54

# 像穴居人一样与 AI 智能体对话可节省 65% 的 Token。我们测试了。 来源:https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens/ Ai logo (https://blog.jetbrains.com/ai/) 在众多 JetBrains 产品中使用 AI 驱动的功能,为你的工具赋能 Agentic AI (https://blog.jetbrains.com/ai/category/agentic-ai/)AI (https://blog.jetbrains.com/ai/category/ai/)AI Assistant (https://blog.jetbrains.com/ai/category/ai-assistant/) 一次针对 token 压缩技能 Caveman (https://github.com/juliusbrussee/caveman) 在 Claude Code 上的配对 A/B 基准测试,运行于 SkillsBench (https://www.skillsbench.ai/):它真的能节省 token 吗?会不会降低 AI 智能体的输出质量? > **宣称节省:65%。实测节省:8.5%。** 在强制激活该技能的情况下,真实智能体任务上的输出 token 节省量。这是上限,而非通常情况下的结果。 ## 我们为什么做这个测试 我们 JetBrains 团队正越来越多地投入到编码智能体相关工具链的规范测试中,而有一个技能引起了我们的注意:**“Caveman”**。它的宣传语最好用其自身的“方言”来描述: > 技能让智能体像穴居人说话。为啥用多 token 当少能办事。废话死。代码、命令保持字节精确。节省 65% 输出 token。每次回复。永远。兼容 30+ 智能体。很多 GitHub star。 我们认为: > 宣称很廉价。验证很昂贵。智能体不是聊天窗口。智能体输出主要是工具调用、文件编辑、代码:该技能承诺不碰这些东西。所以我们测量了 README 没有测量的两件事:多步智能体工作上的真实节省量,以及压缩智能体的“出声思考”是否会影响任务结果。 ## 测试设置 **测试框架**Harbor 0.17:Docker 沙箱化试验、任务级验证器、配对运行。**智能体**Claude Code 2.1.200,无头模式,`bypassPermissions`。**模型**`claude-sonnet-5`,推理努力度 `low`(`--effort low`)。**基准**SkillsBench(`benchflow/skillsbench`):87 个任务中的 86 个。每个任务由其自身的测试在 0-1 量表上自动评分,1 表示解决,并允许部分得分。**A 组**`no-skill`:原版 Claude Code。**B 组**`with-skill-forced`:通过 Harbor `--skill` 安装 Caveman,外加一条指令行强制激活:“使用穴居人模式...”**配对**相同任务、相同模型、相同设置、每组相同预算;被排除的任务在两组中都不使用。**规模**3 次运行,约 240 个计费试验,总计约 106 美元。**为什么“强制”很重要:**Caveman 是用户激活的。它会在“穴居人模式”或“简短点”等短语上触发。我们在每次回复中都强制开启它,这意味着下面每个数字都是该技能的最佳情况。在正常使用中,智能体必须自行决定是否激活,实际节省量只能等于或低于这里测得的约 10% 上限。 ## 发现 1:节省量大约是 8.5%,而不是 65% 宣称的节省来自聊天式散文回答。智能体的输出不同:代码、diff、工具调用和精确错误字符串主导了 token 流,而 Caveman 正确地保留了所有这些内容逐字不变。只有工具调用之间的叙述被压缩,而这类内容并不多。 输出 token 节省量 vs. 基线smoke: 10 个任务, k=1re-run: 10 个任务, k=3full: 86 个任务, k=1-29.5%-6.7%-8.5%小样本噪音标题结果,82 个干净配对宣称 -65%三次运行中强制 Caveman 组的输出 token 节省量。第一次小规模运行中令人瞩目的 -29.5% 没有重现;在更大规模下,节省量收敛到 -8.5%(在 82 个配对任务中,输出 token 从 592k 减至 542k)。宣称的 -65% 在图表之外。 ## 发现 2:没有可检测到的质量下降 我们真正关心的问题:让智能体更简洁会让它更差吗?在完整运行中的 82 个配对任务上,答案是否定的:两组的统计结果无法区分。 每任务配对结果86 个平局10 个技能得分更高64 个两组得分相同8 个技能得分更低完整运行的每任务配对结果。对 18 个非平局做符号检验:p = 0.82,远未达到任何显著差异。基线的平均任务得分为 0.326,而技能组为 0.311,在 0-1 量表上差距为 -0.015。每次运行的平均任务得分no-skillwith-skill-forced0.50.2500.380.250.450.390.330.31smoke: k=110 个任务: k=386 个任务: k=1看起来像是回退差距缩小统计上持平各组的平均任务得分。早期令人担忧的差距随着样本量增大而缩小:这是噪音的规律,而非真实效应。在两组中,单个任务在重复尝试时都会自由地在通过和失败之间翻转。风格迁移本身完全按设计工作:强制组的对话记录明显是穴居人风格,而代码工件保持不变且正常。 ## 发现 3:成本节省是真实的,但很脆弱 成本大致跟随约 8.5% 的 token 节省量,因此技能组应该大约便宜 10%,按任务来看确实如此。但我们在完整运行中的原始组总和显示,技能组反而贵了 11.6%:40.60 美元对 36.39 美元。整个反转来自单个试验:在技能组中,一个依赖审计任务膨胀超过了 200k 长上下文定价层级,计费 **8.29 美元对 0.33 美元**。在之前的一次运行中,同一任务在基线组中抛出了一个 3.25 美元的离群值。这是任务本身的属性,而不是技能的。 ## 结论 **安全、对风格诚实、在节省量上过度宣传。**强制开启时,Caveman 可靠地改变智能体的说话方式,而不会对智能体产出的内容造成任何可测量的损害:82 个配对任务,符号检验 p = 0.82。但在真实智能体工作上,它最多剪掉约 8.5% 的输出 token 和约 10% 的成本,因为主导智能体会话的 token 是代码和工具调用,而该技能刻意保留这些。宣称的 65% 属于聊天式问答,而非编码智能体。 **建议:**如果你喜欢,就用它。它很有趣,而且在质量上不会让你付出任何可测量的代价。只是别指望在日常智能体任务上获得巨大节省:高个位数百分比才是现实的上限。 - **质量:**无可检测的下降:8 个任务更好,10 个更差,64 个持平;平均任务得分在 0-1 量表上相差 0.015(p = 0.82)。 - **Token:**强制激活时输出 token 为 -8.5%,这意味着这是上限;自动触发的使用节省更少或没有。 - **成本:**期望上大约 -10%,但经常被单次试验的方差抹掉。 - **方法论附加收获:**我们的第一次 10 任务运行“显示”了 -30% 的 token 节省。随着样本量增大,它消失了。永远不要相信 k=1 的评测。 想让我们测试下一个技能?在评论区留下名字。几个字就够了。我们来测。 *运行详情:Harbor 0.17;`claude-sonnet-5`,推理努力度 low;SkillsBench 86/87 任务;约 240 次试验;总花费约 106 美元。* #### 订阅 JetBrains AI 博客更新 https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens/# ## 发现更多

相似文章

JuliusBrussee/caveman

GitHub Trending (daily)

一个针对AI编码智能体的技能/插件,通过让智能体以简洁的“原始人”风格进行交流,同时保持技术准确性,将输出令牌减少约75%。支持多个压缩级别和多种智能体平台。

公司让Claude和Codex像穴居人一样说话,以遏制AI成本飙升

Reddit r/ArtificialInteligence

公司正在采用一款名为“Caveman”的插件,强制Claude和Codex等AI模型使用简短的穴居人式语言,以减少令牌消耗并遏制不断飙升的AI成本。该工具可将输出令牌削减高达75%,目前已被OpenAI、Nvidia、GitHub和Legrand的员工使用。