@AstroHanRay: 我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比: - 性能:无回退(甚至略有提升 +2.48pp) - Token 消耗:减少 41.7…
摘要
针对Agent工具裁剪(active tool prune)的A/B测试显示:在121组Terminal Bench任务中性能略有提升(+2.48个百分点),Token消耗减少41.7%,成本降低31.6%。
查看缓存全文
缓存时间: 2026/06/28 22:07
我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比:
- 性能:无回退(甚至略有提升 +2.48pp)
- Token 消耗:减少 41.7%
- 成本:降低 31.6%
kabikabi (@jakevin7): 做 Agent 有个不成文的默认假设:tool result 很重要,模型要看完原文才能继续推理。
最近发现这个假设可能是错的。
https://t.co/3wF7yrD3ES 欢迎 star
在 maka 里,我们对 tool result 做了激进的
相似文章
@yibie: 推荐这篇硬核实测。一个工程师用了一周追踪自己的 coding agent session,发现任务本身只消耗了 0.67% 的 token——其余 99% 全花在搬运工具目录、skill 描述和系统 prompt 上。工作对开销比 1:1…
An engineer tracked his coding agent's token usage over a week, finding that only 0.67% of tokens were spent on actual tasks, with 99% consumed by tool directories, skill descriptions, and system prompts. He provides optimization strategies, including shell output filtering which saved 46.9% of tokens.
TUA-Bench: 通用终端使用代理的基准测试
TUA-Bench是一个综合性基准测试,用于评估通用终端使用代理在各种数字活动和专业工作流中的表现,揭示了当前前沿代理之间的显著性能差距。
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
我在一个真实站点上对我的浏览器代理与 Browser Use 进行了基准测试(150次验证运行,同一模型)。发送页面差异而非完整重渲染,使得令牌增长减少了37%。
一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。
GTA-2:从原子工具使用到开放式工作流的通用工具Agent基准测试
GTA-2 引入了一个分层基准,用于评估通用工具Agent在原子工具使用和开放式工作流中的表现,揭示了显著的能力鸿沟:前沿模型在复杂任务上仅取得14.39%的成功率,尽管在原子任务上表现尚可。