@AstroHanRay: 我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比: - 性能:无回退(甚至略有提升 +2.48pp) - Token 消耗:减少 41.7…

X AI KOLs Following 工具

摘要

针对Agent工具裁剪(active tool prune)的A/B测试显示:在121组Terminal Bench任务中性能略有提升(+2.48个百分点),Token消耗减少41.7%,成本降低31.6%。

我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比: - 性能:无回退(甚至略有提升 +2.48pp) - Token 消耗:减少 41.7% - 成本:降低 31.6%
查看原文
查看缓存全文

缓存时间: 2026/06/28 22:07

我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比:

  • 性能:无回退(甚至略有提升 +2.48pp)
  • Token 消耗:减少 41.7%
  • 成本:降低 31.6%

kabikabi (@jakevin7): 做 Agent 有个不成文的默认假设:tool result 很重要,模型要看完原文才能继续推理。

最近发现这个假设可能是错的。


https://t.co/3wF7yrD3ES 欢迎 star

在 maka 里,我们对 tool result 做了激进的

相似文章

@yibie: 推荐这篇硬核实测。一个工程师用了一周追踪自己的 coding agent session,发现任务本身只消耗了 0.67% 的 token——其余 99% 全花在搬运工具目录、skill 描述和系统 prompt 上。工作对开销比 1:1…

X AI KOLs Timeline

An engineer tracked his coding agent's token usage over a week, finding that only 0.67% of tokens were spent on actual tasks, with 99% consumed by tool directories, skill descriptions, and system prompts. He provides optimization strategies, including shell output filtering which saved 46.9% of tokens.

TUA-Bench: 通用终端使用代理的基准测试

Hugging Face Daily Papers

TUA-Bench是一个综合性基准测试,用于评估通用终端使用代理在各种数字活动和专业工作流中的表现,揭示了当前前沿代理之间的显著性能差距。