不值得再花一个Token:高效深度研究智能体的边际价值估计
摘要
本文对长时程深度研究智能体中减少Token使用和延迟的剪枝策略进行了系统性研究,表明早期剪枝能带来最大的效率提升,且质量损失很小。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - 再花一个 Token 不值:高效深度研究智能体的边际价值估计
来源:https://huggingface.co/papers/2608.08389
摘要
在不同流水线阶段应用的剪枝策略可减少长周期研究智能体的 token 使用量和延迟,其中早期剪枝带来的效率提升最大。
长周期研究智能体通过迭代检索、聚合和综合来解决开放式任务,但上下文增长迅速,而额外证据的边际价值往往下降。这会导致不必要的 token 成本、更高的延迟,以及最终报告生成的输入噪声增加。我们研究了边际价值估计在深度研究智能体上下文管理中的应用,并首次对流水线中的剪枝策略进行了系统的阶段感知比较。我们评估了轻量级启发式标准和学习价值模型在检索前、检索后和综合前阶段的表现。我们的结果表明,剪枝的有效性更多地取决于剪枝的应用位置,而非具体的评分规则:早期剪枝能带来最大的端到端节省,而后期剪枝主要优化最终的综合上下文。轻量级启发式方法可减少高达 73% 的 token 使用量,且质量损失很小;学习式剪枝在选定的权衡上仍具竞争力;没有单一方法能在质量、效率和忠实度方面全面占优。这些发现为设计高效的长周期智能体系统提供了实用指导。
查看 arXiv 页面 (https://arxiv.org/abs/2608.08389) 查看 PDF (https://arxiv.org/pdf/2608.08389) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08389)
在您的智能体中获取此论文:
hf papers read 2608\.08389
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.08389 即可从此页面链接到该模型。
引用此论文的数据集 0
暂无链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.08389 即可从此页面链接到该数据集。
引用此论文的 Space 0
暂无链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.08389 即可从此页面链接到该 Space。
包含此论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。
相似文章
子代理在长代理运行中占据大部分Token成本:实际可将使用量降低70%至90%的修复方法
本文分析了 Bai 等人 2026 年的论文,该论文表明,子代理和上下文膨胀导致长代理运行中的Token成本比普通聊天高出约1000倍,并提出了三种实用的修复方法(PLAN.md、读取预算、带外备注),可将Token使用量减少70-90%。
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…
本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。
并非所有Token都同等重要:通过强化学习中的Token重要性实现高效LLM推理
本文提出了一个强化学习框架,通过建模Token重要性来选择性地对不重要的Token进行惩罚,同时保留关键推理步骤,采用重要性感知奖励和动态长度奖励来减少冗余,在不牺牲准确性的前提下提高效率。
记住,不要重读:用于令牌高效自主实验的有状态ReAct智能体
本文提出使用LangGraph中的有状态ReAct智能体取代无状态自动研究模式,将每次迭代的令牌成本从O(n)降低至O(1),在超参数调优和代码优化基准测试中实现了52-90%的令牌减少。