交接税:在LLM智能体中延续非原生轨迹
摘要
本文研究了在低成本和高成本LLM模型之间交接任务时的成本质量权衡,引入了'交接税'概念,即在升级时进行全轨迹传递会导致质量恢复不佳并伴随成本溢价。
查看缓存全文
缓存时间: 2026/08/27 07:17
论文页面 - 交接代价:在LLM智能体中延续非原生轨迹
来源:https://huggingface.co/papers/2608.24358
摘要
编码智能体执行的任务涉及数十次模型调用、工具使用和代码编辑,运行时间较长。在这些运行过程中,用户面临一个实际的成本-质量权衡:当廉价模型运行困难时切换到更强大的模型,或在复杂推理完成后降级到更经济的模型。每次切换都需要接收模型延续由另一个模型生成的非原生轨迹。我们研究了这种交接如何影响质量和成本,以及改变接收模型继承的轨迹信息如何影响结果。使用Claude和GPT系列中的低成本低能力与高成本高能力模型对,我们变化了交接方向、时机和接口,比较了完整轨迹转移、轨迹压缩以及保留仓库状态但移除轨迹的方法。在两个模型系列中,完整的轨迹升级只能恢复不到一半的从低成本到高质量的差距,同时伴随着显著的成本溢价。我们将这种成本-质量惩罚称为交接代价。相比之下,降级则提供了有利的成本-质量平衡点。有趣的是,首选接口也随方向改变:减少低成本模型的轨迹信息可以提高升级质量,而移除高成本模型的轨迹则会降低降级质量。
查看arXiv页面 (https://arxiv.org/abs/2608.24358)查看PDF (https://arxiv.org/pdf/2608.24358)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24358)
在你的智能体中获取这篇论文:
hf papers read 2608\.24358
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文 在模型README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。
引用此论文的数据集0
无数据集链接此论文 在数据集README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。
引用此论文的Spaces0
无Space链接此论文 在Space README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。
包含此论文的收藏0
无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
协作税:大型语言模型多智能体系统协调的成本有多高
本文在大型语言模型多智能体系统中提出了协作税的概念,通过跨任务和模型的测量,揭示了可预测的机制和实际干预措施。
@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题
一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。
@_avichawla: 一个棘手的LLM面试题:你的代理把所有任务都跑在前沿LLM上,于是你加了一个路由层,将一些简单的调用发送到价格便宜15倍的LLM。
解释了在代理任务中,由于缓存预热问题,模型路由可能无法节省成本,并介绍了一种生产环境下的解决方案——模型亲和性(Model Affinity),以及开源代理Plano,从而实现真正的成本节约。
面向LLM赋能代理工作流的可靠设计:优化延迟-可靠性-成本权衡
本文分析了LLM赋能代理工作流中延迟、可靠性和成本之间的权衡,引入了性能模型,并推导出了如注水令牌分配等最优资源分配策略。
并非所有Token都平等:面向代理型LLM系统的通胀感知路由
本文介绍了InflationAgent,这是一个为代理型LLM设计的路由系统,它能测量Token通胀,使用思维链分支熵(CoT Branching Entropy)预测任务难度,并优化模型选择以最大化成本精度比,在如GSM8K等基准测试中,以更少的Token实现更高的准确率。