交接税:在LLM智能体中延续非原生轨迹

Hugging Face Daily Papers 论文

摘要

本文研究了在低成本和高成本LLM模型之间交接任务时的成本质量权衡,引入了'交接税'概念,即在升级时进行全轨迹传递会导致质量恢复不佳并伴随成本溢价。

编码智能体执行长时间运行的任务,涉及多次模型调用、工具使用和代码编辑。随着这些运行的展开,用户面临实际的成本质量权衡:当较便宜的模型遇到困难时升级到更强大的模型,或在复杂推理完成后降级。每次切换都需要接收方继续由另一个模型产生的非原生轨迹。我们研究这种交接如何影响质量和成本,以及改变接收方继承的轨迹信息如何改变结果。使用来自Claude和GPT系列的低成本、低能力(LC)和高成本、高能力(HC)模型对,我们改变交接方向、时机和接口,比较全轨迹传递、压缩和轨迹移除,同时保持仓库状态。在两个模型系列中,全轨迹升级恢复的LC到HC质量差距不到一半,同时产生显著的成本溢价。我们将这种成本质量惩罚称为交接税。相比之下,降级提供了一个有利的成本质量点。有趣的是,首选接口也随方向反转:减少LC模型轨迹信息可提高升级质量,而移除HC模型轨迹会降低降级质量。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:17

论文页面 - 交接代价:在LLM智能体中延续非原生轨迹

来源:https://huggingface.co/papers/2608.24358

摘要

编码智能体执行的任务涉及数十次模型调用、工具使用和代码编辑,运行时间较长。在这些运行过程中,用户面临一个实际的成本-质量权衡:当廉价模型运行困难时切换到更强大的模型,或在复杂推理完成后降级到更经济的模型。每次切换都需要接收模型延续由另一个模型生成的非原生轨迹。我们研究了这种交接如何影响质量和成本,以及改变接收模型继承的轨迹信息如何影响结果。使用Claude和GPT系列中的低成本低能力与高成本高能力模型对,我们变化了交接方向、时机和接口,比较了完整轨迹转移、轨迹压缩以及保留仓库状态但移除轨迹的方法。在两个模型系列中,完整的轨迹升级只能恢复不到一半的从低成本到高质量的差距,同时伴随着显著的成本溢价。我们将这种成本-质量惩罚称为交接代价。相比之下,降级则提供了有利的成本-质量平衡点。有趣的是,首选接口也随方向改变:减少低成本模型的轨迹信息可以提高升级质量,而移除高成本模型的轨迹则会降低降级质量。

查看arXiv页面 (https://arxiv.org/abs/2608.24358)查看PDF (https://arxiv.org/pdf/2608.24358)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24358)

在你的智能体中获取这篇论文: hf papers read 2608\.24358 没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文 在模型README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。

引用此论文的数据集0

无数据集链接此论文 在数据集README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。

引用此论文的Spaces0

无Space链接此论文 在Space README.md中引用 arxiv.org/abs/2608.24358 以从本页面链接。

包含此论文的收藏0

无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题

X AI KOLs Timeline

一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。

并非所有Token都平等:面向代理型LLM系统的通胀感知路由

arXiv cs.CL

本文介绍了InflationAgent,这是一个为代理型LLM设计的路由系统,它能测量Token通胀,使用思维链分支熵(CoT Branching Entropy)预测任务难度,并优化模型选择以最大化成本精度比,在如GSM8K等基准测试中,以更少的Token实现更高的准确率。