重放差距:LLM智能体中模型切换的静态评估打分于错误的世界

arXiv cs.LG 论文

摘要

本文证明,基于重放的LLM智能体模型切换静态评估存在根本缺陷:在轨迹中途更换模型时,环境与后续动作会与记录的轨迹产生巨大偏差,从而使大多数基准测试结果失效。作者提出分支展开(branching rollouts)作为一种更忠实的评估方法,并公开了其测试框架与轨迹数据。

arXiv:2608.08239v1 公告类型:新论文 \n摘要:LLM路由器通过将每个请求匹配到最便宜且足够胜任的模型来提升效率,并越来越多地在多步智能体的每一步中使用。然而,智能体路由器的评估方式却与单轮路由器相同:通过重放记录的轨迹并替换另一模型的记录输出来进行,假设轨迹其余部分不受影响。我们通过分支展开来检验这一假设:在受控点分叉活跃的SWE-bench智能体轨迹,重建环境,用不同模型继续每个分叉,并与隔离采样和重放噪声的同模型对照分叉进行比较。在六组成对运行(约900次展开)中,模型交换超出其匹配对照基线的幅度为+0.25至+0.66归一化编辑距离(多重性校正置信区间排除零),重写了分叉后61-94%的动作;74-77%的早期交换在分叉后第一个动作即发生分歧,而对照组仅为6-35%,使得仅3%的重放状态仍然有效。分歧程度随分叉深度增加而在两个方向上减小。我们观察到的所有五次结果翻转均发生在交换组中——升级模型挽救未解决实例,而降级模型丢失唯一的解决方案——而359个对照分叉中则无一发生。使用日志拼接重放评估器对相同交换进行评分时,重放对所有与成功相关的结果调用均预测错误,且预测的补丁与实际情况的相似度为0.00-0.11。对噪声底限的审计显示,温度0的“确定性”依赖于配置:FP8服务的对照在90%以上的分叉上产生分歧,而AWQ服务的对照则保持近乎一致;在严格预算下,更强的模型更常耗尽步数而未提交。基于重放的基准测试在智能体路由中评估了错误的世界;我们公开了测试框架及所有轨迹。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:10

Source: https://arxiv.org/html/2608.08239

###### 摘要

LLM 路由器承诺通过把每个请求匹配到满足要求的最便宜模型来提升效率,并且正越来越多地被应用在多步智能体的*每一步*内部。然而,智能体路由器的评估方式却与单轮路由器一样:重放已记录的轨迹,并用另一个模型的已记录输出来替换其中某一步的输出,同时假设轨迹其余部分不受影响。我们用*分支式 rollout* 检验这一假设:在受控的时间点分叉实时的 SWE-bench 智能体轨迹,重建环境,用不同模型继续推进每个分叉,并与同模型控制分叉进行比较,从而隔离采样和重放噪声。在六组成对运行(约 900 次 rollout)中,模型交换超过其匹配控制下限达 +0.25 到 +0.66 的归一化编辑距离(多重性校正置信区间排除零),重写了分叉后 61–94% 的动作;74–77% 的早期交换在分叉后的*第一个*动作上就发生分歧,而控制组只有 6–35%——最终只剩下 3% 的重放状态是有效的。分歧在两个方向上均随分叉深度递减。我们观察到的全部五次结果翻转都发生在交换臂中——升级挽救了未解决的实例,一次降级丢失了唯一的解法——而在 359 个控制分叉中,结果翻转为零。用日志拼接重放评估器对同样的固定切换策略进行评分——这也正是这种评估器会使用的种子匹配日志数据——重放错误预测了每一个与成功相关的结果调用,其预测补丁与真实结果的相似度仅为 0.00–0.11。对噪声底进行审计后发现,温度 0 的“确定性”取决于配置:FP8 服务的控制在超过 90% 的分叉上发生分歧,而 AWQ 服务的控制则保持近乎一致;并且,在预算紧张的情况下,*更强*的模型反而更常在没有提交的情况下耗尽步骤。基于重放的基准在智能体路由问题上评分的是错误的世界;我们发布了我们的测试框架和所有轨迹。

## 1 引言

模型路由已经从研究原型变成了基础设施。在每次查询时从异构 LLM 中选择模型的路由器支撑着商业产品和开源框架([Ong et al., 2024](https://arxiv.org/html/2608.08239#bib.bib16);[Chen et al., 2023](https://arxiv.org/html/2608.08239#bib.bib3);[Hu et al., 2024](https://arxiv.org/html/2608.08239#bib.bib5)),而且一条快速增长的研究路线正在把路由决策推进到多步智能体*内部*:在软件工程、工具使用或计算机使用的轨迹中,为每一步选择一个模型([Liu et al., 2026](https://arxiv.org/html/2608.08239#bib.bib13);[Agarwal et al., 2026](https://arxiv.org/html/2608.08239#bib.bib1);[Wei et al., 2026](https://arxiv.org/html/2608.08239#bib.bib20)),或者在预算约束下联合选择模型和推理策略([Pan et al., 2025](https://arxiv.org/html/2608.08239#bib.bib17))。

这些工作几乎全部是在*记录的*模型输出上进行评估。基准测试会一次性收集每个候选模型对每个查询的回答;然后通过查找路由器原本会选中的答案来给路由器评分([Hu et al., 2024](https://arxiv.org/html/2608.08239#bib.bib5);[Huang et al., 2025](https://arxiv.org/html/2608.08239#bib.bib6);[Lu et al., 2025](https://arxiv.org/html/2608.08239#bib.bib14))。对于单轮查询,这是合理的:查询不依赖于路由器的选择。但对于智能体则不然。智能体在步骤 k 的动作决定了步骤 k+1 的观察;轨迹是穿过环境的闭环。重放评估默默假设了一个开环——即如果路由器在步骤 k 替换成模型 B,模型 A 记录轨迹的其余部分仍然会发生。

这个假设错得有多离谱?轨迹*会*发生分歧并不令人惊讶——智能体是闭环,分歧才是零假设。路由研究需要、但还没有人测量过的,是分歧的*幅度和结构*:它有多快,比服务栈自身的噪声底高出多少,它如何依赖于交换的方向和位置,以及它是否会影响到最终结果。测量这一点需要*分支式实时 rollout*——在决策点实际分叉轨迹,并在各自独立的环境中把每个候选继续推进下去——这比重放昂贵得多。本文支付了这笔成本,并报告重放所隐藏的东西。

#### 贡献。

1. 1\. 方法。一套用于对逐步模型切换进行反事实评估的分支式 rollout 协议(以及开源测试框架):在步骤 k 处分支一条实时轨迹,在新的容器中重新执行动作前缀(具有记录的日志重放保真度),植入消息历史,然后用不同模型继续——总是与一个*同模型控制分支*配对,以隔离采样和环境重放噪声(§3)。
2. 2\. 量化重放差距。在 SWE-bench Verified([Jimenez et al., 2024](https://arxiv.org/html/2608.08239#bib.bib8))上,跨两个交换方向、两个分支位置和三个难度/提示层级(约 900 次 rollout):交换重写了分叉后 61–94% 的动作,超过匹配控制达 +0.25 到 +0.66 的配对编辑距离(95% 置信区间排除零;[表 1](https://arxiv.org/html/2608.08239#S4.T1)、[附录 A](https://arxiv.org/html/2608.08239#A1));74–77% 的早期交换在分叉后的第一个动作就发生分歧,只留下 3–8% 的重放状态有效(§4)。所有五次观察到的结果翻转都发生在交换臂中;359 个控制分叉中为零。用日志拼接重放评估器对相同的固定切换策略进行评分——正是这种评估器会使用的种子匹配日志数据——重放错误预测了每一个与成功相关的结果,其预测补丁与真实产生的补丁近乎正交(§4.5)。
3. 3\. 具有路由启示的结构性发现。分歧在双向都随分叉深度递减;升级会立即产生分歧,而较晚的降级则接近控制行为;我们还观察到,较强的模型在紧凑的步骤预算下比弱模型更常耗尽步骤而不提交——这可能是一种*彻底性税(thoroughness tax)*,预算感知的路由器可能需要为其定价(§4.3)。
4. 4\. 对“确定性”评估的审计。在温度 0 下,我们的 AWQ 服务 14B 模型的控制分支保持近乎一致(编辑距离 0.16–0.23;一半从未分歧),而我们的 FP8 服务 4B 模型在相同设置下的控制分支在 90–96% 的分叉上发生分歧(编辑距离 0.49–0.67)——因此即使在同模型重放下,某些服务栈也是不可靠的。我们还记录了朴素的补丁级指标如何因空对空比较而虚高,并报告了按子集限定的数字(§4.4)。

## 2 相关工作

#### 路由及其基准。

成本-质量路由涵盖级联([Chen et al., 2023](https://arxiv.org/html/2608.08239#bib.bib3);[Aggarwal et al., 2024](https://arxiv.org/html/2608.08239#bib.bib2))、学习式逐查询路由器([Ong et al., 2024](https://arxiv.org/html/2608.08239#bib.bib16);[Ding et al., 2024](https://arxiv.org/html/2608.08239#bib.bib4))、RL 训练的路由器([Zhang et al., 2025](https://arxiv.org/html/2608.08239#bib.bib23))以及面向未见模型的路由([Jitkrittum et al., 2025](https://arxiv.org/html/2608.08239#bib.bib9))。评估基础设施——RouterBench([Hu et al., 2024](https://arxiv.org/html/2608.08239#bib.bib5))、RouterEval([Huang et al., 2025](https://arxiv.org/html/2608.08239#bib.bib6))、RouterArena([Lu et al., 2025](https://arxiv.org/html/2608.08239#bib.bib14))、RouteJudge([Lai et al., 2026](https://arxiv.org/html/2608.08239#bib.bib11))——根据预先收集的结果对路由器进行评分。我们的结果并不质疑这些设计在单轮路由中的有效性;我们只是表明它们不能迁移到智能体场景。

#### 智能体路由与逐步路由。

会话级和步骤级路由已经被部署在服务栈中([Liu et al., 2026](https://arxiv.org/html/2608.08239#bib.bib13)),并被研究用于工具调用和计算机使用智能体([Agarwal et al., 2026](https://arxiv.org/html/2608.08239#bib.bib1);[Wei et al., 2026](https://arxiv.org/html/2608.08239#bib.bib20));TwinRouterBench([Yang et al., 2026](https://arxiv.org/html/2608.08239#bib.bib22))用静态和“实时动态”评估来测试智能体路由器,其中*动态*指的是模型可用性和价格的变化——我们研究的反事实轨迹问题被明确留作开放问题。模型和推理预算的联合选择([Pan et al., 2025](https://arxiv.org/html/2608.08239#bib.bib17);[Ma et al., 2026](https://arxiv.org/html/2608.08239#bib.bib15))在按步骤应用时也继承了同样的评估缺口。

#### 离线策略评估。

强化学习形式化地刻画了我们所测量的失败模式:*行为*策略生成记录轨迹,*目标*策略(这里指路由器的切换)会诱发不同的状态分布,而朴素重放是一种完全忽略这种偏移的退化估计器。标准的修正方法可以直接沿用:逐决策重要性采样([Precup et al., 2000](https://arxiv.org/html/2608.08239#bib.bib18))用目标/行为动作概率之比对记录的回报进行加权;加权和双重稳健变体([Jiang & Li, 2016](https://arxiv.org/html/2608.08239#bib.bib7);[Thomas & Brunskill, 2016](https://arxiv.org/html/2608.08239#bib.bib19))通过将重加权与学习到的价值模型结合,来在偏差和方差之间取舍。将它们应用于智能体路由会带来两个障碍,而我们的数据正好说明了这两点。第一,视野长度:在超过 50 步的轨迹中,逐步比值的乘积会使有效样本量崩溃,这正是已知重要性采样会退化的场景——而我们测量到的分歧(早期升级在分叉后第一个动作就发生分歧)说明这些比值从一开始就远不是 1。第二,支撑集:LLM 策略的动作空间是无界文本,所以行为策略对大多数目标动作赋予的概率趋近于零,违反了这些估计器所需的覆盖假设。这使得分支式真实值(ground truth)的价值超越了测量本身——它是*验证*人们采用任何估计器的唯一途径。我们在此报告这一差距,并把估计器设计留给未来工作。

#### LLM 服务中的非确定性。

在服务社区中,温度 0 下由批处理和内核引起的非确定性

相似文章

超越静态排行榜:LLM智能体评估的预测有效性

Hugging Face Daily Papers

本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。

评估智能体非常困难

Reddit r/AI_Agents

本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。

预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择

arXiv cs.LG

本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。