标签
本文证明,基于重放的LLM智能体模型切换静态评估存在根本缺陷:在轨迹中途更换模型时,环境与后续动作会与记录的轨迹产生巨大偏差,从而使大多数基准测试结果失效。作者提出分支展开(branching rollouts)作为一种更忠实的评估方法,并公开了其测试框架与轨迹数据。