trajectory-divergence

标签

Cards List
#trajectory-divergence

重放差距:LLM智能体中模型切换的静态评估打分于错误的世界

arXiv cs.LG · 昨天 缓存

本文证明,基于重放的LLM智能体模型切换静态评估存在根本缺陷:在轨迹中途更换模型时,环境与后续动作会与记录的轨迹产生巨大偏差,从而使大多数基准测试结果失效。作者提出分支展开(branching rollouts)作为一种更忠实的评估方法,并公开了其测试框架与轨迹数据。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈