标签
本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。
本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。