动态分配评估努力以进行模型排名

arXiv cs.CL 论文

摘要

本文将多模型人类评估形式化为多臂老虎机设置中的最佳臂识别问题,自适应地分配标注努力以聚焦于有竞争力的模型,并提高排名区分度。

arXiv:2608.03437v1 公告类型:新 摘要:尽管人工评估在许多NLP任务中是黄金标准,但它存在成本高昂和可扩展性差的问题。在识别表现最佳的模型时,典型的评估协议会浪费精力,对整个基准上的所有模型进行全面评估,这是一种安全但低效的方法。在这项工作中,我们将多模型人工评估形式化为一个多臂老虎机设置中带有相关臂的最佳臂识别问题,其中拉动一个臂对应于对模型进行人工评估。通过根据迄今为止样本上获得的中间模型排名进行自适应采样,我们可以将标注预算集中在最具竞争力的模型上。我们证明了所提出算法的最优性,并表明它提高了表现最佳模型之间的区分度。这使得评估更快、更便宜,并且更符合大规模竞赛评估的目标。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:45

# 动态分配评估工作量以进行模型排名
来源:https://arxiv.org/abs/2608.03437
查看 PDF (https://arxiv.org/pdf/2608.03437)

> 摘要:尽管人工评估在许多 NLP 任务中是黄金标准,但它存在成本高昂且可扩展性差的弊端。在识别表现最佳的模型时,典型的评估协议会对所有模型在整个基准上进行穷尽式评估,从而浪费大量精力——这是一种安全但低效的方法。在本工作中,我们将多模型人工评估形式化为一种多臂老虎机设置下的最佳臂识别问题,其中各臂之间存在相关性,拉动一个臂即对应人工评估一个模型。通过根据到目前为止样本上获得的中间模型排名进行自适应采样,我们可以将标注预算集中在最具竞争力的模型上。我们证明了所提出算法的最优性,并表明它能提高对顶尖模型之间的区分度。这使得评估更快、更便宜,并且更符合大规模竞赛评估的目标。

## 提交历史

来自:Vilém Zouhar [查看邮箱 (https://arxiv.org/show-email/2afae83a/2608.03437)] **\[v1\]** 2026年8月4日星期二 10:33:04 UTC \(1,139 KB\)

相似文章

Skill-RM: 通过智能体技能统一异构评估标准

Hugging Face Daily Papers

Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。