动态分配评估努力以进行模型排名
摘要
本文将多模型人类评估形式化为多臂老虎机设置中的最佳臂识别问题,自适应地分配标注努力以聚焦于有竞争力的模型,并提高排名区分度。
查看缓存全文
缓存时间: 2026/08/05 07:45
# 动态分配评估工作量以进行模型排名 来源:https://arxiv.org/abs/2608.03437 查看 PDF (https://arxiv.org/pdf/2608.03437) > 摘要:尽管人工评估在许多 NLP 任务中是黄金标准,但它存在成本高昂且可扩展性差的弊端。在识别表现最佳的模型时,典型的评估协议会对所有模型在整个基准上进行穷尽式评估,从而浪费大量精力——这是一种安全但低效的方法。在本工作中,我们将多模型人工评估形式化为一种多臂老虎机设置下的最佳臂识别问题,其中各臂之间存在相关性,拉动一个臂即对应人工评估一个模型。通过根据到目前为止样本上获得的中间模型排名进行自适应采样,我们可以将标注预算集中在最具竞争力的模型上。我们证明了所提出算法的最优性,并表明它能提高对顶尖模型之间的区分度。这使得评估更快、更便宜,并且更符合大规模竞赛评估的目标。 ## 提交历史 来自:Vilém Zouhar [查看邮箱 (https://arxiv.org/show-email/2afae83a/2608.03437)] **\[v1\]** 2026年8月4日星期二 10:33:04 UTC \(1,139 KB\)
相似文章
进化搜索中的计算分配:从深度-广度到多臂老虎机
本文研究了LLM引导的进化搜索中的计算分配问题,识别了经验规律,并提出了BaSE——一种多臂老虎机算法,该算法在多个模型和任务上提高了平均适应度和可靠性。
DualEval:面向统一LLM评估的联合模型-项目校准
介绍了DualEval框架,该框架联合校准模型能力与项目难度/锐度,以统一静态基准和竞技场式评估,从而实现更可靠的排名以及基准压缩和异常检测等下游应用。
基于智能体评估与稳定性感知排序的多模态大语言模型鲁棒检查点选择
本文解决了评估不确定性下多模态大语言模型的鲁棒检查点选择挑战,提出了一个多阶段框架,整合了精心策划的真实世界数据、基于LLM的判断以及带有置信度估计的排序协议。
Skill-RM: 通过智能体技能统一异构评估标准
Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。
Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
This paper formalizes LLM configuration evaluation as a cost-aware multi-objective bandit problem, proposing a hypervolume-based UCB algorithm for online configuration selection and a cost-aware gap elimination algorithm for Pareto identification, both with theoretical guarantees and empirical validation.