CalibratedRubric:面向开放式LLM评估的任务自适应评分标准库
摘要
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
arXiv:2607.29252v1 公告类型:新
摘要:可靠的开放式LLM输出评估需要细粒度的评分标准,但专家人工筛选成本高昂且难以扩展。现有自动化流程依赖严格的评判一致性和二元方差过滤,无法区分可测量的评分标准与信息性评分标准。我们提出CalibratedRubric,一个任务自适应框架,结合了类型特定评分、贝叶斯评分标准可测量性过滤以及基于项目反应理论(IRT)的评分标准库组装。CalibratedRubric通过Beta-Bernoulli一致性后验估计每个评分标准的可测量性,并使用子模信息覆盖目标在观测能力范围内构建紧凑的评分标准库。在金融、医疗、通用和法律基准上,可测量性过滤将JudgmentBench上的人类-金标准一致性从κ=0.604提高到0.743。基于IRT的贪心选择在所有六个评估响应块上比随机选择提高了交叉拟合的排序保真度,并且在FinResearchBench决策支持任务上仅需49个而非131个评分标准即可达到目标相关性。任务标签扰动进一步降低了系统分离度,证实了任务自适应评分的实际相关性。这些结果支持CalibratedRubric作为开放式LLM评估的一种高效、不确定性感知方法,其校准收益取决于足够的评判冗余。
查看缓存全文
缓存时间: 2026/08/03 07:36
# CalibratedRubric:面向开放式大语言模型评估的任务自适应评分标准库 来源:https://arxiv.org/html/2607.29252 Mengting Chen1,Yanshu Sun1,Wanting Liang1,Beidi Luan2,Rui Sun2,Dezhi Chen1,Jing Li2,Zuo Bai2,1(通讯作者) ###### 摘要 对开放式 LLM 输出的可靠评估需要细粒度的评分标准,但专家编写成本高昂且难以扩展。现有自动化流水线依赖严格的评审一致性和二值方差过滤,无法区分可度量的评分标准与信息量丰富的评分标准。我们提出 *CalibratedRubric*,一个任务自适应框架,结合了类型特定评分、贝叶斯评分标准可度量性过滤,以及基于项目反应理论(IRT)的标准库组装。CalibratedRubric 使用 Beta–Bernoulli 一致性后验估计每条评分标准的可度量性,并利用子模信息覆盖目标在观测到的能力范围内构建紧凑的评分标准库。在金融、医疗、通用和法律基准上,可度量性过滤将 JudgmentBench 上的人类金标一致性从 \(\kappa=0.604\) 提升到 \(0.743\)。基于 IRT 的贪心选择在所有六个被评估的响应块上相对于随机选择提高了交叉拟合排名保真度,并且在 FinResearchBench 决策支持任务上只需 49 条评分标准而非 131 条即可达到目标相关性。任务标签扰动进一步降低了系统区分度,证实了任务自适应评分的实际相关性。这些结果支持 CalibratedRubric 作为一种高效、不确定性感知的开放式 LLM 评估方法,其校准收益依赖于足够的评审冗余。 ## 1 引言 基于 LLM 的自主智能体越来越多地采用解耦的、面向服务的设计,具有专门的记忆、检索增强生成(RAG)和工具使用层,从而能够在较长的交互周期内生成长文输出(Wang et al.2024a (https://arxiv.org/html/2607.29252#bib.bib28); Xi et al.2025 (https://arxiv.org/html/2607.29252#bib.bib31))。这种转变使得传统的自动评估指标不再适用:词汇重叠度量(如 BLEU 和 ROUGE)以及基于嵌入的度量(如 BERTScore)是为相对较短、有参考答案约束的输出而设计的,在合成的金融研究报告等开放式交付物上与专家判断的相关性较弱(Papineni et al.2002 (https://arxiv.org/html/2607.29252#bib.bib22); Lin2004 (https://arxiv.org/html/2607.29252#bib.bib15); Zhang et al.2020 (https://arxiv.org/html/2607.29252#bib.bib35))。LLM-as-a-Judge 范式提供了一种可扩展的替代方案,但整体分数混淆了不同的质量维度,并且仍然容易受到长度、位置和自我偏好偏差的影响(Li et al.2024 (https://arxiv.org/html/2607.29252#bib.bib13); Zheng et al.2023 (https://arxiv.org/html/2607.29252#bib.bib36); Liu et al.2023 (https://arxiv.org/html/2607.29252#bib.bib17); Wang et al.2024b (https://arxiv.org/html/2607.29252#bib.bib29))。因此,分析型评估器将质量分解为技能级、评分标准条件化、多维校准、协作对齐或原子式检查表判断(Ye et al.2024 (https://arxiv.org/html/2607.29252#bib.bib33); Kim et al.2024 (https://arxiv.org/html/2607.29252#bib.bib10); Hashemi et al.2024 (https://arxiv.org/html/2607.29252#bib.bib8); Chiang et al.2026 (https://arxiv.org/html/2607.29252#bib.bib5); Cook et al.2024 (https://arxiv.org/html/2607.29252#bib.bib6))。 当前分析型评估器面临两个结构性瓶颈。首先,可靠的评分标准编写仍然严重依赖稀缺的领域专业知识。例如,按照专业考试标准构建金融基准需要专家起草、完善和验证标准,这使得标注难以扩展(Liu et al.2026 (https://arxiv.org/html/2607.29252#bib.bib16))。其次,自动化方法可以合成实例特定的标准(Wang and Blanco2026 (https://arxiv.org/html/2607.29252#bib.bib30); Jia et al.2026 (https://arxiv.org/html/2607.29252#bib.bib9); Li et al.2026 (https://arxiv.org/html/2607.29252#bib.bib14)),但评估项的信息量差异很大(Rodriguez et al.2021 (https://arxiv.org/html/2607.29252#bib.bib24)),而可靠的筛选在很大程度上仍是启发式的。先前的工作使用 IRT 来构建 NLP 评估量表、比较测试集并精简基准(Lalor, Wu, and Yu2016 (https://arxiv.org/html/2607.29252#bib.bib11); Vania et al.2021 (https://arxiv.org/html/2607.29252#bib.bib27); Maia Polo et al.2024 (https://arxiv.org/html/2607.29252#bib.bib20));我们则把 IRT 嵌入评分标准构建过程内部,并使用项目信息函数在相关能力范围内选择标准(Birnbaum1968 (https://arxiv.org/html/2607.29252#bib.bib3); Lord1980 (https://arxiv.org/html/2607.29252#bib.bib18); Baker2001 (https://arxiv.org/html/2607.29252#bib.bib2))。我们扩展的共识派生流水线只保留所有评审都同意的评分标准,并应用二值方差过滤(Luan et al.2026 (https://arxiv.org/html/2607.29252#bib.bib19))。这有利于可复现性,但将评审视为同等可靠,将标准视为同等信息量。二值过滤只会移除完全恒定的标准,无法量化剩余标准能在多大程度上区分系统。 我们提出 *CalibratedRubric*,用任务自适应、概率化校准的评估取代固定的确定性流水线。任务类型化前端将每个查询映射到一种认知任务类型——证据推理、决策支持、高风险约束或发散性创作——并分配相应的评分标准形式和聚合规则。贝叶斯校准模块将评审特定的宽松度和可靠性建模为潜在参数,用由少量人类标注子集锚定的稳健后验共识取代严格的全体一致。最后,我们将项目反应理论(IRT)嵌入评分标准构建:候选评分标准被视为项目,项目信息函数(IIF)选择在相关能力范围内信息量最大化的标准(Birnbaum1968 (https://arxiv.org/html/2607.29252#bib.bib3); Lord1980 (https://arxiv.org/html/2607.29252#bib.bib18); Baker2001 (https://arxiv.org/html/2607.29252#bib.bib2))。 我们的贡献有四个方面:(1)我们引入了一个任务自适应分类体系,根据认知需求动态选择评分标准形式和评分规则。(2)我们将 IRT 和 IIF 作为信息最大化的评分标准选择机制,产生带有校准置信区间的系统能力估计。(3)我们开发了一种贝叶斯评审校准程序,对偏差和可靠性进行建模,建立稳健的后验共识。(4)在通用和专业领域,我们证明了该框架保持人类专家对齐
相似文章
LLM能否生成可靠的评分标准?实验复现的元评估
本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。
金融服务业LLM评估的元基准
本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。
ARES:可扩展LLM强化学习的自动评估标准合成
ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。