BACON:预算有限的人工校准与多AI评判的建模与评估
摘要
BACON提出了一个四阶段流水线,将预算有限的人工标签与多AI评判输出相结合,生成校准的项目级替代预测,支持总体估计和个体评分,提高了准确性并减少了偏差。
arXiv:2607.16239v1 公告类型:新
摘要:AI评判提供了一种可扩展、低成本的人工评估替代方案,但其输出可能相对于人类偏好存在偏差,且高度依赖项目,在不同评判者、任务和领域间存在差异。当未校准的AI评估被用于模型排名、项目评分或总体质量报告时,这些偏差可能直接扭曲下游决策。我们提出了BACON,一种四阶段流水线,将预算有限的人工校准与多AI评判输出相结合,以生成更准确的标注。BACON为每个项目构建全覆盖的辅助特征,包括多评判者分数、词级别不确定度统计和上下文嵌入。然后,它收集一个小型采样子集的人工标签,并训练一个交叉拟合结果模型,以生成校准的项目级替代预测。这些预测支持两种用途:使用增强型估计方程估计器进行总体层面的汇总指标(如均值或分位数)估计,并提供有效的置信区间;以及用于项目排名和标注的个体层面替代评分。BACON将AI评判视为辅助测量而非真值:人工标签提供校准锚点,而AI衍生信号提升效率。在多样化的任务、领域和标注预算下,BACON提高了预测准确性和排名一致性,并相比原始AI输出和纯人工标签方法减少了偏差和方差。这些结果表明,BACON为有限人工标注下的可扩展评估提供了一个实用且基于统计的框架。
查看缓存全文
缓存时间: 2026/07/21 06:47
# BACON:基于预算的人类校准,用于多AI评委的建模与评估
来源:https://arxiv.org/html/2607.16239
Anlan ZhangAdobe Research
Rita LyuUniversity of California, Berkeley
Zhengmian HuAdobe Research
Tong YuAdobe Research
David ArbourAdobe Research
Avi FellerUniversity of California, Berkeley
Saayan MitraAdobe Research
Ritwik SinhaAdobe Research
###### 摘要
AI 评委正越来越多地被用于降低人工评估的成本。虽然它们提供了一种可扩展且成本低廉的替代方案,但其输出可能相对于人类偏好存在偏差,并且高度依赖于具体项目,在不同评委、任务和领域之间存在显著差异。当从业者依赖未经校准的 AI 评估进行模型排名、项目评分或群体层面的质量报告时,系统性偏差可能会直接传播到下游决策中,导致结论不可靠。我们提出 BACON,一个四阶段流水线,将预算有限的人类校准与多个 AI 评委的输出相结合,以获得更准确的标注。BACON 首先为评估池中的每个项目构建全覆盖的辅助特征,包括多评委分数、词元级别的不确定性统计以及上下文嵌入。然后,它获取一个小的采样子集的人工标签,并训练一个交叉拟合的结果模型,以生成校准后的项目级替代预测。这些预测支持两种下游模式:第一种是群体层面摘要指标的估计,例如均值、分位数或其他目标量,使用增强估计方程估计器并附有有效的置信区间;第二种是用于项目评分和排名的个体层面替代评分。在整个过程中,BACON 将 AI 评委视为辅助测量而非真实真相:人工标签提供校准锚点,而 AI 衍生的信号则充当替代预测并提高效率。我们在多种任务和领域上验证了 BACON。在各种设置和标注预算下,交叉拟合的结果模型提高了预测准确性和排名一致性,而估计方程估计器相对于原始 AI 输出和纯人工标签方法减少了偏差和方差。这些结果表明,BACON 提供了一个实用的框架,可在有限的人工标注下进行可扩展且统计上有根据的评估。
## 1 引言
### 1.1 背景:AI 辅助评估中的偏差
许多重要决策依赖于大规模的人工评估:评判学生作文、给说服性文章打分、以及评估网站的美学性、可信度和易用性等。人工标签成本高昂,尤其是目标不仅是为单个项目评分,还要在固定预算下估计群体层面的摘要统计量(例如语料库的平均质量)时。使用生成式 AI 作为可扩展的评委已成为一种流行做法,为大型项目池提供低成本分数。然而,AI 评委的输出可能相对于人类偏好存在系统性偏差,并且其错误通常具有项目依赖性和模型特异性。下面,我们给出三个例子,表明这种不匹配现象跨任务和模态存在。
案例研究 1:使用 PERSUADE 数据集进行作文评分。PERSUADE 数据集(Crossley 等,2024 (https://arxiv.org/html/2607.16239#bib.bib18))包含超过 25000 篇来自美国 6-12 年级学生的议论文,每篇都有一个来自人类评分的整体分数(1-6 分)。我们让几个 LLM 对同一批作文进行评分,并将其输出与人类标签进行比较(提示见附录 B (https://arxiv.org/html/2607.16239#A2))。图 1(a) (https://arxiv.org/html/2607.16239#S1.F1.sf1) 比较了 PERSUADE 上人类和 LLM 的分数分布。人类分数的尾部比 AI 分数更厚,并且一些 AI 模型(例如 llama-3.1-8b)集中在完全不同的峰值附近。
参见图注 (a)
参见图注 (b)
图 1:PERSUADE 和 MQM 数据上人类评分者与 AI 评委之间的分数分布比较。图 (a):PERSUADE 10 年级人类标签和所有 8 个 LLM 评委的分数比例(分数 1-6)。人类为实线;LLM 为虚线。图 (b):WMT 2020 en-de 上人类评分者和六个 LLM 评委的 MQM 片段级分数分布。两个数据集都显示出人类标签与 AI 评委之间的系统性不一致。
案例研究 2:机器翻译评估。我们还研究了 WMT 2020 英-德 MQM 数据集(Freitag 等,2021 (https://arxiv.org/html/2607.16239#bib.bib19)),其中专家评分者按类别和严重程度标注翻译错误,每个片段得到一个非负 MQM 分数(越低越好)。我们使用六个 LLM 评委(列于图 1(b) (https://arxiv.org/html/2607.16239#S1.F1.sf2))对十个 MT 系统(包括三个人工翻译)生成 MQM 风格的标注。图 1(b) (https://arxiv.org/html/2607.16239#S1.F1.sf2) 显示了系统性的校准偏差:一些 LLM 评委很大程度上低估或高估了错误率(Gemini-2.5-Flash 和 Llama-3.1-8B),而另一些则表现出人类标签中未观察到的双峰分布。
案例研究 3:网页设计评分。最后,我们考虑网站截图的视觉评估,其中模型必须判断感知质量,例如美学性、可信度、典型性和易用性(Miniukovich and Figl,2023 (https://arxiv.org/html/2607.16239#bib.bib7))。图 2 (https://arxiv.org/html/2607.16239#S1.F2) 显示了 WebDesign 数据集大学子集的分数分布,并揭示了人类标签与 VLM 评委之间的显著不一致。
参见图注
图 2:WebDesign 大学子集六个感知结果(分数 -3 到 3)的分数分布。人类分数显示为 KDE 曲线;VLM 评委显示为比例线。
以上例子共同表明一个普遍问题:AI 分数的测量目标通常与人类标签不同。如果从业者简单地平均 AI 分数或将其用于项目或系统排名,他们正在做一个隐含且通常未经验证的测量假设。我们提出 BACON 来解决这个问题。
### 1.2 BACON 框架概览及我们的贡献
BACON 是一种评估协议,用于在有限标签下做出与人类对齐的声明。对于目标项目群体,评估者指定人类结果以及感兴趣的评估报告,例如群体均值、系统排名或项目级分数。BACON 从多个 AI 评委收集全覆盖的辅助测量,包括分数、不确定性统计和项目嵌入。然后,由人工标记一小部分样本,并用于拟合从 AI 测量到目标人类结果的交叉拟合校准模型。BACON 报告校准后的项目级替代分数以及带有不确定性区间的聚合人类对齐估计。在整个协议中,AI 评委被视为辅助测量而非人类标签的替代品:人类校准为最终声明的有效性提供锚点,而 AI 测量在它们具有预测性时提高效率。
总结来说,我们做出以下贡献:
(1) 人类校准的 AI 评委评估协议。我们将 AI 辅助评估形式化为一个预算有限的人类校准问题,其中多个 AI 评委被视为辅助测量而非真实真相。AI 评委分数提供全覆盖的结果预测,而一个小的均匀人类样本提供偏差校正,将估计精度与结果模型的质量解耦。
(2) 多评委校准方案。BACON 区分了两种评估任务:经验校准的项目级替代评分和统计有效的摘要指标估计。对于项目级评估,我们建议从多个评委分数、不确定性汇总和上下文嵌入构建结果模型,并讨论针对不同类型结果(如有序、零膨胀、连续和分类评估结果)的实际模型选择。对于摘要统计报告,BACON 遵循基于估计方程的统计框架,提供对人工评估一致的估计量,并通过置信区间提供有效的不确定性量化。
(3) AI 评委校准的跨领域实证研究。我们在三个真实世界数据集上跨多个任务和模态验证了 BACON,包括 PERSUADE 作文评分、MQM 机器翻译评估和 WebDesign 网页设计评分。结果表明,在个体项目质量预测准确性和摘要指标的估计效率方面,相对于几个基线有显著改进。复现代码托管在以下 GitHub 仓库(为评审匿名化):https://github.com/diaryofnewton/bacon-calibration。
### 1.3 相关工作
LLM 作为评委。Zheng 等人(2023 (https://arxiv.org/html/2607.16239#bib.bib30))通过 MT-Bench 和 Chatbot Arena 确立了经典的 LLM-as-judge 范式;Liu 等人(2023 (https://arxiv.org/html/2607.16239#bib.bib31))通过链式思维提示将其扩展到文本生成评估;Dubois 等人(2024 (https://arxiv.org/html/2607.16239#bib.bib35))开发了 AlpacaEval 用于指令遵循比较。尽管有用,LLM 评委表现出位置、冗长和自我增强方面的系统性偏差(Wang 等,2023a (https://arxiv.org/html/2607.16239#bib.bib32)),这扭曲了排名;调查(Li 等,2024 (https://arxiv.org/html/2607.16239#bib.bib33);Gu 等,2024 (https://arxiv.org/html/2607.16239#bib.bib34))编录了这些失败模式。BACON 将这些偏差作为出发点,并提供了一个原则性的校准框架,使用一小部分人工标记数据来纠正它们。
多评委聚合。自一致性(Wang 等,2023b (https://arxiv.org/html/2607.16239#bib.bib39))和多代理辩论(Du 等,2024 (https://arxiv.org/html/2607.16239#bib.bib36);Liang 等,2024 (https://arxiv.org/html/2607.16239#bib.bib37))使用推理路径或模型的集成来提高可靠性。在评估设置中,ChatEval(Chan 等,2023 (https://arxiv.org/html/2607.16239#bib.bib38))、陪审团式小组(Verga 等,2024 (https://arxiv.org/html/2607.16239#bib.bib40))和结构化多代理协作(Qian 等,2025 (https://arxiv.org/html/2607.16239#bib.bib41))表明,聚合多样化的评委可以减少个体偏差。BACON 不同:不是辩论或临时集成,而是将评委分数视为监督结果模型中的特征,该模型针对人类标签进行拟合,从而产生统计上有根据的估计。
预测驱动推理(PPI)与半监督估计。Angelopoulos 等人(2023a (https://arxiv.org/html/2607.16239#bib.bib23))引入 PPI,使用模型预测加上一个小的标注集来形成有效的置信区间;Angelopoulos 等人(2023b (https://arxiv.org/html/2607.16239#bib.bib24))将其扩展到 PPI++ 并带有自适应加权;Zrnic(2024 (https://arxiv.org/html/2607.16239#bib.bib25))通过交叉拟合移除了保留集的要求。这些想法源于经典的调查回归估计量(Särndal 等,1992 (https://arxiv.org/html/2607.16239#bib.bib26);Cassel 等,1976 (https://arxiv.org/html/2607.16239#bib.bib27))以及半监督推理(Zhang 等,2019 (https://arxiv.org/html/2607.16239#bib.bib28);Cai and Guo,2020 (https://arxiv.org/html/2607.16239#bib.bib29))。在摘要指标估计的应用中,BACON 直接遵循这一工作线。对于估计群体均值的特殊情况,我们的估计量在数学上等价于具有学习预测函数的 PPI/回归调整估计量。因此,BACON 的贡献并非一个新的均值估计量。相反,BACON 解决了通用 PPI 公式中遗留的一个问题:在 AI 辅助评估中,当可用的预测变量是多个有偏差的 AI 评委、不确定性统计以及项目嵌入时,如何构建可靠的辅助预测,以及如何在将 AI 判断视为真实真相之外同时报告聚合推断量和项目级替代分数,这作为 LLM-as-judge 和 PPI 之间的协议层。
训练和微调 LLM 评委。JudgeLM(Zhu 等,2025 (https://arxiv.org/html/2607.16239#bib.bib42))、Prometheus(Kim 等,2024a (https://arxiv.org/html/2607.16239#bib.bib43),b (https://arxiv.org/html/2607.16239#bib.bib44))和 PandaLM(Wang 等,2024 (https://arxiv.org/html/2607.16239#bib.bib45))微调开源模型作为可扩展的评估器,而 Li 等人(2023 (https://arxiv.org/html/2607.16239#bib.bib46))生成评估理由而非标量分数。然而,Huang 等人(2025 (https://arxiv.org/html/2607.16239#bib.bib47))发现,微调后的评委在域外通常表现不如 GPT-4。BACON 是免训练的:现成的评委输出送入一个轻量级校准层,不需要评委特定的训练数据,并支持闭源模型。
## 2 BACON 框架
### 2.1 概览与符号设置
我们提出一个用于 AI 辅助评估的免训练流水线。BACON 集成了三个组件以减轻 AI 评委输出中的偏差:(1) 从多个评委聚合预测以捕捉跨评委变异性;(2) 利用上下文特征来去偏评委预测;(3) 使用一小部分人工标记数据校准 AI 评估。我们研究在有限人工标注预算下的 AI 辅助建模与评估。假设有一个项目池,每个项目关联一个标量或向量值的人类结果。我们的目标是通过原则性地结合 AI 评委输出,并使用少量人工标签进行校准,来估计群体层面的性能并改进项目级预测。
形式上,对于项目 i ∈ {1, ..., N},令 y_i 表示人类分数(或一个结果分量),并且 l_i ∈ R^M 收集 M 个模型评委的分数。我们还构建上下文嵌入特征 e_i(例如,作文的文本嵌入和截图的图像嵌入)。然后,我们使用评委分数、不确定性特征和嵌入特征来拟合 y_i 的预测模型,以捕捉它们与人类评估的关系。
### 2.2 预算有限的评估框架
提议的评估框架如下;图 3 (https://arxiv.org/html/2607.16239#S2.F3) 给出概览。
阶段 1
模型输入准备
阶段 2
人工标签采样
阶段 3
结果模型拟合
阶段 4a
摘要指标
阶段 4b
项目分数和排名
嵌入 e_i
分数 l_i,不确定性 u_i
均匀或自适应
交叉拟合
f̂(e_i, l_i, u_i)
μ̂^EE,置信区间
ŷ_i,排名
图 3:BACON 评估流水线。阶段 1 为所有项目准备输入(上下文特征和 AI 评委分数);阶段 2 收集一小部分人工标签样本;阶段 3 使用交叉拟合拟合结果模型;阶段 4 路由到摘要指标估计或个体评分与排名。
(1) 阶段 1:模型输入准备。(i) 上下文特征提取。对于评估池中的每个项目,我们提取一些上下文特征。这包括内容嵌入、摘要统计、情感和心理属性等(Mozer and Miratrix,2025 (https://arxiv.org/html/2607.16239#bib.bib21))。(ii) AI 评委评分。我们使用多个 AI 评委对池中所有项目进行评分。我们可以记录辅助信息,例如词元熵和困惑度。我们还可以运行多轮 AI 评委。
(2) 阶段 2:人工标签采样。相似文章
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
ConfidenceBench:评估大型语言模型中的置信度校准
ConfidenceBench是一个新的基准测试,使用Brier分数评估大型语言模型中的口头置信度估计,揭示了准确性和校准之间的分歧,即使是高精度的模型也可能严重校准不良。
推理中的校准漂移:Chain-of-Thought 预算如何导致大型语言模型过度自信
本文识别了推理中的校准漂移(CDUR),即增加思维链推理预算会导致大型语言模型在错误答案上系统性地过度自信,并提出了一个假设锁定模型(Hypothesis Lock-In)和一个校准感知的停止规则(CABStop)来缓解该问题。
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。