法官代码化:通过程序蒸馏实现可扩展评估
摘要
本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。
arXiv:2607.22561v1 Announce Type: new
Abstract: LLM-as-a-judge 已成为自动评估的标准,但存在成本高、延迟大和决策不透明等问题——这些问题削弱了其可扩展性和可靠性。我们提出了一种简单高效的替代方案:程序蒸馏。不是在评估时提示LLM,而是将其决策逻辑蒸馏成一个程序委员会,直接对候选对象进行评分。这些程序化评判者具有透明性,易于检查或编辑,并消除了每次样本的API成本。基于这一概念,我们引入了PAJAMA,这是一个将程序综合为评判者、将其决策聚合为联合裁决,并纳入回退机制以选择性地将低置信度案例升级到LLM的系统。在五个数据集和四个模型家族上,我们展示了程序化评判者能够匹配13B大小LLM评判者的性能。当使用程序输出作为路由信号时,PAJAMA提高了准确性和吞吐量,并推进了帕累托前沿。除了评估之外,程序化评判者还能产生廉价且有效的奖励信号:在RewardBench上,从程序裁决中蒸馏出的奖励模型优于在专有LLM标签上训练的模型,而API成本降低了两个数量级。
查看缓存全文
缓存时间: 2026/07/28 06:23
# 规范裁判:通过程序蒸馏实现可扩展评估 来源: https://arxiv.org/html/2607.22561 ###### 摘要 LLM作为裁判已成为自动评估的标准,但它存在成本高、延迟大、决策不透明等问题——这些局限性损害了其可扩展性和可靠性。我们提出了一种简单高效的替代方案:程序蒸馏。我们不是每次评估都提示LLM,而是将其决策逻辑蒸馏为一个程序委员会,由它们直接对候选答案进行评分。这些程序化裁判具有透明性,易于检查和编辑,并消除了每次样本的API成本。基于这一概念,我们推出了PAJAMA系统,该系统将程序合成为裁判,聚合其决策形成联合裁决,并引入回退机制,将低置信度案例有选择性地升级到LLM。在五个数据集和四个模型族上,我们展示了程序化裁判能够匹配13B规模LLM裁判的性能。当使用程序输出作为路由信号时,PAJAMA提高了准确率和吞吐量,并推进了帕累托前沿。在评估之外,程序化裁判还产生了廉价有效的奖励信号:在RewardBench上,从程序裁决中蒸馏出的奖励模型,在API成本低两个数量级的情况下,优于从专有LLM标签训练的模型。††\*相同贡献。通讯作者:thuang273, [email protected]¹¹脚注文本:我们的源代码可在此处获取 (https://github.com/SprocketLab/PAJAMA)。项目页面和演示可在 https://sprocketlab.github.io/PAJAMA/ 找到。 ## 1 引言 LLM作为裁判范式是现代机器学习管道的核心构建模块[11 (https://arxiv.org/html/2607.22561#bib.bib63);26 (https://arxiv.org/html/2607.22561#bib.bib62)]。例如,LLM裁判执行成对偏好标注[56 (https://arxiv.org/html/2607.22561#bib.bib1);23 (https://arxiv.org/html/2607.22561#bib.bib12);49 (https://arxiv.org/html/2607.22561#bib.bib10)],为奖励模型蒸馏提供信号[53 (https://arxiv.org/html/2607.22561#bib.bib35);50 (https://arxiv.org/html/2607.22561#bib.bib59);47 (https://arxiv.org/html/2607.22561#bib.bib8)],并根据评分标准为强化学习提供反馈[12 (https://arxiv.org/html/2607.22561#bib.bib34);19 (https://arxiv.org/html/2607.22561#bib.bib24);40 (https://arxiv.org/html/2607.22561#bib.bib58)]。然而,随着LLM作为裁判系统越来越突出,这种方法的基本缺点也变得越来越难以忽视。我们确定了四个关键挑战,这些挑战限制了LLM裁判的**可扩展性**和**可靠性**: - • **推理成本**。当在流程中使用专有模型(如GPT-5[44 (https://arxiv.org/html/2607.22561#bib.bib15)]或Gemini-3-Pro[10 (https://arxiv.org/html/2607.22561#bib.bib36)])时,将评估扩展到数百万样本会产生高昂的API支出[38 (https://arxiv.org/html/2607.22561#bib.bib7)]。开放权重部署虽然避免了API账单,但延迟和GPU需求仍然昂贵。 - • **逻辑不透明**。虽然LLM可以生成推理过程,但其内部决策过程是不透明的。很难验证判决是依赖于陈述的理由还是幻觉的产物[55 (https://arxiv.org/html/2607.22561#bib.bib57);28 (https://arxiv.org/html/2607.22561#bib.bib6)]。 - • **系统性偏见**。LLM裁判对风格偏见敏感,偏好冗长、格式丰富或情绪化的语言——所有这些都会破坏可靠性[5 (https://arxiv.org/html/2607.22561#bib.bib56);52 (https://arxiv.org/html/2607.22561#bib.bib31);41 (https://arxiv.org/html/2607.22561#bib.bib55);39 (https://arxiv.org/html/2607.22561#bib.bib9);54 (https://arxiv.org/html/2607.22561#bib.bib41)]。 - • **重复推理代价**。当前的提示管道缺乏灵活性。修改单个评估标准需要在整个数据集上重新运行推理,导致冗余成本和浪费的周期。 在这项工作中,我们通过**从基于模型的推理转向合成程序执行**来解决这些障碍。我们不重复要求LLM评估每个候选,而是要求它**生成它将应用的裁判逻辑,并将该逻辑转换为可执行程序**。换句话说,LLM现在只在合成时被询问一次,这是一次性投入。之后,我们可以在本地调用程序对每个候选产生判决。 参考图注 图1:合成程序化裁判示例。给定一个合成提示(左上),LLM生成一个Python `judging_function`,该函数阐述了一个评估标准——例如,逻辑连贯性——使用可解释的特征,如通过TF向量余弦相似度衡量语义漂移或跨话语段落的主题一致性。这些特征被组合成一个加权分数,并明确对矛盾和截断进行惩罚,其中权重由LLM本身确定。这产生了一个透明、基于程序的评估器,直接从LLM的推理中蒸馏而来。 这一策略具有三个直接优势。 首先,API成本现在与生成的程序数量(很少)而非数据集大小(通常很大)成正比:一旦合成,程序可以在本地存储和重用,无需额外的API成本。其次,程序执行可能比模型推理快数个数量级,提供低延迟决策。第三,程序是可解释的:从业者可以检查每一行,完善裁判逻辑,或注入领域知识——将基于模型的评估转变为透明且可能可正式验证的过程。 然而,程序化裁判也带来了自身的挑战。首先,单个程序很少能泛化到每个输入。其次,即使有多个程序,简单的合成也往往产生重复的逻辑。第三,从不同标准生成的程序会产生不同尺度且带有噪声的分数。我们通过**Pajama**(Program-As-a-Judge Automated Model Assessment)系统来解决这些挑战,该系统旨在克服这些困难。 Pajama建立在三个组件之上:(i)一组精心策划的评估标准——**每个都可以表达为代码**——以使用多样化的决策规则引导合成;(ii)一个建模步骤,用于校准程序输出并将其冲突解析为联合判决;(iii)一个置信度感知的回退机制,将不确定的样本路由到LLM裁判,产生一个既快速又准确的混合评估系统。我们在四个模型族的五个偏好数据集上验证了Pajama。我们展示了独立的程序化裁判能够匹配OLMo-2-13B-Instruct[46 (https://arxiv.org/html/2607.22561#bib.bib38)]的准确率,同时运行速度快47.25×。通过使用置信度感知的路由器与LLM结合,Pajama推进了准确率-吞吐量帕累托前沿:例如,与OLMo-2-7B-Instruct配对,它在2.9×吞吐量下提高了+5.0%的准确率,与Qwen2.5-3B-Instruct[51 (https://arxiv.org/html/2607.22561#bib.bib16)]配对时,在2.2×吞吐量下提高了+2.6%。在RewardBench[25 (https://arxiv.org/html/2607.22561#bib.bib30)]上,从程序化裁判标签蒸馏出的奖励模型,在API成本低50倍的情况下优于从专有LLM偏好训练的模型——评估时零专有调用。最后,我们展示了基于程序的评估对偏差样本具有鲁棒性,并且与编码代理配对进行迭代程序校准进一步提高了其鲁棒性。我们将我们的贡献总结如下: - • **一种新的评估范式**。我们将LLM裁判逻辑蒸馏为一个由可执行程序组成的委员会,用一次性程序合成和本地程序执行取代每次样本的模型推理。 - • **Pajama系统**。我们介绍了Pajama,一个混合评估系统,该系统合成多样化的程序化裁判,校准并聚合其判决,然后采用高效的路由器将不确定情况升级到LLM回退。 - • **推进帕累托前沿**。在四个模型族上,Pajama以极低的成本匹配强LLM,并推动了准确率-吞吐量帕累托前沿。 - • **廉价、高质量的奖励信号**。从程序化裁判蒸馏出的奖励模型在RewardBench上优于从专有LLM生成标签训练的模型,且成本低50倍。 ## 2 相关工作 我们的工作处于三个线程的交汇处:(i)自动评估,(ii)弱监督,(iii)路由策略。 **自动评估**。LLM的关键突破之一是它们能够取代或增强人类标注员,提供自动评估[11 (https://arxiv.org/html/2607.22561#bib.bib63);26 (https://arxiv.org/html/2607.22561#bib.bib62)]。先前的工作表明,LLM裁判能够产生与人类偏好一致的可靠决策,涵盖排序、成对比较和基于标准的评分等任务[49 (https://arxiv.org/html/2607.22561#bib.bib10);6 (https://arxiv.org/html/2607.22561#bib.bib5);9 (https://arxiv.org/html/2607.22561#bib.bib3);29 (https://arxiv.org/html/2607.22561#bib.bib11)]。最近的工作将LLM裁判整合到训练后管道中,利用它们的评估来训练奖励模型[31 (https://arxiv.org/html/2607.22561#bib.bib40);4 (https://arxiv.org/html/2607.22561#bib.bib54)],为强化学习提供反馈[12 (https://arxiv.org/html/2607.22561#bib.bib34);19 (https://arxiv.org/html/2607.22561#bib.bib24)],或持续微调以得到专门的裁判模型[56 (https://arxiv.org/html/2607.22561#bib.bib1);23 (https://arxiv.org/html/2607.22561#bib.bib12)]。虽然有效,但基于LLM的评估会产生大量推理成本,并从预训练数据和提示设计中继承偏见,引发了对可扩展性和可靠性的担忧[5 (https://arxiv.org/html/2607.22561#bib.bib56);52 (https://arxiv.org/html/2607.22561#bib.bib31);41 (https://arxiv.org/html/2607.22561#bib.bib55);48 (https://arxiv.org/html/2607.22561#bib.bib43);54 (https://arxiv.org/html/2607.22561#bib.bib41)]。为了解决这些局限性,我们提出了一个新方向:**合成程序化裁判,提供低成本、透明且灵活的替代方案,以替代基于模型的评估。** **弱监督**。弱监督通过聚合来自多个噪声标签源的估计[33 (https://arxiv.org/html/2607.22561#bib.bib26);35 (https://arxiv.org/html/2607.22561#bib.bib25);34 (https://arxiv.org/html/2607.22561#bib.bib27);42 (https://arxiv.org/html/2607.22561#bib.bib20);32 (https://arxiv.org/html/2607.22561#bib.bib53)],例如启发式规则、领域知识或预训练模型[17 (https://arxiv.org/html/2607.22561#bib.bib21);18 (https://arxiv.org/html/2607.22561#bib.bib22)],来快速创建带标签的数据集。这些估计通常被编码为标注函数,其伪标签被建模并组合成一个单一的概率性标注决策。弱监督范式已在不同领域证明了成功[36 (https://arxiv.org/html/2607.22561#bib.bib23);20 (https://arxiv.org/html/2607.22561#bib.bib44);14 (https://arxiv.org/html/2607.22561#bib.bib52);3 (https://arxiv.org/html/2607.22561#bib.bib51);37 (https://arxiv.org/html/2607.22561#bib.bib50);16 (https://arxiv.org/html/2607.22561#bib.bib4);45 (https://arxiv.org/html/2607.22561#bib.bib2)]。大多数先前的工作侧重于标签聚合以构建分类数据集。我们的框架PAJAMA将其适应于一个新目的:**对程序化裁判的判决进行建模,以达成组合评估决策。** **路由策略**。LLM路由系统利用不同LLM的互补优势,而不是承诺于单一模型[30 (https://arxiv.org/html/2607.22561#bib.bib49);15 (https://arxiv.org/html/2607.22561#bib.bib39);7 (https://arxiv.org/html/2607.22561#bib.bib48)]。路由器根据任务难度、预期准确率和推理成本等因素将每个查询导向适当的模型[21 (https://arxiv.org/html/2607.22561#bib.bib47)]。现有的路由策略大致可分为**无模型**方法——依赖于启发式规则,例如对相似示例进行最近邻查找[15 (https://arxiv.org/html/2607.22561#bib.bib39)]——和**基于模型**的方法,例如训练分类器(如微调后的BERT)来预测每个查询的最佳模型[43 (https://arxiv.org/html/2607.22561#bib.bib42);13 (https://arxiv.org/html/2607.22561#bib.bib46);27 (https://arxiv.org/html/2607.22561#bib.bib45)]。前者受限于**其启发式规则的强度**,而后者则承担**额外的推理延迟和标注成本,且依赖于监督的质量**。在这项工作中,我们提出了一种结合基于程序和基于LLM的评估的路由策略。我们不是在一组LLM之间进行路由,而是**重用从程序输出中派生的内部信号,并将不确定的样本升级到LLM裁判,从而产生一个高效、无监督的回退机制。** ## 3 框架 我们从Pajama工作流程的概述开始,随后在§3.1中介绍问题设置。§3.2描述了我们如何将LLM评估蒸馏为程序化裁判,§3.3讨论我们如何将它们的程序输出建模为最终判决。最后,§3.4介绍了一种回退机制,用于处理程序化裁判无法覆盖或不确定的情况。 **一般工作流程**。图2展示了Pajama的工作流程。给定一个由查询和两个候选回答组成的数据集,我们首先提示LLM合成编码了不同裁判标准的Python程序;变化提示和评估标准产生了一个多样化的程序化裁判池。然后,我们使用保留的验证集校准每个程序的输出,选择最有效的程序,并将它们的判决聚合为一个偏好决策。对于未覆盖或置信度低的输入,一个高效的路由机制回退到LLM裁判。 ### 3.1 问题设置 参考图注 图2:Pajama工作流程。给定一个查询 $q$ 和两个候选回答 $r^{(1)}, r^{(2)}$,一个由LLM从策划的标准中合成的多样化程序化裁判池生成初始评估。这些程序输出被校准和选择,其判决被聚合成一个组合决策。不确定的情况随后被路由到LLM裁判以产生最终偏好。 我们考虑从 $\Sigma^\star$ 中抽取的用户查询和模型回答,$\Sigma^\star$ 是自由形式文本(例如,所有自然语言字符串)的空间。令 $\mathcal{Q} \subseteq \Sigma^\star$ 表示查询空间,$\mathcal{R} \subseteq \Sigma^\star$ 表示回答空间。给定一个查询 $q \in \mathcal{Q}$ 和两个候选回答 $r^{(1)}, r^{(2)} \in \mathcal{R}$,由相同或不同的LLM生成,我们的目标是确定哪个回答更受偏好。 ### 3.2 蒸馏为程序化裁判 基于模型的评估,即LLM作为裁判,会产生高昂的推理成本并提供有限的透明度。为了解决这些问题,我们将LLM裁判逻辑转换为直接评估 $q$, $r^{(1)}$, $r^{(2)}$ 的程序。我们设计了一个提示模板,指示LLM合成Python函数,这些函数作为我们的裁判。每个函数被要求将查询和回答作为直接输入,返回一个标量分数,其中较高的值表示根据其阐述的评估逻辑更高的质量。
相似文章
@zihengh1: LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们问...
介绍 PAJAMA,一种混合评估系统,通过提取评分标准并以编程方式执行,改进了 LLM-as-a-judge 方法,推动了速度、成本和透明度的帕累托前沿。
JudgeArena:可复现的LLM裁判评估统一框架
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
@akshay_pachaar: 如果你使用LLM作为评判,这篇内容就是为你准备的。(请收藏)大多数团队通过调用一个前沿…
详细介绍了一种训练小型LLM评判器来评估智能体输出的方法,取代了昂贵的前沿模型,并附带一个用于部署的Claude Code插件。
PoQ-Judge:一种面向去中心化LLM推理中成本感知质量证明的多架构评估框架
介绍了PoQ-Judge,一种采用无参考评判模型(TextCNN、MiniLM、DeBERTa)的多架构评估框架,用于去中心化LLM推理中的成本感知质量证明,实现了与地面真值代理的高相关性,同时消除了对参考答案的需求。
教育中的LLM评判:基于课程大纲的评分流水线
本文提出了一种基于课程大纲的LLM评判流水线,用于高风险考试备考中的自动化试题评分。该流水线利用教学大纲材料及评分指南,提升一致性与透明度。初步评估显示,其评分结果与人工导师相当。