评分依赖标准,而非智能
摘要
当使用明确的评分标准时,小型语言模型在评分开放式考试答案时可以与更昂贵的模型一样可靠,从而降低了评分任务中对先进AI智能的需求。
查看缓存全文
缓存时间: 2026/08/19 10:09
# 评分需要评分标准,而非智能 来源:https://arxiv.org/html/2608.17938 ###### 摘要 小型语言模型在依据明确的评分标准进行评分时,其评分开放式考试答案的可靠性可与成本高昂得多的模型相媲美。我们检验了这一主张,作为 **any-to-bench** 背后的设计原则:一个前沿模型在数据摄取阶段一次性阅读源文档,提取每个问题及其评分标准;随后,成本较低的模型则执行所有重复的评分工作。我们评估了来自两个模型家族的六种成本效益型模型配置,涵盖三种推理努力水平。每个配置回答24个开放式考试问题,并且每个配置还对每份答卷评分三次,共计3,456个问题级评分。分数压倒性地取决于被评分的答案:答案本身解释了95.6%的分数方差,而评判者身份仅解释0.2%。提升答题者的推理努力可使所得分数变化高达满分的0.143,而提升评判者的推理努力最多仅使给定分数变化0.006。作为检验而额外加入的六个前沿级评判者重现了这些分数,且作为评审团并不可靠。随后,两项消融实验在相同问题和答案上分解了评分标准。保留官方答案但移除其评判标准和等级后,没有产生任何可测量的变化。若同时移除官方答案,可靠性便崩溃了(ICC从0.888降至0.628),分数膨胀,并且评判者的推理努力再次变得重要。评分标准是将评分与评判者智能解耦的关键,而在评分标准内部,官方答案几乎承担了所有工作。我们未发现基于评分标准的评分存在长度偏好或同族偏好的证据。 ## 1引言 将现有考试转化为机器可运行的基准测试,对于多选题来说基本上已是一个解决的问题。对于其他所有题型,这仍是一个昂贵的问题。开放式问题,如证明、作文、翻译和绘图,需要评分者,而评分者历来是成本高昂且难以扩展的部分。使用语言模型作为评判者[1 (https://arxiv.org/html/2608.17938#bib.bib1), 2 (https://arxiv.org/html/2608.17938#bib.bib2)] 将成本从人类转移到了模型。但标准做法仍在每次评分时消耗一次前沿模型调用,并且存在有记录的评判者偏差:偏好更长的答案[5 (https://arxiv.org/html/2608.17938#bib.bib5)]、偏好特定位置的答案[4 (https://arxiv.org/html/2608.17938#bib.bib4)],以及偏好评判者自身的模型家族[6 (https://arxiv.org/html/2608.17938#bib.bib6)]。 **any-to-bench** 采取了不同的方法,其建立在其两个模型驱动步骤——数据摄取和评分——之间的不对称性之上。智能投入于数据摄取阶段。一个前沿配置读取源文档,提取问题、答案格式和评分标准,并且每份考试只执行一次。在本文中,一个问题的 *评分标准* 是其完整提取的评分标准:官方参考答案,以及在源文档公布处附带的明确评判标准和等级。评分发生在每次基准运行中,该工具押注于评分几乎不需要任何智能:有了评分标准,评分就简化为应用标准。这正是小模型应能廉价、重复、可互换地完成的工作。 这是一个可检验的主张,我们对此进行了检验。六种配置在来自三次台湾地区大型考试的24个开放式问题上,既作为答案撰写者,也作为评判者。它们包括一个模型家族的小型层和另一个家族的中层,每个都在三种推理努力设置下运行。由于相同的配置同时担任撰写者和评判者,该实验在评分关系的每一端各调整了一次“推理努力”旋钮。撰写者一端展示了当能力重要时会发生什么;评判者一端则测试了这对于评分是否重要。我们发现: - •评判者智能并不重要(§5 (https://arxiv.org/html/2608.17938#S5))。推理努力最多可使撰写者 *获得* 的分数变化达满分的0.143,因此当能力位于答题一方时,它起作用。同一个旋钮最多使评判者 *给出* 的分数变化0.006。评判者身份仅占分数方差的0.2%,用其最廉价的成员替换整个评审团,平均每个答案的分数仅变化0.019。前沿级评判者重现了相同的分数。 - •评分标准是机制,其答案键是承载主要负荷的部分(§6 (https://arxiv.org/html/2608.17938#S6))。两项消融实验在相同的问题和答案上分解了评分标准。保留官方答案但移除其评判标准和等级后,没有产生任何可测量的变化。若同时移除官方答案,可靠性便崩溃了,分数膨胀,评判者的努力再次变得重要。 - •两种教科书式的偏差未出现(§7 (https://arxiv.org/html/2608.17938#S7))。在评分标准锚定下,不存在自我偏好,也没有长度溢价。问题内长度与分数的相关性在+0.6至+0.7之间可能暗示相反情况;但跨撰写者比较揭示了这种解读为何错误。 - •一个评判者就够了(§8 (https://arxiv.org/html/2608.17938#S8))。从两名评判者到六名,平均评审团可靠性保持平稳,重复评分未带来任何可测量的增益。更大评审团增加的是对评判者随机选择不佳的保险。 贯穿全文,量表是通过构造而非假设进行锚定的(§4 (https://arxiv.org/html/2608.17938#S4))。一份空白答卷和公布的参考答案分别界定了量表的下限和上限,所有关于一致性的主张都以评判者首先正确获得这两个锚点为前提。 ## 2相关工作 大语言模型评判者的可靠性主要在两两偏好的设置中被研究,即评判者比较两个答案。MT-Bench 和 Chatbot Arena 报告 GPT-4 的裁决与人类偏好之间超过80%的一致性[1 (https://arxiv.org/html/2608.17938#bib.bib1)]。G-Eval 使表格填写式的 GPT-4 评估与人类对生成文本的判断一致[3 (https://arxiv.org/html/2608.17938#bib.bib3)],而 Chiang 和 Lee [2 (https://arxiv.org/html/2608.17938#bib.bib2)] 研究了大语言模型作为人类评估开放文本的替代品。同一文献记录了失败模式:两两评判者对答案顺序敏感[4 (https://arxiv.org/html/2608.17938#bib.bib4)],奖励长度直到明确控制为止[5 (https://arxiv.org/html/2608.17938#bib.bib5)],并且偏好他们自己生成的内容[6 (https://arxiv.org/html/2608.17938#bib.bib6)]。现在的综述和系统性偏差审计正在大规模地编录这些及其他失败模式[7 (https://arxiv.org/html/2608.17938#bib.bib7), 8 (https://arxiv.org/html/2608.17938#bib.bib8)]。 我们的设置在一种对所有三种偏差都重要的方式上有所不同。评判者不是比较两个答案或评估自由形式的质量。它是在具有明确评判标准和等级的已提取评分标准上分配分数,并且问题带有官方分值。这是教育测量的经典工具,我们使用经典工具对其进行评估:用于绝对一致性的组内相关系数[9 (https://arxiv.org/html/2608.17938#bib.bib9)] 以及基于答案、评判者及其交互的方差分解。§7 (https://arxiv.org/html/2608.17938#S7) 中的长度分析是聚集逆转[10 (https://arxiv.org/html/2608.17938#bib.bib10)] 的一个实例,也称为辛普森悖论。 基于评分标准的大语言模型考试评分也被直接研究。近期工作使用课程评分标准对全国性的学校毕业作文进行评分,并报告其一致性与人类评审团相当[11 (https://arxiv.org/html/2608.17938#bib.bib11)],并询问自动评分需要多少评分标准细节[12 (https://arxiv.org/html/2608.17938#bib.bib12)]。该系列工作改变评分标准并与人类评分者比较。我们则固定评分标准并改变评判者,询问应用评分标准需要多少智能。 ## 3实验设计 ### 3.1语料库与问题选择 语料库是 **any-to-bench** 从三次台湾地区大型考试(学科能力测验 GSAT、指定科目考试 AST、以及技术职业教育统一入学考试 TVE)2024-2026年公开文件中生成的164份考试包(7,121个问题)。该语料库是公开的。¹¹¹ https://huggingface.co/datasets/JacobLinCool/taiwan-exams 数据摄取是唯一使用前沿模型的步骤:GPT-5.6 Sol 以超高(xhigh)推理努力阅读源文档并提取每个问题、其答案格式和每个评判标准的评分标准。 从该语料库中评判者评分的问题中,我们抽取了24个,根据源文档本身公布的评分指导多少分为四层(表2 (https://arxiv.org/html/2608.17938#S6.T2),左半部分)。每层包含六个问题。这24个问题来自三个系列和三年的21份不同试卷,涵盖八个科目:语文、英语、数学、物理、化学、生物、地理和公民。每个问题分值从1分到25分,使用三种答案格式:十个简答题(包括英语翻译题)、十个论述题和四个绘图题。评分标准规模从单一的两等级评判标准到包含多达四个评判标准、总计最多26个等级不等。附录A (https://arxiv.org/html/2608.17938#A1) 列出了每个问题。这四层并非一项实验的四个分支。B层的两级评分标准使一致性在很大程度上成为自动过程,因此它作为下限检查。A层没有公布评分标准,是§6 (https://arxiv.org/html/2608.17938#S6) 中作为对比的条件。 ### 3.2撰写者、锚点答卷、评判者 六种配置撰写了答案:GPT-5.6 Luna(其模型家族的小型层)和 Claude Sonnet 5(其家族的中层),分别在低、中、高三种推理努力下运行。下文我们将这些名称简称为 5.6 Luna 和 Sonnet 5。 另外两份答卷是构建而非生成的。我们称其为 *锚点*,因为它们固定了量表的两端:一份包含每个问题公布的官方答案的 *参考* 答卷,它应获得接近满分;以及一份 *空白* 答卷,它应得零分。没有人类评分者时,这些锚点是唯一可用的真实依据。24个问题中有8个未公布官方答案(其命题机构不公布作文和翻译题的答案)。对于这八个问题,满分锚点是未定义的,因此我们仅在参考锚点统计中将其排除。 相同的六种配置随后担任评判者。每个评判者对八份答卷各评分三次:8 × 6 × 3 = 144 次评分过程。一个已评分的问题就是一个 *裁决*;实验产生了3,456个裁决,全部完整。评分时,评判者阅读问题(其图表以图像形式提供)、评分标准和答案,并为每个评分标准评判标准分配其定义的等级之一。绘图题以绘图的精确文本描述(形状、标签、位置)作答,评判者根据评分标准对描述进行评分。我们将分数分析为 p = 获得分数 / 最高分,因此25分的论述题和1分的简答题权重相同。p 上0.10的差异对应于100分制上的10分。 另外六个处于每个家族前沿层的配置也担任评判者:执行数据摄取的 GPT-5.6 Sol,以及 Claude Opus 5(同样在三种努力水平下)。每个对所有八份答卷各评分一次,作为对评判池上限的直接检验(§5 (https://arxiv.org/html/2608.17938#S5))。加上§3.4 (https://arxiv.org/html/2608.17938#S3.SS4) 的消融实验,总计5,760个裁决。 一个设计细节保护结果免受我们自身工具的影响。**any-to-bench** 将每个已评判的评判标准分数强制对齐到评分标准的定义等级。这种强制对齐机械地提高了表面一致性:评判者说1.7和2.3的都会变成2.0。因此,我们记录了每个强制对齐前的裁决,并以两种方式计算了所有统计量。强制对齐仅改变了3,456个裁决中的1个,因此下面的任何结果都不是我们自身舍入造成的假象。 ### 3.3测量指标 我们使用组内相关系数(ICC)测量一致性,形式为 ICC(2,1):双向随机效应,绝对一致,单一测量[9 (https://arxiv.org/html/2608.17938#bib.bib9)]。通俗地说,ICC(2,1) 是反映答案之间真实差异而非评判者之间差异的分数方差比例。值为1意味着评判者可互换;值为0意味着分数取决于谁评分而非写了什么。对于n个答案,k个评判者,以及通常的均方,ICC(2,1) = (MS_R - MS_E) / [MS_R + (k-1)MS_E + (k/n)(MS_C - MS_E)],(1) 其中MS_R、MS_C、MS_E分别是答案、评判者和残差的均方。我们使用绝对一致性而非一致性,因为基准测试需要评判者给出 *相同* 的分数;仅在排序上一致太弱。置信区间来自对整个问题进行重采样的聚类自助法,因为同一问题上的裁决不独立。相同的均方给出方差分解:σ̂²_答案 = (MS_R - MS_E)/k,σ̂²_评判者 = (MS_C - MS_E)/n,σ̂²_残差 = MS_E。 除非另有说明,一致性统计使用单次评分过程,因为生产环境中没人会评分三次。它们也仅覆盖模型撰写的六份答卷:两份锚点极易区分,任何包含它们的统计量都会被夸大。 ### 3.4两项消融实验 分层比较了不同问题,因此无法将评分标准的效果与问题本身的特性分离。两项消融实验通过对相同问题进行干预来消除这一限制。从C层和D层的十二个问题中,我们构建了另外两个集合。第一个移除每个评分标准的评判标准和等级,但保留官方答案,这与A层规则的形式相同。第二个同时移除官方答案,评判者除了问题和要评分的答案外一无所有。相同的六位评判者随后在每种条件下对所有八份答卷重新评分一次:额外96次评分过程和1,152个额外裁决。与完整评分标准的比较使用主研究的第一次重复,因此所有三种条件都是单次评分。 ## 4量表已锚定 评判者几乎毫无例外地正确识别了两个锚点。这很重要,因为仅有共识无法证明任何事:评判者可能都同意但都错了。空白答卷在其全部432次评分中都准确得了零分。参考答卷平均得分为满分的0.990,在288次评分中有285次得分至少0.9。²²²所有三次失误都是单次评分的偶发事件:每次都只有一个零分,并且在所有情况下,同一评判者在其他两次重复中都给了同一答案满分。图1 (https://arxiv.org/html/2608.17938#S4.F1) 显示了两个锚点界定了所有六位撰写者,每个裁决都已绘出。 图1:所有3,456个裁决,按答卷划分。构建的锚点位于它们应在的量表两端;六位撰写者严格位于它们之间。5.6 Luna的答案随推理努力提升而改进;Sonnet 5的答案则没有,在这些问题上如此。 ## 5努力移动撰写者,而非评判者 推理努力改变了答案获得的分数。它不改变评判者给出的分数。因为六种配置同时担任撰写者和评判者……
相似文章
小型语言模型的代码引导推理:可执行MCQA脚手架评估
本文介绍了代码引导推理(CGR),一种评估协议,用于衡量可执行推理脚手架如何提升小型语言模型在多项选择问答任务上的表现,结果显示其准确率相较于直接回答有显著提升。
生成减少智能体评估中过度信任的无奖励评判标准
RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。
AI编写的评论帮助人类发现缺陷
# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。