LLM 在真实、双重评分的 GCSE 基准测试上的表现

arXiv cs.CL 论文

摘要

介绍了一个包含32,534份双重评分的GCSE学生答案的数据集,涵盖五个科目,发现表现最佳的LLM与考官的一致性程度高于考官之间的一致性,包括手写和主观任务。

arXiv:2606.24973v1 Announce Type: new 摘要:我们介绍了一个包含32,534份真实学生GCSE模拟考试双重评分答案的数据集(GCSE是英国的国家考试,大约在16岁时参加),涵盖五个科目的328道题,包括手写作业。我们测试了现成的大型语言模型与考官的一致性是否与两位考官之间的一致性相当。我们发现,模型在各科目中与考官共识的一致性非常高,表现最佳的模型与考官的一致性甚至高于考官之间的一致性。模型在主观任务(如英语作文评分)以及处理复杂、杂乱的手写数学试卷脚本方面均取得了高分。一致性在考官评分线附近均匀分布,且不受模型规模的显著影响,从而提供了成本效益高的自动化评分解决方案。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:09

# 大语言模型在真实、双评 GCSE 基准测试中的表现
来源:https://arxiv.org/html/2606.24973

Malachy Fox  
Medly AI  
[email protected]  

&  
Kavi Samra  
Medly AI  
[email protected]  

&  
Paul Jung  
Medly AI  
[email protected]  

(2026年6月9日)

###### 摘要
我们引入了一个包含 32,534 份双评 GCSE 模拟考试真实学生答卷的数据集(GCSE 是英国 16 岁学生参加的国家级考试),涵盖五门学科的 328 道题目,并包含手写内容。我们测试了现成的大语言模型与阅卷员之间的一致性,并将其与两位阅卷员之间的一致性进行比较。我们发现,各学科中模型与阅卷员共识的一致性普遍良好,表现最好的模型与阅卷员的一致性甚至超过了阅卷员之间的一致性。模型在主观性任务(如英语作文评分)以及处理复杂、潦草的手写数学试卷方面均取得了高分。一致性在阅卷员线附近均匀分布,且不受模型规模显著影响,从而提供了经济高效的自动化评分解决方案。

*关键词* 自动作文评分 · 大语言模型 · 教育评估 · 大语言模型评估 · 二次加权卡帕

## 1 引言
考试委员会和学校需要可靠的评分[9](https://arxiv.org/html/2606.24973#bib.bib9),但人工评阅给教师带来了沉重的负担[10](https://arxiv.org/html/2606.24973#bib.bib10)。自动作文评分历史悠久,从早期的基于特征和神经网络的系统[3](https://arxiv.org/html/2606.24973#bib.bib3), [4](https://arxiv.org/html/2606.24973#bib.bib4), [6](https://arxiv.org/html/2606.24973#bib.bib6), [7](https://arxiv.org/html/2606.24973#bib.bib7)] 发展到近期的大语言模型方法[8](https://arxiv.org/html/2606.24973#bib.bib8), [5](https://arxiv.org/html/2606.24973#bib.bib5), [13](https://arxiv.org/html/2606.24973#bib.bib13), [14](https://arxiv.org/html/2606.24973#bib.bib14)],包括特定学科评分如科学评估[15](https://arxiv.org/html/2606.24973#bib.bib15)]。早期结果好坏参半:在标准作文基准上,使用提示词的现成模型表现不如任务特定系统[13](https://arxiv.org/html/2606.24973#bib.bib13)];后来的研究通过让模型生成基于评分标准的特征而非直接评分,重新取得了进展[14](https://arxiv.org/html/2606.24973#bib.bib14)]。然而,大多数学校考试涵盖多个学科,并包含手写方程、短文本答案和图表,自动系统难以可靠地对其进行评分[11](https://arxiv.org/html/2606.24973#bib.bib11), [12](https://arxiv.org/html/2606.24973#bib.bib12)];即使在原生数字的多模态数学领域,领先模型仍落后于人类[17](https://arxiv.org/html/2606.24973#bib.bib17)]。我们探讨的问题是:在最低推理难度下使用通用提示词运行的商用大语言模型,是否已能可靠地作为这些答卷类型的第二阅卷员,以及它们在哪些方面会失效。我们提出了一个包含 32,534 份双评 GCSE 模拟考试的基准测试,涵盖英语、数学、生物、化学和物理五门学科的 328 道题目。GCSE 是英格兰、威尔士和北爱尔兰 16 岁左右学生参加的国家级学科考试,由合格的阅卷员根据公布的评分方案评分;表格和实例中标注的“Higher”层级是数学和科学中难度较高的 GCSE 层级。据我们所知,这是首个公开描述的双评、多学科 GCSE 评分基准,其中既包含手写学生答卷,也包含输入文本。我们通过计算模型与每位阅卷员的平均一致性,并将其与两位阅卷员之间的一致性进行比较,来评估模型。这可以揭示模型的评分是否与人类阅卷员一样一致。我们按学科报告一致性,并研究模型在英语作文评分中因偏差而呈现出的差异。

## 2 数据集
该数据集包含 32,534 份学生答卷,涵盖五门学科(英语、数学、生物、化学和物理)的 328 道题目,抽样范围覆盖了全部成绩区间。每份答案由两名合格阅卷员独立评分。答案包含输入文本、屏幕文本框以及以笔迹捕获的自由手写内容,因此阅卷员必须具备多模态处理能力。下面两个实例展示了范围:一份输入形式的英语作文,以及一份手写的数学题目。表 1 给出了每门学科中手写输入的占比。

### 英语(创意写作,40分)

**模型的提示词**  
“使用提供的评分方案对学生答案进行评分。仅以 JSON 格式回复,形式为:{"mark": }。”  
此提示词会随题目、评分方案和学生答案一起发送。

**题目**  
你当地的报纸正在举办一个创意写作比赛。  
*要么:* 根据图片提示,写一段海上风暴的描写;  
*要么:* 写一个关于不速之客的故事。

**评分方案**  
两个评估目标,根据最佳匹配等级描述分别评分。  
AO5,内容与组织(24分):清晰富有想象力地表达,语气、风格和语体与目的和受众匹配,结构连贯。  
AO6,技术准确性(16分):词汇和句子结构多样,拼写和标点准确。

**学生答案**  
那是一个安静的屋子,我正进行着常规的日常,常态包裹着我……然后我听到了,一声响亮的敲门声侵入了我的意识;那声音不属于这里,我的心跳得前所未有地快。[……] 有一瞬间,我没认出他:他看起来更瘦了,轮廓更锐利了,仿佛时间剥离了什么。[……] 他走进黑暗,低声说:“有些后果会跟着你回家。”

**阅卷员评分**:19/40(两位阅卷员一致;AO5 + AO6 合并)。

### 数学高级(最大公因数,2分)

**模型的提示词**  
“使用提供的评分方案对学生答案进行评分。仅以 JSON 格式回复,形式为:{"mark": }。”  
此提示词会随题目、评分方案和学生答案一起发送。同时附上渲染的画布图像。

**题目**  
求 84 和 126 的最大公因数(HCF)。

**评分方案**  
M1 使用正确方法,例如对其中一个数进行质因数分解(84=2×2×3×7 或 126=2×3×3×7)。  
A1 得到 42(或 2×3×7)。

**学生答案**  
学生在画布上手写完成:试除法和因式分解树以找出每个数的质因数,合并公因数,并将答案 42 圈出(见下方)。

![ [无标题图片] ](https://arxiv.org/html/2606.24973v1/charts/example_maths_canvas.png)

**阅卷员评分**:2/2(两位阅卷员一致)。  
**AI 评分**:2/2。

**表1:** 包含手写输入(屏幕手写笔迹捕捉)的答卷占比。

## 3 方法
每份答卷都使用通用提示词进行评分:题目、评分方案和学生答案,并附带一句指令,要求根据满分进行评分(图 1)。对于手工作业,会附加渲染的画布图像,因此模型必须自行阅读手写内容。模型被约束为结构化输出,即一个包含单个整数字段 `mark` 的 JSON 模式。模型以最低推理难度运行 [注释 1: “最低”指每个模型可设置的最低推理级别:对于 Gemini 3.1 Pro 而言,其最低可用设置为“低”而非“关闭”,因此除该模型外,其他模型均完全禁用推理功能。]。评分为有序变量,因此一致性使用二次加权卡帕(QWK)[1](https://arxiv.org/html/2606.24973#bib.bib1) 来度量,先按题目计算,然后根据每道题目的满分进行加权平均。这与学生成绩的形成方式一致(分数总和,一道 6 分题目的权重是一道 1 分题目的六倍),并且可以抑制许多近乎二元的低分题目带来的噪声。QWK 的取值范围为 0(偶然一致性)到 1(完全一致)。按照标准尺度 [2](https://arxiv.org/html/2606.24973#bib.bib2),0.21–0.40 为一般,0.41–0.60 为中等,0.61–0.80 为高度,0.81–1.00 为几乎完全一致,因此 QWK 接近 0.8 已经表明两位评分者之间具有高度一致性。

**图1:通用评分提示词:一个多模态消息(指令、题目、评分方案、学生答案以及任何画布图像)返回一个结构化的整型评分。**

我们报告模型与阅卷员之间的一致性平均值,并将其与阅卷员之间的一致性进行比较。对于某个模型,其与两位阅卷员的平均一致性为 \( R_A = \frac{1}{2} \left[ \mathrm{QWK}(\mathrm{AI}, E_1) + \mathrm{QWK}(\mathrm{AI}, E_2) \right] \),即模型与每位阅卷员之间 QWK 的均值。参考值为两位阅卷员之间的一致性 \( R_H = \mathrm{QWK}(E_1, E_2) \),其中 \( E_1, E_2 \) 为两位阅卷员。因此 \( R_A \) 是模型与两位阅卷员的平均一致性,而 \( R_H \) 是两位阅卷员彼此之间的一致性。一个自动评分器应落在两位阅卷员最终会达成一致的分数上。每个 \( R_A \) 和 \( R_H \) 都带有通过按题目聚类 bootstrap(2,000 次重抽样)计算出的 95% 置信区间。我们报告差值 \( \Delta = R_A - R_H \) 及其区间(表 2)。对于作文,我们还报告有符号的评分偏差:将(预测值 - 共识值)作为满分的比例,其中共识值为两位阅卷员的均值(正数表示宽松,负数表示严格)。

## 4 与阅卷员的一致性
我们研究模型与两位阅卷员的一致性是否接近两位阅卷员彼此之间的一致性。图 2 显示了每门学科最佳模型的平均一致性 \( R_A \) 与两位阅卷员之间的一致性 \( R_H \) 的对比。表 2 给出了每门学科的数值以及差值 \( \Delta = R_A - R_H \) 及其 95% 置信区间。在所有学科中,领先模型与一位阅卷员的一致性超过了两位阅卷员彼此之间的一致性。英语表现最佳,各种规模的模型都能达到阅卷员一致性水平,且顶级模型大大超过这一水平。在数学中,尽管阅卷员之间的一致性非常高,约为 0.84,但顶级模型仍实现了 +0.02 的差值。科学领域也展现出阅卷员级别的评分能力,最高差值为 +0.06。模型之间的差异很小,且在置信区间之内;模型规模并不能预测一致性:小型模型与大型模型一样稳定。每门学科的领先模型分别是 GPT-5.5(英语)、Gemini 3.5 Flash(数学)和 Gemini 3.1 Pro(综合科学),而更具成本效益的模型得分也非常接近。后续部分将对这些结果进行详细分析。

**图2:每门学科的最佳模型(\( R_A \),彩色)与阅卷员之间的一致性(\( R_H \),灰色)对比。彩色柱达到灰色条表示与第二阅卷员一致。**

**表2:图 2 的数值:最佳模型的一致性 \( R_A \)、阅卷员基准线 \( R_H \),以及 \( \Delta = R_A - R_H \) 及其 95% 置信区间。\( \Delta > 0 \)(置信区间不包含零)意味着模型评分比阅卷员彼此之间更接近阅卷员。**

## 5 作文评分
作文是最主观的评分任务。阅卷员之间的一致性远低于 STEM 学科的一致性。此外,英语评估仅基于八道题目,因此图 3 中的每学科 QWK 相对而言噪声较大。先前将 GPT-4 应用于第二语言作文评估的研究发现,与人类分数在单一注释数据集上存在显著相关性 [16](https://arxiv.org/html/2606.24973#bib.bib16)];这里我们对真实的 GCSE 作文进行评分,并以双评阅卷员基线作为参考,我们关注的问题不是模型与人类的相关性,而是模型相对于两个评分者之间差异的位置。模型与一位阅卷员的一致性仍然超过两位阅卷员彼此之间的一致性(\( R_A > R_H \))。各模型的误差分布相似,与模型规模/成本无关。然而,一个区别因素是评分偏差,如图 4 所示。差异表现为严格程度上的偏移。Claude Opus 4.8、Claude Haiku 4.5 和 GPT-5.5 最为中立,而 Claude Sonnet 4.6 和 Gemma 4 26B 最为严格。

**图3:英语:每个模型与两位阅卷员的平均 QWK(越高越好,最佳在前)。虚线及其带状区域为阅卷员之间的 QWK 及其 95% 置信区间;柱体达到带状区域表示与第二阅卷员一致。图 5 和 6 采用相同布局。**

**图4:英语作文,每个模型的有符号误差(AI - 共识,占满分的百分比),最准确的在顶部。虚线为中位;左侧为严格,右侧为宽松。**

## 6 科学与数学评分
大多数测试模型在科学和数学评分上与第二阅卷员同样一致,数学中模型之间的性能差距更大。科学领域的顶级模型实现了接近 +0.06 的正差值,表明其一致性优于阅卷员。数学中阅卷员基准线很高,\( R_H \) 为 0.84,因为两位阅卷员的一致性非常紧密。Google 的 Gemini 模型似乎比 OpenAI 的模型更符合 GCSE 评分标准的预期,这可能是其训练数据的差异所致,似乎比模型规模更具指示性(图 5)。

**图5:数学:模型与两位阅卷员的平均 QWK 与阅卷员基准线对比(参见图 3)。**

**图6:科学(生物、化学、物理合并):模型与两位阅卷员的平均 QWK 与阅卷员基准线对比(参见图 3)。**

## 7 成本与模型选择
根据标价,评分 1,000 份学生答卷的成本在 1 美元到 120 美元之间,如图 7 所示。成本与一致性之间仅存在弱相关;一些更便宜的模型,如用于英语的 Claude Haiku 4.5 和用于科学/数学的 Gemini 3.1 Flash Lite,以极低的成本实现了优于 Claude Opus 4.8 的性能。

**图7:平均 QWK 与评分 1,000 份答卷的成本(美元标价,对数刻度),分英语和数学+科学显示。每个点代表一个模型;左上角为最佳(高一致性,低成本)。虚线及其带状区域为阅卷员基准线及其 95% 置信区间。**

## 8 讨论与结论
本基准测试表明,当今可用的大语言模型在最低推理难度下使用单一通用提示词运行时,可作为可靠的第二阅卷员。此外,通过改进提示词甚至微调,性能还有提升空间。包含手写内容的双评、多学科数据集在真实条件下测试了这一点,克服了其他基准测试的局限性。我们注意到若干局限性。该数据集来自 Medly 自己的模拟考试,因此题目类型可能无法完全代表所有 GCSE 考试。虽然涵盖了多种题型(作文、计算题、简答题),但并非所有可能的形式都包括在内。此外,阅卷员之间的高一致性(尤其是在数学领域)可能部分源于评分方案的细致程度以及阅卷员的培训质量,这在其他环境中可能有所不同。最后,我们使用的通用提示词可能并非最优;针对特定学科或题型的定制提示词有可能进一步提高性能。未来的工作可以探索更精细的提示策略、模型微调以及在更广泛的教育环境中的适用性。总体而言,我们的结果表明,利用现成大语言模型进行自动评分是一种可行且经济高效的方法,可以减轻教师的工作量,同时保持与人类阅卷员相当的一致性水平。

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

LLM团队能玩‘What? Where? When?’吗?

arXiv cs.CL

本文研究了在问答游戏‘What? Where? When?’(ChGK)中,基于团队协作的交互是否能提升LLM的表现。通过在2025年发布的572道问题的数据集上使用六个最新的开源LLM,他们展示了团队策略(投票、沉默队长、健谈队长)比单个模型高出最多20个百分点,最佳团队达到了44.23%的准确率,接近人类水平。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。