大语言模型通过历史考试,却错过了《历史》:波兰高中毕业考试Matura基准

arXiv cs.CL 论文

摘要

本文介绍了一个新的基准,用于评估大语言模型在波兰高中历史毕业考试(Matura)上的表现,结果表明模型在总分上优于人类,但在史料解读和时间推理方面表现出明显的失败模式。

arXiv:2608.12343v1 公告类型:新 摘要:AI聊天机器人被学生广泛用作知识来源,然而LLM基准很少评估解释性历史推理。我们评估了八个领先的LLM在波兰高中历史毕业考试(Matura)中的表现——包括2023-2025年的三份官方试卷,包含简答题和长篇论述题——并将模型表现与人类考生群体进行比较。每个模型都显著优于人类考生,但总分掩盖了不同的能力特征:排名在任务类型、资料来源形式和地理范围上不稳定,且一致性地对波兰历史内容比全球历史内容惩罚更多。定性错误分析揭示了两种反复出现的失败模式——来源混杂,即模型基于来源内容进行推理,而非将其视为分析对象;以及时间迷失,即回答在历史上错位。本研究引入了第一个基于波兰国家课程体系的LLM历史基准。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:25

# 大型语言模型通过历史考试但错失<>:波兰高中毕业考试(Matura)基准

来源:https://arxiv.org/html/2608.12343

Adrian Trzoss¹,⁶  
Kacper Dudzic¹,²,³  
Wiktor Werner¹  
Marcin Moskalewicz¹,⁴,⁵

¹亚当·密茨凯维奇大学,波兰波兹南  
²IDEAS 研究院,波兰华沙  
³AMU 人工智能中心,波兰波兹南  
⁴波兹南医科大学,波兰波兹南  
⁵玛丽亚·居里-斯克沃多夫斯卡大学,波兰卢布林  
⁶WSB Merito 大学,波兰波兹南

###### 摘要

AI 聊天机器人在学生中被广泛用作知识来源,然而 LLM 基准测试很少评估解释性历史推理能力。我们在波兰高中毕业考试(Matura)历史科目上评估了八款领先的 LLM——涵盖 2023 年至 2025 年的三份官方试卷,包括简答题和扩展论文——并将模型表现与人类考生群体进行比较。每个模型的表现都远超人类考生,但总分数掩盖了不同的能力画像:排名在不同任务类型、来源模态和地理范围上不稳定,并且模型在波兰历史内容上的表现持续低于全球历史内容。定性错误分析揭示了两种反复出现的失败模式——来源混淆(source conflation),即模型依据来源内容进行推理,而不是将其视为分析对象;以及时间错位(temporal disorientation),即回答在历史上被错误定位。本研究首次提出了一个以波兰国家课程为基础的 LLM 历史基准¹¹我们已在以下地址发布代码:https://github.com/kdudzic/history-matura-llm-evaluation。

---

# 大型语言模型通过历史考试但错失<>:波兰高中毕业考试(Matura)基准

Adrian Trzoss¹,⁶\*\*通讯作者:[email protected]\*\*  
Kacper Dudzic¹,²,³  
Wiktor Werner¹  
Marcin Moskalewicz¹,⁴,⁵

¹亚当·密茨凯维奇大学,波兰波兹南  
²IDEAS 研究院,波兰华沙  
³AMU 人工智能中心,波兰波兹南  
⁴波兹南医科大学,波兰波兹南  
⁵玛丽亚·居里-斯克沃多夫斯卡大学,波兰卢布林  
⁶WSB Merito 大学,波兰波兹南

## 1 引言

由大型语言模型驱动的 AI 聊天机器人已成为教育环境中重要的知识来源,被中学生和大学生广泛使用。越来越多的研究(Gilson et al. (2023);Locatelli et al. (2024);Hendrycks et al. (2020);Darg̀is et al. (2024))使用标准化基准评估这些模型的知识水平和教学价值。然而,针对历史议题的解释性评估——这类议题很少存在明确答案——仍然严重不足。本文评估了领先 LLM 在波兰高中毕业考试(Matura)历史科目上的表现,该考试由国家级中央考试委员会(Centralna Komisja Egzaminacyjna, CKE)²²https://cke.gov.pl/egzamin-maturalny/egzamin-maturalny-w-formule-2023/ 命题。我们使用 2023–2025 年的官方试卷测试了八款模型,并从两个维度评估表现:模型之间的相互比较,以及与人类考生的比较。历史科目毕业考试在方法论上是有效的历史技能基准,因为它在国家课程框架内同时评估事实知识和历史推理能力。此外,试题库每年更换,且试题并非为 LLM 设计,从而减少了研究设计偏差。最后,每份试卷都配有标准化的评分方案,包含参考答案和评分标准,可实现客观评分。因此,该基准代表了一个罕见的开放式人文学科任务实例,其具有外部定义且相对客观的评估框架。我们研究了以下问题:LLM 是否在总体上优于人类考生;表现是否因题目类型、来源模态和历史范围而系统性变化——包括预测的波兰历史内容相对于全球历史内容的性能损失(Dadas et al. (2025))。此外,我们还考察了某些任务表述在基线提示条件下是否会系统性地无法被理解。我们将本研究置于两类先前工作的背景下:全球历史基准(尚未涉及非英语教育内容)和波兰语 NLP 基准(尚未涉及开放式人文学科任务)。

## 2 相关工作

Hauser 提出了 HiST-LLM 基准(Hauser et al. (2024)),证明模型在不同历史地区和时期的表现存在显著差异。Chartier 通过 HiBenchLLM(Chartier et al. (2025))扩展了这一研究方向,确认模型在非英语内容——包括法语材料——上表现较差。然而,这些基准依赖于任意构建的题目集和人工设计的评估标准,且均未将模型表现与人类基线联系起来。在波兰语境中,Jassem 提出的 LLMzSzŁ(“课桌后的 LLM”)是首个面向高中考试的大规模 LLM 基准(Jassem et al. (2025)),基于多个科目(历史除外)的历年考试档案构建。作者发现,多语言模型通常优于单语模型,尽管单语模型在规模受限的情况下也可能具有竞争力。这些发现并不能直接迁移到本研究中:LLMzSzŁ 完全依赖封闭式多项选择题,这类题更易于自动化和大规模评估。本研究同时弥补了上述两个空白:它是首个使用真实开放式考试任务评估 LLM 在波兰历史内容上表现的基准,也是首个将模型表现与人类分布基线进行比较的基准——这两点正是该领域此前所有工作的共同局限。

## 3 数据集

该基准包含 2023、2024 和 2025 年的三份官方历史 Matura 试卷。每份试卷包含若干*任务(tasks)*——围绕来源材料构建的主题单元——每个任务可能包含一个或多个*问题(questions)*。2023 年试卷包含 25 个任务、共 36 个问题;2024 年试卷包含 25 个任务、共 39 个问题;2025 年试卷包含 24 个任务、共 37 个问题。每份试卷的最后一个任务要求就三个指定主题之一撰写至少 600 词的论文。所有试卷都涵盖从古代至二十世纪后期的广泛时间范围,波兰历史与全球历史的覆盖面大致相当。简答题的形式多种多样:单词或短语回答(指明人物或事件)、多项选择题、带有简要论证的二元判断题(正确/错误)、以及来源分析练习(3–5 句)。除论文外,每个*任务*都包含来源材料,以不同组合出现:历史文本、图像材料(地图、照片)和表格(经济或谱系类)。大多数问题分值为 1 或 2 分;每份试卷的最高总分为 60 分,其中论文占 15 分。回答按照官方 CKE 评分指南进行评分,并由一名高水平人类专家——一名经过 CKE 培训且经验丰富的 Matura 考官——进行交叉检查。

## 4 方法论

### 4.1 模型选择

我们评估了来自 4 家领先提供商的共 N=8 款模型:OpenAI 的 GPT-4o(OpenAI (2024))和 GPT-5.4(OpenAI (2026));Anthropic 的 Claude Sonnet 3.7(Anthropic (2025))和 Claude Sonnet 4.6(Anthropic (2026));Google 的 Gemini 2.5 Pro(Google (2025))和 Gemini 3.1 Pro(Google (2026));以及 xAI 的 Grok 4(xAI (2025))和 Grok 4.20。我们的模型选择标准包括公众关注度和综合表现、处理图像输入的能力、在 OpenRouter³³https://openrouter.ai/ 上的可用性,以及各提供商免费计划中通过网页界面的可用性。最后一项标准是出于方法论动机:考虑到高中生在实际生活中使用 LLM 的潜在可能。同样,从每家提供商选择两款模型的目的在于考察最新可用版本与较旧版本之间是否存在显著性能差异。

### 4.2 模型推理过程

模型输出通过 OpenRouter API 获取。每个问题通过单独的 API 调用传入。问题文本与提示词(均为波兰语)一起传入,图像输入则包含在额外的 API 调用载荷中。每个简答题在默认温度设置下分别传给每个模型 3 次,以评估模型非确定性导致的潜在不一致性。同样,每个论文主题也传递 3 次,并且对每份试卷中的所有可能主题都进行评估(与必须选择一个主题的学生不同);这一调整使我们能够更全面地评估模型在论文部分的表现——主题涉及不同时期和问题,模型不保证在每个主题上表现同样出色。总共进行了 2688 次简答题 API 调用(2023 年试卷 36 个问题×25 个任务,2024 年 39×25,2025 年 37×24;每个问题集×3 次尝试×8 个模型)和 216 次论文 API 调用(3 个论文主题×每份试卷×3 次尝试×8 个模型)。推理协议中未采用任何上下文学习(in-context learning)范式。

### 4.3 数据准备与标注

每个问题都沿三个维度进行人工标注:地理范围(波兰历史 vs. 全球历史);历史时期(古代、中世纪、近代早期、十九世纪、二十世纪、PRL——1945 年后的波兰共产主义时期);以及来源材料类型(仅文本、仅照片、照片与文本、表格)。

### 4.4 定量分析

我们计算了三个总体模型排名——所有任务合并、仅简答题、仅论文——基于所有年份和运行汇总的平均归一化分数,并通过 95% 自助法置信区间(5,000 次重复)估计不确定性。排名进一步按每个标注类别进行汇总。在人类与模型比较中,我们计算了 Wasserstein 距离(D.3,D.4)。由于每个模型被评估了全部三个论文主题——而人类考生只选择一个主题——一次完整的模型运行最高可得 90 分,而人类为 60 分。因此,所有比较均使用归一化分数来消除这种不对称性。

## 5 结果

### 5.1 简答题 vs. 论文

图 1 展示了模型在三个分数维度上的排名,呈现三层结构:Claude Sonnet 4.6 和 Gemini 3.1 Pro 以重叠的置信区间领先(96.6% 和 96.2%);Grok 4 和 GPT-5.4 构成明显的第二梯队;其余模型紧密聚在一起,置信区间无法区分。简答题表现与总得分高度一致,确认其是模型之间的主要区分维度。论文得分在七个模型中普遍较高,在基准中不具有区分能力;GPT-4o 是唯一例外,为 90.1%。然而,总体排名掩盖了不同主题和来源类型类别之间的显著不稳定性——并且远高于所有分析年份的人类考生平均水平 44.1%(表 D.3)。

图 1:基于所有年份和运行聚合的归一化分数所显示的 LLM 综合表现:所有任务合并、仅简答题、仅论文。误差线代表 95% 自助法置信区间。

### 5.2 波兰历史 vs. 全球历史

图 2 展示了按地理范围划分的模型排名。几乎所有模型在全球历史任务上的得分都高于波兰历史任务,波兰内容上的性能损失最高达 10.8 个百分点。对于排名前两位的模型,这一差距可以忽略不计,但对于其余六款模型则较为显著,差距在 2.3 到 10.8 个百分点之间——这表明较弱的模型受国家特定内容的影响不成比例地更大。这一划分产生了不可忽视的排名重排:总体排名第三的 Grok 4 在全球历史上得分 97.6%,但在波兰历史上降至 91.7%,落后于 GPT-5.4。按时代划分的细目(图 A.1)也反映了这一模式,二十世纪和 PRL 时期的得分方差最大。

图 2:按地理范围划分的模型排名(简答题)。误差线代表 95% 自助法置信区间。

### 5.3 问题结果的来源类型

图 3 展示了模型×来源类型矩阵中的平均归一化分数。照片+文本任务产生的分数最高且最一致,表明存在天花板效应或冗余线索效应。仅文本任务的跨模型方差最大(69.4%–96.8%),Gemini 2.5 Pro 跌至矩阵中最低单元格。Gemini 3.1 Pro 在仅照片任务上领先(99.0%),Claude Sonnet 4.6 在表格任务上领先(100%),Grok 4 在仅文本任务上领先(96.8%),尽管其总体排名仅为第三。GPT-4o 在所有类型上均低于前沿模型。

图 3:模型×来源类型矩阵中的平均归一化分数。照片+文本任务产生的分数最高且最一致;仅文本任务的方差最大。为清晰起见省略误差线。

### 5.4 最困难的问题

表 C.1 列出了对模型而言最困难且最具区分度的三个问题。这些问题主要出现在 2024 年和 2025 年的试卷中,涉及时间导向推理或二十世纪及 PRL 时期的波兰特定文化内容。问题 11_02_2025 既是基准中最困难的项目,也是区分度最高的项目之一:“确定片段 A–C 中引用的文献哪一份最早出现。通过参考来源和自身知识证明你的答案”(见附录 E)。模型正确识别了来源名称,但未能按时间顺序排列它们。Gemini 和 Grok 4 在所有运行中均获得满分,GPT-5.4 仅在一次运行中获得 1 分,而其他模型在全部三次测试中均得 0 分。跨群体比较显示出一个反转:根据 CKE 报告,人类最难的项目不成比例地涉及照片+文本组合(表 C.2)——而这恰恰是模型表现最一致的题型(图 3)。

### 5.5 失败模式

对所有模型输出的人工检查揭示了两种反复出现的失败模式。第一种,我们称之为来源混淆(source conflation),发生在模型依据所提供的来源的语义内容进行推理,而不是将其视为历史分析对象时(Basmov et al. (2024))。在问题 07_2024(E.4)中,模型一致地推断出年代顺序……【注:原文在此处中断】

相似文章

易于完成,难以选择:探究LLM在ProverbIT基准上的表现

arXiv cs.CL

本文介绍了ProverbIT,一个包含100道多选题的新型意大利语基准,用于测试LLM完成谚语的能力。通过对13个模型的评估,研究发现,在没有正确答案的多选题格式中,模型性能显著下降,这表明模型依赖记忆模式而非深层的语义理解。

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。