测量部分分数差距:越南2025凸面评分方案的严格基准测试
摘要
本文介绍了THPT-Ladder,这是一个使用越南2025凸面评分方案评估AI模型的基准测试,揭示了部分分数差距如何导致与标准准确度指标相比的不准确评估。
arXiv:2608.18336v1 公告类型:新
摘要:在评估语言模型在人类考试中的表现时,基准测试通常将每个回答评分对错,并报告整体准确度。这种方法假设部分知识应获得比例分数,但当考试使用非加性评分方案时,此假设失效。越南2025年国家高中毕业考试改革展示了这种替代的代价。在考试第二部分,考生评估每个问题的四个真假陈述。评分为凸面:正确陈述的数量获得0、0.10、0.25、0.50或1.00分。正确识别三个陈述获得0.50分,而非标准准确度指标会奖励的0.75分。由于第二部分占考试10.00分中的4.00分,报告准确度会通过奖励国家明确惩罚的部分知识来夸大分数。我们引入了THPT-Ladder,这是一个包含来自11个学科21个官方考试的632个项目的基准测试,完全按照教育部评分学生的方式评分。教育部公布超过百万考生的分数,使我们能够将模型直接置于人类队列中。在八个模型中,官方评分标准每个第二部分问题支付比比例分数少0.020到0.159分。这一短缺改变了模型的明显能力。对于2025年历史考试中的Qwen3.5-27B,0.042分的短缺使其在481,293名考生中的排名从第90百分位降至第77百分位。模型的准确度并不能预测这种惩罚。在Claude Sonnet 5的准确度水平下,不同的错误分布导致每个问题的得分从0.869到0.932分不等。官方分数取决于正确陈述的分组方式,这意味着标准基准测试报告了机构不会认证的能力。
查看缓存全文
缓存时间: 2026/08/20 10:09
# 衡量部分分数差距:越南2025凸形评分方案的严格基准测试 来源:https://arxiv.org/html/2608.18336 Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh 越南河内邮电学院 [email protected] ###### 摘要 在人类考试中评估语言模型时,基准测试通常将每个回答评判为正确或错误,并报告整体准确率。这种方法假设部分知识应获得相应比例的分数,然而当考试采用非加性评分方案时,此假设不再成立。2025年越南国家高中毕业考试改革的代价便体现在此。考试第二部分要求考生对每个题目中的四个判断题进行评估。其评分方式是凸形的:根据答对的陈述数量,得分为0、0.10、0.25、0.50或1.00分。正确判断三个陈述可获得0.50分,而非标准准确率指标会给予的0.75分。由于第二部分占考试总分10.00分中的4.00分,报告准确率会因奖励国家明文惩罚的部分知识而虚高分数。我们引入了THPT-Ladder基准测试,该基准包含来自11个学科、21场官方考试的632个题目,完全按照教育部对学生的评分标准进行评分。教育部公布了超过一百万考生的分数,这使我们能够直接将模型置于人类考生群体中。在八个模型中,官方评分标准下每个第二部分题目的得分比按比例计分少0.020到0.159分。这一差额改变了模型的表面能力水平。以Qwen3.5-27B在2025年历史考试中的表现为例,0.042分的差额使其在481,293名考生中的排名从第90百分位降至第77百分位。模型的准确率无法预测这种惩罚。在Claude Sonnet 5的准确率水平下,不同的错误分布可导致每个题目得分在0.869到0.932分之间浮动。官方分数取决于正确陈述的分组方式,这意味着标准基准测试报告的能力水平不会得到官方的认可。 关键词:教育评估,自动评估与反馈,部分分数,评分方案,基准测试,大型语言模型,学习分析,越南语 ## 1引言 语言模型的评估在很大程度上依赖于为人类考生设计的考试,其范围包括从由学校考试汇编而成的多任务套件[3 (https://arxiv.org/html/2608.18336#bib.bib3), 4 (https://arxiv.org/html/2608.18336#bib.bib4)]到针对单一国家的基准测试[1 (https://arxiv.org/html/2608.18336#bib.bib1), 2 (https://arxiv.org/html/2608.18336#bib.bib2)]。然而,几乎所有这些基准测试都保留了题目,却摒弃了评分方案。它们将每个题目评判为正确或错误,并报告准确率。这种替代假设部分知识总是值得相应比例的分数。实际上,考试的评分方案精确地编码了部分知识的分数值。用简单的准确率替代该方案,相当于奖励模型答对的每一个片段,使其在实际上会不及格的考试中显得能力很强。 0246810满分10.00分(282,519名考生)及格5.00分固定答案串SDSS1.75分8个模型得分范围6.50–9.50分 图1:2026年参加经济学与法律考试的282,519名考生分数分布图,所有八个模型和一个固定答案串置于同一尺度上。每个标记点位于其对应的分数处,高度与获得该分数的考生人数成比例。在这次考试中,最佳固定答案串是SDSS,无需阅读任何题目即可获得1.75分。在官方规则下评分将模型定位在考试旨在评估的人群之内,这是标准准确率无法达到的结果。越南国家高中毕业考试(*Kỳ thi tốt nghiệp trung học phổ thông*,THPT)使得忽视评分方案的代价变得可衡量。2025年有113万考生参加了该考试。教育部公布了考试、答案钥匙以及规定每种格式如何评分的约束性规则。 这些规则在2025年发生了变化。教育部对考试进行了重组,第764号决定(764/QĐ-BGDĐT)[5 (https://arxiv.org/html/2608.18336#bib.bib5)]现在定义了三种题型:每题0.25分的四选一选择题、将四个判断题作为一个整体评分的题目,以及无选项的简答题。试卷将这些部分分别印为*PHẦN I*、*PHẦN II*,以及在科目包含时出现的*PHẦN III*,我们将其称为第一部分、第二部分和第三部分。现有的越南基准测试均未覆盖这两种新题型。目前最大的数据集VNHSGE,其材料完全来自2019年至2023年的考试,早于此次改革。 第二部分使得部分知识的价值显而易见,因为它是唯一采用非加性评分方案的题型。一个题目中四个陈述被判正确的数量索引了一个凸阶梯函数:阶梯 = (0, 0.10, 0.25, 0.50, 1.00)。正确判断四个陈述中的三个可获得0.50分,而非按比例的0.75分(图3 (https://arxiv.org/html/2608.18336#S4.F3))。当这种题型出现时,它占考试总分10.00分中的4.00分。加性评分会支付0.25*a_q(其中*a_q*是四个陈述中被判正确的数量),而官方支付的是阶梯[*a_q*]。我们将此差值定义为*部分分数差距*,或称*差额*。该差距衡量了模型知识的形态。一个答案大致正确但不完美的模型将落入被惩罚的区域,而一个答案完全正确或完全错误的模型则不会。因此,差额是一个校准信号,而不仅仅是第二个准确率指标(第4节 (https://arxiv.org/html/2608.18336#S4))。 报告这一差额需要一个基线,而标准方法并不适用。将四个陈述进行加性评分会产生一个教育部永远不会给予的分数,并且通过构造消除了差额。或者,将0.25视为随机水平则忽视了凸形评分对猜测者的影响。对每个陈述抛硬币的期望值是: $$\sum_{k=0}^{4} \binom{4}{k} 2^{-4} \, \mathrm{ladder}[k] = \frac{4.90}{16} = 0.30625$$ (1) 相比之下,传统四选一题目的期望值为0.25。阶梯函数确实抑制了幸运获得满分的情况,因为必须四个陈述全部正确(概率为1/16)。然而,它实际上将猜测者的预期收益比0.25提高了22.5%。如果我们根据每个科目公布的结构传播公式(1),整个考试的随机基线是变化的。它在数学学科占总分比例的19.75%到包含24道第一部分题目且无第三部分的五个学科的27.25%之间。因此,单一的“优于随机”阈值既错误地描述了随机猜测的价值,也错误地描述了考试结构的差异性(第3节 (https://arxiv.org/html/2608.18336#S3))。 我们通过应用教育部自己公布的规则来解决这些错误。我们引入了THPT-Ladder,其名称源自学校层级*trung học phổ thông*(高中)。该语料库包含来自11个学科、21场考试的632个题目,所有答案均直接来自教育部的官方钥匙(第3节 (https://arxiv.org/html/2608.18336#S3))。由于考试的难度在年际间波动,我们将每个分数报告为参加该特定考试的考生中的百分位数(图1 (https://arxiv.org/html/2608.18336#S1.F1),第4节 (https://arxiv.org/html/2608.18336#S4))。这个队列正是考试设计所针对的目标人群。由于官方公布了分数分布,我们可以用考试使用的同一尺度来解读模型的分数。 我们在该规则下评估了八个模型以衡量替代成本。测试包括三个开源模型和来自两家供应商的五个闭源模型。Qwen3.5-27B正确判断了92.6%的第二部分陈述,但仅完成了81.0%的第二部分题目。因此,阶梯函数为其支付了每题0.884分,而按陈述逐个计分则支付0.926分。标准基准报告的是这两个数字中较高的一个,而教育部授予的是较低的一个。通过使用公布的队列分数,我们可以将这种差异解读为排名的下降,而不仅仅是一个小数。在2025年历史考试中,这一惩罚使该模型从第90百分位降至第77百分位。差额范围在每个题目0.020到0.159分之间。人们很容易将这种排序解读为阶梯函数对广泛但分散的知识施加了重税。 闭源模型表明这种解释过于简单。当按陈述准确率排序时,差额并不是单调的。准确率根本无法决定非加性评分方案支付多少分数(第5节 (https://arxiv.org/html/2608.18336#S5))。这种效应并非特定于任何模型。差额是阶梯函数在数学上的必然结果,猜测基线则是钥匙构造方式的结果。任何根据第764号决定评分的系统都会遇到这两者。 我们做出了四项贡献。首先,我们发布了THPT-Ladder基准测试,包含来自21场官方考试的632个题目,涵盖所有教育部钥匙和评分规则,允许模型像考生一样被评分,而非简单的准确率评估。其次,我们形式化了差额,它衡量了凸形评分方案的授予分数与基准通常报告的准确率之间的差距,并提供队列分布以将分数转换为人类百分位数。第三,我们证明公布的钥匙在陈述上并非平衡。一个固定的答案串可以利用这种不平衡,在不阅读任何题目的情况下获得考试分数的11.07%至24.25%。最后,我们发布了用于构建该语料库的提取流程。这包括图形提取、各变体钥匙阅读,以及针对第764号决定引入的三种题型的解析器,确保未来的考试可以以最小的精力添加。 ## 2相关工作 有两个越南基准测试与本工作密切相关,但均无法在非加性评分方案下评估模型。VMLU[1 (https://arxiv.org/html/2608.18336#bib.bib1)]衡量58个学科、四个教育层级的学科知识。它使用混合材料而非单一考试,其多项选择题部分严格按正确或错误评分。VNHSGE[2 (https://arxiv.org/html/2608.18336#bib.bib2)]直接建立于高中毕业考试之上,包含超过19,000道多项选择题和300篇文学论文。然而,这些材料来自2025年改革之前的课程,且该基准评估的是两个闭源聊天服务而非任何开源模型。由于这两个基准都描述了2025年之前的考试情况,且缺少评分方案,因此均无法区分一个正确判断三个陈述与一个四个全部正确的模型。越南在这方面并不特殊。其他低资源语言的课程对齐基准,包括LaoBench[6 (https://arxiv.org/html/2608.18336#bib.bib6)]、SinhalaMMLU[7 (https://arxiv.org/html/2608.18336#bib.bib7)]以及一项针对尼泊尔K-10课程的评估[8 (https://arxiv.org/html/2608.18336#bib.bib8)],也将题目简单评判为正确或错误。我们不知道任何包含2025年新题型的公开数据集。 在其他领域,以比整道题更细的粒度对模型评分已是成熟的做法。SteuerLLM[10 (https://arxiv.org/html/2608.18336#bib.bib10)]最接近我们的场景,它对德国税法题目进行逐陈述评分。RadSEM[11 (https://arxiv.org/html/2608.18336#bib.bib11)]将放射科报告分解为原子发现,当存在错误时不给予分数。PsyScore[12 (https://arxiv.org/html/2608.18336#bib.bib12)]应用分级的部分分数项目反应模型,CMPhysBench[13 (https://arxiv.org/html/2608.18336#bib.bib13)]在表达式树上授予非二元分数。然而,这些基准测试中没有一个使用凸形分数函数,即四个陈述中正确三个获得0.50分而非比例的0.75分。我们不知道有任何先前的基准测试针对国家教育部建立的非加性评分方案对语言模型进行评分,更不用说针对实际参加考试的人类群体进行评估了。 研究人员通常通过合成排列选项来测试选项顺序敏感性[14 (https://arxiv.org/html/2608.18336#bib.bib14)]。越南考试则分发24或48个官方试卷变体(*mã đề*)。这些变体不仅仅是彼此的重新排序副本。在我们拥有钥匙的20个学科-年份中,有15个被划分为内容完全不同的组。我们发布所有公布的钥匙以支持未来对这些变体的研究。 ## 3考试与语料库 考试的公开结构固定了差额和仅答案基线。每位考生参加四门科目。每门考试满分10.00分,自2025年改革以来,遵循第764号决定定义的三种题型。教育部设定了评分方案,我们语料库中的每个答案均直接来自教育部公布的钥匙。 越南2025年高中毕业考试——生物,第二部分(PHẦN II) 题目3。图示显示一个家庭中指甲-髌骨综合征和ABO血型系统的两个性状的遗传情况。... 两个基因(N,I)位于第9号染色体上,基因间的交换频率为10%。a)人类种群中与这两个性状相关的表型最多有8种。b)个体II-1产生2种携带这两个性状基因的配子。c)个体I-3的表型由关于这两个性状的5种基因型之一决定。d)II-1和II-2夫妇的第一个孩子患指甲-髌骨综合征且血型为AB型的概率是22.5%。 各模型回答情况 (a) (b) (c) (d) 答案钥匙 正确 正确 正确 正确 Claude Opus 5 正确 正确 正确 正确 4/4 → 1.00分 InternVL3.5-8B 正确 错误 正确 正确 3/4 → 0.50分 Claude Haiku 4.5 正确 错误 正确 错误 2/4 → 0.25分 Qwen3.5-9B 错误 错误 错误 正确 1/4 → 0.10分 Qwen3.5-27B — — — — 0/4 → 0.00分 图2:语料库中的一道第二部分题目,按照教育部的印刷和评分方式呈现。左侧为越南语原文,右侧为我们的英文翻译。四个陈述均为正确(*Đ* = *đúng*)。这单个题目展示了凸形评分阶梯:正确判断四个陈述中的三个获得0.50分,而非按比例应得的0.75分。右侧面板显示了这一规则如何在所有八个模型中造成每个第二部分题目0.020至0.159分的差额。展示了四个模型,表明它们按差额排序与按陈述准确率排序不同。 THPT-Ladder: 632个题目,21场官方考试 陈述准确率 | 获得分数 | 差额 Claude Opus 5 | 0.024 GPT-5.5 | 0.020 Claude Sonnet 5 | 0.054 Qwen3.5-27B | 0.042 0.88 | 0.92 | 0.96 每道第二部分题目(满分1.00) 结构是统一的。第764号决定为每门考试设定了相同的三个部分,通告
相似文章
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
VLegal-Bench: 越南法律推理认知基础基准测试
VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。
当无基准存在时:验证无真实标签的LLM安全评分比较
本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。
VIVID:一个植根于文化的基准,揭示越南语自然语言处理中的比喻语言差距
本文介绍了VIVID,这是首个系统评估越南语中植根于文化的比喻语言理解的基准,包含1,636条习语和谚语。对八个最先进模型的评估揭示了显著差距:越南语专用模型的表现远逊于多语言系统,即使顶尖模型平均正确率也不到50%。
零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解
本文批判了现有的基准污染缓解指标,并提出了SA-PPG(逐题概率差距的分层聚合)以实现更可靠的评估,同时提出了RailCap,一种解码时缓解方法,通过限制贪婪回退令牌来抑制记忆。