可解释、公平评估的自动化第二语言口语评估,超越单一人评判者上限,以及为什么停顿编码不改变大语言模型流畅度评分

arXiv cs.CL 论文

摘要

本文介绍了一个可解释的特征-大语言模型混合系统,用于自动化第二语言英语口语评估。该系统优于个别受过训练的人类评判者,并表明停顿编码对大语言模型流畅度评分没有显著影响。

arXiv:2608.26137v1 公告类型:新 摘要:第二语言(L2)英语学习者很少有机会与搭档练习口语。口语也是最令人焦虑的技能。这些缺口推动了自动化口语练习和评分的快速增长市场。但自动化评分只有在准确、可解释、公平,并且针对正确的人类基准进行校准时才值得信赖。我们构建了一个可解释的特征加大语言模型混合系统,用于自发性L2对话。我们从未将其拟合到人类标签,而是针对ICNALE全球评分档案进行评估:140段语音由约80名受过训练的评判者根据10个分析标准进行评分。我们对130段具有可用音频的L2语音进行评分。一个确定的De-Jong语音时序复合指标达到rho=0.764。与单个文本大语言模型流畅度判断结合后,针对共识金标准达到Spearman rho=0.818。这与80名个体受过训练的评判者中的81%以上达成共识:高于中位数评判者(rho=0.73)并接近最佳,并且达到可靠性校正最大值(kappa_max=0.99)的约83%。结合比单独复合指标提高了+0.054(配对自助法95% CI [0.017, 0.108],排除0);大语言模型添加了一个粗糙的流畅度排名,而连续复合指标对其进行细化。我们还报告了关于停顿编码的对照零假设,在此样本量下,其效应范围约为±0.1 rho。固定大语言模型和学习者词汇,仅改变停顿写入提示的方式,内联停顿位置不优于聚合停顿统计(-0.069,CI [-0.15, +0.08]),而基于子句中点的标准没有可靠的增益。流畅度信号来自测量的语音时序特征,而不是停顿如何为大语言模型编写。我们用两种一致的学习者隔离方法、配对自助法CI、单声道负对照、每个特征的经典测量重现以及每个母语公平性审计来支持每个主张。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:19

# 可解释、公平评估的自动化L2口语评估,超越单人评估上限——以及停顿编码为何不改变LLM流利度评分
来源:https://arxiv.org/html/2608.26137
###### 摘要

二语(L2)英语学习者很少有机会与搭档练习口语,而口语也是最令人焦虑的语言技能。这些空白推动了自动化口语练习与评分市场的快速增长。然而,自动化评分只有具备准确性、可解释性、公平性,并且以*正确*的人类基准作为参照,才是可信的。我们为即兴L2对话构建了一个可解释的特征+LLM混合评估模型。我们在从未拟合人类标签的情况下,使用ICNALE全球评分档案库对其进行评估:该库包含140个语音片段,由约80名训练有素的评分员依据10个分析性标准进行评分。我们对130个具有可用音频的L2语音片段进行评分。一个确定性的De-Jong语音时序组合特征达到ρ=0.764。将其与单一的文本LLM流利度判断相结合,在共识黄金标准上达到了斯皮尔曼相关系数ρ=0.818。这一结果与共识的一致性超过了80名训练有素评分员中的81%(高于中等水平评分员ρ=0.73),并接近最佳水平,达到了信度校正后最大值(κ_max=0.99)的约83%。该组合比单独的组合特征提升了+0.054(配对bootstrap 95% CI [0.017, 0.108],排除了0);LLM提供了一个粗略的流利度排序,由连续的组合特征进行细化。我们还报告了一个关于停顿编码的控制性零假设,在本样本量下,其效应范围被限定在约±0.1 ρ以内。在固定LLM和学习者词语、仅改变停顿写入提示的方式时,内联停顿*位置*并不优于聚合停顿*统计量*(-0.069, CI [-0.15, +0.08]),而基于语言学基础的子句内标准并未带来可靠的增益。流利度信号来自测量的语音时序特征,而非为LLM书写停顿的方式。我们以两种一致的“学习者隔离”方法、配对bootstrap置信区间、独白负对照、对经典测量的逐特征复现,以及按母语的公平性审计来支持每一项主张。

## 1 引言

二语习得理论认为,学习者不仅通过接收语言来进步,还通过*产出*和*协商*语言来进步。Swain的输出假说源于加拿大法语沉浸式数据。他认为,仅有可理解输入是不够的。学习者必须产出“推动性输出”以注意到差距、检验假设,并发展准确性和流利度(Swain, 1985; 1995)。Long的互动假说进一步指出,习得是由互动调整驱动的。这些调整包括澄清请求、确认检查和理解检查,它们发生在与对话伙伴协商意义的过程中(Long, 1996)。其含义是明确的:理论所强调的互动性口语,恰恰是独自学习者无法自我提供的。

这一点之所以重要,是因为口语是L2英语学习者最缺乏练习机会的技能。在许多英语作为外语的教学环境中,课堂对话由教师主导,班级规模大,课外接触机会极少。对于许多学习者来说,课本是他们接触英语的唯一场所(ERIC EJ1319829, 2021)。口语也是最令人焦虑的技能。Horwitz、Horwitz和Cope将外语焦虑确立为一个独立的构念,其首要且主要的组成部分是说话时的交际忧虑(Horwitz et al., 1986; ERIC EJ1305502, 2019)。跨国学习者调查大规模地证实了这一模式。害怕开口和犯错是语言学习成功的最大障碍(Preply, 2025)。现在,AI对话伙伴正在大规模地解决这一可及性与焦虑性的鸿沟。经过同行评审的证据表明,无评判的AI练习既能提高语言水平,又能降低口语焦虑(Ding & Yusof, 2025)。同一浪潮也将自动化口语*评分*应用于大学招生等高风险场景(Isaacs et al., 2023)。

但是,自动化口语评分的价值仅在于其可信度。最近一项对商业评分工具的比较研究发现,其与人类评分员的相关性约为r≈0.85,同时也发现了分数虚高和细节遗漏的问题,并且操作实践中仍将疑难案例交由人类处理(Chen & Sun, 2025)。这带来了两个后果。首先,正确的评估目标是*在已知评分员不可靠性下的人类评分员间一致性*,而非单一的无噪声黄金标签。模型应该与单个人类训练有素评分员实际达到的水平进行比较,并与纠正评分员噪声后完美模型可能达到的最高分数(即信度校正上限)进行比较。其次,高相关性并不能使一个不透明的系统变得可信。一个可解释的评分器,在*未经标签拟合*的情况下进行评估,才是值得研究的对象。因此,机器口语评分必须准确、可解释、公平,并在正确的基准下进行诚实评估。

我们研究现代语音时序特征和大语言模型(LLM)是否能够公平地对即兴L2对话进行评分,并与一个独特丰富的人类黄金标准进行对比。该标准是ICNALE全球评分档案库(GRA),其中包含140个语音片段,由约80名训练有素的评分员依据10个分析性标准进行评分。我们提出一个正面主张和一个负面主张,并将它们严格区分。我们的贡献有四方面:

- •一个可解释、公平评估的评分器,超越单人评分上限。一个De-Jong语音时序组合特征(符号预先固定,未拟合人类标签)与一个LLM流利度判断相结合,达到了ρ=0.818。这比80名训练有素的个体评分员中的81%更符合共识(高于中等水平评分员),并达到了信度校正上限(κ_max=0.99)的约83%。该组合比单独的组合特征提升了+0.054(配对bootstrap CI [0.017, 0.108],排除了0),主要是解决了LLM粗略的平局问题。
- •关于LLM停顿编码的控制性零假设。我们仅改变停顿写入提示的方式。内联停顿*位置*并不优于聚合停顿*统计量*(-0.069, CI [-0.15, +0.08]),而基于语言学基础的子句内×词频标准并未带来可靠的增益。三种停顿编码表现大致相同,所有差异都在置信区间内。
- •对完整140×80×10 GRA矩阵的信度校正上限分析,报告了单评分员vs共识的ρ=0.621,平均成对评分员间相关ρ=0.979,以及Cronbach α=0.979,并给出了有原则的κ_max和类人目标基准。
- •广泛的验证,这是本文的标志:两种独立且一致的学习者隔离方法、每个对比的配对bootstrap置信区间、独白负对照、对经典De-Jong量级的逐特征复现,以及按母语的公平性审计。

论文其余部分将回顾相关工作(§2),描述数据(§3)和方法(§4),呈现结果(§5),用专门章节讨论验证与鲁棒性(§6),讨论解释(§7)与局限性(§8),并在结论(§9)中附上明确的诚实性声明(§10)。

## 2 相关工作

### 2.1 经典的自动化口语与流利度评估

L2口语的自动化评估有着成熟的工程谱系,植根于基于特征的评分引擎。ETS的SpeechRater(Zechner et al., 2009)开创了操作性的口语回应评分。它提取可解释的特征——流利度、发音、韵律、词汇和语法——并通过一个经过人类评分员验证的线性模型进行组合。此类系统的流利度部分直接建立在de Jong等人(2012)定义的言语流利度测量基础上。他们将速度、停顿和修复流利度分解为可计数的声学测量:语速、平均语段长度,以及无声停顿和填充停顿的频率与持续时间。他们证明这些测量可以解释人类水平判断的很大一部分差异。这些特征的预测能力稳健且量化充分。Suzuki等人(2021)的元分析报告,在各项研究中,*语速*与水平的相关性为r=.76,*平均语段长度*为r=.72,*停顿频率*呈负相关r=-.59。这些并非偶然的相关性。它们是每个已部署的口语评分器的经验支柱,并且正如我们所示,它们仍然难以超越。我们的确定性组合特征是对De-Jong特征系列的忠实再实现。我们每个特征的相关性方向和大致量级在我们的语料库中保持一致。平均语段长度(ρ=+.75)和停顿比(ρ=-.72)与先验值紧密吻合。我们*包含停顿的语速*(ρ=+.68)与de Jong排除停顿的语速测量方式不同,因此我们将其解读为方向一致的认可,而非对+.76先验值的精确复制。

### 2.2 自监督语音表示

第二条研究路线用自监督语音表示替代手工设计的特征,例如wav2vec 2.0(Baevski et al., 2020)、HuBERT(Hsu et al., 2021)和WavLM(Chen et al., 2022)。Bañno & Matassoni(2022)将wav2vec 2.0应用于*ICNALE*(我们使用的语料库)上的L2水平评估。他们报告,一个冻结的wav2vec 2.0表示达到了77.9%的CEFR准确率,而BERT文本基线仅为53.5%。这表明声学信号包含了仅转录文本无法提供的水平信息。Liu等人(2023)更进一步,构建了一个基于SSL特征和聚类的无ASR流利度评分器。在他们的数据上,该评分器达到了0.797的相关性,而手工特征仅为0.690。这些结果激励我们使用声学表示,但有两个注意事项适用于我们的场景。最大的SSL优势恰恰是我们的De-Jong特征已经捕获的时间/流利度信号。此外,SSL编码器也会编码L1和口音。这对我们数据中的十种亚洲L1语言构成了公平性风险。因此,我们视SSL为一个受公平性约束的附加组件,而非核心。

### 2.3 语音-LLM评分器

最新一波研究将语音编码器与大语言模型相结合。这些评分器直接从音频中评分——并且常常*解释*——L2水平。Ma等人(2025)在Interspeech 2025上评估了用于L2水平的语音-LLM评分器。Radboud团队(Parikh et al., 2026a, b, c)在speechocean762上系统地构建了受量规指导、多评分员、输出理由的语音-LLM评估器,其中微调的Qwen2-Audio在句子级流利度PCC上达到了0.85。这一系列研究的一个反复发现是,零样本音频LLM在评判表达方面表现不佳。它们系统地给出过高分数。Qwen2-Audio在零样本使用中,流利度评分基本等同于随机(PCC 0.053),其韵律相关性在直接匹配下仅为0.140(Parikh et al., 2026c)。Bañno等人(2025)则采取可解释的纯文本路线。他们用转录文本和CEFR能力描述词来提示大型LLM(总体PCC≈0.76),但*明确排除*作为文本无法获取的声学流利度线索。这些系统要么处理不当(零样本音频),要么放弃处理(基于描述词的文本)的声学流利度信号,正是我们的研究工作的切入点。

### 2.4 将韵律和停顿文本化供LLM使用

有一条研究路线是将声学结构渲染为LLM提示中的*文本*,我们的方法比较直接建立在此基础上。SpeechCueLLM(Wu et al., 2025)通过阈值对声学特征进行分箱,并用文字描述以用于情感识别。这是“声学即文本”最清晰的模板。与我们最接近的是TextPA(“Read to Hear”;Chen et al., 2025),它向零样本LLM提供附有IPA、CMU音素和*内联停顿持续时间*(例如“D (0.12s pause) G”)的转录文本,用于发音和流利度评分。它在MultiPA上达到了0.650的流利度PCC,与监督系统融合后达到0.784。TextPA确立了这种机制:将停顿位置文本化,然后让LLM判断流利度。一个广泛共享的观点是,告诉LLM停顿*在哪里*应该比原始的聚合统计量更有助于其判断流利度。下文的L2心理语言学为这一观点提供了动机。我们通过一个控制性比较,测试了将停顿写入提示的三种方式。

### 2.5 LLM作为裁判与比较判断

我们的评估设计借鉴了更广泛的“LLM作为裁判”文献。MT-Bench及相关裁判研究(Zheng et al., 2023)确立了LLM裁判的潜力和偏见。比较判断方法已反复证明优于逐点评分。LCES(Shibata & Miyamura, 2025)报告,成对比较显著提高了二次加权卡帕系数(QWK),例如在TOEFL11数据集上使用Llama-3.1-8B,QWK从0.021提升至0.633。Liusie等人(2024)在自然语言生成评估中的规范性比较评估研究得出了同样的结论。这些结果来自*论文*和文本自然语言生成评分,而非语音。它们为我们理解逐点LLM评分中一个被测量到的缺陷(粗略分箱、频繁平局)提供了背景,但这并非本文的主要贡献。

### 2.6 评估方法论与人类上限

一个评分器只能在目标自身的信度已知的情况下进行评判。经典测试理论提供了校正方法。Uto(2026)最近将其引入自动化评估。他推导了可实现的共识上限:给定有限的评分员信度,一个完美模型可能达到的最大相关性。他认为,模型不应因不可减少的人类噪声而受到惩罚。这重新定义了成功标准,从“完全匹配共识”转变为“达到信度校正上限”。

相似文章

在现实对话环境中评估语言模型

arXiv cs.CL

本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。