控制L2英语口语自动评分系统中隐式捷径依赖

arXiv cs.CL 论文

摘要

本文提出了一种新颖的训练准则,旨在减少自动英语口语能力评估系统对捷径的依赖,防止考生在没有真正进步的情况下通过利用捷径提高分数。在基于音频和文本的系统的实验表明,该方法降低了与可被利用特征的相关性,使自动评分更接近人工评判。

arXiv:2607.16085v1 公告类型:新 摘要:越来越多地,语音和语言处理任务直接采用音频或文本,而不是从这些中提取特征作为分类器或回归器的输入。这些系统通常使用复杂的、例如基于Transformer的过程,能够推导输入和输出之间的高度非线性映射。不幸的是,这些系统也可能学习到“捷径”,即分类器过度依赖输入的特定方面来产生输出。对于语言能力评估任务,这种过度依赖可能使学习者通过利用捷径而非提高自身能力来提高分数。本文引入了一种新颖的训练准则,能够减少分类器对捷径的依赖,从而限制语言评估中这种作弊的可能性。该方法在两种评估系统上进行了演示:一种基于音频,另一种基于语音识别文本。结果表明,对于这两种系统,与可能被利用进行作弊的特征的相关性高于预期的人类参考值,表明对这些特征过度依赖。通过采用修改后的训练准则,这种相关性可以降低至接近参考相关性。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:36

# 控制二语口语自动评分器中隐式捷径依赖

来源:https://arxiv.org/html/2607.16085

###### 摘要

语音和语言处理任务越来越多地直接使用音频或文本,而非从中提取特征作为分类器或回归器的输入。这些系统通常利用复杂的、例如基于Transformer的过程,能够推导出输入与输出之间高度非线性的映射。不幸的是,这些系统也可能学习到“捷径”,即分类器过度依赖输入的特定方面来产生输出。在语言能力评估任务中,这种过度依赖可能使学习者通过利用捷径而非提升自身能力来提高分数。本文提出了一种新颖的训练准则,能够减少分类器对捷径的依赖,从而限制语言评估中这种不当行为的选择。该过程在两种评估系统上进行了验证:一种基于音频,另一种基于语音识别文本。结果表明,对于两种系统,与可能被利用进行不当行为的特征的相关性均高于人类参考的预期值,表明对这些特征存在过度依赖。通过引入修改后的训练准则,这种相关性可以降低至更接近参考相关性。

## I. 引言

在语音和语言处理中,端到端神经系统的应用日益增多,这些系统直接接收原始音频或文本作为输入,而非先提取人类可理解的特征。基于BERT[13](https://arxiv.org/html/2607.16085#bib.bib26)、ModernBERT[37](https://arxiv.org/html/2607.16085#bib.bib27)和wav2vec 2.0[2](https://arxiv.org/html/2607.16085#bib.bib25)等模型的系统,利用复杂的、基于Transformer的过程,能够推导出输入与输出之间高度非线性的映射。虽然这些模型在广泛的任务上带来了显著的性能提升,但它们也更容易受到捷径学习[19](https://arxiv.org/html/2607.16085#bib.bib40)的风险影响。在这类问题中,模型不仅基于特征与训练集标签的关系可靠性,还基于特征从输入中提取的难易程度来利用数据中的方面(特征),导致对表层方面的过度依赖以产生输出。

在语言能力评估任务中,这种过度依赖具有直接的实际后果:在一项旨在“欺骗”自动作文评分器的研究中,最有效的投稿只是将同一段落重复了37次,结果从系统获得了最高分,而人类阅卷员却给出了最低分[28](https://arxiv.org/html/2607.16085#bib.bib48)。对于口语而言,类比很简单:一个只是不停说话(甚至重复)的学习者,可能利用相同的长度相关捷径。这种自动评分器可能被考生利用以虚增分数而无需提升实际能力的担忧,在自动作文评分(AES)领域中早已确立。长期以来已有研究表明,自动评分器可能过度依赖作文长度[11](https://arxiv.org/html/2607.16085#bib.bib35), [1](https://arxiv.org/html/2607.16085#bib.bib36), [16](https://arxiv.org/html/2607.16085#bib.bib37)],并且仅利用长度的模型也能在基准数据集上达到最先进的性能[21](https://arxiv.org/html/2607.16085#bib.bib3)]。这引发了旨在提高评分器鲁棒性(围绕评分效度)的研究,包括通过反事实进行推理对齐[36](https://arxiv.org/html/2607.16085#bib.bib7)]、检测对抗性设计的输入[14](https://arxiv.org/html/2607.16085#bib.bib2)],以及通过人机交互补充自动预测[9](https://arxiv.org/html/2607.16085#bib.bib23)]。在口语评估(SLA)中,语速、停顿分布和词数等时间流畅性特征早已被确立为口语能力的预测因子[35](https://arxiv.org/html/2607.16085#bib.bib44), [3](https://arxiv.org/html/2607.16085#bib.bib43), [18](https://arxiv.org/html/2607.16085#bib.bib45)],并对其构念效度进行了严格审视[18](https://arxiv.org/html/2607.16085#bib.bib45)],但这些特征也存在被过度依赖的风险。

由于这些特征既与人类评分相关,又可能在自动评分器过度依赖时被利用,我们的目标是在平衡特征对预测分数的贡献的同时,缓解后一个问题。现有的缓解策略,如特征重加权和长度归一化[11](https://arxiv.org/html/2607.16085#bib.bib35), [1](https://arxiv.org/html/2607.16085#bib.bib36)]、基于梯度的惩罚[32](https://arxiv.org/html/2607.16085#bib.bib8), [33](https://arxiv.org/html/2607.16085#bib.bib10)],以及基于归因的防御[34](https://arxiv.org/html/2607.16085#bib.bib5), [25](https://arxiv.org/html/2607.16085#bib.bib4), [36](https://arxiv.org/html/2607.16085#bib.bib7)],都要求捷径特征是模型的显式可微分输入。而基于微调编码器的评分器直接接收原始音频或语音转录文本,不满足这一条件:例如,响应长度被隐式地吸收到学习到的表示中,从预测分数到该代理特征没有直接的梯度路径。我们提出一种训练目标,通过向主要任务损失添加一个排名相关惩罚项,来惩罚对任何外部可计算的代理特征的过度依赖。两种损失都基于排名,确保在不同动态范围的特征之间具有可比性。该惩罚仅在输出层运行,无需修改编码器或要求显式特征访问,并且适用于基于文本和基于音频的评分器。

我们在Speak & Improve 2025语料库[24](https://arxiv.org/html/2607.16085#bib.bib14), [23](https://arxiv.org/html/2607.16085#bib.bib15)]上,针对四种任务类型,使用ModernBERT文本评分器[31](https://arxiv.org/html/2607.16085#bib.bib29), [29](https://arxiv.org/html/2607.16085#bib.bib13)]和wav2vec 2.0音频评分器[6](https://arxiv.org/html/2607.16085#bib.bib28)]演示了该方法,并分别以词数和语音活动检测(VAD)时长作为相应的捷径代理。零样本Qwen2.5-72B预测[26](https://arxiv.org/html/2607.16085#bib.bib33)]作为外部参考基线。我们的结果表明,可以在控制捷径依赖的同时,保持具有竞争力的评分性能。以人类评分员自身的特征相关性作为参考点,我们识别出两种互补的运行模式:一种*人类对齐*模式,匹配人类对代理特征的依赖程度;以及一种更激进的*不当行为抑制*模式,以可接受的预测准确性代价进一步减少捷径依赖。重要的是,该惩罚主要抑制目标代理相关性,而其余无关特征基本不受影响,表明干预具有选择性,而非导致模型行为的普遍退化。

本研究的主要贡献如下:

- • 一种排名相关惩罚,用于控制端到端模型中隐式捷径依赖,在输出层运行,无需显式特征输入。
- • 跨两种模态的捷径依赖经验证据,以及在所提惩罚下其抑制的跨模态原则性比较。
- • 两种可解释的运行模式,即*人类对齐*和*不当行为抑制*,可由评估设计者选择。

## II. 自动口语评估

自动口语评估系统根据学习者话语,使用原始音频信号 \(x_{1:T}^{(i)}\) 和/或自动语音识别(ASR)转录文本 \(w_{1:L}^{(i)}\) 作为输入,分配一个能力分数 \(\hat{y}^{(i)}\),其中 \(T\) 表示音频帧数,\(L\) 表示识别的词标记数。目标是估计人类考官对该话语的整体判断 \(y^{(i)}\)。这些系统的标准训练准则(例如图1中所示)是最小化 \(y^{(i)}\) 与 \(\hat{y}^{(i)}\) 之间的均方误差(MSE)[23](https://arxiv.org/html/2607.16085#bib.bib15), [6](https://arxiv.org/html/2607.16085#bib.bib28)]:

\[\mathcal{L} = \frac{1}{n} \sum_{i=1}^{n} \left( y^{(i)} - \hat{y}^{(i)} \right)^2 \quad (1)\]

其中 \(n\) 是训练样本数。

(图1:三种典型的自动口语评估系统架构[4](https://arxiv.org/html/2607.16085#bib.bib30)]:a) 手工特征评分器,b) 基于文本BERT的评分器,c) 基于音频wav2vec 2.0的评分器。)

### II-A. 基于手工特征的自动评分器

早期的自动评分器使用一组 \(k\) 个可解释特征 \(\hat{z}_{1:k}^{(i)}\),直接从音频和转录文本中计算得出。然后使用相对简单的模型预测分数:

\[\hat{y}^{(i)} = f_{\theta}\!\left( \hat{z}_{1:k}^{(i)} \right), \quad \hat{z}_{1:k}^{(i)} \leftarrow \bigl\{ x_{1:T}^{(i)},\, w_{1:L}^{(i)} \bigr\} \quad (2)\]

SpeechRater[38](https://arxiv.org/html/2607.16085#bib.bib19), [40](https://arxiv.org/html/2607.16085#bib.bib17), [20](https://arxiv.org/html/2607.16085#bib.bib24), [10](https://arxiv.org/html/2607.16085#bib.bib42)] 和 Linguaskill 口语自动评分器[35](https://arxiv.org/html/2607.16085#bib.bib44), [39](https://arxiv.org/html/2607.16085#bib.bib20), [17](https://arxiv.org/html/2607.16085#bib.bib22)] 就是这种形式模型的例子,典型特征包括语速、发音分数、词汇和语法复杂性的度量。后来版本的 SpeechRater 明确以特征独立性为目标,将最小化提取特征之间的共线性作为设计目标,同时兼顾公平性和构念相关性[10](https://arxiv.org/html/2607.16085#bib.bib42)]——我们在第V节选择捷径代理时重新考虑了这一点。重要的是,每个 \(\hat{z}_{j}^{(i)}\) 都是代表考官隐含考虑的潜在语言构念 \(z_{j}^{(i)}\) 的手工工程代理。例如,ASR转录文本中的词标记数 \(\hat{z}_{j}^{(i)}\) 近似于真实的说话词数 \(z_{j}^{(i)}\)。虽然这种方法透明且可解释,特征直接与口语评估标准相关,但这些特征不太可能覆盖应试者的所有属性。例如,话语连贯性和交际成就等更高层次的能力方面很难用这种方式建模[22](https://arxiv.org/html/2607.16085#bib.bib18)]。

### II-B. 基于微调编码器的自动评分器

大型预训练声学和语言模型的可用性使得能够直接从音频和转录文本进行端到端微调,无需中间特征提取。在基于音频的自动评分器中,wav2vec 2.0[2](https://arxiv.org/html/2607.16085#bib.bib25)]等自监督模型在原始波形上进行微调[6](https://arxiv.org/html/2607.16085#bib.bib28), [4](https://arxiv.org/html/2607.16085#bib.bib30)],得到:

\[\hat{y}^{(i)} = f_{\theta}\!\left( x_{1:T}^{(i)} \right) \quad (3)\]

在基于文本的自动评分器中,BERT[13](https://arxiv.org/html/2607.16085#bib.bib26)]和Longformer[7](https://arxiv.org/html/2607.16085#bib.bib32)]等预训练基础模型在ASR转录文本上进行微调[31](https://arxiv.org/html/2607.16085#bib.bib29), [27](https://arxiv.org/html/2607.16085#bib.bib31), [23](https://arxiv.org/html/2607.16085#bib.bib15)],得到:

\[\hat{y}^{(i)} = f_{\theta}\!\left( w_{1:L}^{(i)} \right) \quad (4)\]

这两种模型都学习隐式编码能力相关信息的潜在表示,而不是像特征工程那样直接显式计算。

### II-C. 大型语言模型作为自动评分器

最近,大型语言模型(LLM)已被评估为基于ASR转录文本的零样本口语评估系统[5](https://arxiv.org/html/2607.16085#bib.bib21)]。接受原始语音和文本指令的语音LLM也已被研究。然而,当前模型的零样本性能不如微调变体[26](https://arxiv.org/html/2607.16085#bib.bib33)]。此外,它们的计算成本限制了其在大规模评估中的部署。因此,本工作专注于微调的音频和文本编码器,而零样本LLM预测作为非微调基线。

## III. 自动评分器中的捷径依赖

### III-A. 测量捷径依赖

系统预测与可解释特征之间的相关性长期以来一直被用作自动评估中过度依赖的诊断指标。在自动作文评分(AES)中,早期版本的e-rater产生的预测与仅使用作文长度时的差异极小[11](https://arxiv.org/html/2607.16085#bib.bib35)]。e-rater V.2明确将降低与长度的相关性作为有效的效度标准[1](https://arxiv.org/html/2607.16085#bib.bib36)]。此后,作文长度与模型分数之间的皮尔逊和斯皮尔曼秩相关被作为标准诊断量进行计算,并且显示了仅利用长度的模型也能在基准数据集上达到最先进的性能[21](https://arxiv.org/html/2607.16085#bib.bib3)]。

类似的问题也出现在口语评估(SLA)中。时间流畅性特征,包括语速、停顿分布、VAD时长和词数,与能力相关,并被用作手工评分引擎的特征[35](https://arxiv.org/html/2607.16085#bib.bib44), [10](https://arxiv.org/html/2607.16085#bib.bib42), [3](https://arxiv.org/html/2607.16085#bib.bib43)]。此类度量在自动口语评估中的效度在文献[18](https://arxiv.org/html/2607.16085#bib.bib45)]中进行了检验,观察到自动语音评估系统通常依赖有限范围的时间和词汇特征,并发现发音率和停顿频率共同解释了功能充分性分数中很大一部分变异。这些方法都属于前面描述的显式特征提取框架。

我们的工作解决了一个不同的问题,即特征由自动评分器从原始音频和ASR转录文本中隐式编码。设 \(\hat{\mathbf{y}} = \{\hat{y}^{(1)}, \ldots, \hat{y}^{(n)}\}\) 和 \(\mathbf{y} = \{y^{(1)}, \ldots, y^{(n)}\}\) 分别表示在 \(n\) 个话语上的模型预测和真实人类分数。对于给定代理可解释特征 \(\hat{\mathbf{z}}_j = \{\hat{z}_j^{(1)}, \ldots, \hat{z}_j^{(n)}\}\),当模型的预测与该代理的相关性强于人类标签时,就存在捷径:

\[\rho(\hat{\mathbf{y}}, \hat{\mathbf{z}}_j) \gg \rho(\mathbf{y}, \hat{\mathbf{z}}_j),\]

相似文章