翻译作为数据增强:翻译数据对难度评估的影响
摘要
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
arXiv:2607.19101v1 公告类型:新
摘要:可靠的文本难度评估是有效的文本简化工作流和个性化学习应用的前提。然而,稳健评估模型的开发面临一个关键瓶颈:包含细粒度难度级别(例如CEFR)的专家标注语料库的稀缺性,尤其是在低资源语言中。本文针对一种低资源欧洲语言中的数据稀缺问题提出了解决方案。我们提出了一种跨语言数据增强策略,利用机器翻译将标注资源从高资源语言迁移到目标低资源语言。我们训练基于BERT的回归模型来预测难度分数,并研究合成翻译数据是否能够有效补充本土训练集。我们的实验表明,用机器翻译语料库增强稀缺的本土数据显著提高了难度估计的准确性,为缺乏广泛专家标注的语言提供了可行的解决方案。
查看缓存全文
缓存时间: 2026/07/22 08:25
# 翻译数据对难度评估效果的影响 来源:https://arxiv.org/html/2607.19101 ## 翻译作为增强:翻译数据对难度评估效果的影响 Anisia Katinskaia,†‡Anh\-Duc Vu,†‡Jue Hou,†‡Ulla Vanhatalo,♢ Yiheng Wu,‡Roman Yangarber‡ †计算机科学系,‡数字人文学系 ♢芬兰语、芬兰-乌戈尔语及斯堪的纳维亚研究系 赫尔辛基大学,芬兰 first\.last@helsinki\.fi ###### 摘要 可靠的文本难度评估是有效文本简化流程和个性化学习应用的先决条件。然而,稳健评估模型的开发面临一个关键瓶颈:包含精细难度等级(如CEFR)的专家标注语料库极其稀缺,尤其是对于低资源语言。本文针对一种低资源欧洲语言的数据稀缺问题展开研究。我们提出了一种跨语言数据增强策略,利用机器翻译将高资源语言的标注资源迁移到目标低资源语言。我们训练基于BERT的回归模型来预测难度分数,并探究合成翻译数据能否有效补充原生训练集。实验表明,用机器翻译语料增强稀缺的原生数据可以显著提高难度估计的准确性,为缺乏大量专家标注的语言提供了一种可行解决方案。 \NAT@set@cites 翻译作为增强:翻译数据对难度评估效果的影响 Yiheng Wu, Jue Hou, Roman Yangarber赫尔辛基大学,芬兰first\.last@helsinki\.fi摘要内容 ## 1\. 引言 文本复杂度评估——难度评估——在无障碍沟通实践中变得越来越重要,这得益于美国的政策要求¹和欧盟的推动²。它在个性化第二语言教学中同样扮演着关键角色。满足这些要求以及个性化L2教学都依赖于这一共同的技术瓶颈:文本难度的可靠估计。我们认为,难度评估是自动文本简化任务的先决条件:如果没有可靠的指标来确定简化系统输出是否达到目标难度规格,那么该系统就无法得到有意义的指导或评估。 因此,本文聚焦于评估问题。我们将该问题建模为回归任务,其中难度模型预测一个连续分数,该分数随后可映射到CEFR量表³。这类模型不仅对评估学习者文本至关重要,还能在基于大型语言模型(LLM)的简化流程中充当评判器。构建稳健难度模型的一个核心障碍是数据稀缺。高质量的评估需要由领域专家标注的大规模语料库,而这一资源在许多低资源欧洲语言(如芬兰语)中十分匮乏。 为解决这一瓶颈,我们提出了一种跨语言方法:利用高资源语言现有的专家标注语料库,并应用机器翻译生成目标语言的合成标注训练数据。我们提出两个研究问题: 1. 使用高资源语言的机器翻译数据增强的训练数据能否提高低资源语言中难度评估的质量? 2. 在源语言和目标语言之间,基于翻译数据进行训练能在多大程度上提高跨语言泛化能力? 我们训练了一个基于BERT的回归模型来预测连续尺度上的难度分数。结果表明,使用机器翻译数据可以显著提高目标语言中难度评估的准确性和稳健性。本文组织如下:第2节介绍相关工作。第3节描述用于训练的数据集。第4节详述实验设置和结果。第5节给出结论和未来方向。 ## 2\. 相关工作 书面文本难度估计——有时也称为可读性、熟练度或年级水平评估⁴——在教育研究和NLP中都有悠久历史。早期的基于公式的方法,如Flesch-Kincaid和Lexile框架,提供了简单的数值难度分数,但依赖于表层特征,无法捕捉更深层的词汇或句法复杂度。后续的监督系统融入了更丰富的手工特征,包括句法深度、语法结构和词频列表。最近的神经方法——从分层注意力网络到微调后的BERT模型——已显著优于基于特征的基线,并且Transformer模型已与特征工程系统在英语和俄语上进行了比较。大型语言模型也在可读性任务上进行了评估,取得了有竞争力的结果。 难度评估在文本简化流程中同样扮演着重要角色,既可作为识别复杂内容的信号,也可作为基于规则的系统的优化目标。最近的工作已转向反馈驱动的生成,使用可读性分类器结合强化学习,或基于目标阅读水平进行可控生成——这一范式与我们使用难度模型作为LLM简化循环中评判器的思路直接相关。 所有这些方法的一个持续瓶颈是专家标注的难度标签语料库的稀缺,这对低资源语言来说尤为严重。即使是最近的一项英语简化共享任务也没有提供训练数据。对于芬兰语,我们基于现有的标注资源,并通过机器翻译俄语语料库进行扩展,直接针对这一标注数据瓶颈。 我们首先描述用于训练和评估难度模型的芬兰语和俄语数据。一个主要挑战是芬兰语中用于难度预测的标注数据稀缺。为解决这一问题,我们用一个较小的芬兰语文本集合(原生数据)进行增强,这些文本带有难度级别标注,再加上一个较大的俄语文本集合,该集合带有难度级别标注,然后使用机器翻译模型将其翻译成芬兰语。 ### 3.1\. 原生数据 | 整体水平 | EL | TextBook | HS | YLE | Selko | 总计 | |--------|----|----------|----|-----|-------|------| | A1 | 10 | 0 | 0 | 0 | 129 | 4295 | | A1+ | 15 | 30 | 0 | 0 | 15 | 3282435 | | A2 | 0 | 363 | 0 | 0 | 363 | 465828 | | A2+ | 0 | 0 | 0 | 0 | 0 | 9696 | | B1 | 0 | 229 | 0 | 0 | 229 | 3013530 | | B1+ | 0 | 0 | 76 | 76 | 67 | 16722438 | | B2 | 0 | 163 | 0 | 0 | 163 | 834997 | | B2+ | 0 | 0 | 0 | 0 | 0 | 0 | | C1 | 0 | 192 | 0 | 0 | 192 | 484676 | | C1+ | 0 | 715 | 70 | 30 | 141 | 801418 | | C2 | 0 | 175 | 0 | 0 | 175 | 29204 | | 总计 | 15 | 311237 | 15 | 70 | 3766 | 346074574610917 | 表1: 按CEFR级别划分的芬兰语原生和机器翻译(MT)数据集中的文档数量 | 平均数据 | CEFR级别 | # 文档 | # 词数 | # 句子数 | |---------|----------|--------|--------|----------| | RuFoLa | A1 | 1.0 | 301 | 1368.8 | | Encyclop.| A1-A2 | 1.5 | 282 | 3112.3 | | RuFoLa | A2 | 2.0 | 466 | 18310.5 | | Zlatoust | A2-B1 | 2.5 | 965 | 0.8 | | RuFoLa | B1 | 3.0 | 330 | 69112.2 | | Zlatoust | B1-B2 | 3.5 | 167 | 75415.8 | | Zlatoust | B2 | 4.0 | 834 | 22812.8 | | RuFoLa | C1 | 5.0 | 485 | 36314.9 | | RuFoLa | C2 | 6.0 | 293 | 8516.5 | 表2: 俄语标注文档。 我们通过结合多种原生和机器翻译来源,编译了一个芬兰语数据集,涵盖CEFR可读性级别(A1–C2)。表1提供了该数据集组成的概览。原生数据来自五个主要来源: - **简易语言**——来自政府和非政府组织网站的文本集合,采用“简易语言”为母语非芬兰语者编写; - **教科书**——来自L2教材的文本集合,涵盖不同CEFR级别; - **Helsingin Sanomat**——覆盖全国最广的商业新闻网站; - **YLE**——政府新闻网站; - **YLE Selkouutiset**——YLE为母语非芬兰语者和L2学习者提供的简化新闻。 每个来源贡献不同语言复杂度和体裁的文本。**简易语言**和**YLE Selkouutiset**提供针对初学者和中级学习者的简化芬兰语材料,而**YLE**和**Helsingin Sanomat**提供高级CEFR级别(C1–C2)的真实新闻文本。原生语料库总共包含4544篇文本,分布在CEFR量表上。 我们将此集合中的每篇文本分配到11个类别之一——对应6个“主要”CEFR级别,外加5个中间级别,即A1+、A2+、B1+等。引入中间级别的理由如下。一些来源(如教科书)提供了文本到CEFR级别的精细分配。然而,其他来源(如新闻网站)只能给出难度的粗略估计。因此,我们假设新闻文本处于假设水平“C”,大约介于C1和C2之间。 同样重要的是要注意,在建模中我们假设CEFR级别在难度线性标尺上等距分布。这样做是因为CEFR量表上级别的确切间距是潜在的,并未明确知晓。在建模中,第4.1节我们将这些级别映射到1到6的连续数值标尺,保留它们的相对顺序,同时实现基于回归的文本难度预测。 为解决芬兰语数据稀缺问题(尤其是在较低可读性级别),我们用机器翻译文本增强语料库,这些文本在原文中具有CEFR标注。此过程在第3.2节中详细描述。翻译子集(表1中标记为“MT←\leftarrowRU”)包含8321篇文档,反映了原生数据的CEFR分布,以支持平衡训练。包含翻译数据使我们能够检验来自高资源语言的CEFR标注内容是否能提高低资源目标语言的性能。 在原生和翻译子语料库中,数据集涵盖了所有CEFR级别(A1–C2),共12,865篇文本。较低级别(A1–A2+)主要来自**简易语言**、**教科书**和翻译材料,而中级别文本(B1–B2)来自**YLE Selkouutiset**和相应的MT数据。高级别(C1–C2)主要由来自**HS**和**YLE**的真实芬兰语新闻和文学文本代表。这种分布确保了数据集既反映了教学简化的用法,也反映了自然的复杂用法,从而能够跨可读性级别对跨语言迁移和基于翻译的增强进行稳健分析。 ### 3.2\. 翻译数据 我们使用俄语中手动标注了难度的文本资源,并将其翻译成芬兰语来增强训练数据集。我们使用Dmitrieva (2025)中介绍的一系列俄语简易语言语料库。两个已标注的俄语文本语料库如表2所示: - **RuFoLa**语料库,包含为俄语作为外语学习者设计的教材文本; - **RuAdapt**语料库,这是一个俄语-简易俄语的平行语料库,包含为俄语作为外语学习者改编的原始文本。本文中,我们仅使用文学(Zlatoust)和百科子语料库。 | 划分 | FI | RU (MT) | 两者 | |-----|-----|---------|------| | 训练集 | 2,332 | 5,961 | 8,293 | | 开发集 | 263 | 748 | 1,001 | | 测试集 | 865 | 748 | 1,613 | | 总计 | 3,460 | 7,457 | 10,917 | 表3: 按源语言划分的数据划分 我们使用OpusMT模型将俄语文本翻译成芬兰语。⁵ 需要注意的是,机器翻译并不能保证俄语文本在翻译成芬兰语后难度级别保持不变。这个问题——在什么条件下以及在多大程度上MT模型能保留原文的难度级别——值得单独详细研究;我们预计这会严重依赖于MT模型的训练方式。然而,我们实验中使用的这些特定MT模型似乎确实表现出很强的跨翻译保留难度级别能力,这一点通过对母语专家样本的手动检查得到了证实。 | 样本 | TTR | 词汇密度 | 平均词长 | 平均句长 | 平均从句长度 | POS多样性 | |------|-----|----------|----------|----------|--------------|----------| | FI | 0.6993 | 0.6930 | 7.40 | 8.65 | 19.67 | 1.90 | | RU | 0.8262 | 0.5934 | 5.30 | 12.71 | 10.76 | 2.04 | | FI+MT | 0.8598 | 0.6338 | 6.61 | 9.31 | 10.68 | 1.85 | 表4: FI、RU和FI+MT样本的语言特征。 | 实验 | 训练集与开发集 | 测试集 | MSE (%) | RMSE (%) | MAE (%) | R² (%) | |------|----------------|--------|---------|----------|---------|--------| | 1 | FI Native | Native | 5.12 | 22.63 | 12.17 | 97.30 | | 2 | FI Native | MT | 146.84 | 121.18 | 102.59 | -99.71 | | 3 | FI MT | Native | 155.00 | 124.50 | 109.25 | 18.24 | | 4 | FI MT | MT | 24.54 | 49.54 | 26.80 | 66.93 | | 5 | FI Native + MT | Native | 7.57 | 27.5 | 9.43 | 96.01 | | 6 | FI Native + MT | MT | 4.22 | 20.55 | 8.24 | 94.26 | | 7 | RU Native | Native | 19.19 | 43.81 | 26.04 | 73.90 | | 8 | RU Native + MT | Native | 16.72 | 40.89 | 19.43 | 77.26 | 表5: 芬兰语和俄语文本难度预测的模型性能。MT表示通过机器翻译(俄语到芬兰语)进行的数据增强。实验1–8测试了原生数据集与翻译数据集的不同训练与测试组合。 检查俄语语料库中的实例时,我们发现有些实例太短或太……
相似文章
翻译作为计算高效的桥梁:英语BERT用于低资源语言的可行性
本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。
揭秘数据受限语言模型预训练中的训练时数据增强
本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。
基于迁移学习与数据增强的低资源汉语方言辨识
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。
思考式翻译:通过强化学习实现多领域机器翻译的难度自适应推理
本文介绍了Translation with Thought (TwT),一种资源理性的多领域机器翻译框架,可根据输入难度自适应调节推理强度,通过难度感知推理轨迹上的监督微调和强化学习训练而成。TwT-7B和TwT-14B在降低32–60% token用量的同时,在翻译质量上超越了更大的SOTA推理模型。
当英语并非最佳教师:跨语言上下文学习中的源语言效应
本文通过七项任务、六种模型及类型多样的语言,实证研究了上下文学习中的跨语言迁移,表明基于微调的预期并不始终适用,并提出了源语言选择的新启发式方法。