优化基于词的L2韩语语法错误标注

arXiv cs.CL 论文

摘要

本文通过解决现有资源中的问题(包括表面目标实现和单一参考评估),优化了L2韩语的基于词的语法错误标注,并展示了使用基于KoBART的纠错方法所取得的改进。

arXiv:2605.30545v1 Announce Type: new 摘要:韩语语法纠错(K-GEC)在基于词的评估与许多学习者错误的语素层面位置之间存在结构性不匹配。后置词和动词结尾附着于词汇宿主,但它们编码了必须在纠错和评估中表示的语法关系。本文通过解决现有资源中的三个相关连问题——表面目标实现、韩语特定编辑标注和单一参考评估——来优化L2韩语的基于词语法错误标注。我们根据形态受限的实现规则,从国立国语院(NIKL)L2语料库中重建目标句子,并将其语素层面标注转换为词级的\texttt{m2}编辑。然后,我们定义了一个韩语ERRANT风格标注方案,保留了MRU核心,同时区分功能语素错误、拼写错误、单词边界错误和词序错误。我们还为KoLLA语料库增加了一个额外的参考纠错,从而为韩语GEC提供了一个多参考评估设置。实证验证表明,改进的NIKL目标产生了更低的困惑度,转换后的\texttt{m2}文件与源-目标编辑表示实现了更高的一致性,并且在相同模型设置下,改进的资源提高了基于KoBART的纠错。多参考KoLLA评估进一步减少了对偏离单一参考的有效纠错施加的惩罚,特别是对于神经和提示式GEC系统。这些结果表明,韩语GEC评估不仅依赖于纠错模型,还依赖于反映韩语形态、空格和纠错变异的参考数据和编辑标注。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:25

# 完善面向第二语言韩语的基于词的语法错误标注

来源: https://arxiv.org/abs/2605.30545  
查看 PDF (https://arxiv.org/pdf/2605.30545)

> 摘要:韩语语法纠错(K-GEC)在基于词的评估与许多学习者错误的语素层面定位之间存在结构性错配。助词和谓词词尾依附于词汇宿主,但它们编码了必须在纠错和评估中表达的语法关系。本文通过解决现有资源中三个相互关联的问题来完善面向第二语言韩语的基于词的语法错误标注:表层目标实现、韩语专属编辑标注以及单参考评估。我们在形态约束实现规则下从韩国国立国语院(NIKL)第二语言语料库重建目标句子,并将其语素层面的标注转换为词级的 \texttt{m2} 编辑。然后我们定义了韩语风格的 ERRANT 标注方案,该方案在保留 MRU 核心的同时区分功能语素错误、拼写错误、词边界错误和词序错误。我们还为 KoLLA 语料库增补了一个额外的参考纠错,从而为韩语 GEC 提供了多参考评估设置。实证验证表明,经过精炼的 NIKL 目标句子具有更低的困惑度,转换后的 \texttt{m2} 文件在源-目标编辑表示上达到更高的一致性,并且精炼后的资源在相同模型设置下改善了基于 KoBART 的纠错性能。多参考 KoLLA 评估进一步降低了对偏离单一参考的有效纠错的惩罚,尤其对于神经和提示型 GEC 系统而言。这些结果表明,韩语 GEC 评估不仅取决于纠错模型,还取决于能够反映韩语形态、空格和纠错变异性的参考数据和编辑标注。

## 提交历史

来自:Jungyeul Park [查看邮件 (https://arxiv.org/show-email/7c89ca8a/2605.30545)] **\[v1\]** 2026年5月28日星期四 20:27:36 UTC (30 KB)

相似文章

通过令牌剪枝优化韩语中心的大语言模型

arXiv cs.CL

本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。