针对中文学习者语法错误标注的分层分类体系

arXiv cs.CL 论文

摘要

本文提出了一种用于标注中文学习者写作中语法错误的分层分类体系,结合了计算和教学视角,并通过覆盖分析和与语言模型的一致性研究进行评估。

arXiv:2609.02153v1 公告类型:新 摘要:中文学习者写作中的语法错误标注需要既一致又具有语言学意义的标签。本文提出了一种分层方案,将计算中文语法错误纠正(CGEC)与教学错误分析联系起来。该方案首先识别字符和标点级别的拼写错误,根据编辑操作和子类型进行标注。其他错误获得一个三层核心标签,结合编辑操作、语言领域和词性,并可选择针对体、情态、比较、论元结构和补语的中文特定扩展。基于CGEC资源、学习者错误分类和普通话语法,该分类体系通过自动提取的MuCGEC编辑的覆盖分析和一个初步一致性研究进行评估,其中五个大型语言模型将其应用于样本。结果支持分层方法,同时识别出需要进一步细化的类别边界。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:51

# 面向中文学习者语法错误标注的分层分类体系
来源:https://arxiv.org/html/2609.02153
nanummj

邱梦阳,朴正烈
圣伊丽莎白大学,韩国科学技术院
美国,韩国
mqiu@steu\.edu, jungyeul@kaist\.ac\.kr

###### 摘要

中文学习者写作中的语法错误标注需要一套既具一致性又具语言学意义的标签体系。本文提出了一种将计算中文语法错误纠正(CGEC)与教学错误分析相结合的分层方案。该方案首先识别字符和标点层面的书写错误,并根据编辑操作和子类型进行标注。其他错误则采用三层核心标签,结合编辑操作、语言领域和词性,并为体态、情态、比较、论元结构和补语等中文特有现象提供可选扩展层。该分类体系借鉴了CGEC资源、学习者错误分类体系和现代汉语语法体系,并通过自动提取的MuCGEC编辑操作覆盖率分析以及五种大型语言模型对样本应用该体系的一致性初步研究进行评估。结果支持了这种分层方法,同时也指出了需要进一步细化的类别边界。

关键词:中文语法错误标注;学习者语料库研究;错误分类体系;标注方案;教学反馈

## 1 引言

语法错误标注是二语写作研究的基础性工作。通过分类学习者产生的错误,研究者可以考察中介语发展轨迹和特定语言的学习挑战;教师可以提供有针对性的形成性反馈;开发者可以评估写作辅助工具。这些标注的有效性取决于其背后的分类体系。过于宽泛的类别会掩盖有意义的差异,而过于详细的类别则可能难以一致应用。因此,一个有效的分类体系必须在描述的精确性和实际可用性之间取得平衡(Lüdeling and Hirschmann, 2015 (https://arxiv.org/html/2609.02153#bib.bib17); Eryiğit et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib9))。

中文提供了一个特别具有启发性的案例。111此处中文特指现代标准普通话,即所综述语料库和二语课程的目标语言。在中文书写系统中,字符通常将书写形式与音节和语素关联起来,创造了视觉形式、声音和意义之间的紧密关系。书面中文不使用空格标记词边界,因此标注者和自动工具可能对同一句子进行不同的分词。此外,作为一种屈折形态变化较少的语言,普通话在标记时态、数或格时相对有限地使用词形变化。语法意义反而主要依赖于词序、体标记、结构助词和特定构式(Li and Thompson, 1981 (https://arxiv.org/html/2609.02153#bib.bib14); Packard, 2000 (https://arxiv.org/html/2609.02153#bib.bib18))。因此,中文学习者写作中包含了与拼音输入相关的同音混淆、视觉相似字符之间的替换、三个“de”助词(的、地、得)的误用,以及诸如“把”字句和“被”字句等构式中的错误(Li, 2020 (https://arxiv.org/html/2609.02153#bib.bib15); Gu et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib11))。

计算中文语法错误纠正(CGEC)标注通常始于一个学习者句子和一个或多个参考纠正。一个自动程序对齐这些版本,识别被编辑的片段,并根据其表层操作和相关语言属性对每个编辑进行分类。ERRANT为英语确立了这种方法(Bryant et al., 2017 (https://arxiv.org/html/2609.02153#bib.bib3));ChERRANT将其应用于多参考中文语法错误纠正(MuCGEC)基准数据集(Zhang et al., 2022 (https://arxiv.org/html/2609.02153#bib.bib26));Gu et al.(2025 (https://arxiv.org/html/2609.02153#bib.bib11))的中文实现则增加了基于字符读音、字符字形、“的”助词以及重排序类型的区分。这些工具有助于标注和比较大型数据集,特别是用于系统评估(Qiu et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib21))。

学习者语料库研究和中文教学语法从不同的角度看待学习者错误。它们的分类描述了反复出现的学习困难,包括Zhang(2006 (https://arxiv.org/html/2609.02153#bib.bib25))的字-词-句层级结构,以及Li(2020 (https://arxiv.org/html/2609.02153#bib.bib15))详细的功能和构式类别。

因此,计算和教学传统之间存在一个实际差距。计算方案提供了诸如R:VERB这样的稳定标签,但相对较少说明学习者需要理解的语法对比。教学分类提供了更丰富的诊断信息,但往往缺乏用于语料库标注的一致表示。为弥合这一差距,本研究开发了一种分层分类体系,它既保留了基于编辑的计算标注的可重复性,又容纳了教学诊断所需的功能和构式区分。在此过程中,它遵循了错误标注的一般建议,将编辑单元、表层变化、语言层次和相关元数据作为独立维度进行记录(Eryiğit et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib9))。

提出的分类体系将错误信息组织成不同的、模块化的层次。每个错误首先基于一个可观察的编辑操作(缺失、替换、多余、词序或字符序)。一个初步筛选步骤识别字符和标点层面的书写错误,并为其分配一个操作和子类型的标签,形式如op:orth:subtype,例如R:ORTH:phon或CO:ORTH:order,无需词性标记或教学扩展。所有其他错误则获得一个三层核心标签(op:dom:pos),结合编辑操作、一个宽泛的语言领域(词汇内容、词汇功能或结构)和一个词性标记。一个可选的扩展层可以为这些非书写错误标签添加更细粒度的功能和构式类别,包括体态、情态、论元结构和补语构成。这种设计允许项目共享紧凑、标准化的标签,同时根据其教学目标添加诊断细节。

这种明确的规范旨在支持大语言模型辅助标注以及手动标注和传统自动工具。最近的学习者语料库研究使用大语言模型(LLMs)为人类审核提出错误位置、纠正和分类标签(Gajo et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib10); Acharya et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib1)),而中文GEC研究则使用它们生成解释和评估纠正(Li et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib16))。这些应用表明,明确的定义和决策规则对于模型和人类标注者都很重要。

本研究有四个贡献。首先,它综合了具有影响力的CGEC资源和中文学习者错误教学分类体系的设计见解。其次,它将这些见解整合到一个双路径标注架构中,为非书写错误提供可选的教学扩展。第三,它提供了一个全面的类别定义、决策规则和详细示例清单,项目可以根据需要模块化采用。最后,它通过MuCGEC基准中自动提取编辑的类别覆盖率分析以及五种LLM之间标注一致性的初步调查来评估提出的分类体系。

本文其余部分组织如下。第2节(https://arxiv.org/html/2609.02153#S2)回顾了先前的资源并描述了分类体系的设计过程。第3节(https://arxiv.org/html/2609.02153#S3)、第4节(https://arxiv.org/html/2609.02153#S4)和第5节(https://arxiv.org/html/2609.02153#S5)分别介绍了标注方案、教学扩展和参考规范。第6节(https://arxiv.org/html/2609.02153#S6)评估了该分类体系,第7节(https://arxiv.org/html/2609.02153#S7)讨论了其意义和局限性,第8节(https://arxiv.org/html/2609.02153#S8)是结论。在线补充材料提供了与早期资源的详细比较、扩展的教学表格、详细映射以及LLM研究的完整协议和额外结果。222匿名化补充材料可在https://anonymous.4open.science/r/new-cgec-taxonomy-CAFC/获取。

## 2 先前资源、分类体系和设计过程

本节回顾了启发该分层方案的数据集、工具和分类体系,并描述了它们如何影响了方案的设计。

### 2.1 CGEC数据集和错误标注的学习者语料库

三个基准资源尤其具有影响力,每个都以不同的方式表示错误。NLPCC2018(Zhao et al., 2018 (https://arxiv.org/html/2609.02153#bib.bib27)),主要源自Lang-8学习者日志,首先将学习者和纠正后的句子分割成词。然后使用MaxMatch(M2M²)评分器(Dahlmeier and Ng, 2012 (https://arxiv.org/html/2609.02153#bib.bib8))对齐这两个词序列,并将它们的差异组合成编辑,如缺失、多余和替换的词。当存在多种组合方式时,评分器选择最匹配参考纠正的编辑集。由于这个过程在词上操作,不同的分词选择可能会改变生成编辑的数量和范围。MuCGEC为许多句子提供了多个参考纠正,并使用ChERRANT自动提取基于字符的编辑片段和标签(Zhang et al., 2022 (https://arxiv.org/html/2609.02153#bib.bib26); Hinson et al., 2020 (https://arxiv.org/html/2609.02153#bib.bib12))。使用多个参考允许一个学习者句子有多种可能的修复方式,而不是单一固定的答案。YACLC同样记录了备选纠正方案以及提出每个方案的标注者数量(Wang et al., 2021 (https://arxiv.org/html/2609.02153#bib.bib23))。它还区分了最小语法纠正和更广泛的流畅性改写。这种区分类似于学习者语料库研究中严格纠正不合法形式的最小目标假设(TH₁)和同时改进惯用性和话语自然性的扩展或流畅目标假设(TH₂)之间的对比(Lüdeling and Hirschmann, 2015 (https://arxiv.org/html/2609.02153#bib.bib17); Reznicek et al., 2013 (https://arxiv.org/html/2609.02153#bib.bib22))。这些基准支持纠正和系统评估。

其他中文学习者语料库手动分配错误类别。例如HSK动态作文语料库(Zhang, 2009 (https://arxiv.org/html/2609.02153#bib.bib24))、广外-兰卡斯特中文学习者语料库(Chen and Xu, 2019 (https://arxiv.org/html/2609.02153#bib.bib6))以及TOCFL学习者语料库,其标签结合了宽泛的编辑操作和更细的语言类别(Lee et al., 2018 (https://arxiv.org/html/2609.02153#bib.bib13))。这些类别提供了有用的语言信息,但与CGEC中常用的编辑标签是独立开发的。分层表示可以保留这两种信息,同时使它们之间的关系明确化。

### 2.2 先前的中文学习者错误分类体系

先前的中文学习者错误分类体系范围广泛,从宽泛的教学层级到计算导向的类型学。Zhang(2006 (https://arxiv.org/html/2609.02153#bib.bib25))提供了最早的系统分类之一。它将错误组织为字、词和句级类别,涵盖了诸如别字、词序错误、遗漏、冗余和句式杂糅等现象。这种三部分组织对于教学用途是直接的,尽管它对于特定词类和句法结构的作用提供了有限的细节。

Li(2020 (https://arxiv.org/html/2609.02153#bib.bib15))的专著采取了更细粒度的教学方法。其三十章每章都专注于一个反复出现的语法项或构式。有些章节比较学习者经常混淆的项,如“才”和“就”或者三个“de”助词。其他章节解释构式的各部分如何协同工作。例如,分配副词“都”通常与指代多个成员或某个范围的表达连用,而“把”字句则要求有一个受事宾语和一个表明该宾语如何受影响的谓语。在这些情况下,仅识别被编辑的词并不能完全解释错误;学习者还需要理解该词在更大表达或构式中的作用。因此,该专著为教学诊断提供了详细的材料。

最后,Gu et al.(2025 (https://arxiv.org/html/2609.02153#bib.bib11))使用语言学信息丰富的类别改进了自动中文ERRANT标注。他们的实现使用了Stanford Stanza的词性标注(Qi et al., 2020 (https://arxiv.org/html/2609.02153#bib.bib20))。它将与发音相关的替换标记为R:PINYIN,与视觉相关的替换标记为R:SHAPE,同时涉及两者的标记为R:MULTI。它还区分字符序(R:CO)和词序(R:WO),并为三个“de”助词分配专门的标签。这些添加改进了自动提取编辑的描述,而教学说明则提供了关于编辑相关的学习困难或构式的补充信息。

### 2.3 设计过程

该分类体系是通过比较三组资源开发的:主要CGEC数据集和工具(Zhao et al., 2018 (https://arxiv.org/html/2609.02153#bib.bib27); Zhang et al., 2022 (https://arxiv.org/html/2609.02153#bib.bib26); Wang et al., 2021 (https://arxiv.org/html/2609.02153#bib.bib23); Gu et al., 2025 (https://arxiv.org/html/2609.02153#bib.bib11));教学导向的中文学习者错误分类(Zhang, 2006 (https://arxiv.org/html/2609.02153#bib.bib25); Li, 2020 (https://arxiv.org/html/2609.02153#bib.bib15));以及关于显式编码、跨语料库比较和将可观察编辑与其解释分离的学习者语料库研究(Dagneaux et al., 1998 (https://arxiv.org/html/2609.02153#bib.bib7); Lüdeling and Hirschmann, 2015 (https://arxiv.org/html/2609.02153#bib.bib17))。Falko德语学习者语料库为最后一个原则提供了一个有用的先例:它将选定的纠正(即目标假设)与错误的解释分开记录(Reznicek et al., 2013 (https://arxiv.org/html/2609.02153#bib.bib22))。

对于每个资源,我们记录了正在标注的单元、表层编辑操作、分词的作用、可用的词性信息、中文特有现象的处理方式、最小纠正与面向流畅性的改写之间的区别,以及提供的教学解释的程度。

然后我们应用三个测试来决定每个区别应该属于分类体系的哪个部分。首先,如果一个区别可以从学习者

相似文章

使用大语言模型自动标注汉语叙事转录文本

arXiv cs.CL

本文评估了使用大语言模型自动标注汉语口语叙事宏观结构的效果,发现最佳模型在降低65%标注时间的同时,达到了接近人类水平的可靠性,但在语义复杂或词汇多样的叙事文本上性能有所下降。

优化基于词的L2韩语语法错误标注

arXiv cs.CL

本文通过解决现有资源中的问题(包括表面目标实现和单一参考评估),优化了L2韩语的基于词的语法错误标注,并展示了使用基于KoBART的纠错方法所取得的改进。