错误编码:多语言语法错误纠正的上下文示例表征检索
摘要
本文介绍了语法错误表征(GER),一种基于错误模式而非语义相似性检索上下文示例的新方法,显著提升了具有上下文学习能力的大型语言模型在多语言语法错误纠正中的表现。
arXiv:2606.15416v1 公告类型:新
摘要:语法错误纠正(GEC)涉及检测和纠正错误的语法用法。虽然具有上下文学习(ICL)能力的大型语言模型(LLM)在各种自然语言处理(NLP)任务上取得了显著进展,但它们在GEC上的少样本表现仍然不理想。这主要是由于难以检索到能够捕捉错误模式而非语义相似性的合适上下文示例。在本文中,我们证明了LLM可以通过其内部状态天然地捕获与语法错误相关的信息。从这些状态中,我们提取了语法错误表征(GER),一种信息丰富且语义中立的语法错误编码。我们基于GER的新型检索方法在多语言GEC数据集的ICL设置中显著提升了性能,提高了纠正的准确性。对于高资源语言,我们在8B大小的开源模型上的结果与Deepseek2.5和GPT-4o-mini等闭源模型相当。对于低资源语言,我们的F_{0.5}分数比基线高出最多1.20倍。该方法为多语言GEC提供了更精确且资源高效的解决方案,为可解释的GEC研究提供了一个有前景的方向。
查看缓存全文
缓存时间: 2026/06/16 11:48
# 编码错误:面向多语言语法纠错的上下文示例表征检索
来源:https://arxiv.org/html/2606.15416
彭广跃,李伟,罗文,王厚峰
北京大学计算机学院多媒体信息处理国家重点实验室
\{agy,wanghf\}@pku\.edu\.cn
weili22@stu\.pku\.edu\.cn,llvvvv22222@gmail\.com
###### 摘要
语法纠错(GEC)旨在检测并纠正语法错误的使用。尽管具备上下文学习(ICL)能力的大语言模型(LLM)在各种自然语言处理(NLP)任务上取得了显著进展,但其在GEC上的少样本性能仍不理想。这主要是因为难以检索到能捕捉错误模式(而非语义相似性)的合适上下文示例。本文证明,LLM能通过其内部状态固有地捕获与语法错误相关的信息。我们从这些状态中提取出语法错误表征(GER),这是一种信息丰富且语义中立的语法错误编码。我们基于GER的新型检索方法在多语言GEC数据集的ICL设置下显著提升了性能,提高了修正的准确性。对于高资源语言,我们在80亿参数的开源模型上取得的结果可与闭源模型(如Deepseek2.5和GPT-4o-mini)相媲美。对于低资源语言,我们的F0.5F_{0.5}分数最高比基线提升了1.20倍。该方法为多语言GEC提供了一种更精确、资源效率更高的解决方案,为可解释的GEC研究提供了一个有前景的方向。111代码已公开于https://github.com/viniferagy/GER。
---
# 编码错误:面向多语言语法纠错的上下文示例表征检索
彭广跃,李伟,罗文,王厚峰††感谢:通讯作者
北京大学计算机学院多媒体信息处理国家重点实验室
\{agy,wanghf\}@pku\.edu\.cn
weili22@stu\.pku\.edu\.cn,llvvvv22222@gmail\.com
## 1 引言
请参考图Figure 1:一个最小工作示例,展示了表征检索的工作流程。给定一个包含修正不足(红色标记)和过度修正(蓝色标记)预测的错误输入,我们首先将模型检测到的错误信息转换为语法错误表征(GER)。然后,我们从错误数据库中检索与GER相邻的示例,这些示例表现出与输入中类似的错误模式。这些示例指导模型进行更精确的修正,并减轻过度修正。
语法纠错(GEC)是自然语言处理(NLP)中的一个重要研究领域,它要求语言模型理解自然句子细微结构背后的句法、语义和语用学(Bryant et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib1))。最初被视为机器翻译的一个特例(Yuan and Briscoe, 2016 (https://arxiv.org/html/2606.15416#bib.bib5); Junczys-Dowmunt et al., 2018 (https://arxiv.org/html/2606.15416#bib.bib6)),GEC已发展出两种主流方法。文本到文本方法(Katsumata and Komachi, 2020 (https://arxiv.org/html/2606.15416#bib.bib61); Sun et al., 2021 (https://arxiv.org/html/2606.15416#bib.bib80); Ingólfsdóttir et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib72))构建错误输入与修正输出句子对,训练编码器-解码器模型;而文本到编辑方法(Stahlberg and Kumar, 2020 (https://arxiv.org/html/2606.15416#bib.bib82); Omelianchuk et al., 2020 (https://arxiv.org/html/2606.15416#bib.bib8))则依赖编码器的能力来识别错误并进行修正。随着大语言模型(LLM)的崛起,它们在GEC上取得了可观的成果(Maeng et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib36); Zeng et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib37))。然而,未针对GEC任务进行专门适配的LLM面临两个主要挑战:未对齐和过度修正(Loem et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib35))。这些模型常常产生与人工标注标签未对齐的修正,并且可能过度修正无错误部分,将其重写为更流畅的形式。这种行为违反了人类在纠正语法错误时习惯遵循的*最小编辑距离*原则(Nagata and Sakaguchi, 2016 (https://arxiv.org/html/2606.15416#bib.bib84))。由于少样本推理被广泛用于通过上下文学习(ICL)弥合下游任务中的对齐差距,基于LLM的GEC系统已利用数据库中的修正示例来提升性能和可解释性(Davis et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib34); Song et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib39))。然而,基于句子嵌入或k近邻(kNN)的原始检索方法难以满足语法错误选择的独特需求(Vasselli and Watanabe, 2023 (https://arxiv.org/html/2606.15416#bib.bib16))。语法错误通常是局部的结构性问题,与词义无关,但模型嵌入将句法和语义混合成单一向量,导致无法检索到具有相似错误模式的样本。
本文中,我们主张尽管GEC任务存在对齐问题,但语言熟练的模型能够顺利区分对错并识别错误模式。这表明我们应少关注LLM的生成能力,而更多关注其关于语法错误的内部知识。我们探讨两个关键问题:*语言模型如何在内部编码语法错误?* 以及 *我们能否提取出与语义分离的语法错误表征?* 为了回答这些问题,我们引入了一种新颖的方法来提取语法错误表征(GER),这是一种精确且可解释的语法错误表征,语义噪声较少,用于指导上下文示例的检索。具体来说,我们通过对错误令牌和正确令牌隐藏状态之间的差异应用PCA来计算错误向量(EV)。然后,我们将错误的隐藏状态投影到EV上以获得GER。如图Figure ̃1 (https://arxiv.org/html/2606.15416#S1.F1)所示,我们的GER保留了细粒度错误的接近性:在检索过程中,每个检测到的错误都与相似的错误模式对齐。此外,过度修正的令牌在数据库中查询类似的过度修正案例,从而提高了修正过程的精度。在推理过程中,检索示例的数量会根据句子中检测到的错误动态调整,从而更有效地利用计算资源。
我们进行了大量实验,证明我们在跨四种语言的五个GEC数据集上持续取得更优性能。无需额外训练或生成,我们即可为ICL获得高质量且可解释的示例。我们的结果超越了最先进(SOTA)的GEC检索方法,对于英语等高资源语言,F0.5F_{0.5}分数提升了高达9.46点;对于爱沙尼亚语等低资源语言,提升了1.20倍。在开源的80亿参数模型上,我们的方法取得了与Li等人(2025 (https://arxiv.org/html/2606.15416#bib.bib67))报告的闭源LLM基线(如Deepseek2.5和GPT-4o-mini)相当的结果。我们的贡献总结如下:
- • 我们引入了一种新颖的方法,将语法错误与语义信息分离,并转化为语法错误表征(GER),这是一种高质量的语法错误编码。
- • 我们开发了一个基于GER的有效检索器,用于查询具有相似错误模式的示例,从而在多语言数据集上实现强大的ICL。
- • 据我们所知,我们是首个探索语法错误与LLM表征之间关系的工作,为利用LLM表征指导GEC任务提供了新见解。
## 2 相关工作
### 2.1 语法纠错
语法纠错(GEC)系统在校对、教育和第二语言习得中有广泛应用(Kaneko et al., 2022 (https://arxiv.org/html/2606.15416#bib.bib70); Caines et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib2); Liang et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib71))。研究主要聚焦于两种基于Transformer的方法:序列到序列生成(Yuan and Briscoe, 2016 (https://arxiv.org/html/2606.15416#bib.bib5); Junczys-Dowmunt et al., 2018 (https://arxiv.org/html/2606.15416#bib.bib6); Li et al., 2022 (https://arxiv.org/html/2606.15416#bib.bib83))和序列到编辑标注(Awasthi et al., 2019 (https://arxiv.org/html/2606.15416#bib.bib7); Omelianchuk et al., 2020 (https://arxiv.org/html/2606.15416#bib.bib8))。考虑到语法错误的局部性和稀疏性,研究人员常通过生成合成数据(Stahlberg and Kumar, 2024 (https://arxiv.org/html/2606.15416#bib.bib68))、融入额外信息(Zhang et al., 2022 (https://arxiv.org/html/2606.15416#bib.bib13); Fei et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib20))或在推理时添加额外处理步骤(Lai et al., 2022 (https://arxiv.org/html/2606.15416#bib.bib9); Zhou et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib14); Zhang et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib12); Li and Wang, 2024 (https://arxiv.org/html/2606.15416#bib.bib10))来提升性能。近期工作也探索了LLM用于GEC,无论是通过直接修正生成(Loem et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib35))还是指令微调(Fan et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib38))。尽管LLM存在过度修正和未对齐等挑战(Vasselli and Watanabe, 2023 (https://arxiv.org/html/2606.15416#bib.bib16)),人类评估往往对其修正评价较高(Zeng et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib37))。
### 2.2 LLM中的可解释表征
尽管由于参数量巨大,LLM常被视为黑盒,但近期研究表明,它们在其表征中发展了涌现结构(Elhage et al., 2021 (https://arxiv.org/html/2606.15416#bib.bib79); Zou et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib73))。在最简单的情况下,模型内的单一维度足以表征特定行为(Arditi et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib77); Sheng et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib78));更复杂的回路可能涉及分布在多层中的数十个神经元,相互作用形成有意义的组件(Wang et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib74))。这些可解释组件可以通过添加、删除、替换或微调等技术来理解和控制(Liu et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib75); Wu et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib76))。我们的工作是首个探索并利用LLM中与语法错误相关的表征的研究。
### 2.3 GEC中的上下文学习
LLM已展示出将生成结果与多个上下文示例的知识领域和风格对齐的能力(Brown et al., 2020 (https://arxiv.org/html/2606.15416#bib.bib55); Saakyan and Muresan, 2024 (https://arxiv.org/html/2606.15416#bib.bib86))。少样本推理范式避免了与下游任务微调相关的额外参数和计算成本。提示中示例的选择在很大程度上影响ICL的性能。研究人员通过过滤数据(He et al., 2021 (https://arxiv.org/html/2606.15416#bib.bib85); Peng et al., 2023 (https://arxiv.org/html/2606.15416#bib.bib26))或优化查询编码和检索算法(Li and Qiu, 2023 (https://arxiv.org/html/2606.15416#bib.bib27); Wang et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib28))来提升检索结果。最有帮助的示例通常与查询具有相似编码,同时具有足够的多样性以增加信息熵。然而,对于GEC任务,这一选择目标难以实现。由于句法和语义的纠缠,错误编码倾向于检索意义相似而非错误类型相似的示例(Vasselli and Watanabe, 2023 (https://arxiv.org/html/2606.15416#bib.bib16); Song et al., 2024 (https://arxiv.org/html/2606.15416#bib.bib39))。近期工作通过让模型写出错误解释,然后基于解释嵌入检索错误来解决这一纠缠问题(Li et al., 2025 (https://arxiv.org/html/2606.15416#bib.bib67))。尽管检索性能有所提升,这些方法仍受限于粗粒度的句子级别和生成解释引入的语义噪声。此外,尚无工作解决过度修正问题。
## 3 方法
本节中,我们描述了一种提取表征语法错误信息向量的新方法,并利用这些向量创建语义中立的语法错误表征(GER)。训练数据集中的GER存储在一个数据库中,每个错误关联其原始文本和修正文本。在推理过程中,模型基于GER检索类似的修正示例以指导修正,并能根据输入句子的复杂度灵活动态调整示例数量。最终GEC预测通过将检索到的示例与修正模板结合生成。
请参考图Figure 2:所提出的面向少样本GEC的表征检索流程。左图:提取最能反映错误信息的隐藏状态,并通过PCA转化为错误向量(EV)。在EV上的投影,即语法错误表征(GER),作为键存储在数据库中。右图:测试输入的GER作为查询,检索相似错误模式以辅助修正。
### 3.1 错误向量的提取
给定一个GEC数据集S={\(x^{(k)}, y^{(k)}\)}_{k=1}^{N},每个样本包含一个潜在错误的文本xx及其平行修正文本yy。xx使用初始修正提示(可以是零样本或填充了随机初始示例333初始提示中示例的选择在Section5.3 (https://arxiv.org/html/2606.15416#S5.SS3)中讨论。)进行提示。在生成初始预测y^\hat{y}的过程中,我们提取模型第tt层第ii位置的隐藏状态,记为hi(t)\mathbf{h}_{i}^{(t)},得到集合H(t)\mathcal{H}^{(t)}。特定层tt的选择在5.2 (https://arxiv.org/html/2606.15416#S5.SS2)中讨论。为简化,后续公式省略层索引。
y^=LLM(promptinit(x)) (1)
H(t)={hi(t)∣∀i∈{1,...,|y^|}} (2)
通过比较xx和y^\hat{y},我们识别LLM所做的所有编辑,并收集编辑位置集合E\mathcal{E}和未编辑位置集合U\mathcal{U}。对应的隐藏状态为HE\mathcal{H}_{\mathcal{E}}和HU\mathcal{H}_{\mathcal{U}}。相似文章
SERC: 基于LDPC思想的语义纠错用于检索增强生成
提出SERC,一种受LDPC码启发的无需训练的方法,通过将生成过程视为噪声信道,并利用稀疏验证查询与外部证据对比,来纠正大语言模型中的幻觉。
当正确示例有害:重新思考语境学习中示例的作用
本文揭示了一个反直觉的现象:语境学习中的正确示例反而可能降低模型准确率,并引入任务保持扰动来研究示例正确性与实用性之间的差距。
CoCoGEC:用于鲁棒语法错误纠正的反事实生成
提出CoCoGEC,一种反事实生成框架,通过改变GEC训练数据中与错误无关的上下文来提升模型鲁棒性,在扰动基准上取得了显著的F0.5提升。
评估本地LLM机器翻译中的提示范围与示例相似性
本文评估了提示范围(单目标 vs. 家族范围)和示例相似性(随机、词汇、嵌入)对本地LLM在英语到罗曼语系和英语到日耳曼语系翻译质量的影响,发现专用机器翻译系统仍然表现更好,且嵌入检索带来适度的提升。
大型语言模型能否可靠地纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究
本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。