通过自动预群超标签标注扩展印地语量子自然语言处理

arXiv cs.CL 论文

摘要

本文将印地语自动预群超标签标注构想为量子自然语言处理中的词级分类任务,在一个低资源语料库上评估了多种方法,结果显示上下文回退和词汇修复的准确率约为64%,证明了可扩展的多语言QNLP流水线的可行性。

arXiv:2609.13721v1 公告类型:新 摘要:量子自然语言处理(QNLP)使用预群语法将语法结构转换为图示表示和量子电路。最近的印地语QNLP工作表明,印地语特定的预群语法可以支持语法敏感的组合模型,但语法类型赋值在很大程度上仍然是手动的,限制了可扩展性。本文将印地语自动预群超标签标注构想为词级分类任务。使用一个包含380个印地语句子的手动标注语料库,我们评估了词汇、上下文、基于提示、词汇修复和后缀/形态感知方法。结果显示,在低资源环境中,简单的词汇和上下文模型表现强劲:上下文回退达到了最佳完成准确率64.56\%,而原始Qwen2.5提示仅达到11.65\%。词汇修复将LLM辅助预测提升至64.08\%,展示了用符号语法知识约束生成输出的价值。诊断分析进一步显示,已见和无歧义的词元比未见的词元更容易处理,后缀/形态特征提高了karaka-token的准确性,但未提高整体性能。这些结果表明,印地语自动预群赋值是可行的,并可以在未来的多语言QNLP流水线中减少对人工标注的依赖。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:39

# 通过自动预群超标注扩展印地语量子自然语言处理
来源:https://arxiv.org/html/2609.13721
Gautami Sanjay Naik隶属机构:印度信息技术学院达瓦德分校,达瓦德,印度 电子邮箱:[email protected]
Mithun Paul Saint-Germain隶属机构:亚利桑那州立大学,亚利桑那州,美国
H Aswath Babu隶属机构:印度信息技术学院达瓦德分校,达瓦德,印度 电子邮箱:[email protected]

###### 摘要

量子自然语言处理(QNLP)使用预群语法将语法结构转化为图示表示和量子电路。近期的印地语QNLP研究表明,针对印地语的预群语法能够支持语法敏感的组合模型,但语法类型标注仍主要依赖人工,限制了可扩展性。本文将印地语自动预群超标注问题定义为词元级分类任务。我们使用包含380个印地语句子的人工标注语料库,评估了词法、上下文、提示式、词法修复以及词缀/形态感知方法。结果显示,在低资源环境下,简单的词法和上下文模型表现强劲:上下文回退模型取得了64.56%的最佳完成准确率,而直接使用Qwen2.5提示仅达到11.65%。词法修复将大语言模型辅助预测提升至64.08%,证明了使用符号语法知识约束生成输出的价值。诊断性分析进一步表明,已出现且无歧义的词元比未出现词元容易处理得多,词缀/形态特征提升了karaka词元的准确率但未提升整体性能。这些结果表明,印地语自动预群标注是可行的,并且能够在未来多语言QNLP流程中减少对人工标注的依赖。

###### 关键词:

印地语自然语言处理 量子自然语言处理 预群语法 超标注 大语言模型

## 1引言

量子自然语言处理(QNLP)结合了组合语法、范畴论和量子启发的语义表示。在DisCoCat框架中,语法归约决定了词义如何组合成句义[3 (https://arxiv.org/html/2609.13721#bib.bib3)]。由于预群语法是紧闭范畴,其归约可被解释为串图、张量网络和量子电路[1 (https://arxiv.org/html/2609.13721#bib.bib1), 2 (https://arxiv.org/html/2609.13721#bib.bib2), 5 (https://arxiv.org/html/2609.13721#bib.bib5), 4 (https://arxiv.org/html/2609.13721#bib.bib4), 6 (https://arxiv.org/html/2609.13721#bib.bib6), 7 (https://arxiv.org/html/2609.13721#bib.bib7)]。因此,语法类型标注不仅是预处理步骤;它直接决定了下游QNLP系统使用的图示和电路结构。

印地语是QNLP的重要目标语言,因为它使用广泛且结构与英语不同。它表现出相对灵活的词序、丰富的形态、后置词、助动词构造和karaka式依存关系。这些特性使得直接移植英语语法资源变得不足,并推动了针对印地语的预群语法清单的开发。近期工作开始将QNLP扩展到英语之外,并开发了语法敏感的印地语情感分类流程[20 (https://arxiv.org/html/2609.13721#bib.bib20), 21 (https://arxiv.org/html/2609.13721#bib.bib21)]。然而,这些系统仍然严重依赖人工分配的预群类型。

本文解决了印地语自动预群超标注的瓶颈问题:即为每个印地语词元分配一个来自印地语特定语法清单的有效预群类型。此任务类似于词汇化语法中的超标注,其中丰富的词汇范畴编码了大部分解析所需信息[8 (https://arxiv.org/html/2609.13721#bib.bib8), 9 (https://arxiv.org/html/2609.13721#bib.bib9), 10 (https://arxiv.org/html/2609.13721#bib.bib10), 11 (https://arxiv.org/html/2609.13721#bib.bib11), 12 (https://arxiv.org/html/2609.13721#bib.bib12)]。虽然大语言模型最近在CCG和Lambek范畴语法超标注方面显示出强大结果[13 (https://arxiv.org/html/2609.13721#bib.bib13)],但原始大语言模型提示是否能可靠地为印地语生成精确的符号化预群类型仍不清楚。

我们评估了词法多数投票、上下文预测、上下文回退、大语言模型提示、词法修复以及词缀/感知排序。本研究基于三个问题:印地语预群类型能否被自动预测、大语言模型提示是否优于词法-上下文基线、以及符号修复和形态感知特征是否在低资源印地语环境下有所帮助。我们也使本研究与现代印地语和印度语系自然语言处理资源[15 (https://arxiv.org/html/2609.13721#bib.bib15), 18 (https://arxiv.org/html/2609.13721#bib.bib18)]、基于Transformer的语言建模[16 (https://arxiv.org/html/2609.13721#bib.bib16), 17 (https://arxiv.org/html/2609.13721#bib.bib17)]以及用于提示的Qwen2.5模型族[19 (https://arxiv.org/html/2609.13721#bib.bib19)]保持联系。我们的主要发现是,上下文词法方法优于原始提示,并且大语言模型的输出只有在受符号词法修复约束时才变得有用。

## 2方法论

研究使用预群超标注作为印地语词元级自动处理流程。我们的目标是确定给定印地语句子中每个词元所属的语法类型(预群)。作为评估此任务能否自动化的一部分,我们在一个手工标注的印地语预群语料库上进行了实验,并在单一框架内评估了三种不同方法(词法、上下文和基于大语言模型)。

### 2.1数据集与任务

实验在为印地语量子自然语言处理开发的、手工标注的印地语预群语法语料库上进行。该语料库包含380个句子记录。经过对齐过滤后,使用了376个句子记录和2,048个词元。划分包含303个训练句子、37个验证句子和36个测试句子,其中测试词元有206个。任务是印地语预群超标注,在词元级别进行评估。

在测试集中,206个词元中有166个在训练划分中出现过,40个词元未出现。在已出现的测试词元中,有115个具有歧义的表面形式,意味着相同的词元(小写形式)在训练集中有多个类型。测试集还包含12个携带karaka的词元,71个涉及n_11的词元,以及16个涉及n_12的词元。

### 2.2实验框架

自动印地语预群超标注被构建成一个监督预测任务。完整流程如图1 (https://arxiv.org/html/2609.13721#S2.F1)所示。系统从印地语句子预处理开始,构建词法和上下文特征,使用多个模型预测预群类型,并将预测类型与人工标注的黄金标签进行评估。

图1:自动印地语预群超标注流程。
### 2.3评估的方法

我们评估了全局多数投票、词法多数投票、使用前一词元和下一词元信息的局部上下文模型、上下文回退、零样本和少样本大语言模型提示、重复输入提示、词法修复以及词缀/形态感知排序。上下文回退模型使用层次结构:(prev, w, next) → (prev, w) → (w, next) → w → 全局。大语言模型提示使用Qwen2.5-1.5B-Instruct进行。模型接收一个印地语句子和固定的分词,并被指示为每个词元输出一个预群类型。词法修复针对训练集类型清单验证生成的标签:对于已出现的词,不支持的预测会被上下文回退预测替换;对于未出现的词,无效或缺失的输出也使用上下文回退进行修复。词缀/形态感知候选排序器使用来自词标识、局部上下文、位置、词缀和全局类型计数的加权证据。

### 2.4评估指标与实现

所有模型使用相同的固定训练-验证-测试划分进行测试。主要指标是词元级精确匹配准确率。只有当预测的预群类型与人工标注的黄金类型完全匹配时,预测才被计为正确。此外,还报告了针对已出现和未出现词元、歧义词法项、包含karaka的语法类别、名词类类别、神谕词汇覆盖范围和词缀/形态行为的额外评估。

## 3结果与讨论

本节将展示基于印地语预群超标注方法评估的实验结果,以及这些结果对自动语法类型分配的意义。结果通过表格和图表形式展示。在展示结果后,我们讨论从结果中观察到的趋势,以及这些趋势如何有助于解决印地语预群人工标注的困难。

### 3.1超标注方法的整体性能

表1 (https://arxiv.org/html/2609.13721#S3.T1)提供了被评估算法在印地语预群超标注任务中的总体成功率证据。

表1:36句、206词元测试集上的主要结果。如数据所示,各方法在成功率上存在显著差异。与其他方法相比,全局多数投票基线成功率最低;这表明为所有项分配一个类别(即“一刀切”或全局多数)不能充分反映印地语的语法。如词法多数投票模型所示,使用词级词法特征使模型正确预测预群的能力提高了近30%。

使用上下文信息时,预组的正确预测百分比也有明显提升。三种利用上下文的方法(前一词、词+下一词和上下文回退)都提升了基于词法模型的性能。在这三种方法中,上下文回退方法展示了最高的词元级准确率。这表明利用词元周围直接区域的上下文信息有助于解决许多语法歧义问题。

此外,值得注意的是,尽管基于提示的大语言模型在语言学知识广度上似乎远优于其他方法,但它们无法为测试集中的项生成准确的符号化预群标签。

### 3.2基于大语言模型的预测分析

为评估大语言模型在印地语预群超标注中的应用,研究了多种提示方法。这些实验的结果如表2 (https://arxiv.org/html/2609.13721#S3.T2)和图所示。

表2:Qwen2.5-1.5B 原始提示。仅基于提示的预测未能产生令人满意的印地语预群标注。虽然少样本提示系统平均表现优于零样本提示系统,但其准确率仍远低于上下文系统获得的结果。将输入句子作为提示的一部分重复,对准确率的影响充其量是边际的。

因此,虽然大语言模型或许能够理解印地语句子的句法特性,但生成预群框架所需的显式符号化语法表示似乎是不可能的。这一发现表明,任务的难度不仅在于语义或句法,还在于表示:模型必须从稀疏且高度结构化的语法清单中生成精确的符号类型字符串。

### 3.3词法修复的效果与诊断分析

本研究也探讨了通过词法修复技术提高大语言模型的预测质量。与这些词法修复分析相关的如表3 (https://arxiv.org/html/2609.13721#S3.T3)所示。

表3:词法修复与诊断分析。桶/系统 | 词元数 | 正确数 | 准确率(%)
--- | --- | --- | ---
最佳原始Qwen提示 | 206 | 24 | 11.65
Qwen + 词法修复 | 206 | 132 | 64.08
上下文回退 | 206 | 133 | 64.56
已出现词元 | 166 | 122 | 73.49
未出现词元 | 40 | 11 | 27.50
歧义已出现词元 | 115 | 77 | 66.96
非歧义已出现词元 | 51 | 45 | 88.24
携带karaka的词元 | 12 | 6 | 50.00
n_11词元 | 71 | 42 | 59.15
n_12词元 | 16 | 6 | 37.50
将词法修复纳入模型显著提升了输出质量。基于训练集上下文数据对模型输出施加的额外约束减少了语法相关的错误输出实例。此外,它还提供了诊断证据,表明模型对先前遇到过的词元(即包含在训练词汇表中的词元)的预测准确率远高于对新的(未出现的)词形。而且,正如结果所示,在歧义语法类别(即有多个可能分类的类别)和非歧义词法项(有单一分类的项)的准确率方面存在更大的差异。

神谕词-候选分析进一步支持这种解释。当要求同一词的正确类型出现在词法候选中时,前1、前3和前5神谕准确率分别为52.43%、62.62%和63.59%。对于已出现词,这些值上升到65.06%、77.71%和78.92%,而未出现词的神谕准确率保持在0.00%。这表明词法记忆提供了一个强大但不完整的上限:它对训练中观察到的词非常有用,但不能直接解决未出现词元的问题。

### 3.4词缀/形态分析

进行了额外分析以检查形态感知和基于词缀的信息是否能改善印地语预群超标注。结果如表4 (https://arxiv.org/html/2609.13721#S3.T4)所示。

表4:词缀/形态分析。词缀/形态感知候选排序器达到57.28%的总体准确率,低于上下文回退模型。然而,它将karaka词元的准确率从50.00%提高到58.33%。这表明词缀和表面形式特征对于某些印地语语法关系(特别是karaka相关类别)具有语言学信息,但它们本身不足以超越更强的词法-上下文方法。同时,词缀/形态排序器较低的未出现词元准确率表明,形态感知特征应与上下文和词法回退策略结合使用,而不是作为独立替代方案。

### 3.5讨论

结果为印地语自动预群超标注提供了重要见解。首先,上下文模型更强的表现表明印地语语法类型分配严重依赖于局部词法上下文。上下文回退模型取得了最高的词元级准确率64.56%,这表明在低资源印地语预群环境下,简单的相邻词模式层次结构可以是有效的。

其次,原始大语言模型提示在精确符号预测方面表现不佳。虽然预群超标注可能类似于文本生成任务,但它需要高度特定的结构标签,而最佳的原始Qwen提示条件仅达到11.65%的准确率。这表明,在没有

相似文章

卡在独特的NLP难题上[D]

Reddit r/MachineLearning

开发者寻求在不依赖大模型的情况下对英-印混写文本进行分类的建议,因为句子变换器在处理罗马化印地语时完全失效。

QTrans: 用于情感分类的量子Transformer

arXiv cs.LG

论文提出QTrans,一个用于情感分类的量子-经典混合Transformer模型,该模型使用参数化量子电路进行注意力计算,在基准数据集上实现了比经典基线更高的准确率。

植物表型组学中小数据量子学习的监督潜在重构

arXiv cs.LG

本文提出了一种面向小数据场景下植物表型组学分类的混合量子-经典工作流,通过监督潜在重构(PCA+LDA)在量子核对齐前提升几何可分性。实验显示可分性有所提升,但揭示了压缩权衡以及实现强量子性能的困难。