基于波你尼语法的印度语言处理基础
摘要
本文提出了一套基于波你尼语法的基准套件,旨在统一跨印度语言的处理,提高准确性、数据效率和可迁移性。
arXiv:2606.24172v1 公告类型:新论文
摘要:超过十亿人使用印度语言进行交流,但服务于这些语言的自然语言处理基础设施仍然分散且不发达。根本原因在于结构性问题:该领域围绕单个语言或小范围的语系分支来组织工具和基准,为每种语言构建独立的分析器、解析器和数据集,然后为下一种语言重新开始。这忽视了深层次的规律性。通过两千多年来围绕梵语的趋同,印度语言共享了一种形态句法架构,这一架构由波你尼的语法《八章书》形式化。这跨越了语系界限,通过一个共同框架将语言统一起来。我们认为,这一波你尼框架提供了该领域一直缺乏的统一计算架构,并且明确基于该框架的基准将使印度语言系统更准确、数据效率更高、更可迁移,有效地将许多看似分散且稀疏的印度语言资源整合为单一的高资源元语言基础。我们提出了一个由四部分组成的基准套件,使这一共享架构变得明确、可测量,并可供实际应用利用。此外,我们强调它为可解释性研究提出的问题:在这些语言上训练的神经模型是否会自行学会表征波你尼的范畴。
查看缓存全文
缓存时间: 2026/06/24 07:45
# 十亿之声的同一元语法:基准与架构 ## 印度语言处理的波你尼基础 **来源:** https://arxiv.org/html/2606.24172 \correspondingauthor Ritwik Banerjee [[email protected]](https://arxiv.org/html/2606.24172v1/mailto:[email protected]) [0000-0003-0336-0258](https://orcid.org/0000-0003-0336-0258) 计算机科学系,石溪大学 石溪,纽约,美国 石溪大学AI创新研究所 石溪,纽约,美国 Lav R. Varshney [[email protected]](https://arxiv.org/html/2606.24172v1/mailto:[email protected]) [0000-0003-2798-5308](https://orcid.org/0000-0003-2798-5308) 石溪大学AI创新研究所 石溪,纽约,美国 电子与计算机工程系,石溪大学 石溪,纽约,美国 ###### 摘要。 超过十亿人使用印度语言进行交流,然而为其服务的自然语言处理基础设施仍然支离破碎且发展不足。其根源在于结构性问题:该领域的工具和基准围绕单一语言或系谱语系的子集组织,为每种语言构建独立的分析器、解析器和数据集,然后为下一种语言从头开始。这忽视了一个深层的规律性。通过两千多年来围绕梵语的趋同,印度语言共享了一种形态句法架构,该架构在波你尼的语法——《八章书》中被形式化。这种架构超越了谱系界限,通过一个共同框架将各种语言统一起来。我们认为,这个波你尼框架提供了该领域所缺乏的统一计算架构,并且明确以此为基础的基准将使印度语言系统更准确、数据效率更高、可迁移性更强,实际上是将许多看似截然不同且稀疏的印度语言资源合并为一个单一的高资源元语言基石。我们提出了一个由四部分组成的基准套件,以使这种共享架构变得明确、可衡量,并准备好被用于实际应用。此外,我们强调了它为可解释性研究提出的问题:训练于这些语言的神经模型是否会自行学习表示波你尼的范畴?印度语言,自然语言处理,波你尼语法,梵语,跨语言迁移,低资源语言,多语言模型,形态分析,依存句法分析,语义角色标注,基准与评估,计算语言学 ††版权:无 ††ccs:计算方法 机器翻译 ††ccs:计算方法 语音识别 ††ccs:计算方法 音系学/形态学 ††ccs:计算方法 语言资源 ††ccs:计算方法 话语、对话与语用学 ††ccs:计算方法 信息抽取 ††ccs:计算方法 自然语言生成 ††ccs:计算方法 词汇语义学 ## 1. 引言 南亚及其他地区超过十亿人每天使用印度语言交流——印地语、孟加拉语、泰米尔语、泰卢固语、马拉地语、桑塔利语等等——然而服务这些使用者的计算基础设施相对于其全球重要性而言仍然严重发展不足。随着翻译、无障碍、教育和信息检索等人工智能驱动工具成为现代生活的核心,自然语言处理(NLP)能为英语或中文所做的事情与能为印度语言所做的事情之间的差距带来了真实的人力与经济成本。缩小这一差距是当今计算界面临的一项重要工程挑战。 然而,进展一直很缓慢。主要原因不是缺乏数据或人才,而是该领域组织自身的方式存在结构性问题。长期以来,在印度语言分类学中对谱系划分的强调导致计算方法碎片化:为每个语系甚至每种语言构建独立的形态分析器、解析器和标注数据集。结果是重复的工程努力、严重的资源限制以及无法跨语言迁移的基准基础设施。这种重复的规模是具体的:仅在通用依存关系(de Marneffe等人,2021)集合中,截至2026年5月的2.18版(Zeman等人,2026),就维护了跨越18种印度语言的24个独立标注树库[¹](https://arxiv.org/html/2606.24172#fn1),每个都是独立构建的,并且它们标注方案之间的转换常常是有损的(Ravishankar, 2017; Rai等人,2025)。每种新语言实际上都需要从头开始构建。 这并不是否认大规模多语言模型的价值或巨大的工程成就(NLLB团队,2024)。但它们的设计目标是广度,而非深度:覆盖数百种语言优化的是翻译流畅度和覆盖面,而非区分印度语言的形态句法和语义结构,并且当前没有任何基准能够揭示这种差异。这些模型确实实现了跨语言迁移,但在印度语言之间传递迁移的单位——共享的和借用的词汇、平行的屈折模式以及编码它们的子词——之所以被共享,正是因为这些语言是由一个共同的波你尼架构组织的[²](https://arxiv.org/html/2606.24172#fn2),无论是通过继承、持续接触还是独立趋同。因此,迁移实际上已经在波你尼的轨道上运行了;这些模型只是隐式地、不完整地利用它们,通过偶然的表面信号而非这些信号所反映的更深层结构。 经验证据带有这种共享架构的印记:即使控制了文字差异,印度语言内部的跨语言迁移也比印度语言与非印度语言之间的迁移更强(Bafna等人,2023; Nag等人,2023),并且基于波你尼原理构建的形态分析器可以跨语系而非仅在语系内部迁移(Goyal and Huet, 2016; Hellwig, 2016)。然而,仅仅依靠规模很快就会达到一个真正的上限。一个固定容量的模型分布在许多语言上会稀释每种语言的质量,收益倾向于高资源语言(Conneau等人,2020a),使得大多数印度语言服务不足。此外,通用子词分词器会分割形态丰富的印度语词汇,而不是恢复其语素(Brahma等人,2025)。 将共享基底变得明确,可以将这种迁移转化为一个可解释且经过设计的机制,使得词位的意义在跨语言的屈折和复合过程中可以被透明地追踪,而不是因基于特定统计的子词碎片化而丢失。缺乏波你尼基础的印度语言间天真的数据共享已经提高了标注准确性(Pawar等人,2023),这表明通过明确的基础化有足够的经验改进空间。由于多语言模型的迁移行为已经揭示它们隐式地学习了一个各语言共有的结构先验,因此,为一个已知是共同基础的印度语言提供可解释的语法,很可能会全面提升语言理解能力。 碎片化的、语言逐一处理的方法与多语言模型的不透明性在同一个事实的错误方向上犯错:印度语言的结构统一性是真实存在的——前者忽视它并付出了重复努力的代价,而后者从中获益却从未认识到其核心作用。这种统一性并非建模产物,而是印度语言使用者跨越语言和谱系界限一致观察到的结构共同点:在动词变位、格标记和黏着等形态模式中,在后置词和分词关系从句等句法结构中,以及在表达施事性、因果性、体貌和示证性的共享框架中,都存在显著平行性。这些现象远非表面的词汇借用,而是反映了超过两千年的语言趋同过程所孕育的深层架构相似性,在此过程中,梵语在南亚及更广地区充当了形式化的知识“元语言”。 这并不是一个孤立的观察。在其他语言传统中,拉丁语塑造了英语的声望语域和语法自我认知(Blake, 1996; Lurie, 2023)。然而,就印度语言而言,共享架构要深刻得多:泰米尔语语法学家在其自身传统内工作,得出了与波你尼范畴趋同的结构性结论——这一发现之所以计算意义重大,正是因为它超越了谱系界限。方言和语域变化也沿着可预测的连续体运作,而非离散的断裂:方言通常在语音实现或词汇选择上有所不同,同时保留了基本的形态句法架构。在印度语境中广泛存在的双言现象[³](https://arxiv.org/html/2606.24172#fn3)——梵语-普拉克里特语、文雅与口语化的泰米尔语、印地语与卡里博利语——都遵循共享结构约束内的系统交替。 印度语言的计算处理长期以来一直因否认这些规律性而受影响。结果是,这些语言基础的结构统一性对旨在处理它们的工具来说仍然是不可见的。我们认为,波你尼在《八章书》(Vasu, 1897)中形式化的语法框架提供了该领域所需的统一计算架构;并且,明确以此框架为基础的基准将开启新一代能力更强、资源效率更高、可迁移性更强的印度语言处理系统。 ## 2. 波你尼框架作为统一架构 我们提出的统一架构并非现代发明。波你尼的《八章书》成书于公元前500年左右,是人类历史上最复杂的形式化语法系统之一——并且超过两千年来,它跨越语言界限,作为南亚话语的共享智力操作系统发挥作用。哲学、法律、科学和美学在整个次大陆都以其形式范畴进行。梵语不仅仅是一种语言;它是提供本体论基元、句法模板和形态音位规律性的元语言,整个地区的思维通过它得以组织和交流。 计算专业人士可能会发现以下类比很有用:将马拉地语和泰米尔语视为源自不同的内核——它们的谱系起源不同——但其高层设计模式、话语语义和形式结构是按照波你尼梵语语法的规格构建的。就像构建于通用接口规范之上的软件组件无论其底层实现如何都能保持互操作性一样,构建于此共享规范之上的印度语言在计算最重要的层面上——形态、句法和语义组织——仍然保持结构兼容。这种兼容性并非纯粹的理论,而是具体体现在诸如同时存在于梵语和泰米尔语文学传统中的 Śaiva Siddhānta(சைவ சித்தாந்தம்)等文本中,其底层语义和论证结构在两者中均完整保留。 这个类比低估了波你尼系统的一个特性,该特性与现代计算实践有着异常直接的联系。任何强大到足以描述自然语言的语法形式主义,都几乎不可避免地强大到足以过度生成,即生成该语言中不存在的字符串。Penn和Kiparsky(2012)表明,就其原始表达能力而言,波你尼的形式主义也不例外。然而,例外之处在于强加于其上的纪律。通过规则优先级和一套控制规则如何竞争和应用的元约定,《八章书》为每个合乎语法的梵语句子产生了*唯一*推导——消歧内置于架构中,而非事后附加。乔姆斯基传统中的任何生成系统都没有这个属性,Penn和Kiparsky(2012)认为,正是这种缺失迫使现代NLP求助于其沉重的统计和概率机制:数值方法在很大程度上是约束这些形式主义无法自行控制的过度生成的一种手段。从这个角度看,《八章书》的奇迹不在于它产生了多少正确的分析,而在于它完全避免了多少不正确的分析。基于这一传统的架构将继承确定性作为核心设计原则。它不会取代现代NLP的统计组件,但提供了一个理由来预期,明确的波你尼结构携带了现代系统仅能间接且以高昂成本恢复的信息。 印度语言内迁移学习的已证明优势(Bafna等人,2023; Nag等人,2023)以及基于波你尼原理的现有形态分析器(Goyal and Huet, 2016; Hellwig, 2016)直接支持了这一图景。训练于波你尼依存标签的模型显示出改进的论元检测和语义角色标注(Pal and Sharma, 2019)。高度特定领域的任务,如技术词汇翻译,在训练于梵语令牌时显示出零样本设置的改进(N等人,2025)。这些并非边际收益,而是共享架构在计算上是真实且可利用的有力证据。此外,历史记录独立地支持了这一图景……
相似文章
PaliBench:面向古典语言翻译基准的多参考蓝图
介绍PaliBench,一个用于巴利语到英语翻译的多参考基准,采用多位学者的独立翻译,并提供一种可复用的方法论,用于为古典语言创建类似的基准测试。
Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
PIIBench:个人可识别信息检测的统一多源基准语料库
PIIBench 是一个用于检测多种数据源中个人可识别信息 (PII) 的统一基准语料库。该资源解决了 PII 检测任务中标准化评估的需求,这对隐私保护的自然语言处理应用至关重要。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。