一个逐词数字阅读器,用于《普拉斯塔纳特罗伊》及商羯罗注疏:语料库、方法及面向不二论吠檀多经典的开源离线阅读辅助工具
摘要
介绍了一个开源的离线逐词数字阅读器,用于《普拉斯塔纳特罗伊》及商羯罗注疏,具有可点击的词分析、索引功能,以及结合规则和LLM辅助方法的混合流水线。
arXiv:2607.07282v1 公告类型:新
摘要:《普拉斯塔纳特罗伊》——十部主要奥义书、《梵经》和《薄伽梵歌》及其商羯罗的注疏——是不二论吠檀多的基础典籍。连续的连音变化、长复合词以及密集的经院散文使得在逐词层面上阅读变得困难:一个词在哪里结束,以及每个词的语法含义都被掩盖了。我们提出了一个开源的、完全离线的、逐词级别的数字阅读器,涵盖了整个《普拉斯塔纳特罗伊》及商羯罗的注疏。每一个词——无论是原文还是注释——都可以点击,并弹出一个窗口显示其分词、形态分析和注释。由于每个词都带有词元,该阅读器还充当了语词索引:搜索一个词典词头可以检索该词的所有屈折变化和隐藏的连音出现,以及它在复合词中的出现,跨越两个层面。该资源覆盖了13个注释单元(2,971节、经文和散文段落;36,881个已分析的原文词出现)以及一个包含95,587个不同注释表层形式的全局词典。我们描述了语料库、混合流水线——一个基于屈折形式词典和已验证语料库查询的规则连音分割器,结合LLM辅助分析(采用对抗性两轮验证协议)——以及一个持久的人工审核循环,其更正会在每次重新生成中保留。针对独立梵语资源的内在评估发现,高置信度的分析与权威屈折词典在超过99%的已证形式上一致,而盲区判定确认质量在置信区间内可预测地下降,错误集中在低置信度层级,这正是审核循环的目标。该阅读器是一个自包含的单一HTML文件,无需服务器或网络,作为可自由分发的教学和阅读辅助工具提供。
查看缓存全文
缓存时间: 2026/07/09 07:49
# 基于词级的 Prasthānatrayī 及其 Śaṅkara 的 Bhāṣya 的数字阅读器:语料库、方法与 Advaita Vedānta 经典的开放离线阅读工具 来源: https://arxiv.org/html/2607.07282 \[ Path = \./fonts/ , BoldFont = CharisSIL\-Bold\.ttf , ItalicFont = CharisSIL\-Italic\.ttf , BoldItalicFont = CharisSIL\-BoldItalic\.ttf \] \[ Path = \./fonts/ , BoldFont = NotoSansDevanagari\-Bold\.ttf , Script = Devanagari \]\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English Tamal Maharaj 计算机科学系,Ramakrishna Mission Vivekananda Educational and Research Institute, Belur Math, Howrah, 西孟加拉邦, 印度通讯作者:\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishtamal@gm\.rkmvu\.ac\.in. 该阅读器的在线实例可在以下网址公开访问:https://cs.rkmvu.ac.in/~tamal/prasthanatrayi/prasthanatrayi-sankara-bhasya-detail.html \(2026 年 7 月\) ###### 摘要 Prasthānatrayī——十部主要《奥义书》、《梵经》和《薄伽梵歌》,连同 Śaṅkara 的注释(bhāṣya)——是不二论(Advaita Vedānta)的基础语料库。对于非专业人士乃至学生而言,从词级层面阅读该文本十分困难:连续的语音连读(sandhi)、长的名词复合词(samāsa)以及密集的经院式散文掩盖了单词的起止边界及其语法含义。我们呈现了一个开放、完全离线、词级的数字阅读器,涵盖整个 Prasthānatrayī 及其 Śaṅkara 的 bhāṣya。在该阅读器中,*每个*单词——无论是原文(mūla)还是注释——都是可点击的,点击后会弹出窗口,显示其语音拆分(padaccheda)、形态和句法分析以及释义。由于每个单词都带有词元(lemma),该阅读器也可用作*索引*:搜索词典中的主词条即可检索该词的所有屈折变化和因 sandhi 隐藏的出现形式——包括其在复合词内部的出现——跨越原文和注释两个层面。该资源涵盖十三个注释单元(2,971 偈颂、经句和散文段落;原文分析词次为 36,881),以及包含 95,587 个不同注释表层形式的全局词典。我们描述了语料库、混合分析流程——一个基于规则的 sandhi 拆分引擎,结合权威的屈折形式词典和经过验证的语料库查询,并辅以大语言模型(LLM)辅助的词形分析,且采用对抗性双轮验证协议——以及一个持久的人工专家审阅循环,该循环允许梵文学家一次性纠正机器输出,并使校正结果在所有后续重建中保持不变。与独立梵文资源的内部评估显示,高置信度的分析与权威的屈折词典在超过 99% 的已证实形式上达成一致;独立且盲标区间的判定确认,分析质量在各置信度区间内可预测地下降,错误主要集中在低置信度区间,而该区间正是审阅循环针对的目标。阅读器是一个单一、自包含的 HTML 文件,无需服务器、无需安装、无需网络连接,并以自由可再分发的教学和阅读工具形式提供。 关键词:Advaita Vedānta;Śaṅkara;Prasthānatrayī;奥义书;数字人文学;计算梵文;sandhi 拆分;形态分析;数字文献学;开放教育资源。 ## 1 引言 Vedānta 的三个“出发点”(*prasthāna*)——śruti\-prasthāna(主要《奥义书》)、nyāya\-prasthāna(Bādarāyaṇa 的《梵经》)和 smṛti\-prasthāna(《薄伽梵歌》)——构成了每个经典吠檀多学派赖以确立权威的经典。Śaṅkara 对这三者的注释(bhāṣya)对于不二论传统而言是典范性的阐述;它们至今仍被阅读、背诵和辩论。 然而,这个语料库在学习者所需的粒度上*难以阅读*。经典梵文以连续的语音连写形式书写:相邻单词在边界处通过规则音系变化(sandhi)融合,而名词复合词(samāsa)可能包含多个成分且内部无空格。页面上的一个正字法“单词”,例如 \devfontधूमेनाव्रियते,实际上可能是两三个单词(dhūmena āvriyate),而 Śaṅkara 的散文——句法复杂、引经据典且穿插大量未标注的经文引用——使这一难度进一步加剧。无法进行 sandhi 拆分(“分离”sandhi)并识别每个单词的词干、屈折变化和句法角色的读者,实际上无法查阅词典,因为表层形式并不出现在词典中。 传统上,这种能力通过口传方式,经年累月地从老师传递给学生。少数著名文本(尤其是《薄伽梵歌》)存在逐词印刷版(anvaya 和 ṭīkā),但对于整个 Prasthānatrayī,不存在统一的词级注释工具,而对于 Śaṅkara 注释的连续散文——其篇幅是其解释的原文的数倍——则根本没有任何此类工具。 本文报告了一种填补这一空白的资源。我们构建了一个开放、离线、词级的数字阅读器,其中原文和注释的每个单词都可以直接查询。点击一个单词会打开一个分析弹窗:语音拆分、组成词干、语法描述(词性、名词的性/数/格、动词的类/时态/语气/人称/数、相关的句法角色 kāraka)以及英文释义。关键的是,由于梵文单词的书写形式很少与其词典主词条匹配——sandhi、屈折变化和复合词都会掩盖它——该阅读器还将版本转换为*词元索引的索引*:搜索一个词干可以检索其所有屈折变化和因 sandhi 隐藏的出现形式,以及(通过辅助的*拆分感知*搜索)其在复合词内部的出现,跨越原文和整个注释。整词高亮同时覆盖两个文本层面。 我们的贡献有四点: 1. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1.**一个语料库资源**:对完整的 Prasthānatrayī *以及*连续的 Śaṅkara\-bhāṣya 进行了统一的词级分析数字版,其规模(95,587 个不同的注释形式)此前在可查询形式下无法获得。 2. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.**一个发现工具**:由于每个单词都带有词元标签,该版本可作为*按词典主词条搜索的索引*——检索一个术语的屈折变化、因 sandhi 隐藏以及在复合词内部的出现——覆盖两个层面,这是仅凭天城体全文搜索无法提供的检索形式。 3. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.**一种方法**:一个可复现的混合流程,结合了确定性语言资源(基于规则的 sandhi 拆分引擎、包含 927,000 个词形的屈折词典、经过验证的语料库查询)与 LLM 辅助的分析,并采用对抗性双轮验证协议,以及一个持久的人机协作校正覆盖层。 4. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4.**一个工件**:一个单一、自包含的 HTML 文件,无依赖项且可自由再分发,设计为教学和自学辅助工具,以及学术校正的平台。 我们首先强调,机器分析只是一个*脚手架*,而非神谕。最终的学术权威在于人类编辑;系统的作用是在原本难以处理的文本量上产生一致的初步分析,标记其置信度最低的输出,并使专家校正变得廉价、持久且可累积。 ## 2 背景与相关工作 #### 计算梵文。 过去二十年产生了成熟的梵文分词和形态学工具。Huet 的 *Sanskrit Heritage* 引擎及其阅读器提供了一个基于 Pāṇinian 描述的有限状态形态分析器和分词器 (Huet 2005 (https://arxiv.org/html/2607.07282#bib.bib5); Goyal & Huet 2016 (https://arxiv.org/html/2607.07282#bib.bib2))。*Digital Corpus of Sanskrit* (DCS) 提供了一个大型的、经过形态和词汇标注的语料库 (Hellwig 2010– (https://arxiv.org/html/2607.07282#bib.bib3)),最近的神经形态系统在数据驱动的分词和依存分析方面取得了进展 (Hellwig & Nehrdich 2018 (https://arxiv.org/html/2607.07282#bib.bib4); Krishna et al. 2018 (https://arxiv.org/html/2607.07282#bib.bib6); Sandhan et al. 2021 (https://arxiv.org/html/2607.07282#bib.bib7))。两年一度的 *Sanskrit Computational Linguistics* 研讨会汇集了大部分此类工作 (Huet et al. 2009 (https://arxiv.org/html/2607.07282#bib.bib8))。我们的系统并非这些分析器的竞争者;它*消费*它们——最直接的是,从 Heritage 引擎提取的屈折形式词典以及从标注语料库中提取的 padaccheda 证据——并在此基础上添加了一个 LLM 辅助的分析和验证层,专门针对一个特定、封闭且高价值的语料库。 #### 数字版本与词典。 诸如 GRETIL 和 Muktabodha Indological Research Institute 数字图书馆等数字文本档案将 Prasthānatrayī 作为可搜索文本提供,而 Cologne Digital Sanskrit Dictionaries 项目则使标准词典(Monier\-Williams、Apte 等)机器可读 (Cologne 2019 (https://arxiv.org/html/2607.07282#bib.bib1))。对于《薄伽梵歌》而言,IIT Kanpur 的“Gita Supersite”并列展示了多种注释。这些资源提供*文本*和*释义*,但通常不提供连续注释散文的统一逐词语法工具;这正是本研究新增的内容,并且其词典释义来源于 Cologne 词典。 #### 用于古典文献学的 LLM。 大语言模型最近被应用于低资源和古典语言的翻译、修复和标注。它们对梵文的承诺是进行大规模流畅的初步分析;其危险在于自信的错误。我们的设计正是针对这一权衡:通过 (i) 将 LLM 输出与确定性资源进行约束和交叉验证,(ii) 运行一个对抗性的“反驳”传递,其唯一任务是找出第一次传递中的错误,(iii) 为每个分析附加明确的置信度标签,以及 (iv) 将低置信度输出路由给人类专家,其裁决被永久存储。本文的方法论贡献与语料库本身同等重要,即这个*验证框架*。 ## 3 语料库 该阅读器涵盖了 Śaṅkara 注释过的完整 Prasthānatrayī:十部主要《奥义书》(对 Kena 有 Śaṅkara 的两部分开注释:padabhāṣya 和 vākyabhāṣya)、《梵经》和《薄伽梵歌》——共十三个注释单元。Māṇḍūkya 单元额外包含 Gauḍapāda 的《Kārikā》,Śaṅkara 也对其进行了注释。表 \fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 (https://arxiv.org/html/2607.07282#S3.T1) 给出了详细分类。 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English表 1:语料库。“偈颂/经句/段落”计数了可寻址的原文单元;散文体《奥义书》(《歌者奥义书》、《大森林奥义书》)按段落计数。Māṇḍūkya 的总数包括 Gauḍapāda 的《Kārikā》。唯一的事实来源是一个语料库文件,该文件为每个可寻址单元存储原文单词、连续的 bhāṣya 散文以及 sambandha\-bhāṣya(引言性的“连接”段落),均为结构化数据。所有衍生工件——分析后的单词数据和阅读器 HTML——都由脚本从该源*构建*而成;构建文件从未经过手动编辑,这确保了流程的可复现性和源文件的权威性。 ## 4 系统概述 交付件是一对自包含的 HTML 文件,它们共享一个共同的构建。*mūla 阅读器*使每个原文单词都可点击。*详细阅读器*是其超集:它额外使 Śaṅkara 注释的每个单词都可点击。两者都是单个文件,可在任何现代浏览器中直接打开,无需服务器,无需网络连接;详细阅读器将其包含 95,587 个条目的注释词典以内联 JSON 格式嵌入。 两个设计决策值得提及,因为它们塑造了整个系统。 #### 基于光标的单词解析,而非逐词标记。 使单词可点击的简单方法是将每个单词包裹在独立的 HTML 元素中。对于如此规模的语料库,这会使文件膨胀,而且——更重要的是——它会碎片化文本节点,破坏连续文本的搜索和高亮功能。取而代之的是,在运行时,点击散文中的任意位置都会解析为光标下的单词,方法是通过获取光标位置周围最长的天城体字符序列。用于此操作的分词器与离线提取时使用的分词器是逐字符一致的,因此点击的表层形式保证能匹配词典中的键。DOM 保持原样,短语搜索和高亮功能在未分割的文本上继续有效。 #### “路线 B”:每个不同的表层形式分析一次。 Śaṅkara 的散文在词级上高度重复:同一个屈折形式(ātman, brahmaṇaḥ, tasmāt, ...)会重复出现数千次。与其分析每个*出现*,我们构建了一个*不同表层形式的全局词典*,并对每个形式分析一次。这使分析负担减少了一个数量级以上,并保证了内部一致性(同一表层形式始终获得相同分析),代价是未通过局部上下文消除歧义——我们将在 §\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English8 (https://arxiv.org/html/2607.07282#S8) 中回到这一权衡。原文篇幅小得多,且上下文更为重要,因此改为按*出现*分析,并通过位置索引。 ## 5 方法:分析流程 该流程包含五个阶段(图 \fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 (https://arxiv.org/html/2607.07282#S5.F1)):规范化、确定性语言分析、对抗性验证下的 LLM 辅助分析、聚合以及人类专家审阅。我们逐一描述。 来源语料库 *(唯一事实来源)* mūla 文本 · bhāṣya 散文 · sambandha 1 规范化 一个共享的分词器(离线 ≡ 浏览器内) 去除连接符 / PUA 字形 · 重新合并不合理的拆分 2 确定性分析 经证实的拆分 → 屈折词典 → 规则 *(按权威性递减)* 3 LLM 辅助分析 验证 → *反驳*(对抗性)→ 重新合并检查 mūla:按出现分析 · bhāṣya:路线 B(每个表层形式一次) 4 聚合与置信度 按表层形式合并;标记 \fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English高 / 中 / 低 阅读器 HTML *(自包含、离线)* mūla 阅读器 + 详细阅读器 确定性资源 • 经证实的 padaccheda (∼240k) • Heritage 屈折词典 (∼927k) • 基于规则的 sandhi 拆分器 • Cologne 释义 · Dhātupāṭha 5 人类专家审阅 梵文学家纠正拆分 / 语法 / 释义 → 持久的*覆盖层* 聚合后的单词数据 低置信度工作列表 覆盖层最后重新应用 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English图 1:分析流程。单一来源语料库经过规范化,然后通过确定性层(经证实的拆分、屈折形式词典和基于规则的拆分器,按此顺序尝试),顶部辅以 LLM 辅助层,并采用对抗性的*验证*–*反驳*–重新合并框架。结果按表层形式聚合并划分置信度区间;低置信度尾部被路由到持久的审阅覆盖层,该覆盖层在每次重建时重新应用,分析数据以两个自包含的阅读器文件形式输出。原文(mūla)在诗节上下文中按出现分析;注释(bhāṣya)的表层形式各分析一次(“路线 B”)。
相似文章
Darshana Graph:用于比较印度哲学的平行注释语料库,并附带文体测量与探索性图分析
本文介绍了Darshana Graph,一个用于比较印度哲学的平行注释语料库,并展示了文体测量与探索性图分析。
从金刚乘的度母到孟加拉的鲍尔:孟加拉佛教、性力派与毗湿奴派传统间词汇传播的计算研究
本文对孟加拉佛教、性力派与毗湿奴派传统间的词汇传播进行了计算分析,考察了词汇与概念如何在各宗教社群间流动。
@SebastianNehrd2: 对任何对 http://Dharmamitra.org 上梵文文献的初步年代测定感兴趣的人,基于语…
一条推文,宣布基于语言特征对 Dharmamitra.org 上的梵文文献进行了初步年代测定,并附有该平台链接。该平台利用人工智能(包括 Gemini API)支持对古籍的学术研究与翻译。
Svarna:一个面向现代希腊语的开源语料库工作台
Svarna 是一个面向现代希腊语的开源网络语料库工作台,整合了多个数据库,包含超过 5.07 亿词,并提供多种语言分析工具,采用 MIT 许可证发布。
从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。