跨异构阿拉伯传记数据库的圣训传述者身份链接:多信号实体解析流水线

arXiv cs.CL 论文

摘要

本文提出一个两阶段实体解析流水线,将Sanadset语料库中的传述者姓名链接到两个传记数据库,从而构建一个富含跨源元数据的大型传述图谱。

arXiv:2607.05424v1 公告类型:交叉 摘要:伊斯兰圣训文献的传述链 (sanad) 编码了数万名历史传述者之间的关系,这些传述者的传记记录分散在各自独立维护的数字数据库中,且没有共享的通用标识符。我们提出一个两阶段实体解析流水线,将来自 Sanadset 650K 语料库(包含 926 本书籍的 650,986 条圣训记录,含 185,216 个独特的传述者名称变体)的传述者名称链接到两个传记数据库:Hadithtransmitters(Hawramani;100,915 条条目)和 Muslimscholars(25,247 条条目)。第一阶段仅使用名称相似性(Sanadset 不携带元数据)将 Sanadset 名称与 Hawramani 匹配,获得 94,628 个链接(51.1%;高 39,938 / 中 54,690)。第二阶段通过加权多信号函数(结合名称相似性、逝世年份接近度和可靠性等级极性)将 Hawramani 与 Muslimscholars 交叉引用,获得 95,573 个链接(占 Hawramani 的 94.7%;高 18,245 / 中 71,546 / 低 5,782)。链接两个阶段使 Sanadset 传述者能够通过传递方式访问 Muslimscholars 数据。链接数据支持构建一个包含 185,216 个节点、814,093 条有向边的传述图谱,并丰富了跨来源的传记元数据。注释链接语料库和丰富后的图谱作为开放资源发布。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:43

# 跨异构阿拉伯语传记数据库的圣训叙述者身份链接:一个多信号实体解析流水线

来源:https://arxiv.org/html/2607.05424

陶菲克·维拉赫曼
计算研究中心,国家研究与创新署(BRIN),苏加诺科技园,西爪哇省芝比侬,印度尼西亚
数学系,理学院,马来西亚理工大学,柔佛州新山,马来西亚
[email protected] (https://arxiv.org/html/2607.05424v1/mailto:[email protected])
(2026年6月)

###### 摘要

伊斯兰圣训文献的传承链(sanad)编码了数万名历史叙述者之间的关系,这些叙述者的传记记录分散在各自独立维护、且没有共享通用标识符的数字数据库中。我们提出了一个两阶段实体解析流水线,将来自Sanadset 650K语料库(包含926部圣训著作中的650,986条圣训记录,涉及185,216个独特的叙述者姓名变体)的叙述者姓名链接到两个传记数据库:Hadithtransmitters (hawramani; 100,915条记录) 和 Muslimscholars (25,247条记录)。第一阶段使用仅基于姓名相似性的方法(Sanadset不附带元数据)将Sanadset姓名匹配到hawramani,产生94,628个链接(占51.1%;高置信度39,938个/中置信度54,690个)。第二阶段通过一个加权的多信号函数(结合姓名相似性、逝世年份接近度和可靠性等级极性)将hawramani与muslimscholars进行交叉关联,产生95,573个链接(占hawramani的94.7%;高置信度18,245个/中置信度71,546个/低置信度5,782个)。链接两个阶段使得Sanadset叙述者能够通过传递方式访问muslimscholars的数据。这些链接数据使得构建一个包含185,216个节点、814,093条边的有向传承图成为可能,该图丰富了跨来源的传记元数据。注释后的链接语料库和丰富后的图谱作为开放资源发布。

关键词:实体解析,圣训叙述者,阿拉伯语自然语言处理,传承图,知识图谱,圣训链分析,伊斯兰数字人文学

## 1. 引言

伊斯兰圣训学术研究建立在一个被称为'ilm al-rijāl(叙述者评价学)的学科基础上。一千多年来,学者们通过手动交叉引用阿拉伯语tabaqāt(传记词典)中记录的叙述者传记,来评估圣训传承链(sanad)的可靠性。一个叙述者可能在不同来源中以不同的姓名形式出现:在一个数据库中可能是kunyah(如Abū Ḥanīfa),在另一个数据库中则可能是完整的nasab链(如al-Nu'mān ibn Thābit ibn Zūtā),可能带或不带变音符号,并且根据在传承链中的句法位置而使用不同的语法格。

圣训文献的数字化已经产生了几个大型、独立维护的数据库。Sanadset 650K [12] 提供了来自926部阿拉伯语著作的650,986条结构化圣训记录,带有XML标记的叙述者链,产生了185,216个独特的叙述者姓名变体。Hadithtransmitters平台 (hawramani) 托管了100,915位叙述者的传记记录,包括逝世年份、可靠性等级以及师生关系链接。Muslimscholars.info 维护了25,247位伊斯兰学者的结构化档案。每个数据库使用不同的姓名表示方式、覆盖标准和数据模型,并且彼此之间没有在实体层面建立链接。

这种孤立状态给计算圣训研究带来了结构性的天花板:对传承链的社会网络分析 [19, 1] 揭示了丰富的图论特性,但仅限于单一集合,且叙述者节点没有传记元数据;叙述者消歧系统 [10, 9] 达到了较高的分类准确率,但完全在单一的传记权威来源内部运行。现有的阿拉伯语实体解析方法针对的是现代维基百科对齐的知识库,无法应对历史伊斯兰人名的独特挑战:长度可变的多元nasab链、kunyah/ism交替、中世纪拼写惯例以及形态格变化 [4, 14]。虽然概率性多信号记录链接提供了理论基础 [3],但在此之前,不存在为跨来源圣训叙述者链接而专门调整的流水线——这是先前综述 [13] 中一致指出的空白。第2节将详细回顾相关文献。

本文通过三项贡献来填补这一空白:(i) 一个两阶段实体解析流水线,结合了纯名称阶段 (Sanadset → hawramani) 和多信号阶段 (hawramani ↔ muslimscholars),使用了姓名相似性、逝世年份接近度和等级极性,并应用了领域特定的阿拉伯语归一化;(ii) 两个注释后的链接语料库——sanad_links (Sanadset到hawramani) 和 narrator_links (hawramani到muslimscholars)——均按置信级别分层;(iii) 一个大规模的、带有跨来源传记元数据的有向传承图,并对其进行了丰富。

本文结构如下:第2节回顾相关工作;第3-5节描述数据库、流水线和结果;第6节讨论局限性和未来方向;第7节进行总结。

## 2. 相关工作

### 2.1 计算圣训学与伊斯兰数字人文学

Sanadset 650K [12] 提供了来自926部著作的650,986条圣训记录,包含XML标记,在传承链包装器内标记叙述者提及,构成了本文实体解析任务的源语料库。叙述者消歧已被形式化为多类分类问题:AR-Sanad 280K [10] 引入了279,625条合成sanad序列,包含18,298个叙述者类别,并确立了AraBERT [2] 作为主要的基线模型。AR-Sanad v2 [9] 通过将 NarratorsKG 整合到消歧流水线中扩展了这项工作。两者都将消歧视为一个*封闭世界*问题,要求叙述者存在于预定义的类别集合中。我们的工作则处理互补的*开放世界*问题:给定一个来自Sanadset的叙述者姓名,在使用了不同姓名表示方式的外部数据库中查找其匹配的记录。Narrator2Vec [11] 将叙述者姓名表示为在Sanadset语料库上训练的连续向量,提供了软性的名称相似性信号,但没有显式的实体链接或置信度分数。

社会网络分析 [19, 1] 揭示了圣训传承链中的无标度度分布以及叙述者中心在地理上随世代的变迁。Multi-IsnadSet [15] 发布了来自《穆斯林圣训实录》的有向图,包含2,092个叙述者节点和77,797条边;本文构建的图涵盖了926部著作和185,216个节点。知识图谱方法 [7, 8] 将圣训结构建模为RDF三元组;它们不处理跨来源的叙述者实体解析。

Romanov [17] 以及 Romanov 和 Seydi [18] 建立了从阿拉伯语传记集合分析学术网络的计算方法;Mhamedi [13] 综述了sanad方法论,并将跨来源的叙述者身份解析确定为一个开放问题。

### 2.2 阿拉伯语实体解析

使用与维基百科对齐的知识库进行阿拉伯语命名实体消歧 [4] 依赖于历史伊斯兰叙述者所不具备的实体描述。混合阿拉伯语名称匹配 [14] 结合了分词级别的Jaccard相似度与编辑距离,并在对Alef变体和变音符号进行归一化之后进行比较——这些技术与第4.1节直接相关。Christen [3] 的概率性记录链接框架为第4.4节中的加权多信号评分提供了理论基础。阿拉伯语知识图谱的构建面临着在历史圣训领域中更为复杂的问题:在线百科中阿拉伯语覆盖率低、形态丰富以及Alef变体泛滥 [5]。

将AraBERT [2] 应用于跨来源链接需要精细调整的对齐对,而这些在链接之前并不存在——这正是我们流水线通过生成第一个此类语料库来解决的自举问题。

## 3. 数据来源

### 3.1 Sanadset 650K

Sanadset 650K [12] 是一个结构化的语料库,包含来自926部历史阿拉伯语著作的650,986条圣训记录。每条记录都带有完整的圣训文本,并附有类似XML的标记,用于标记叙述者链 () 和单个叙述者提及 ()。在拆分叙述者列表并归一化名称(第4.1节)后,该语料库产生**185,216**个独特的纯叙述者姓名变体,这些变体参与了约480万个叙述者-圣训出现对。Sanadset不为叙述者姓名携带任何传记元数据(逝世年份、等级)——这一约束决定了第一阶段的设计。

### 3.2 Hadithtransmitters (Hawramani)

Hadithtransmitters平台 [6] 托管了根据经典伊斯兰传记来源汇编的**100,915**位圣训叙述者的传记记录。每条记录提供:完整的阿拉伯语姓名、URL-slug标识符、估计的逝世年份(仅部分叙述者有该字段;见第4.4节)、多位古典rijāl学者的可靠性等级、来源引文计数以及带有超链接的师生姓名列表。该数据库通过广度优先搜索(BFS)抓取,从已知的叙述者URL模式开始,每位叙述者发送三次HTTP请求(主要传记、教师列表、学生列表)。在每个页面上遇到的教师和学生ID被添加到BFS队列中,从而能够在无需详尽范围扫描的情况下,有机地发现所有叙述者。完整的爬取覆盖了100,915条记录。

### 3.3 Muslimscholars

Muslimscholars.info [16] 托管了**25,247**位伊斯兰学者的档案。每条记录提供阿拉伯语和英语姓名形式、估计的逝世年份(在第二阶段匹配对中出现的muslimscholars条目中,21.7%有此字段;见表2)、法学派别(mazhab)以及以整数ID表示的师生关系链接。与hawramani相比,muslimscholars覆盖了一个更窄但记录更完善的子集,并提供了有用的辅助信号——英文罗马化。抓取使用了相同的BFS策略,从已知的紧凑ID范围开始,随后通过链接ID进行队列扩展,达到了高ID记录(最高ID 151,001),而无需扫描已知范围之间估计的110,000个空位。

### 3.4 叙述者知识库 (narrators_db)

来自AR-Sanad 280K [10] 的 narrators_db 为**18,298**位叙述者提供结构化的传记元数据:Ibn Hajar可靠性等级(12类)、shuhra(别号)、laqab(尊称)、nasab链、家族关系和法学派别。所有18,298位叙述者的逝世年份字段以自由形式的阿拉伯语文本字符串存在(例如,一个年份数字后跟阿拉伯语希吉拉缩写,或一个日期范围如“AH 141–150”);其中8,802位在AH 1–500范围内携带可解析的希吉拉年份。此资源为图4提供了逝世年份数据。

## 4. 方法论

图1展示了完整的流水线。在进行任何比较之前(第4.1节),对所有三个数据库应用阿拉伯语归一化。第一阶段使用纯名称匹配(第4.3节)将Sanadset名称链接到hawramani;第二阶段使用加权多信号分数(第4.4节)将hawramani与muslimscholars进行交叉关联。两个链接语料库都输入到传承图(第4.5节),其中第一阶段和第二阶段的链接通过传递组合,使得Sanadset叙述者能够访问muslimscholars的数据。

```
Sanadset 650K        Hawramani             Muslimscholars
185,216叙述者       100,915叙述者          25,247学者
     |                    |                     |
     +--------------------+---------------------+
                          |
                阿拉伯语归一化
                       §4.1
                          |
              +-----------+-----------+
              |                       |
        第一阶段                 第二阶段
    Sanadset→HW (纯名称)    HW↔MS (多信号)
            §4.3                §4.4
              |                       |
              v                       v
        sanad_links           narrator_links
        94,628链接            95,573链接
        高/中置信度            高/中/低置信度
              |                       |
              +-----------+-----------+
                          |
                    传承图丰富
                       §4.5
                          |
                          v
                 185,216节点
                 814,093条边
                 + 传记元数据

来源数据库                实体链接

图 1: 两阶段叙述者实体解析和图丰富流水线。
```

### 4.1 阿拉伯语名称归一化

历史阿拉伯语人名需要的归一化超越了标准的阿拉伯语自然语言处理预处理。共享的归一化过程 norm(t) 按顺序应用四个转换:

1.  **变音符号移除**。通过仅针对变音符号的Unicode范围,移除阿拉伯语tashkeel字符(U+064B–U+065F及分散的补充码点)。这里存在一个非平凡的实现风险:一个覆盖U+0610–U+064A的朴素的码点范围除了变音符号外,还会包含所有阿拉伯语辅音。早期实现使用了这个过宽的范围,导致从输入字符串中剥离了所有阿拉伯字母,使得每条记录都与其他每条记录匹配。修正后的程序通过显式、不重叠的码点范围仅针对变音符号。
2.  **Alef统一**。五种Alef变体——Alef (U+0627)、带上方hamza的Alef (U+0623)、带下方hamza的Alef (U+0625)、带madda的Alef (U+0622) 和 Alef wasla (U+0671)——全部映射到纯Alef (U+0627)。
3.  **Ta marbuta 和 Alef maqsura**。Ta marbuta (U+0629) 归一化为 ha (U+0647);Alef maqsura (U+0649) 归一化为 ya (U+064A)。
4.  **Tatweel 和空白字符**。移除 Tatweel (U+0640);多个空白字符折叠为单个空格。

组合后的过程减少了因拼写变异而导致的假阴性。例如,带有完整变音符和带下方hamza的Alef的Sanadset形式 "Muḥammad ibn Ismā'īl" 与使用纯Alef的无变音符的hawramani形式 "Muhammad ibn Ismail",在 norm(·) 下映射到相同的字符串。

### 4.2 候选生成

对所有185,216个Sanadset叙述者与所有hawramani或muslimscholars记录进行直接的 O(n × m) 比较在计算上是不可行的。两个链接阶段都使用**二元语法前缀索引**:每个数据库通过连续的归一化阿拉伯语标记对(即标记的二元语法)进行索引。

相似文章

实体解析实践:自服务管线的经验教训

arXiv cs.LG

本文分享了在六个基准测试上构建和评估自服务实体解析管线时得出的三条实用经验:没有一种匹配算法能通吃所有场景,精确率和召回率需要分别修复,假阳性链接可能链式合并无关实体。