大语言模型时代的Hadith计算科学:批判性叙述综述

arXiv cs.CL 论文

摘要

本批判性叙述综述探讨了大语言模型和基于transformer的系统如何重塑Hadith计算科学,突出了数据资源和分段任务方面的进展,同时指出了叙述者验证和可重复性方面的差距,并提出了方法论强化的研究议程。

arXiv:2608.20364v1 公告类型:新 摘要:我们探讨了Hadith计算科学如何被transformer模型、检索增强管道和大语言模型(LLMs)所重塑。近期的综述记录了文献的增长,但尚未批判性地评估哪些进展在方法论上是稳健的,哪些仍局限于基准测试,以及哪些未解决的问题仍然限制了学术使用。我们通过批判性叙述综述来弥补这一差距,该综述结合了对现有综述的批判、代表性原创研究的论文级评估,以及伊斯兰学者和领域专家对真实性、权威性和负责任使用的观点综合。我们发现进展不均。数据资源已扩展,分段任务已成熟,叙述者和来源验证问题得到了更好的形式化,LLM辅助的工作流现在支持语料库规模的丰富化、多语言访问和基于上下文的评估。与此同时,进展仍受限于狭窄的语料库、弱基准可比性、合成到真实的迁移差距、叙述者身份解析、预处理脆弱性、有限的可重复性以及稀疏的基于专家的验证。我们表明,重要的差距超出了主导基准:非规范和晦涩的语料库、评论和解释性文献、与Qur'an和seerah的跨来源链接,以及面向fiqh的证据支持。我们认为,Hadith计算应更少地被视为孤立的模型性能,而更多地被视为一个需要知识集成、溯源和专家监督的证据基础设施问题。在此基础上,我们定义了一个研究议程,使该领域在方法论上更强,并对伊斯兰学术更有用。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:12

# 大语言模型时代的圣训计算科学:批判性叙事综述
来源:https://arxiv.org/html/2608.20364
\[1,2\]\\fnmRiasat\\surIslam 1\]\\orgnameGreentech Apps Foundation UK,\\orgaddress\\countryUnited Kingdom \[2\]\\orgnameQueen Mary University of London,\\orgaddress\\cityLondon,\\countryUnited Kingdom

###### 摘要

本文探讨了Transformer模型、检索增强流程和大型语言模型(LLMs)如何重塑圣训计算科学。近期综述记录了该领域文献的增长,但尚未对哪些进展在方法论上是稳健的、哪些仍受限于基准测试、以及哪些未解决的问题仍然限制其学术应用进行批判性评述。我们通过一项批判性叙事综述来填补这一空白,该综述结合了对现有综述的批判、对代表性原创研究的论文级评估,并综合了伊斯兰学者和领域专家关于真实性、权威性以及负责任使用的观点。我们发现该领域的进展并不均衡。数据资源已扩展,分割任务已成熟,传述人和来源验证问题得到了更好的形式化,而LLM辅助的工作流现在支持语料库级别的信息丰富化、多语言访问和有依据的评估。与此同时,进展仍受限于狭窄的语料库、薄弱的基准可比性、从合成数据到真实数据的迁移差距、传述人身份解析、预处理的脆弱性、有限的可复现性以及稀少的专家验证。我们指出,重要的差距存在于主导性基准之外:非正典和晦涩的语料库、注释和解释性文献、与古兰经和先知传记的跨来源联系,以及面向教法的证据支持。我们认为,圣训计算应较少被视为孤立的模型性能评估,而更多地被看作一个需要知识整合、出处追溯和专家监督的证据基础设施问题。基于此,我们定义了一个研究议程,以使该领域在方法论上更强大,并对伊斯兰学术更有用。

###### 关键词:

圣训计算、圣训自然语言处理、叙事综述、大型语言模型、阿拉伯语自然语言处理、伊斯兰学术、专家在环人工智能

††文章类型:综述文章
## 1 引言

Azmi等人\[20 (https://arxiv.org/html/2608.20364#bib.bib20)\]提供了早期最清晰的圣训计算领域图谱。他们的综述描述了一个主要由基于规则的系统、传统机器学习、小规模精策语料库和特定任务流程塑造的领域。它记录了关于分割、传述人提取、本体构建、检索和认证支持的重要工作。它也反映了在基于Transformer的自然语言处理和生成模型重塑对规模、表征和端到端语言处理的期望之前该领域的面貌。

本综述关注的是一个现在运行于显著不同技术环境中的领域。基于Transformer的模型、检索增强系统和大型语言模型改变了建模的规模、评估的结构以及语料库级工作流的可行性。圣训计算随之发生了变化,但并不均衡。一些任务,特别是传述系统与文本内容的分割(即分离传述链与报告内容)以及语料库丰富化,受益于更好的数据和现代建模技术\[14 (https://arxiv.org/html/2608.20364#bib.bib14),37 (https://arxiv.org/html/2608.20364#bib.bib37),17 (https://arxiv.org/html/2608.20364#bib.bib17)\]。其他问题,包括传述人消歧、跨集合泛化、传记基础和可信验证,仍然困难,仅仅依靠更大的模型并未消除这些困难\[31 (https://arxiv.org/html/2608.20364#bib.bib31),33 (https://arxiv.org/html/2608.20364#bib.bib33),9 (https://arxiv.org/html/2608.20364#bib.bib9)\]。

近期的综述论文记录了不断增长的文献量\[43 (https://arxiv.org/html/2608.20364#bib.bib43),26 (https://arxiv.org/html/2608.20364#bib.bib26),22 (https://arxiv.org/html/2608.20364#bib.bib22),21 (https://arxiv.org/html/2608.20364#bib.bib21)\]。这些综述是有用的,但它们留下了一个不同的解释性问题:哪些原创研究提供了方法论进步的持久证据,哪些主张仍然局限于特定基准,以及哪些弱点继续限制着下游的学术应用。大多数综述对伊斯兰学者和领域专家的观点也关注有限,尽管随着人工智能系统更接近宗教敏感任务,这些观点变得越来越重要\[4 (https://arxiv.org/html/2608.20364#bib.bib4),25 (https://arxiv.org/html/2608.20364#bib.bib25)\]。

目前仍然需要的是一个批判性综合,将当代技术发展与它们旨在支持的学术任务联系起来。因此,我们探讨五个相互关联的问题。在Transformer和LLM时代,哪些方法论变化显得最为重要?哪些当代研究代表了实质性的进步,而非局限于基准的成果?为什么现有的综述论文仍然留下了解释性差距?哪些结构性限制继续制约着该领域,特别是超出六大正典集合以及超出基础圣训文本本身之外?伊斯兰学者和领域专家的观点应如何为下一阶段的研究提供信息?

我们采用批判性叙事综述设计。该领域在数据、方法、发表场所和评估实践上仍然异质,因此仅靠详尽计数可能会忽略最重要的差异。我们的目标是区分持久的进步与局限于基准的成果,确定该领域在哪些方面似乎正在成熟,并解释为什么圣训计算的下一阶段不仅取决于模型规模,同样取决于认识论基础和与专家对齐的评估。

## 2 现有综述的局限

我们的目的不是填补综述文献的空白,而是解决现有综述类型与该领域当前所需问题类型之间的错位。现有综述是有用的,但它们回答的是邻近问题,而非我们此处的核心问题。

表 1:我们的综述与近期关于圣训计算和数字圣训研究的综述文献有何不同。近期综述论文的主要局限性与其说在于不准确性,不如说在于分析层面。文献计量学和系统性综述非常适合展示增长、主题聚类和方法标签。它们不太适合确定所报告的进展是否特定于基准、资源是否可重用、任务是解决真正的学术瓶颈还是仅是一个代理指标,以及输出结果是否值得信任到足以用于高风险的宗教文本领域。

批判性综述不应仅仅列出领域应用。它应该评估技术、模型类别和评估设计实际取得了什么成就,哪些方面证据薄弱,以及为什么一些主张在狭窄的基准环境之外难以成立。在我们看来,当前的圣训综述文献在这一层面仍过于描述性。

这一局限在Transformer和LLM时代变得更加明显。一旦该领域开始采用更新的模型家族和流程级工作流,就无法再通过列举额外的研究和架构来充分概括。因此,一个有用的综述必须识别实质性的方法论变化,而非仅仅是出版物的增长;从描述性汇总转向对代表性原创论文的批判性评估;解释为什么现有技术进展仍然不足以支持稳健的学术应用;并解释这样一个事实:伊斯兰学者和领域专家越来越多地将核心问题不仅框定为性能问题,也框定为权威性、真实性、可解释性和伦理治理问题\[4 (https://arxiv.org/html/2608.20364#bib.bib4),40 (https://arxiv.org/html/2608.20364#bib.bib40),25 (https://arxiv.org/html/2608.20364#bib.bib25)\]。

我们并不将本综述呈现为文献计量学或PRISMA式工作的替代品。相反,我们使用不同的综述逻辑来探讨不同的问题:文献的哪些部分为方法论进步提供了最强有力的证据,这些研究实际提供了何种类型的证据,以及技术进步在何处仍未能支持稳健的学术应用。

## 3 综述设计与局限

### 3.1 检索与范围

我们遵循批判性叙事综述设计,但明确说明了文献筛选过程。检索于2025年末和2026年初在Google Scholar、Scopus、ACL Anthology、SpringerLink、ScienceDirect、arXiv以及手工维护的领域存储库中迭代进行。查询组合将圣训术语(如*hadith*、*sanad*/*isnad*(传述系统)、*matn*(报告内容)、*sharh*(注释)和*takhrij*(来源追溯与认证引用))与人工智能术语(如*NLP*、*machine learning*、*deep learning*、*transformer*、*large language model*、*knowledge graph*、*question answering*、*retrieval*和*authentication*)相结合。随后使用前向和后向引文追踪来整合工作清单。

本研究整理的综述数据库在初始筛选阶段包含42个项目,经过范围精炼后包含32条记录。精炼后的清单包括技术研究、数据集或语料库论文、综述论文,以及少量用于解释语料库基础设施和治理问题的背景性著作。我们特别强调与Transformer和LLM时代相关的工作,同时保留了定义该领域技术基线或仍具有方法论指导意义的早期研究。

### 3.2 纳入逻辑与研究类型

当一条记录满足以下三个条件之一时,我们将其纳入。首先,它直接在圣训或密切相关的古典阿拉伯宗教文本任务上引入或评估了计算方法。其次,它创建、记录或基准测试了对圣训计算有实质性影响的资源,如语料库、分割数据集、传述人数据集或基于知识的评估资产。第三,它提供了改变该领域应如何被解读的综述层面或面向学者的反思,特别是在伊斯兰学术中关于真实性、权威性或负责任AI使用方面。我们排除了与计算无关的纯神学讨论,以及未能实质性阐明圣训处理的通用阿拉伯语NLP论文。

我们区分了几种研究类型,而非将文献视为一个扁平的集合。综述论文被分析为先前的综合成果,而非技术进步的证据。主要的技术和资源论文构成了论文级评估的基础。概念伦理和学者视角论文用于解释治理、权威性和可接受使用问题,但不用于支持技术性能主张。为了对主要研究进行深入评估,我们从核心清单中选择了满足另外四个标准的论文:任务中心性、方法论独特性、对后续工作或基准实践的影响,以及足够的技术细节以支持批判性评估。

### 3.3 评估框架

我们不是用单一分数对文献进行排名,而是根据表2 (https://arxiv.org/html/2608.20364#S3.T2)总结的明确维度对主要研究进行编码。这为综述提供了结构化的判断基础,同时尊重该领域任务、数据集和评估设置的异质性。

表 2:本综述用于评估主要研究的评估维度。然后,表4 (https://arxiv.org/html/20364#S5.T4)将这些维度应用于本文中最密切讨论的主要研究。在做出技术主张时,我们最重视经过同行评审的主要研究。仅当预印本引入了已塑造后续讨论的实质性基础设施或数据集时才保留它们,并在引用时予以标明。概念或伦理论文被视为解释性背景,而非技术证据。

由于任务定义、语料库和指标在文献中差异很大,我们不会将主要分数汇总成单一的定量排名。我们仅在其任务背景下解读准确率、F1值、专家评分、检索质量和端到端工作流结果。在整篇文章中,我们也区分了三种类型的主张:直接由编码文献支持的经验观察、对异质研究的解释性综合,以及对未来研究的规范性建议。

### 3.4 局限与解释立场

像任何叙事综述一样,我们的综述仍然容易受到检索和选择偏差的影响,优先考虑被索引或通过主流学术数据库可数字访问的研究,并且必然未能充分代表灰色文献、索引能力较弱的纯阿拉伯语出版场所,以及实践中使用的未发布工具。晦涩圣训语料库的长尾现象本身就是问题的一部分:在许多情况下,可发现的语料库或可复现的计算研究尚不存在。因此,我们关于领域成熟度的主张是基于代表性证据的批判性综合,而非对每个相关项目的详尽测量。

我们的解释遵循明确的优先级。在阅读文献时,我们特别重视出处、基础、基准现实性和面向学者的有用性。这一偏好反映了所综述的领域以及我们认为特别重要的下游用途,但也影响了我们对哪些研究特别有说服力的判断。我们明确表达这一偏好,因为它影响了评估以及本文后面提出的研究议程。

为了便于理解,我们采用了一个源自早期文献的圣训计算流程三级视图。第一级涉及传述系统与文本的分割及相关分割任务。第二级涉及传述人分析、来源验证、问答以及与认证相关的建模。第三级涉及知识图谱、语料库级信息丰富化和更大的研究基础设施。我们实用地而非教条地使用这一框架。它有助于解释为什么进展不均衡:第一级最快地受益于清晰的任务定义和可复用的注释,而第二级和第三级则更严重地依赖于结构化知识、跨文档链接和面向学者的验证。

## 4 Transformer转向之前的领域

在当前的AI转向之前,圣训计算已经具有几个可识别的方向:传述系统与文本的分割\[23 (https://arxiv.org/html/2608.20364#bib.bib23),32 (https://arxiv.org/html/2608.20364#bib.bib32)\]、传述人提取和图谱构建\[19 (https://arxiv.org/html/2608.20364#bib.bib19),18 (https://arxiv.org/html/2608.20364#bib.bib18),42 (https://arxiv.org/html/2608.20364#bib.bib42),48 (https://arxiv.org/html/2608.20364#bib.bib48)\]、分类和认证支持\[41 (https://arxiv.org/html/2608.20364#bib.bib41),29 (https://arxiv.org/html/2608.20364#bib.bib29)\],以及针对古典阿拉伯语和圣训材料的语料库构建工作\[30 (https://arxiv.org/html/2608.20364#bib.bib30),7 (https://arxiv.org/html/2608.20364#bib.bib7)\]。该领域已经表明,圣训文本包含可利用的语言和结构规律性,特别是在正典集合和精心编辑的语料库中。

早期的格局也存在明显的约束。大多数系统是特定于集合的,通常针对高度规范化的语料库(如《布哈里圣训实录》或《穆斯林圣训实录》)进行优化。任务通常被单独处理,而非作为可重用工作流的组成部分。手工制作的规则、触发词和局部特征工程仍然是核心。

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

科学概念的计算概念史:从早期数字方法到大语言模型

arXiv cs.CL

本文将大语言模型置于科学史、科学哲学与科学社会学(HPSS)领域概念分析计算方法的宏观历史背景之中,系统回顾了词汇语义变化检测的方法论挑战与基于大语言模型的案例研究,涵盖前大语言模型时代与大语言模型时代工作流程中的语料库构建、操作化及评估方法。