整合知识图谱与多语种学术语料库,实现社会科学与人文学科领域自适应大语言模型

arXiv cs.AI 论文

摘要

本文介绍了欧洲LLMs4EU项目与ALT-EDIC基础设施中的一个用例,重点通过整合知识图谱和多语种学术语料库,将基础模型适配至社会科学与人文学科(SSH)研究实践。该方法旨在支持问答、文献综述等任务,同时确保领域敏感性与法规合规性。

arXiv:2607.05956v1 公告类型:新 摘要:将大语言模型(LLMs)整合到科学研究工作流程中,特别是用于文献发现和文献综合,给社会科学与人文学科(SSH)带来了重大的方法论、认知和监管挑战,尤其是在学科多样性、多语种资源访问和结果评估方面。本文介绍了欧洲LLMs4EU项目与ALT-EDIC基础设施中正在开发的一个用例,旨在将基础模型适配至SSH研究实践,并支持问答、比较文档分析和文献综述等任务。评估框架遵循LLMs4EU协议,包括独立的定量基准测试(检索、摘要、可追溯性和幻觉检测)以及由数字人文学科专家小组参与的定性评估。通过将模型适配嵌入研究基础设施以及结构化的法律和伦理合规框架,该用例探索了领域敏感且具有监管意识的生成式AI如何在保持可靠性和认知责任的同时,支持SSH学术研究。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:39

# 融合知识图谱与多语种学术语料库:面向社科人文领域的自适应大型语言模型
来源:https://arxiv.org/html/2607.05956
###### 摘要

将大型语言模型(LLMs)集成到科学研究工作流程中,特别是用于文献发现和文献综合,给社会科学与人文学科(SSH)带来了方法论、认识论和监管方面的重大挑战,尤其是在学科多样性、多语种文献获取以及结果评估方面。本文介绍了一个正在进行的用例,该用例在欧洲LLMs4EU项目和ALT-EDIC基础设施框架下开发,旨在将基础模型适应于SSH研究实践,并支持问题解答、比较文档分析和文献综述等任务。评估框架遵循LLMs4EU协议,涵盖独立的定量基准测试(检索、摘要、可追溯性和幻觉检测)以及由数字人文学科专家小组参与的定性评估。通过将模型适应嵌入研究基础设施及结构化的法律与伦理合规框架中,该用例探索了领域敏感且符合监管要求的生成式AI如何在保持可靠性和认识论责任的同时支持SSH学术研究。

关键词:科学研究工作流程,数字人文,检索增强生成

\NAT@set@cites

融合知识图谱与多语种学术语料库:面向社科人文领域的自适应大型语言模型

Adam Faci¹, Alessio Miaschi², Anne Combe³, Pascal Cuxac⁴, Francesca Frontini², Nicolas Larrousse¹, Stéphane Pouyllau¹
¹ Huma-Num, CNRS, 巴黎, 法国
² CNR – 计算语言学研究所 “A. Zampolli” (CNR-ILC), 比萨, 意大利
³ Inria, 法国
⁴ Inist, CNRS, 2 rue Jean Zay, 54500 旺德夫尔莱南锡, 法国
\{name.surname\}@huma-num.fr, \{name.surname\}@ilc.cnr.it
[email protected], [email protected]
摘要内容

## 1. 引言

近年来,大型语言模型(LLMs)深刻改变了社会科学与人文学科(SSH)中语言技术及研究实践的面貌(例如,参见Arachchige等人, 2025 (https://arxiv.org/html/2607.05956#bib.bib1))。与此同时,LLMs及AI增强的科学发现平台的发展仍高度集中于主流语言和文化语境,且倾向于偏重所谓“硬科学”中典型的认识论模型与验证实践。

这种不平衡反映在许多现有及新兴的AI驱动科学文献探索平台上。语义搜索引擎(如Semantic Scholar)、AI辅助发现工具(如Elicit)、大规模引文索引(如Scopus和Web of Science),以及集成到出版生态系统中的对话系统(如Scite Assistant),主要基于英语期刊文章的大规模语料库进行训练。在多数情况下,它们主要或仅支持英语查询,优先考虑同行评议的期刊出版物而非其他形式的学术产出(如专著、评注版或研究数据),并严重依赖基于引文的指标(如影响因子或h指数)来排序和筛选结果。

这类设计选择并非中立。它们反映并强化了特定的科学生产、可见性和权威性模型,可能与SSH领域多样化的实践不相契合。在SSH中,多语种、书籍型学术、地方研究传统以及定性评估标准仍然占据核心地位。因此,从事资源较匮乏语言研究或遵循不符合引文驱动模型的认识论传统的SSH学者,在日益由AI中介的研究生态系统中面临进一步被边缘化的风险。

此外,SSH研究往往依赖于解读与语境化。文本、数据和元数据并非固定或中立的客体;其意义取决于研究问题、理论视角及历史语境。因此,同一材料可能以不同方式被阅读和组织。以但丁这样的著名作者为例:文学学者可能关注《神曲》的叙事结构、诗歌语言与互文指涉;语文学家可能研究手稿传统、文本变体与编辑史;历史学家可能考察但丁的政治思想与中世纪意大利冲突的关系。而数字人文学者则可能构建数字学术版本,以TEI-XML编码文本,通过计算方法比较手稿,或利用网络分析和语料库方法分析但丁作品的传播。在此类情境中,算法不能仅依赖主题匹配,还应识别方法亲和力、学科视角乃至研究方法。

为应对这些挑战,欧洲已构建了丰富的资料库和出版平台生态系统,旨在保留SSH的认识论与方法论特性。跨境学科基础设施如CLARIN ERIC、DARIAH ERIC和OPERAS,旨在支持数字资源的共享使用,同时保持对学科传统和语言多样性的高度关注 (Branco等人, 2023 (https://arxiv.org/html/2607.05956#bib.bib13); Dumouchel等人, 2020 (https://arxiv.org/html/2607.05956#bib.bib7); König等人, 2023 (https://arxiv.org/html/2607.05956#bib.bib14))。这些基础设施开发了专门的发现服务和元目录——如CLARIN虚拟语言观察站、SSH开放市场及GoTriple平台——明确针对SSH社区的需求。此类环境为商业发现工具提供了重要替代方案,并可从LLM增强功能中受益。在国家层面,诸如法国Huma-Num等基础设施提供了包括Nakala和ISIDORE在内的搜索工具,为人文学者广泛使用¹¹¹https://www.huma-num.fr/les-services-par-etapes/。

研究表明,这些数字环境并非中立存储库,而是围绕其学术社区的实践与期望而塑造的。近期关于研究基础设施与数据存档服务的研究进一步强调,人文学科数据源于动态的集体过程,其中档案馆和服务提供商不仅是技术支持结构,更是研究社区的调解者与共建者 (Morselli等人, 2025 (https://arxiv.org/html/2607.05956#bib.bib8))。这一视角强化了以下观点:发现与分析工具必须保持对学科实践的敏感性,而非强加外部的相关性模型。

人文学科研究的另一个独特特征在于学术产出的多样性以及多语种作为认识论与方法论维度的核心地位,这一点在多语种数字人文研究中已得到广泛讨论 (Balula and Leão, 2021 (https://arxiv.org/html/2607.05956#bib.bib15); Viola and Spence, 2024 (https://arxiv.org/html/2607.05956#bib.bib3))。除期刊文章外,知识生产还包括数据集、策展语料库、数字版本、工作流程以及研究博客等形式的学术交流。这些产出的相关性——以及相应的引用、索引和认可实践——已得到充分记录 (Barbot等人, 2024 (https://arxiv.org/html/2607.05956#bib.bib4); Mayeur, 2017 (https://arxiv.org/html/2607.05956#bib.bib17))。任何旨在服务SSH社区的AI增强发现系统都必须考虑到格式、语言和出版文化的多样性。

在上述背景下,将基于LLM的功能整合到SSH的文献搜索研究中,不能简化为通用应用。语言模型的设计与评估需要反映人文学科的具体研究实践,支持跨学科与超学科视角,并促进学术社区之间的有意义互动。我们提出的用例ReSearch_SSH是法国和意大利SSH研究基础设施在LLMs4EU项目(由欧盟委员会资助,ALT-EDIC协调²²²https://www.alt-edic.eu/)中的合作成果。它旨在通过集成基于LLM的先进检索功能,并支持基于策展SSH目录构建最新综述,从而增强现有搜索平台。

正如Fenlon (2017 (https://arxiv.org/html/2607.05956#bib.bib2))所指出的,数字人文(DH)见证了新形式学术产出的出现,包括研究博客、大规模数字语料库、工具和平台,这些挑战了传统的学术出版模式。这些产出在上述基础设施中得到了良好体现,而DH本身也是一个特别活跃的研究领域,以强烈的多语种和跨学科性为特征。因此,DH成为集成基于LLM搜索功能的一个引人注目的试验场。习惯于跨方法、跨语言和跨格式工作的DH学者,有条件成为这些新工具评估与共建过程中的专家用户。

本文组织结构如下:在从SSH研究实践角度定位LLM的角色之后,我们在新的ALT-EDIC基础设施的更广泛背景下介绍欧洲LLMs4EU项目。然后,我们将ReSearch_SSH用例作为模型适应和微调以服务于SSH领域的案例研究,重点关注数据资源、方法论和微调策略,最后讨论预期的评估策略和法律问题。最后,我们建议通过建立专家小组,让研究社区,尤其是数字人文社区参与进来,并概述SSH社区参与和支持性LLM开发与评估的可能形式。

## 2. ALT-EDIC 与 LLMs4EU

ALT-EDIC是一个欧洲数字基础设施联盟,这是一种法律框架,旨在使多个成员国能够共同开发和运营具有共同欧洲利益的战略数字基础设施。具体而言,ALT-EDIC旨在支持欧洲在语言技术领域的卓越发展,并促进欧洲语言多样性,遵循一种将公共机构、产业界、公民社会和研究界联合起来的合作模式。这体现在它与语言资源研究基础设施CLARIN ERIC及其多个国家节点的密切合作中。

ALT-EDIC成立于2024年,通过参与多个互补的欧洲项目来开展活动。其中,OpenEuroLLM专注于开发开放和多语种的语言模型,代表了欧洲开放、透明且符合价值观的人工智能战略的关键组成部分。

与这第一支柱并行,LLMs4EU项目关注大型语言模型在战略部门中的更应用维度,采用强烈的用例驱动方法。该项目围绕五个应用领域构建,即旅游、公共服务、电信、能源和科学,并专注于将开放模型微调和适应于具体语境和需求。这些用例并非简单的应用演示,而是作为实验实验室,在其中定义模型适应要求,选择和准备领域数据,测试微调和任务调整策略,并设计评估协议。总体目标是将LLM的开发锚定在现实世界需求和具体实践社区中。

## 3. ReSearch_SSH 用例

对欧洲数字人文社区特别感兴趣的是ReSearch_SSH用例,它属于LLMs4EU项目的“科学”领域。该用例专注于开发和实验性评估生成式语言模型,这些模型适应于社会科学与人文学科中学术文献发现与综合的高级任务。特别关注结果的事实性、来源可追溯性和可解释性。该倡议基于法国和意大利主要研究基础设施之间的紧密合作。

该用例并非构建新的发现系统,而是扩展现有的ISIDORE平台³³³https://isidore-project.eu/,这是一个广泛使用的法国人文社会科学(SSH)搜索引擎,聚合了多语种的学术资源。因此,ISIDORE既是一个大规模文献基础设施,也是一个运行中的搜索环境。

该系统采用检索增强生成(RAG)架构。其检索层基于一个领域适应模型,该模型在历史ISIDORE查询上训练,使检索与实际SSH搜索行为对齐。该组件通过基于图谱的技术得到加强:语境化主要依赖于Wikidata知识图谱进行实体消歧和语义扩展,而源自元数据的关系结构支持跨作者、主题、机构和引文的结构化导航。文档级语义图谱进一步实现了研究产出之间的细粒度比较。

一个多语种大型语言模型构成生成层,在ISIDORE索引的语料库上运行,并接收元数据和基于图谱的信号。它支持自然语言查询、辅助文献综合,以及生成基于显式检索来源的结构化综述。通过将自适应检索与图谱感知的语境化以及生成式推理相结合,该系统支持核心SSH工作流程,如文献综述、主题探索和比较分析,同时确保所有生成输出保持透明并可追溯至索引文档。

该项目目前正在进行中。在当前阶段,它专注于支持对ISIDORE生态系统中聚合的、主要是法语学术材料进行意大利语和英语的高级查询,作为迈向更广泛多语种覆盖的第一步。

在操作上,该用例分为四个主要阶段:

- • 首先,领域对齐与多语种丰富阶段,利用大规模策展语料库将基础模型适应于SSH话语。
- • 其次,在检索增强生成(RAG)框架中优化检索与表示组件,利用ISIDORE的元数据和索引基础设施。
- • 第三,针对下游学术任务(包括多语种文档检索、文献综合和结构化最新综述构建)对模型进行微调。
- • 最后,通过基于专家的验证协议对系统进行评估,旨在评估其在真实SSH研究场景中的相关性、事实基础性和可用性。

下面我们将说明数据集、微调计划和评估策略。

### 3.1. 数据与学科重点

大规模领域对齐的主要语料库是ISTEX数据库的SSH子集⁴⁴⁴https://www.istex.fr/ressources-pour-le-fouille-de-textes/。IST

相似文章

LLM Wiki v2(16分钟阅读)

TLDR AI

本文介绍了一种利用LLM构建个人知识库的模式,为在大语言模型辅助下进行知识管理提供了结构化方法。