利用外部知识通过检索增强型大语言模型进行历史文档修复
摘要
本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。
arXiv:2607.21936v1 Announce Type: new
摘要:历史文档作为宝贵的知识档案,常因物理退化和损坏而难以辨认。现有的基于掩码语言建模的修复方法虽能有效利用局部上下文,但在修复需要外部历史知识的命名实体时存在困难。为解决这一局限,我们提出了一种新颖的历史文档修复框架,该框架利用检索增强生成(RAG)技术结合大语言模型。通过将预训练LLM的隐式知识与显式检索的外部上下文相结合,我们的模型ARI有效缓解了推断依赖上下文的专有名词的挑战。在韩国历史文档上的大量实验表明,我们的方法显著优于基线,在通用字符和命名实体的修复上均取得了显著提升。此外,包括专家评估在内的综合评价证实,ARI作为领域专家的实用工具,有望加速历史记录的分析工作。
查看缓存全文
缓存时间: 2026/07/27 07:39
通过检索增强的大语言模型利用外部知识进行历史文献修复 Source: https://arxiv.org/html/2607.21936 Gabeen Kim¹ Kyeongpil Kang² ¹江原大学人工智能融合系 ²江原大学计算机科学与工程系 gokong0516@kangwon\.ac\.kr rudvlf0413@kangwon\.ac\.kr ###### 摘要 历史文献作为宝贵的知识档案,常因物理老化和损坏而难以辨认。现有基于掩码语言建模的修复方法虽能有效利用局部上下文,但在恢复需要外部历史知识的命名实体时力不从心。为解决这一局限,我们提出了一种新颖的历史文献修复框架,该框架利用检索增强生成(RAG)的大语言模型。通过将预训练LLM的隐式知识与显式检索的外部上下文相结合,我们的模型ARI有效缓解了推断依赖上下文的专有名词的难题。在韩国历史文献上的大量实验表明,我们的方法显著优于基线,在恢复一般字符和命名实体方面均取得了大幅提升。此外,包括专家评估在内的全面评价证实,ARI可作为领域专家的实用工具,有望加速历史记录的分析。 通过检索增强的大语言模型利用外部知识进行历史文献修复 Gabeen Kim¹ Kyeongpil Kang²††¹江原大学人工智能融合系 ²江原大学计算机科学与工程系 gokong0516@kangwon\.ac\.kr rudvlf0413@kangwon\.ac\.kr ## 1 引言 历史记录是跨越数百年甚至数千年的海量信息宝库。认识到这些记录的全球重要性,各国政府和研究人员不仅致力于保护这些古代文献,还努力发掘和分析其中包含的知识。例如,涵盖500年历史、不仅记载历史事实还包含自然事件的《朝鲜王朝实录》(AJD)¹¹¹https://sillok.history.go.kr/intro/english.do 和《承政院日记》(JRS)²²²https://sjw.history.go.kr/intro/engInfo.do,已被列入联合国教科文组织世界记忆遗产。这些档案被不同领域的研究人员广泛分析,以获取有价值的见解。 参见图注图1:所提模型与基线的性能比较。x轴和y轴分别表示命名实体和随机掩码字符的修复准确率。尽管这些历史档案拥有巨大价值,但保存它们并提取知识仍面临重大挑战。首要问题是历史手稿本身易受损坏和退化。这些文献通常记录在木材或植物纤维等材料上,其耐久性远不如现代纸张。因此,它们对环境条件极为敏感,暴露在光、热或湿气下容易变色和结构损坏。此外,在金属活字出现之前,文本是用毛笔或钢笔手工抄写的。因此,可读性高度依赖于抄写员的笔迹,这不可避免地引入了转录错误。这些受损部分对于OCR系统和人类专家来说都难以分析。结果,它们常被视为空白或损坏标记,严重阻碍了下游分析。例如,通过匹配这些损坏标记,我们发现在JRS中约有4.19万个字符(涉及1.11万份文档)仍然损坏或无法识别。 为了修复历史档案中难以辨认的部分,已有多种方法被提出。Kang等人(2021)通过掩码语言建模(MLM)训练模型来处理损坏文档的修复。然而,这些方法的一个关键局限
相似文章
通过检索增强大型语言模型提升金融情感分析
本文介绍了一种检索增强的大型语言模型框架用于金融情感分析,相比传统模型及ChatGPT、LLaMA等大型语言模型,在准确率和F1分数上实现了15%至48%的提升。
VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
KARLA: 基于知识库增强检索的语言模型
KARLA 提出了一种方法,让大型语言模型在生成过程中查询知识库,从而无需重新训练即可更新事实知识,并提高透明度。实验表明,该方法在短文本和长文本生成中均提升了事实依据性。
用于模式约束临床信息抽取的检索增强型大语言模型
本文提出了一种模块化的检索增强生成(RAG)流水线,用于从护理人员与患者的对话转录中提取结构化临床观察结果,采用模式约束提示和第二遍审核,基于Llama和GPT骨干模型,取得了80.36%的F1分数。
LLM锚定副语言丰富化用于阿尔茨海默病检测
本文提出LAPE方法,该方法通过副语言线索丰富LLM导出的语言表征,用于阿尔茨海默病检测,并在基准数据集上实现了最先进的性能。