HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

arXiv cs.CL 论文

摘要

本文介绍HistoRAG,一个将史学原则(分离的检索/生成、时间窗口、LLM作为评判者评估)转化为标准RAG架构干预的框架,应用于包含102,189篇Der Spiegel文章的语料库,以满足解释性而非事实性问答需求。

arXiv:2606.18103v1 公告类型:新 摘要:检索增强生成(RAG)是将语言模型输出基于外部证据的主流架构,但其主导的评估范式和默认配置仍面向事实性问答。对于历史学等解释性学科,RAG嵌入的假设与学术实践相冲突。我们提出HistoRAG,一个将史学原则转化为具体架构干预的框架。分离的检索与生成将源发现与解释脱钩,时间窗口强制在研究期间实现平衡的源表示,作为历史研究的方法论要求,而LLM作为评判者的评估使相关性判断透明且可争议。我们使用SPIEGELragged评估这些干预措施,该数据集应用于1950-1979年间Der Spiegel的102,189篇文章。每项干预都针对标准RAG中的一个可测量缺陷:使用1970年代术语时,特定时代的词汇从1950年代检索到零个片段,这证明了时间偏差,从而推动了窗口化;向量相似度与LLM评估的相关性仅弱相关(Spearman rho = 0.275),推动了检索后评估;基于关键词和语义的检索呈现了大部分不重叠的源池,推动了在共享LLM评估过滤器下两者作为互补检索层运行的架构。我们还引入了Zwischentexte(作为解释性提议而非发现的中介文本)的概念,作为将LLM生成文本负责任地整合到学术实践中的框架。该架构提供了一个模型,说明如何将特定领域的认识论承诺转化为RAG设计决策,并可能迁移到处理大型语料库的其他解释性学科。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:42

# 通过关键性技术实践将历史方法论嵌入检索增强生成 来源:https://arxiv.org/html/2606.18103 ###### 摘要 检索增强生成(RAG)是将语言模型输出锚定于外部证据的主流架构,但其主导评估范式与默认配置仍以事实型问答为导向。对于历史研究等阐释性学科而言,RAG 内嵌的假设与学术实践存在冲突。为此,我们提出 HistoRAG——一个将史学研究原则转化为具体架构干预措施的框架。**分离式检索与生成**(将来源发现与阐释解耦)、**时间窗口化**(在研究周期内强制实现均衡的来源表征,作为历史探究的方法论要求)、以及 **LLM 作为裁判的评估**(使相关性判断透明化且可争议)。我们利用 SPIEGELragged(一个应用于新闻周刊《明镜》1950–1979 年间 102,189 篇文章的实现)来评估这些干预措施。评估显示,每项干预均弥补了标准 RAG 的可量化缺陷:使用 1970 年代的术语检索时,特定时期的词汇无法获取 1950 年代的任何文本块,这证明时间偏差正是窗口化的动因;向量相似度与 LLM 评估的相关性仅呈弱相关(Spearman ρ = 0.275),佐证了检索后评估的必要性;基于关键词的检索与基于语义的检索所覆盖的来源池基本不重叠,这支撑了将两者作为互补检索层、在同一 LLM 评估过滤器下协同运行的架构。此外,我们引入 **Zwischentexte**(中间文本,作为阐释性提案而非结论)这一概念,作为将 LLM 生成的文本负责任地融入学术实践的框架。我们提出的架构为如何将特定领域的认识论承诺转化为 RAG 设计决策提供了范例,并有望推广至其他处理大规模语料的阐释性学科。 ## 1 引言 检索增强生成已成为 LLM 应用架构中不可或缺的组成部分,用于将语言模型输出锚定于外部证据。然而,RAG 系统设计通常仍泛泛而谈,以事实型问答为导向,优化目标是找到最佳单一段落、生成简洁答案、然后继续。此类系统倾向于鼓励无论源类型如何的流畅用户行为。对于那些从根本上以阐释方式处理文本的学科而言,标准 RAG 架构内嵌的假设与诠释学的学术实践相冲突。在这些领域中,“相关性”在经验上难以定义,往往取决于研究者个体的特定认识旨趣、所追求的研究问题、时间性、语义,而且选择来源的依据本身也必须接受审视。这里的任务并非传统意义上的信息检索(即定位语料中的陈述),而是阐释。这意味着对文本本身提出问题,例如其中所含的陈述如何随时间变化,这相当于对这些陈述做出论断,而不仅仅是找到它们。本文探讨如何重新设计 RAG 以支持历史研究,并论证这一过程需要基于学科认识论承诺的架构决策。 数字历史正在经历一场既根本又具颠覆性的转型。几十年来,计算方法为历史学家提供了分析大规模语料的强大工具,但正如我们所说,这些方法通常侧重于在符号层面而非意义层面处理字符序列。受 Silke Schwandt 将计算机描述为“语义盲”(Schwandt, 2018)的启发,这些早期计算方法在文本的表面而非意义上运作。正如我们之前所述(Hiltmann 等,2021),更深层的问题在于,这些方法根本无法触及语义层面,这一限制塑造了历史学家使用它们的方式。我们将这一范式称为 **DH 1.0**。例如,主题建模基于共现矩阵,文本重用检测识别重复的字符序列,而像 Voyant(Rockwell and Sinclair, 2016)这样的语料库工具则可视化词元序列的频率。 大语言模型(LLM)如今承诺了一种质的不同,转向我们所谓的 **DH 2.0**。LLM 使用 Simons 等人(2025)所称的“情境化表征”——这是意义的计算近似,既能实现模式识别,也能进行阐释性生成(第 2 页)。尽管 LLM 内部仍对词元进行操作,但关键区别在于,我们与这些工具的交互发生在意义层面,而非形式操作层面。历史学家用自然语言提出问题,并收到处理语义内容的回应,而非频率表或共现矩阵。这种从计算字符序列到计算这些序列的语义近似的转变,为阐释性学科提出了紧迫的问题,并代表了一种根本的认识论变化。 这种潜力伴随着真正的危险。如果早期方法要求历史学家明确形式化其分析路径并解释结果,那么 LLM 则可能完全隐藏这些选择。当一个系统能够“阅读”数千份来源并生成连贯的分析时,我们如何保持定义历史学术的阐释权威?正如 Chen(2025)所述,这核心上是关于认识论能动性的问题。这是关于保留研究者提出、评估和质疑知识主张的能力,而不是将这些委托给计算系统。风险不在于 AI 取代历史学家,而在于我们会接受那些模糊了构成学术实践的关键决策(如来源选择、相关性评估、阐释框架)的界面。如果我们不主动塑造我们使用的工具,商业供应商就会为我们设计它们,以效率和流畅用户体验为代价,牺牲认识论透明性。 RAG 提供了一条前进道路,因为它保留了推理者(LLM)与档案(文档)之间的区别,使得生成的洞见可以追溯到特定来源(Lewis 等,2020)。与将知识埋入神经网络权重且输出的认识论起源无法追踪的微调不同,RAG 保持了历史学术所要求的主张与证据之间的联系。正如 Weatherby(2025)所述,LLM 输出是受训练数据塑造的文化产物,难以检查。RAG 提供了一种在生成文本与可识别来源之间保持联系的手段。但标准 RAG 架构通常是为信息检索而非阐释性探究而构建和评估的。它们在一个无缝管道中将来源发现与阐释混为一谈,将相似度视为相关性的代理,缺乏确保时间覆盖的机制,并将语料库词汇视为稳定,忽略了历史探究必须追踪的概念变化。这些假设都与历史方法的要求相冲突。 我们提出 HistoRAG¹¹¹https://scm.cms.hu-berlin.de/digital-history/digital-history-forschung/histo_rag/historag,这是一个通过基于关键性技术实践(Agre, 1998)的三项干预措施,将历史方法论嵌入 RAG 架构的框架。首先,**分离式检索与生成**正式将语料库构建与分析解耦,恢复了历史方法所需的 Heuristik(来源发现)与 Interpretation(阐释)之间的区别。其次,**时间窗口化**强制在研究周期内实现来源的均衡表征,作为历史探究的方法论要求,保证每个时间窗口有固定比例的来源,而不是让相似度排名决定时间覆盖。标准检索通过两种机制引入时间偏差:词汇在几十年间漂移,使得当代查询词与较晚时期更接近;主题密度随时间变化,使得对某主题讨论集中的时期排挤掉稀疏时期中同样相关的来源。第三,**LLM 作为裁判的评估**将历史学家定义的标准引入检索后过滤,将算法选择从黑箱转变为透明、可论证的过程,其理由可以被审查和质疑。我们利用 SPIEGELragged²²²https://scm.cms.hu-berlin.de/digital-history/digital-history-forschung/histo_rag/spiegelragged(一个应用于《明镜》1950–1979 年间 102,189 篇文章的实现)来评估这些干预措施,证明每项干预都弥补了标准 RAG 的可量化缺陷,并且该架构中包含的关键词过滤和语义检索层,在同一 LLM 评估过滤器下,捕获了基本互补的相关性维度。 虽然我们的案例研究是历史学的,但根本问题延伸至其他处理大规模语料的阐释性学科,包括文学研究、法律分析、定性社会科学、档案研究等。无论哪里,“相关性”不是文档的固定属性而是所提出问题的函数,无论哪里时间或语境定位塑造意义,无论哪里来源选择的依据必须透明且可争议,标准 RAG 设计与学科实践之间的张力都会重现。通过 HistoRAG,我们提供了一个模型,用于将特定领域的认识论承诺转化为具体的架构决策。 ## 2 相关工作 HistoRAG 处于三条研究轨迹的交汇点。第一条是 RAG 架构超越事实型问答的演变。第二条是对特定领域语料要求特定领域检索设计的日益认识。第三条涉及数字人文学科内部关于计算系统如何介入阐释性学术的方法论辩论。我们在此追溯这些轨迹,以确定我们的框架所解决的具体空白。 检索增强生成由 Lewis 等人(2020)提出,旨在将语言模型输出锚定于外部证据,结合参数化记忆与可搜索知识库。后续工作显著完善了这一架构。Gao 等人(2024)区分了“朴素”与“高级”RAG 管道,将检索后处理(包括重排序与过滤)确定为改进的关键环节。Huang 和 Huang(2024)将领域组织为四个阶段(检索前、检索、检索后、生成),指出多数增强针对事实查找任务的检索准确性。“LLM 作为裁判”范式,即指令遵循模型根据明确标准评估内容,已成为有前景的检索后策略(Gu 等,2024),而 Nogueira 和 Cho(2020)证明基于 BERT 的段落重排序在标准基准上显著优于初始检索。然而,在整个文献中,主导评估范式仍然以信息检索基准为导向,系统根据是否返回最佳单一段落来回答事实性问题进行评估。Murugadoss 等人(2024)发现,即使高度具体的评分指令也仅使 LLM 与人类的一致性提高约 4%(第 2 页),并且模型困惑度有时比提示更能与人类判断对齐,这突显了事实任务中基于提示的评估的局限性。 自 Lewis 等人最初提出以来的几年中,越来越多的研究表明,通用 RAG 管道在应用于专业领域时会失败。在医学领域,Kim 等人(2025)进行了迄今为止最大规模的医学 RAG 专家评估,发现标准 RAG 通常降低而非提高性能,仅 22% 的检索段落被专家评估者评为相关。一项对 70 项医疗 RAG 研究的系统综述同样得出结论,基本实现仅带来边际改善,有效的临床应用需要领域适应的嵌入、结构化知识集成和专家验证(Amugongo 等,2025)。在法律领域,Magesh 等人(2025)证明商业法律 RAG 工具在 17% 至 33% 的时间产生幻觉,表明面向领域的应用不仅需要改进检索,或许还需要不同的整体框架。此外,这些努力表明,通用 RAG 与学科需求之间的距离不仅是量上的(更多文档、更好的嵌入),而且是质上的,涉及对“相关性”在语境中含义的不同概念。 在数字人文学科与历史研究领域,与 RAG 的接触尚处于初期但正在加速。Murugaraj 等人(2025)引入了 TopicRAG,将基于 BERTopic 的主题建模与检索相结合,以改善搜索历史报纸档案时的主题连贯性。他们的系统将检索限制在主题相关的文档,以牺牲召回率为代价换取精度。这一策略与我们自己的策略形成对比,我们将**以召回率换精度**作为核心设计原则。由于历史探究中的相关性是阐释性的且可争议,我们不会让相似度阈值在历史学家能够判断之前丢弃来源。HistoRAG 反而在检索阶段广撒网,然后通过透明的评估步骤实现精度,该步骤将相关性决策权保留给研究者。Lee 等人(2025)将 RAG 应用于朝鲜王朝实录(472 年历史记录),证明相对于仅用 LLM 的基线有大幅改进,同时强调清晰来源引用作为历史分析不可协商的要求。与我们的工作最直接相关的是,Zhou 等人(2025)提出了一个“人文学科在回路中”的框架,将细读实践嵌入数字档案材料的 RAG 管道阶段。他们对常规 RAG 未能捕捉人文学科研究所要求的语境复杂性与阐释细微差别的论证与我们的观点高度一致,尽管他们关注细读方法,而我们则侧重于将史学理论(分期、来源批评、时间推理)整合到系统架构中。 超越 RAG

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。