TRACE: 可问责的智能体检索框架,用于数字档案中的来源发现
摘要
TRACE是一个无需训练的智能体检索框架,专为历史数字档案中的可问责来源发现而设计,在基准测试中以每问题低成本优于RAG基线。
arXiv:2609.19897v1 公告类型:新
摘要:历史档案为检索增强生成系统带来了困难的检索问题:文档因OCR降质,跨类型和来源异质性强,并且需要强源可追溯性以供学术和机构使用。我们介绍了TRACE,一个无需训练的智能体检索框架,专为历史语料库的可问责来源发现而设计。该系统是在DECIDON项目的背景下开发的,该项目是一个跨学科项目,研究法国第三共和国时期议会辩论与媒体之间政治话语的流通,涉及数字化历史收藏和机构用例。原型目前已在项目内部部署,可供六家合作伙伴机构的24名研究人员访问。我们在HistoriQA-ThirdRepublic上评估了TRACE,这是一个包含1,752个法国历史问题的基准,问题基于1887年的议会辩论和报纸,文档来源于Biblioth{\`e}que nationale de France数字化收藏。TRACE实现了R@10 = 0.856和MRR = 0.653,优于稀疏、密集、基于图和智能体RAG基线,在多跳和跨语料库问题上获得最大收益。在默认托管推理配置下,每问题成本约为0.02美元,TRACE对于无法依赖昂贵本地GPU基础设施的遗产机构、实验室或公司仍然经济可行。这些结果表明,对于大型数字图书馆和档案,检索问责制和语料库感知智能体设计可以提供一种更实用的替代方案,替代更重的基于训练或图构建的方法。
查看缓存全文
缓存时间: 2026/09/18 09:27
# TRACE:数字档案馆中源发现的可问责智能检索
来源:https://arxiv.org/html/2609.19897
CCS:信息系统 问答
CCS:信息系统 信息检索
CCS:计算方法 自然语言处理
边东翰
https://orcid.org/0009-0007-1684-6026
隶属机构:法国国立文献学院(École nationale des chartes – PSL),让·马比荣中心,法国巴黎
隶属机构:法国电子与信息技术应用学院(EPITA),EPITA研究实验室,法国勒克雷姆兰-比塞特尔
玛丽·普伦
https://orcid.org/0000-0001-5452-3913
隶属机构:法国电子与信息技术应用学院(EPITA),EPITA研究实验室,法国勒克雷姆兰-比塞特尔
隶属机构:法国国立文献学院(École nationale des chartes – PSL),让·马比荣中心,法国巴黎
弗洛里安·卡菲罗
https://orcid.org/0000-0002-1951-6942
隶属机构:法国电子与信息技术应用学院(EPITA),EPITA研究实验室,法国勒克雷姆兰-比塞特尔
隶属机构:日内瓦高等研究院,数字人文与多边主义中心,瑞士日内瓦
###### 摘要
历史档案对检索增强生成系统提出了艰巨的检索挑战:文档经OCR处理后质量退化,体裁和来源异质性强,并且学术与机构应用需要强大的源可追溯性。我们引入TRACE,一个无需训练的智能检索框架,旨在实现历史语料库上可问责的源发现。该系统是在DECIDON项目的背景下开发的,这是一个关于法国第三共和国时期议会辩论与报刊之间政治话语流通的跨学科项目,涉及数字化历史馆藏和机构应用场景。该原型系统目前在项目内部部署,可供六家合作机构的24名研究人员访问。我们在HistoriQA-ThirdRepublic基准测试上对TRACE进行了评估,该基准包含1,752个关于1887年议会辩论和报纸的法语历史问题,文档源自法国国家图书馆(Bibliothèque nationale de France)的数字化馆藏。TRACE实现了R@10 = 0.856 和 MRR = 0.653,优于稀疏、稠密、基于图和智能体RAG基线方法,在多跳和跨语料库问题上取得了最大的性能提升。在默认托管推理配置下,TRACE每个问题的成本约为0.02美元,对于无法依赖昂贵本地GPU基础设施的遗产机构、实验室或公司而言,仍然具有经济可行性。这些结果表明,对于大型数字图书馆和档案馆,检索问责制和语料库感知的智能体设计可以提供一种比更重的训练或图构建方法更实用的替代方案。
###### 关键词:
智能检索、检索增强生成、历史语料库、数字档案、源发现、OCR退化文本、多跳检索
††这是作者的工作版本,仅供个人和非商业用途。最终版本已被《*第35届ACM国际信息与知识管理会议(CIKM '26)论文集*》接受发表,会议于2026年11月7日至11日在意大利罗马举行,可通过以下链接获取:https://doi.org/10.1145/3799682.3840134。
## 1\.引言
档案文件长期以来一直是历史研究的基石(Blouin Jr. and Rosenberg, 2011)。随着计算机科学与数字人文科学的融合,大量纸质材料已被数字化,使得大规模搜索日益可行。然而,在历史研究场景中部署检索增强生成(RAG)仍受到三个复合挑战的阻碍。在*技术*层面,高OCR错误率在嵌入过程中引入语义漂移并降低了检索精度(Bourne, 2026; Zhang et al., 2025b)。在*查询*层面,历史问题通常横跨多个异质来源、宽泛的时间范围,或者需要跨文档综合而非单一事实查找。在*方法论*层面,大多数RAG系统针对生成质量进行优化(Nguyen et al., 2025; Xia et al., 2026),而历史学术研究则要求严格的源可追溯性、解释透明性以及在每个检索步骤都有人类干预的可能性(Puren et al., 2026),这些要求在通用RAG场景中没有对应项。这些限制同样存在于拥有大量数字化馆藏但缺乏语料库特定监督或本地GPU基础设施的图书馆、档案馆和机构库中。
对此,我们提出了TRACE(无需训练的智能语料库探索检索),一个轻量级、无需训练的智能RAG框架,专为历史语料库上的可问责源发现而设计。这项工作基于DECIDON项目,这是一个法国国家研究署(ANR)资助的项目,研究法国第三共和国时期议会辩论与报刊之间的政治话语流通,涉及计算机科学家、历史学家和法国国家图书馆(BnF)。在历史和档案研究中,检索本身并非隐藏的预处理步骤,而是一种学术操作:检索到的源必须是可发现、可检查和可引用的。TRACE还旨在补充Corpusense,这是在Mezanno项目内开发的基于IIIF的工具,用于将数字化的连续出版源转换为结构化数据(Abadie et al., 2026; Mezanno Project, 2026; Bibliothèque nationale de France, 2026)。TRACE的开源版本也已发布(https://github.com/Kepler1908/TRACE)。
我们的贡献有三方面:
- •我们将历史档案检索重新定义为*源发现*:一个在OCR退化、异质源结构和源可追溯性约束下的应用性、语料库感知的文档检索问题,评估指标是检索质量而非生成指标。
- •我们介绍了TRACE,一个无需训练的智能检索框架,结合了语料库定向分解、融合热启动、带有延迟重评估的显式检索裁决,以及基于智能体撰写的理由进行计数分组重排序。
- •我们通过实证表明,这种对成熟、现成的检索组件进行编排的方法,在一个包含1,752个问题的法语历史基准测试上,优于专门为构建的基于图和智能RAG系统,同时保持无需训练且每个问题的成本约为0.02美元。
## 2\.相关工作
### 2\.1\.从检索有效性到检索可问责性
智能RAG以两种主要形式出现:使用强化学习的训练方法(Asai et al., 2023; Li et al., 2025; Hui et al., 2026; Xia et al., 2026)和依赖框架设计的无需训练方法(Besrour et al., 2025; Nguyen et al., 2025; Du et al., 2026)。两者都展示了显著的检索增益,但存在一个关键限制:它们在生成指标(精确匹配、F1、LLM判断的准确率)上进行端到端评估,未检查检索质量,并且混淆了参数知识与基于证据的检索(注:Self-RAG和RAGentA确实报告了召回率,但只是多个指标之一)。基于图的RAG(Edge et al., 2025; Guo et al., 2025; Gutiérrez et al., 2025; Zhuang et al., 2025)提供了补充性的结构化索引,并在多跳问题上取得了一致的增益,但引入了两个与此相关的约束:图构建是一种有损压缩形式,并且实体提取在OCR噪声下严重退化,导致结构错误传播到检索中。历史档案语料库结合了大量的OCR噪声、异质子语料库和严格的源可追溯性要求,同时考验着两种范式的假设,这促使我们提出一个检索优先的框架,直接在噪声文本上操作,无需中间结构提取。
### 2\.2\.数字人文中针对历史语料库的RAG
RAG在数字人文中被越来越多地用于查询大型、异质和OCR噪声的档案馆藏,涵盖报纸档案(Tran et al., 2025; Mudet and Bakkali, 2025)、议会辩论(Perez et al., 2025)、古典文本(Fan et al., 2025)、行政记录(Lee et al., 2025)和个人日记档案(Zhou et al., 2025; Lin et al., 2025)。一个反复出现的发现是,语料库特定属性(如OCR伪影、古体词汇和时间结构)始终主导着检索性能:在重排序时注入命名实体可部分缓解OCR错误;基于日期的元数据过滤显著提高了时间密集型馆藏的精度;而稠密检索在历史词汇上系统性地失败,稀疏检索和重排序优于基于嵌入的方法。
除了检索性能,围绕源可追溯性和人类监督的平行关切也已出现:在历史学术中,识别相关源本身就是学术目标,检索必须保留从查询到证据的可检查、可引用的路径。这些研究推动了一种检索优先的评估视角,其中源发现,而不仅仅是答案生成,成为测量的对象。
## 3\.方法论
### 3\.1\.问题设定与架构概述
设 \(\mathcal{D} = \mathcal{D}_1 \cup \cdots \cup \mathcal{D}_K\) 是一个异质档案语料库,被划分为 \(K\) 个在体裁、词汇和文档质量上各不相同的子语料库。给定一个用语料库语言表述的问题 \(q\),系统必须返回一个排序的文档标识符列表。黄金标准集 \(G_q \subseteq \mathcal{D}\) 可能跨越多个子语料库,并且无法从 \(q\) 的表面形式中恢复。我们使用召回率@k作为主要评估指标。
TRACE通过一个六阶段的流程来应对上述挑战,如图1所示。
流程图展示了一个用户问题被分解为子问题,随后进行融合检索、一个智能搜索与审查循环、待定重评估、简报与重新规划,以及最终的文档合并与重排序。
图1\. TRACE流程概述。
### 3\.2\.规划器:语料库定向分解
规划器是一次LLM调用,它将 \(q\) 分解为一组 \(M\) 个子问题 \(\{s_1, \ldots, s_M\}\),其中 \(M \leq M_{\max}\)。每个 \(s_i\) 是一个元组 \((\text{text}_i, c_i, \text{entities}_i)\),其中 \(c_i \in \mathcal{C}\) 标识目标子语料库。设计遵循了规划与执行、基于分解的智能检索的普遍思路。提示强制执行三个不变性:(i) 子问题联合覆盖 \(q\) 的含义,无遗漏或添加;(ii) 每个 \(s_i\) 精确针对一个子语料库,因此跨语料库的问题被扇出为按语料库划分的子问题;(iii) 实体名称保留其原始语言表面形式,以避免因翻译导致的OCR不匹配。
语料库定向指导了第一阶段的候选分配,但并不限制智能体循环:当证据表明存在跨语料库关联时,智能体可以搜索跨语料库边界(§3\.4)。
### 3\.3\.第一阶段:融合热启动
对于每个子问题 \(s_i\),第一阶段通过倒数排名融合(RRF, \(k=60\))融合互补的检索通道,生成初始候选池。每个通道独立对分块进行评分,并对父文档进行*最大池化*:一个包含 \(N\) 个分块的文档在每个通道中只贡献一次——其最佳分块分数——防止任何单个长文档通过大量段落主导池。这种混合设计基于近期的发现,即稀疏、稠密、元数据感知和重排序策略通常能弥补历史语料库中不同的故障模式。
稀疏词汇检索(BM25):在分词后的分块上进行检索,对经OCR幸存的专有名词和领域术语有效。
稠密语义检索:使用预计算的分块嵌入上的余弦相似度,捕获词汇搜索遗漏的释义和概念匹配。
时间检索:使用基于日期的检索,通过时间距离的指数衰减评分,当子问题携带明确可解析的日期时激活。
两个主要通道是强互补而非冗余的。通过每个通道独立重放已执行的子问题,BM25与稠密检索前20名候选池之间的平均Jaccard重叠度仅为0.19,并且28.8%的由融合恢复的黄金文档恰好可通过两个通道之一访问到。融合检索恢复了78.9%的黄金文档,而更好的单一通道仅恢复70.1%。这为OCR噪声提供了隐式的鲁棒性,无需显式预处理:BM25匹配经数字化幸存的分词,而稠密检索捕获损坏文本的语义释义。然而,在不平衡的语料库中,应用全局结果上限会系统性地截断少数子语料库文档。我们通过预计算属于目标子语料库的文档ID集合并将这些ID作为*候选约束*传递来解决此问题。相似文章
TRACE:可信检索增强对话引擎
TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。
@TREC_RAG:搜索正在变得越来越自主化:系统规划、搜索、综合、引用和修订。但,我们该如何研究……
TREC RAG 2026 旨在构建一个可复用的集合,用于评估那些能够规划、搜索、综合、引用和修订的自主搜索系统。该计划聚焦于四个核心方向。
参数与上下文:面向鲁棒检索增强生成的TRACE微调
本文提出TRACE,这是一个用于检索增强生成(RAG)的微调框架,它使用多智能体辩论轨迹和答案完整性正则化来处理知识冲突,从而提高对误导性上下文的鲁棒性并减少不完整答案。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
Tokengeist: 智能体对话中的多轮归因追踪
介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。