面向证据到分类法检索的因子化假设搜索

arXiv cs.CL 论文

摘要

本文介绍了因子化假设搜索(Factorized Hypothesis Search, FHS),一种在输入提供间接上下文证据(如表格单元格或临床笔记)时从大型分类法中检索概念的方法。FHS 在金融分类法标注和 CodiEsp 临床编码任务上取得了优异结果,在 Recall@1、MRR 和准确率方面均优于非 oracle 基线方法。

arXiv:2608.06614v1 公告类型:新 摘要:大型分类法检索通常假设输入已经表达了目标概念。然而,在许多场景中,输入是间接证据,例如其含义取决于所在行、列、数据类型和上下文的表格单元格。我们将这种不匹配称为“检索就绪度差距”。我们的分析表明,当目标语义显式时,当前索引能可靠地检索到目标,而原始证据往往使其深陷排名底部。我们提出了因子化假设搜索(Factorized Hypothesis Search, FHS),它在命名语义维度上维护多个部分解释。这些假设支持结构化查询渲染、多假设检索和维度级候选验证。在金融分类法标注和 CodiEsp 临床编码任务中,FHS 在非 oracle 方法中取得了最佳的 Recall@1、MRR 和最终准确率。将因子化假设路径替换为自由文本集成会导致头部排名性能的最大下降,而顺序细化相比 FHS 强大的并行第一轮没有带来额外收益。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:02

# 面向证据到分类体系检索的分解式假设搜索
Linhai Ma1, Ethan F. Wei2, Xueqing Peng1, Yan Wang1,\*, Lingfei Qian1,\*, Víctor Gutiérrez-Basulto3  
1The Fin AI, USA, 2Yale University, USA, 3Cardiff University, UK  
通讯作者:\{wy2266336,lfqian94\}@gmail.com

###### 摘要
大型分类体系检索通常假设输入已经显式表达了目标概念。然而在许多场景中,输入只是间接证据,例如一个表格单元格,其含义依赖于所在行、列、数据类型及上下文。我们将这种不匹配称为**检索就绪度差距**。分析表明,当目标概念的语义显式时,当前索引能够可靠地检索到它;而原始证据往往使其深陷排序底部。我们提出了分解式假设搜索(Factorized Hypothesis Search, FHS),它在命名的语义维度上维护多个部分解释。这些假设支持结构化查询生成、多假设检索和维度级候选验证。在金融分类体系标注和CodiEsp临床编码两个任务上,FHS在所有非oracle方法中取得了最优的Recall@1、MRR和最终准确率。将分解式假设路径替换为自由文本集成会造成头部排序性能的最大下降,而顺序精化相比FHS强大的并行首轮并无额外收益。代码和数据可在 https://github.com/SarielMa/FHS 获取。

面向证据到分类体系检索的分解式假设搜索
Linhai Ma1, Ethan F. Wei2, Xueqing Peng1, Yan Wang1,\*, Lingfei Qian1,\*, Víctor Gutiérrez-Basulto3  
1The Fin AI, USA, 2Yale University, USA, 3Cardiff University, UK  
通讯作者:\{wy2266336,lfqian94\}@gmail.com

## 1 引言
图1:FHS在来自测试集的一个表格事实上的概览。FHS从目标值及其上下文中生成多个分解式假设,将每个假设渲染为定义式查询和程序化构造的标签式查询,并将检索排序融合为一个候选池。随后,候选级验证器根据各假设的语义承诺对候选进行评估。在本例中,它将金概念从第7位提升到第1位。所有比较方法共享最终的列表式选择器。

许多核心NLP任务,如生物医学实体链接(Miranda-Escalada et al., 2020a (https://arxiv.org/html/2608.06614#bib.bib1); Ye and Mitchell, 2025 (https://arxiv.org/html/2608.06614#bib.bib11))、模式匹配(Hassanzadeh et al., 2024 (https://arxiv.org/html/2608.06614#bib.bib7); Wang et al., 2025c (https://arxiv.org/html/2608.06614#bib.bib12))和金融分类体系标注(Wang et al., 2025b (https://arxiv.org/html/2608.06614#bib.bib28)),都需要将观测到的输入映射到大型概念清单中的一个条目。标准方法通常遵循检索-重排范式(Wang et al., 2025c (https://arxiv.org/html/2608.06614#bib.bib12); Ye and Mitchell, 2025 (https://arxiv.org/html/2608.06614#bib.bib11)),当输入直接提及或表达目标概念时,这种方法能够成功。然而在实践中,输入往往只提供间接的、依赖上下文的证据。例如,解释金融表格中的一个单元格需要综合其数值、行和列表头、数据类型以及相邻单元格的信息(Wang et al., 2025b (https://arxiv.org/html/2608.06614#bib.bib28));类似地,为临床结果分配编码取决于分析物、样本类型和周围的临床记录(Huang et al., 2022 (https://arxiv.org/html/2608.06614#bib.bib29))。在此类场景中,目标事实并未明确指称其概念,而其周围上下文却包含指向无关实体的干扰线索。我们将这种根本性的结构差异称为检索就绪度差距,并形式化了“证据到分类体系检索”(evidence-to-taxonomy retrieval)的设置:模型必须在搜索大型分类体系之前,先为孤立事实合成一个检索就绪的表示。这一设置超越了假想文档嵌入(HyDE; Gao et al., 2023 (https://arxiv.org/html/2608.06614#bib.bib24))所处理的传统查询-文档词汇不匹配问题:由于不存在显式查询,系统必须直接从非结构化、带噪声的证据中推断预期的语义概念。

一个自然的基线是将上下文改写成单个查询(Wang et al., 2023a (https://arxiv.org/html/2608.06614#bib.bib25); Gao et al., 2023 (https://arxiv.org/html/2608.06614#bib.bib24))。然而,查询改写根本上假设底层语义是明确的,只需要

相似文章

CFS-R:条件字段重建

Reddit r/artificial

CFS-R 是一种新颖的检索方法,通过将候选记忆视为基向量并求解正系数以重建查询,从而解决部分证据稀释问题,提升 RAG 系统的多跳推理能力。

基于术语的异质语料库层级归纳

arXiv cs.CL

提出了一种基于术语的框架,用于从异质文本源中归纳层级分类体系,实现跨源对齐和可解释的层级结构。在多源基准上的实验表明,与基于文本和摘要的基线相比,该框架在一致性和质量上有所提升。

联邦哈希投影潜在因子学习

arXiv cs.LG

本文提出了一种联邦哈希投影潜在因子(FHPLF)模型,该模型将哈希学习集成到联邦学习中,以降低通信成本并增强隐私保护,通过使用二值类梯度矩阵和投影汉明距离来提高准确性和效率。