ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Hugging Face Daily Papers 论文

摘要

ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。

视觉文档检索是多模态检索增强生成的关键组成部分,旨在从文档集合中识别查询相关的页面,其中证据分布在文本、布局、图表和视觉结构中。近期对细粒度监督的努力主要依赖文本描述或局部视觉区域作为证据代理。然而,这种监督信号可能忽略复杂的视觉结构,或提供对底层证据不完整和不准确的表示。为了解决这些限制,我们提出了ConceptFormer,一个用于视觉文档检索的潜在概念表示学习框架。ConceptFormer将查询相关证据建模为连续的、查询条件化的潜在概念,明确连接局部视觉证据和语义相关性,而无需文本中间表示或直接依赖原始视觉标注。在训练过程中,ConceptFormer采用了一个强大的视觉语言模型来动态确定潜在概念标记的数量,并使用这些概念作为中间表示来弥合查询和文档之间的语义差距,从而指导嵌入空间的学习。在多样化视觉文档检索基准上的实验表明,ConceptFormer在平均NDCG@10上相对于最强的视觉检索基线和最强的基于OCR的文本检索基线分别实现了16.7%和22.1%的相对改进。进一步分析表明,潜在概念有效连接局部视觉证据和语义相关性,使检索器能够捕获细粒度文本线索和复杂的文档级视觉结构,同时保持强大的检索对齐。代码和数据可在https://github.com/Neuir/ConceptFormer获取。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:51

论文页面 - ConceptFormer:在视觉文档检索中学习查询与文档对齐的自适应潜在概念

来源:https://huggingface.co/papers/2608.15698 作者:

,

,

,

,

,

,

,

,

,

,

摘要

ConceptFormer 学习连续的潜在概念表示,用于连接视觉证据与语义相关性,实现视觉文档检索,且无需依赖文本中间表示或原始视觉标注。

视觉文档检索 (https://huggingface.co/papers?q=Visual%20document%20retrieval) 是多模态检索增强生成的关键组成部分,旨在从文档集合中识别与查询相关的页面,其中证据分布于文本、布局、图表和视觉结构中。近期为实现更细粒度监督的努力主要依赖文本描述或局部视觉区域作为证据代理。然而,此类监督信号可能忽视复杂的视觉结构,或提供不完整且不准确的底层证据表示。为解决这些局限性,我们提出了 ConceptFormer (https://huggingface.co/papers?q=ConceptFormer),一个用于视觉文档检索 (https://huggingface.co/papers?q=visual%20document%20retrieval) 的潜在概念表示学习 (https://huggingface.co/papers?q=latent%20concept%20representation%20learning) 框架。ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 将查询相关证据建模为连续的、依赖查询的潜在概念,这些概念明确连接了局部视觉证据与语义相关性,无需任何文本中间表示,也不直接依赖原始视觉标注。在训练过程中,ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 利用一个强大的视觉-语言模型 (https://huggingface.co/papers?q=vision-language%20model) 动态确定潜在概念令牌 (https://huggingface.co/papers?q=latent%20concept%20tokens) 的数量,并将这些概念用作中间表示,以弥合查询与文档之间的语义鸿沟,从而引导嵌入空间 (https://huggingface.co/papers?q=embedding%20space) 的学习。在多个视觉文档检索 (https://huggingface.co/papers?q=visual%20document%20retrieval) 基准上的实验表明,ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 在平均 NDCG@10 (https://huggingface.co/papers?q=NDCG%4010) 上分别比最强的视觉检索基线和最强的基于 OCR 的文本检索基线相对提高了 16.7% 和 22.1%。进一步分析揭示,潜在概念有效地将局部视觉证据与语义相关性连接起来,使检索器能够同时捕捉细粒度的文本线索和复杂的文档级视觉结构,同时保持强大的检索对齐能力。代码和数据可在 https://github.com/Neuir/ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.15698)查看 PDF (https://arxiv.org/pdf/2608.15698)GitHub2 (https://github.com/NEUIR/ConceptFormer)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15698)

在您的代理中获取此论文:

hf papers read 2608\.15698

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型2

hmhm1229/ConceptFormer-Qwen 图像特征提取• 更新于 42 分钟前 • 2 (https://huggingface.co/hmhm1229/ConceptFormer-Qwen)

hmhm1229/ConceptFormer-Phi3V 图像特征提取• 更新于 42 分钟前 • 2 (https://huggingface.co/hmhm1229/ConceptFormer-Phi3V)

引用本文的数据集2

hmhm1229/ConceptFormer-Eval 查看器• 更新于 43 分钟前 • 83.9k (https://huggingface.co/datasets/hmhm1229/ConceptFormer-Eval)

hmhm1229/ConceptFormer-Trainset 查看器• 更新于 43 分钟前 • 12.2k (https://huggingface.co/datasets/hmhm1229/ConceptFormer-Trainset)

引用本文的 Space0

没有关联本文的 Space。

在 Space 的 README.md 中引用 arxiv.org/abs/2608.15698 以从本页面链接它。

包含本文的收藏夹0

没有包含本文的收藏夹。

将本文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接它。

相似文章

将视觉-语言接地视为双向概念对应

Hugging Face Daily Papers

本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。