ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐
摘要
ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。
查看缓存全文
缓存时间: 2026/08/18 03:51
论文页面 - ConceptFormer:在视觉文档检索中学习查询与文档对齐的自适应潜在概念
来源:https://huggingface.co/papers/2608.15698 作者:
,
,
,
,
,
,
,
,
,
,
摘要
ConceptFormer 学习连续的潜在概念表示,用于连接视觉证据与语义相关性,实现视觉文档检索,且无需依赖文本中间表示或原始视觉标注。
视觉文档检索 (https://huggingface.co/papers?q=Visual%20document%20retrieval) 是多模态检索增强生成的关键组成部分,旨在从文档集合中识别与查询相关的页面,其中证据分布于文本、布局、图表和视觉结构中。近期为实现更细粒度监督的努力主要依赖文本描述或局部视觉区域作为证据代理。然而,此类监督信号可能忽视复杂的视觉结构,或提供不完整且不准确的底层证据表示。为解决这些局限性,我们提出了 ConceptFormer (https://huggingface.co/papers?q=ConceptFormer),一个用于视觉文档检索 (https://huggingface.co/papers?q=visual%20document%20retrieval) 的潜在概念表示学习 (https://huggingface.co/papers?q=latent%20concept%20representation%20learning) 框架。ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 将查询相关证据建模为连续的、依赖查询的潜在概念,这些概念明确连接了局部视觉证据与语义相关性,无需任何文本中间表示,也不直接依赖原始视觉标注。在训练过程中,ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 利用一个强大的视觉-语言模型 (https://huggingface.co/papers?q=vision-language%20model) 动态确定潜在概念令牌 (https://huggingface.co/papers?q=latent%20concept%20tokens) 的数量,并将这些概念用作中间表示,以弥合查询与文档之间的语义鸿沟,从而引导嵌入空间 (https://huggingface.co/papers?q=embedding%20space) 的学习。在多个视觉文档检索 (https://huggingface.co/papers?q=visual%20document%20retrieval) 基准上的实验表明,ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 在平均 NDCG@10 (https://huggingface.co/papers?q=NDCG%4010) 上分别比最强的视觉检索基线和最强的基于 OCR 的文本检索基线相对提高了 16.7% 和 22.1%。进一步分析揭示,潜在概念有效地将局部视觉证据与语义相关性连接起来,使检索器能够同时捕捉细粒度的文本线索和复杂的文档级视觉结构,同时保持强大的检索对齐能力。代码和数据可在 https://github.com/Neuir/ConceptFormer (https://huggingface.co/papers?q=ConceptFormer) 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15698)查看 PDF (https://arxiv.org/pdf/2608.15698)GitHub2 (https://github.com/NEUIR/ConceptFormer)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15698)
在您的代理中获取此论文:
hf papers read 2608\.15698
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型2
hmhm1229/ConceptFormer-Qwen 图像特征提取• 更新于 42 分钟前 • 2 (https://huggingface.co/hmhm1229/ConceptFormer-Qwen)
hmhm1229/ConceptFormer-Phi3V 图像特征提取• 更新于 42 分钟前 • 2 (https://huggingface.co/hmhm1229/ConceptFormer-Phi3V)
引用本文的数据集2
hmhm1229/ConceptFormer-Eval 查看器• 更新于 43 分钟前 • 83.9k (https://huggingface.co/datasets/hmhm1229/ConceptFormer-Eval)
hmhm1229/ConceptFormer-Trainset 查看器• 更新于 43 分钟前 • 12.2k (https://huggingface.co/datasets/hmhm1229/ConceptFormer-Trainset)
引用本文的 Space0
没有关联本文的 Space。
在 Space 的 README.md 中引用 arxiv.org/abs/2608.15698 以从本页面链接它。
包含本文的收藏夹0
没有包含本文的收藏夹。
将本文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接它。
相似文章
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
将视觉-语言接地视为双向概念对应
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。
丢失还是隐藏?监督持续学习中的概念级遗忘
本文介绍了一种基于稀疏自编码器(Sparse Autoencoders)的诊断框架,用于分析持续学习中的概念级遗忘,发现大部分遗忘源于表示不可访问性而非信息擦除。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
并行LLM推理实现抗偏差、稳健的概念抽象
本文提出了一种并行分块处理长文档的框架,利用LLMs减少累积偏差并提高证据可追溯性,显著降低了遗漏错误和无依据主张。