ColGraphRAG:多模态GraphRAG的延迟交互证据检索
摘要
ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。
arXiv:2607.16208v1 公告类型:新
摘要:基于图的多模态问答将文本、表格和图像组织成结构化的证据图,但端到端的准确性取决于哪些多模态资产被排名足够高以进入下游推理;对于图链接图像,单向量双编码器相似度可能会丢弃细粒度对齐所需的补丁和令牌级结构。我们评估了在 ColBERT/ColPali 系列中使用延迟交互 MaxSim 风格的多向量评分替换图链接图像节点上的视觉候选排序运算符,同时保持离线图构建、文本和表格侧检索、结构化提取以及下游推理不变。在 MultimodalQA 上,这一变化与图链接图像候选的检索阶段点估计提升和下游问答收益相关,在视觉证据最关键的问题上提升更大,而在文本主导的问题上趋势混杂;我们将这一模式解释为图链接视觉证据纳入的机制层证据,而更广泛的验证和更精细的图级诊断仍是重要的未来工作。
查看缓存全文
缓存时间: 2026/07/21 06:37
# 晚期交互证据检索用于多模态 GraphRAG 来源:https://arxiv.org/html/2607.16208 ###### 摘要 基于图的多模态问答将文本、表格和图像组织成结构化的证据图,但端到端的准确性取决于哪些多模态资产能够排名足够高以进入下游推理;对于图中链接的图像,单向量双编码器相似度可能会丢弃进行细粒度对齐所需的补丁级和令牌级结构。我们评估将图中链接图像节点上的视觉候选排序操作替换为 ColBERT/ColPali 系列中的晚期交互 MaxSim 风格多向量评分,同时保持离线图构建、文本和表格侧检索、结构化提取以及下游推理不变。在 MultimodalQA 上,这一变化与图中链接图像候选项的检索阶段点估计改进以及下游问答收益相关,在视觉证据最关键的场景中效果更显著,而在以文本为主的问题上趋势混合;我们将此模式解释为机制层面的证据,表明包含图中链接的视觉证据的重要性,同时更广泛的验证和更精细的图级诊断仍然是未来工作的重点。 ## 1 引言 针对长篇、视觉丰富的文档进行多模态问答,需要来自文本、表格和插图的证据,这些证据只有在结合时才可能具有决定性。基于图的系统将资产链接在一个证据图中,并在子图上进行推理,但下游阶段只能看到早期被提升的证据;排名过低的决定性图表通常无法恢复。最近的长文档和视觉基础问答基准进一步强调了这一场景,即证据分散在多个页面和模态之间[4 (https://arxiv.org/html/2607.16208#bib.bib4),5 (https://arxiv.org/html/
相似文章
ContextRAG:面向检索增强生成的无抽取层次图构建
ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。
FAIR GraphRAG:一种用于语义数据分析的检索增强生成方法
一种名为FAIR GraphRAG的新型框架将FAIR数字对象与基于图的检索相结合,以增强面向语义数据分析的检索增强生成,提高了问答准确性并遵循FAIR原则,在生物医学数据集上进行了演示。
从场景到元素:可验证多模态RAG的多粒度证据检索
本文介绍了GranuVistaVQA,一个带有元素级注释的多模态基准,以及GranuRAG,一个将视觉元素视为可验证多模态RAG的一等检索单元的框架,相较于基线实现了高达29.2%的提升。
混合检索 + 依赖图扩展优于仅嵌入的代码 RAG——可测量、CI 门控
Archex 是一款新的开源代码 RAG 工具,通过结合混合搜索(BM25F + 密集嵌入)、交叉编码器重排序和依赖图扩展来改进检索,与纯基于嵌入的方法相比,实现了更高的召回率和令牌效率。
RAG-Anything:全能型 RAG 框架
RAG-Anything 是一个全新的开源框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂的基准测试中表现优于现有方法。