ColGraphRAG:多模态GraphRAG的延迟交互证据检索

arXiv cs.AI 论文

摘要

ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。

arXiv:2607.16208v1 公告类型:新 摘要:基于图的多模态问答将文本、表格和图像组织成结构化的证据图,但端到端的准确性取决于哪些多模态资产被排名足够高以进入下游推理;对于图链接图像,单向量双编码器相似度可能会丢弃细粒度对齐所需的补丁和令牌级结构。我们评估了在 ColBERT/ColPali 系列中使用延迟交互 MaxSim 风格的多向量评分替换图链接图像节点上的视觉候选排序运算符,同时保持离线图构建、文本和表格侧检索、结构化提取以及下游推理不变。在 MultimodalQA 上,这一变化与图链接图像候选的检索阶段点估计提升和下游问答收益相关,在视觉证据最关键的问题上提升更大,而在文本主导的问题上趋势混杂;我们将这一模式解释为图链接视觉证据纳入的机制层证据,而更广泛的验证和更精细的图级诊断仍是重要的未来工作。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:37

# 晚期交互证据检索用于多模态 GraphRAG
来源:https://arxiv.org/html/2607.16208

###### 摘要

基于图的多模态问答将文本、表格和图像组织成结构化的证据图,但端到端的准确性取决于哪些多模态资产能够排名足够高以进入下游推理;对于图中链接的图像,单向量双编码器相似度可能会丢弃进行细粒度对齐所需的补丁级和令牌级结构。我们评估将图中链接图像节点上的视觉候选排序操作替换为 ColBERT/ColPali 系列中的晚期交互 MaxSim 风格多向量评分,同时保持离线图构建、文本和表格侧检索、结构化提取以及下游推理不变。在 MultimodalQA 上,这一变化与图中链接图像候选项的检索阶段点估计改进以及下游问答收益相关,在视觉证据最关键的场景中效果更显著,而在以文本为主的问题上趋势混合;我们将此模式解释为机制层面的证据,表明包含图中链接的视觉证据的重要性,同时更广泛的验证和更精细的图级诊断仍然是未来工作的重点。

## 1 引言

针对长篇、视觉丰富的文档进行多模态问答,需要来自文本、表格和插图的证据,这些证据只有在结合时才可能具有决定性。基于图的系统将资产链接在一个证据图中,并在子图上进行推理,但下游阶段只能看到早期被提升的证据;排名过低的决定性图表通常无法恢复。最近的长文档和视觉基础问答基准进一步强调了这一场景,即证据分散在多个页面和模态之间[4 (https://arxiv.org/html/2607.16208#bib.bib4),5 (https://arxiv.org/html/

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。

RAG-Anything:全能型 RAG 框架

Papers with Code Trending

RAG-Anything 是一个全新的开源框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂的基准测试中表现优于现有方法。