重新思考长视频中的RAG:检索什么以及如何使用?

arXiv cs.AI 论文

摘要

本文介绍了V-RAGBench,一个用于评估长自我中心视频中检索增强生成的基准,以及CARVE,一种自适应地为每个片段选择检索配置以提升VideoRAG性能的方法。

arXiv:2606.13141v1 公告类型:新 摘要:检索增强生成正从文本扩展到长自我中心视频,系统必须在多种模态和时间粒度中选择与查询相关的片段。然而,VideoRAG的进展受到两个限制:现有基准允许无需视频即可回答查询,掩盖了检索错误;而先前方法对每个查询应用单一模态-粒度配置,忽略了片段级别的可变性。我们通过两个创新来解决这些问题:V-RAGBench,一个由$\langle$查询、证据片段、答案$\rangle$三元组构成的基准,支持对检索和生成进行忠实且解耦的评估;以及CARVE,一种简单方法,跨配置运行并行检索器并采用片段自适应重排序来为每个片段确定获胜配置。每个片段随后在其检索时选定的获胜配置下进入生成器,产生一种交错证据形式,其中片段级别的决策在两个阶段中传播。CARVE优于八个最新的VideoRAG基线,提供给生成器的片段交错使用多种配置,而非共享单一配置,这是查询级方法无法实现的行为。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:55

# 应检索什么以及如何使用?来源:https://arxiv.org/html/2606.13141 ## 重新思考长视频中的 RAG:应检索什么以及如何使用? David S. Hippocampus 计算机科学系 Cranberry-Lemon 大学 匹兹堡, PA 15213 [email protected] 使用脚注提供作者的进一步信息(网页、替代地址)——*不*用于致谢资助机构。 重新思考长视频中的 RAG:应检索什么以及如何使用?Yuho Lee¹, Jisu Shin¹, Nicole Hee-Yeon Kim¹, Jihwan Bang², Juntae Lee², Kyuwoong Hwang², Fatih Porikli², Hwanjun Song¹ ¹KAIST, ²Qualcomm AI Research†, Qualcomm Korea YH, 首尔, 韩国 检索增强生成正从文本领域迈向长时、第一人称视频领域。在该领域中,系统必须跨多种模态和时间粒度选择与查询相关的视频片段。然而,VideoRAG 的进展受到两个差距的限制:现有基准允许在无需视频的情况下回答查询,掩盖了检索错误;且现有方法对每个查询应用单一的模态-粒度配置,忽略了片段级别的可变性。我们通过引入 **V-RAGBench**(一个由 ⟨查询、证据片段、答案⟩ 三元组构成的基准,能够实现检索和生成的忠实、解耦评估)以及 **CARVE**(一种简单方法,该方法跨配置并行运行检索器,并采用片段自适应重排序为每个片段确定胜出配置)来解决这两个问题。每个片段随后以其在检索期间选定的胜出配置进入生成器,形成一个交错证据形式,其中片段级别的决策在检索和生成两个阶段传播。CARVE 优于八个最近的 VideoRAG 基线,提供给生成器的片段交织了多种配置,而非共享单一配置,这是查询级方法无法实现的行为。  
日期:2026年6月11日  
通讯作者:Hwanjun Song ([email protected] (https://arxiv.org/html/2606.13141v1/mailto:[email protected]))  
第一作者(同等贡献):Yuho Lee ([email protected] (https://arxiv.org/html/2606.13141v1/mailto:[email protected])),Jisu Shin ([email protected] (https://arxiv.org/html/2606.13141v1/mailto:[email protected])),Nicole Hee-Yeon Kim ([email protected] (https://arxiv.org/html/2606.13141v1/mailto:[email protected]))  
![[未标图图像]](https://arxiv.org/html/2606.13141v1/figures/dislab-icon-Photoroom.png)  
![[未标图图像]](https://arxiv.org/html/2606.13141v1/figures/qc_AIResearch_RGB-removebg-preview.png)  
†Qualcomm AI Research 是 Qualcomm Technologies, Inc. 的一项倡议。  

## 1 引言

检索增强生成(RAG)将大语言模型(LLM)锚定在外部知识上,提高了事实可靠性 [13 (https://arxiv.org/html/2606.13141#bib.bib18), 22 (https://arxiv.org/html/2606.13141#bib.bib68), 56 (https://arxiv.org/html/2606.13141#bib.bib17), 86 (https://arxiv.org/html/2606.13141#bib.bib19)]。其前沿现在正从静态文本语料库向以视频为中心的场景转移 [28 (https://arxiv.org/html/2606.13141#bib.bib48), 77 (https://arxiv.org/html/2606.13141#bib.bib58), 84 (https://arxiv.org/html/2606.13141#bib.bib85), 71 (https://arxiv.org/html/2606.13141#bib.bib49)]。在这些场景中,主要的知识来源不再是经过整理的文本,而是*长视频*中的*第一人称*设置。随着可穿戴设备将日常生活转化为长长的第一人称视频 [6 (https://arxiv.org/html/2606.13141#bib.bib64), 73 (https://arxiv.org/html/2606.13141#bib.bib39)],以及智能体系统直接操作累积的个人视频数据 [8 (https://arxiv.org/html/2606.13141#bib.bib47), 51 (https://arxiv.org/html/2606.13141#bib.bib65)],这一趋势愈发明显。我们将这种长视频上的 RAG 设置称为 **VideoRAG**,即系统需要从长视频中检索与查询相关的证据。这种转变不仅仅是扩展了检索,而是从根本上增加了检索和生成的复杂性。给定一个目标查询,系统必须通过跨*多模态表示* [30 (https://arxiv.org/html/2606.13141#bib.bib52), 45 (https://arxiv.org/html/2606.13141#bib.bib50), 81 (https://arxiv.org/html/2606.13141#bib.bib51)](如视觉特征和更高层次的文本抽象)以及跨多种*时间粒度* [23 (https://arxiv.org/html/2606.13141#bib.bib53), 40 (https://arxiv.org/html/2606.13141#bib.bib54)](从帧级细节到片段级片段)进行匹配,来检索与查询相关的视频片段。因此,问题超出了“检索什么”,转而决定“应从哪种模态和哪种粒度进行检索?”以及“如何在检索和生成中联合利用它们?”

尽管兴趣日益增长 [39 (https://arxiv.org/html/2606.13141#bib.bib56), 44 (https://arxiv.org/html/2606.13141#bib.bib63), 58 (https://arxiv.org/html/2606.13141#bib.bib62)],当前的基准数据集却未能跟上步伐。虽然通过 Ego4D [19 (https://arxiv.org/html/2606.13141#bib.bib36)] 和 EgoLife [73 (https://arxiv.org/html/2606.13141#bib.bib39)] 可以获得小时级的源视频,但与它们配对的查询却很少,并且并非专为 VideoRAG 设计。特别是,最近的工作 [37 (https://arxiv.org/html/2606.13141#bib.bib74)] 表明,超过一半广泛使用的视频 QA 样本可以在完全没有视频的情况下回答,依赖于语言先验、世界知识或静态线索。这样的查询对于 VideoRAG 来说是致命的,因为系统即使检索到不相关的片段也能得出正确答案,因此*高生成准确率并不意味着检索成功*,最终准确率无法作为检索阶段的代理指标。在此类评估下,无法确定跨检索和生成使用模态和时间粒度的正确方式,因为每个设计选择都隐藏在最终准确率之后。

参考图注  
图 1:CARVE 概述:阶段 1 通过片段级并行检索构建候选池,而阶段 2 执行片段自适应重排序。最终的 top-k 证据及其获胜配置以模态交错的形式传递给生成器。

在方法论方面也存在同样的差距。最近的工作提出了 VideoRAG 的技术,例如引导查询精炼 [66 (https://arxiv.org/html/2606.13141#bib.bib89), 71 (https://arxiv.org/html/2606.13141#bib.bib49)]、模态融合 [42 (https://arxiv.org/html/2606.13141#bib.bib86), 74 (https://arxiv.org/html/2606.13141#bib.bib87)] 和查询分解 [70 (https://arxiv.org/html/2606.13141#bib.bib88)],而其他工作则将检索委托给迭代的智能体循环 [44 (https://arxiv.org/html/2606.13141#bib.bib63), 77 (https://arxiv.org/html/2606.13141#bib.bib58)],这些做法更像是测试时扩展,而非原则性的检索。尽管检索是所有框架最终依赖的核心组件,但其验证仍停留在浅层,被简化为完整流水线在下游 QA 上的准确率。这与以文本为中心的 RAG 形成鲜明对比,在后者中,检索被视为一等研究对象,并通过查询-证据对的阶段级指标进行审计 [13 (https://arxiv.org/html/2606.13141#bib.bib18), 17 (https://arxiv.org/html/2606.13141#bib.bib72), 34 (https://arxiv.org/html/2606.13141#bib.bib71)]。

我们通过引入 **V-RAGBench** 来解决这一差距,这是一个专用基准,旨在使 VideoRAG 中的检索和生成在孤立状态及其交互中都能被忠实地度量。V-RAGBench 由从 Ego4D [19 (https://arxiv.org/html/2606.13141#bib.bib36)] 和 EgoLife [73 (https://arxiv.org/html/2606.13141#bib.bib39)] 的长第一人称视频中抽取的 ⟨查询、证据片段、答案⟩ 三元组组成,总计 2,100 个高质量三元组,跨越 216 个视频,时长范围 1–9 小时。针对 VideoRAG 设置,V-RAGBench 联合强制执行了现有数据集无法同时满足的三个属性:每个查询 (i) *绑定到非重复证据*,使得潜在事件不会作为近似重复在视频其他地方出现;(ii) *视觉可证实的*,使得答案不能仅从查询本身推断或从参数化知识中恢复;以及 (iii) *证据定位的*,使得答案无法从其他非证据片段中偶然出现的通用视觉线索重构。属性 (i) 通过时间分割和聚类来强制执行,而 (ii) 和 (iii) 通过专用的后置过滤器强制执行。这些属性共同使生成因果性地依赖于检索,从而能够以阶段级视角审视 VideoRAG。

凭借 V-RAGBench,我们将 VideoRAG 的主要问题从提高 QA 准确率转向:视频片段的哪种表示最能支持流水线的每个阶段,即检索和生成。每个片段有四个候选配置¹¹,通过两个轴交叉形成:模态(视觉嵌入 vs. 文本摘要的嵌入)和时间粒度(帧级 vs. 片段级)。现有的 VideoRAG 检索策略 [21 (https://arxiv.org/html/2606.13141#bib.bib70), 22 (https://arxiv.org/html/2606.13141#bib.bib68), 28 (https://arxiv.org/html/2606.13141#bib.bib48), 53 (https://arxiv.org/html/2606.13141#bib.bib23)] 对给定查询的所有候选片段统一应用单一配置或固定融合——这是一个*查询级*决策。然而,这是次优的,因为最佳配置是片段内容的一个属性,而非查询的属性;一个视觉上显著的时刻最容易通过视觉嵌入来区分,而一个语义丰富的时刻则更容易通过其文本摘要来呈现,粒度也遵循相同的内容依赖性。因此,我们提出 **CARVE**(视频证据的片段感知重排序),如图 1 所示。这是一个新颖的框架,利用多模态交叉编码器信号为每个候选片段根据其查询相关性分配其获胜配置。关键思想是重新利用重排序(重排序是文本 RAG 中广泛使用的工具 [1 (https://arxiv.org/html/2606.13141#bib.bib20), 36 (https://arxiv.org/html/2606.13141#bib.bib22), 64 (https://arxiv.org/html/2606.13141#bib.bib21)],但在 VideoRAG 中尚未充分探索)作为一种*片段级*配置决策机制。

具体来说,CARVE 分两个阶段操作。首先,并行检索运行四个并行检索器,每个对应一种配置,各自将其 top-k 片段贡献给一个共享候选池。其次,一个多模态交叉编码器根据其检索配置(例如,对于文本检索,依据查询-文本相关性;对于视觉检索,依据查询-视觉相关性)对每个候选片段重新评分。对这些配置特定的分数进行排序,得到最终排名。在此排名中,来自不同配置的片段交错出现,每个片段携带其检索配置前进。最终的 top-k 片段随后服务于 VideoRAG 流水线的两个阶段。对于检索,它们是 CARVE 的输出,其中片段级决策在于哪个配置给了每个片段最高分。对于生成,相同的片段被增强到查询中,但每个片段以其检索配置提供给生成器,因此输入生成器的表示因片段而异。重要的是,我们的实验表明,这种片段级选择不仅在检索阶段有益,而且在带入生成阶段时影响更大,导致答案准确率进一步提升。

我们在 V-RAGBench 上的实验揭示了四个关键发现:(1) CARVE 在检索和生成两个阶段均显著优于八个基线方法,这一比较得益于 V-RAGBench 的阶段级可测量性;(2) 模态-粒度消融实验在配置间揭示了两个阶段的性能巨大差距,没有任何单一配置是统一最优的,这激发了片段级而非查询级决策的需求;(3) CARVE 的片段级决策在四个配置之间分布相当均匀,表明每个片段的多样性是真实的,而非坍缩到单一主导选择;以及 (4) 在生成阶段,CARVE 甚至超过了受过训练的查询级路由器(该路由器学习为每个查询选择一个配置),且无需任何额外训练。

## 2 相关工作

文本中的检索增强生成。RAG 通过从外部文本语料库检索与查询相关的证据,并将生成器条件建立在其上来改进生成 [2 (https://arxiv.org/html/2606.13141#bib.bib15), 13 (https://arxiv.org/html/2606.13141#bib.bib18), 29 (https://arxiv.org/html/2606.13141#bib.bib76), 34 (https://arxiv.org/html/2606.13141#bib.bib71)]。进展主要集中在检索上,因为检索质量在很大程度上决定了最终答案的质量。一个方向是改进检索器,从稀疏和密集检索器 [17 (https://arxiv.org/html/2606.13141#bib.bib72), 31 (https://arxiv.org/html/2606.13141#bib.bib75), 72 (https://arxiv.org/html/2606.13141#bib.bib77)] 到结合互补信号的混合稀疏-密集流水线 [22 (https://arxiv.org/html/2606.13141#bib.bib68), 46 (https://arxiv.org/html/2606.13141#bib.bib8), 54 (https://arxiv.org/html/2606.13141#bib.bib67)]。第二个方向通过重写 [43 (https://arxiv.org/html/2606.13141#bib.bib9), 63 (https://arxiv.org/html/2606.13141#bib.bib12), 87 (https://arxiv.org/html/2606.13141#bib.bib13)] 或扩展 [4 (https://arxiv.org/html/2606.13141#bib.bib10), 13 (https://arxiv.org/html/2606.13141#bib.bib18), 83 (https://arxiv.org/html/2606.13141#bib.bib11)] 来重构查询,使检索意图显式化。第三个方向通过重排序(即交叉编码器重新评分候选 [1 (https://arxiv.org/html/2606.13141#bib.bib20), 36 (https://arxiv.org/html/2606.13141#bib.bib22), 64 (https://arxiv.org/html/2606.13141#bib.bib21), 78 (https://arxiv.org/html/2606.13141#bib.bib69)])来解决第一阶段检索器精度有限的问题。这些进步共同显著提高了检索质量,其收益很大程度上转化为下游生成的准确率。然而,这些方法是为文本开发的,并不能直接推广到从视频中检索证据。

长视频中的检索增强生成。长视频理解传统上依赖于通用视频表示,例如稀疏帧采样 [7 (https://arxiv.org/html/2606.13141#bib.bib91), 38 (https://arxiv.org/html/2606.13141#bib.bib43), 75 (https://arxiv.org/html/2606.13141#bib.bib90)]、视觉标记压缩 [12 (https://arxiv.org/html/2606.13141#bib.bib44), 24 (https://arxiv.org/html/2606.13141#bib.bib93), 60 (https://arxiv.org/html/2606.13141#bib.bib92), 82 (https://arxiv.org/html/2606.13141#bib.bib42)] 或全视频文本化 [32 (https://arxiv.org/html/2606.13141#bib.bib96), 35 (https://arxiv.org/html/2606.13141#bib.bib41), 41 (https://arxiv.org/html/2606.13141#bib.bib94), 81 (https://arxiv.org/html/2606.13141#bib.bib51)]。然而,这些方法将整个视频编码为与查询无关的视图,随着长度增加,与查询相关的证据被稀释。这促使了 VideoRAG 的出现,它模仿文本 RAG,在生成之前先检索与查询相关的证据。VideoRAG 的主要挑战在于检索和生成比文本中复杂得多。一个视频片段在时间上是连续的,并且本质上是多模态的 [30 (https://arxiv.org/html/2606.13141#bib.bib52), 45 (https://arxiv.org/html/2606.13141#bib.bib50), 81 (https://arxiv.org/html/2606.13141#bib.bib51)]。

相似文章

长视频生成(阅读时间 4 分钟)

TLDR AI

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。

面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析

arXiv cs.CL

本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。

ScalableRAG:零摄入成本的高质量RAG

arXiv cs.AI

本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。