R$^{2}$Adapter:用于高效混合RAG的路由与重写适配器
摘要
R2Adapter 是一个轻量级的路由与重写适配器,能够动态地在传统RAG和基于图的RAG之间分配查询,将基于图的RAG使用率降低高达59%,同时在多跳问答基准测试中保持准确性。
arXiv:2609.02894v1 Announce Type: new
摘要:检索增强生成(RAG)已成为利用非参数知识增强大语言模型(LLMs)的主流范式。传统RAG能够高效处理简单查询,但在关系型或多跳推理方面表现不佳。基于图的RAG缓解了这一问题,但引入了更高的推理复杂性和延迟。在实践中,用户查询的复杂性差异显著,使得固定的RAG策略不够优化。然而,现有的混合文本-图RAG方法通常依赖于启发式和基于LLM的路由,导致不必要的开销和对底层LLM的强烈依赖。为解决这些挑战,我们提出了R$^{2}$Adapter,一个轻量级的即插即用路由与重写适配器,旨在动态分配查询于传统RAG和基于图的RAG之间。通过仅路由那些真正受益于基于图的推理的查询,R$^{2}$Adapter减少了不必要的图检索开销。此外,对不确定的图路由查询进行重写,以更好地暴露其多跳推理需求,从而在无需额外监督的情况下提高检索质量。在三个多跳问答基准测试上的大量实验表明,R$^{2}$Adapter将基于图的RAG使用率降低高达59%,同时保持相当的问答准确率。该适配器与模型无关,可以无缝集成到各种传统和基于图的RAG管道中,为混合RAG系统提供高效且自适应的解决方案。
查看缓存全文
缓存时间: 2026/09/04 05:51
# R2Adapter:一种用于高效混合RAG的路由与重写适配器
来源:https://arxiv.org/html/2609.02894
郭宇灿1,2,3,苏苗1,2,3,关赛平1,2,3,白龙1,2,3,侯中妮4,李子轩1,2,3,金小隆1,2,3†,郭嘉峰1,2,3,程学旗1,2,3
1 人工智能安全国家重点实验室
2 中国科学院计算技术研究所
3 中国科学院大学
4 美团
\{guoyucan23z, guansaiping, jinxiaolong\}@ict.ac.cn
###### 摘要
检索增强生成(RAG)已成为利用非参数知识增强大语言模型(LLMs)的主流范式。传统RAG能有效处理简单查询,但在关系型或多跳推理任务中表现受限。基于图的RAG虽缓解了此问题,却带来更高的推理复杂度和延迟。实际应用中,用户查询的复杂度差异显著,固定的RAG策略难以达到最优。然而,现有的文本-图混合RAG方法通常依赖启发式规则或基于LLM的路由,导致不必要的开销并强依赖于底层LLM。为此,我们提出R2Adapter——一个轻量级的即插即用路由与重写适配器,旨在动态分配查询至传统或基于图的RAG。通过仅路由真正受益于图推理的查询,R2Adapter减少了不必要的图检索开销。此外,对路由置信度低的图查询进行重写,以更好暴露其多跳推理需求,在无需额外监督的情况下提升检索质量。在三个多跳问答基准上的大量实验表明,R2Adapter在保持回答准确率相当的前提下,将基于图的RAG使用量最高降低了59%。该适配器具有模型无关性,可无缝集成到各类传统与基于图的RAG流程中,为混合RAG系统提供高效自适应的解决方案。
R2Adapter:一种用于高效混合RAG的路由与重写适配器
郭宇灿1,2,3,苏苗1,2,3,关赛平1,2,3††谢谢:通讯作者,白龙1,2,3,侯中妮4,李子轩1,2,3,金小隆1,2,3†,郭嘉峰1,2,3,程学旗1,2,3
1 人工智能安全国家重点实验室
2 中国科学院计算技术研究所
3 中国科学院大学
4 美团
\{guoyucan23z, guansaiping, jinxiaolong\}@ict.ac.cn
## 1 引言
大语言模型(LLMs)在广泛自然语言处理任务中表现出色(Zhao等人,2023 (https://arxiv.org/html/2609.02894#bib.bib14);Team等人,2024 (https://arxiv.org/html/2609.02894#bib.bib13);DeepSeek-AI等人,2025 (https://arxiv.org/html/2609.02894#bib.bib8);Yang等人,2025 (https://arxiv.org/html/2609.02894#bib.bib51))。然而,其对参数化知识的依赖限制了在处理知识密集型查询或训练分布外信息时的事实准确性(Augenstein等人,2024 (https://arxiv.org/html/2609.02894#bib.bib18);Huang等人,2025 (https://arxiv.org/html/2609.02894#bib.bib12))。检索增强生成(RAG)通过将非参数化外部知识融入LLMs来缓解此局限,使模型能基于检索证据生成响应,从而提升准确性和可解释性(Lewis等人,2020 (https://arxiv.org/html/2609.02894#bib.bib19);Gao等人,2023 (https://arxiv.org/html/2609.02894#bib.bib20);Zhao等人,2024 (https://arxiv.org/html/2609.02894#bib.bib64))。
参考图1:传统RAG与基于图的RAG对比。如图1 (https://arxiv.org/html/2609.02894#S1.F1)所示,现有RAG方法主要遵循两种范式:传统RAG和基于图的RAG。传统RAG检索非结构化段落并将其整合到生成过程中,为可通过单跳检索或表层证据匹配解决的查询提供高效方案(Guu等人,2020 (https://arxiv.org/html/2609.02894#bib.bib27);Karpukhin等人,2020 (https://arxiv.org/html/2609.02894#bib.bib40);Wang等人,2023 (https://arxiv.org/html/2609.02894#bib.bib25))。然而,它难以处理需要多跳推理或跨多个实体和事实进行组合证据聚合的查询。相比之下,基于图的RAG将非结构化段落组织为结构化知识图谱(Edge等人,2024 (https://arxiv.org/html/2609.02894#bib.bib28);Gutiérrez等人,2024 (https://arxiv.org/html/2609.02894#bib.bib29), 2025 (https://arxiv.org/html/2609.02894#bib.bib32)),通过显式建模实体和关系来支持复杂多跳推理(Peng等人,2025 (https://arxiv.org/html/2609.02894#bib.bib35);Zhou等人,2025 (https://arxiv.org/html/2609.02894#bib.bib34);Zhang等人,2025 (https://arxiv.org/html/2609.02894#bib.bib66))。尽管具有这些优势,基于图的RAG由于图构建和检索过程而带来较高的推理延迟和计算开销,这限制了其可扩展性和实际部署。
在实际场景中,用户查询的推理需求差异很大,从简单事实检索到复杂多跳关系推理。为适应这种多样性,一个自然的解决方案是在混合框架内结合传统和基于图的RAG,为每个查询动态选择最合适的RAG范式。现有的文本-图混合RAG方法通常依赖启发式规则(如查询中的实体数量,Lee等人,2025b (https://arxiv.org/html/2609.02894#bib.bib54))或基于LLM的查询分类器(Han等人,2025 (https://arxiv.org/html/2609.02894#bib.bib58))。然而,这些方法存在显著局限性。启发式策略通常脆弱且无法泛化到各类查询,而基于LLM的路由则带来巨大的计算成本和推理延迟。在实践中,仅调用LLM进行查询分类的成本可能等同于甚至高于直接应用基于图的RAG。因此,有效的混合RAG系统需要一种既自适应又轻量、快速且成本高效的路由机制。
为应对这些挑战,我们提出R2Adapter——一个即插即用的路由与重写适配器,旨在实现高效混合RAG。R2Adapter的核心目标是利用传统和基于图的RAG的互补优势,同时避免各自的低效性。R2Adapter作为一个可无缝集成到现有RAG系统中的即插即用模块,而非依赖固定检索策略或昂贵的基于LLM的路由。R2Adapter包含两个组件:(1)一个轻量级路由器,通过训练快速评估给定查询是否可能受益于图推理。路由器作为查询复杂度评估的低成本分类器,无需调用LLM即可实现快速策略选择;(2)一个查询重写器,选择性地对路由至基于图的RAG但置信度较低的查询进行优化,以更好揭示其潜在关系结构,确保即使在查询模糊时也能进行有效的图推理。R2Adapter具有模型无关性,无需修改底层的传统或基于图的RAG系统。因此,它提供了一个实用通用的解决方案,在保留基于图RAG推理优势的同时提升其效率,使其非常适合可扩展的实际混合RAG部署。
我们的贡献总结如下:
- • 我们提出R2Adapter,一个用于混合RAG系统的即插即用适配器,它能在传统和基于图的RAG之间动态路由查询,并选择性重写查询以进一步增强基于图的RAG。
- • 为实现快速低成本路由,我们构建了一个标注查询是否可由传统RAG成功处理或需要图推理的训练语料库,并训练了一个轻量级路由器来预测检索策略,无需依赖LLM。
- • 在多跳问答基准上的大量实验表明,R2Adapter在保持代表性基于图RAG系统回答准确率的同时,显著减少了基于图RAG的使用,证明了其有效性和通用性。
参考图2:R2Adapter与传统和基于图RAG系统集成的概览。
## 2 相关工作
### 基于图的RAG。
RAG通过外部知识增强LLMs,早期方法主要依赖非结构化段落检索(Lewis等人,2020 (https://arxiv.org/html/2609.02894#bib.bib19);Karpukhin等人,2020 (https://arxiv.org/html/2609.02894#bib.bib40);Jiang等人,2023 (https://arxiv.org/html/2609.02894#bib.bib67);Asai等人,2024 (https://arxiv.org/html/2609.02894#bib.bib23)),常难以处理关系型和多跳查询。为解决此局限,近期工作利用结构化图增强RAG,以实现对实体和关系的显式推理(Peng等人,2025 (https://arxiv.org/html/2609.02894#bib.bib35);Han等人,2024 (https://arxiv.org/html/2609.02894#bib.bib65))。RAPTOR(Sarthi等人,2024 (https://arxiv.org/html/2609.02894#bib.bib49))将文档组织成层次摘要树用于检索。转向具有实体和关系的显式图结构,GraphRAG(Edge等人,2024 (https://arxiv.org/html/2609.02894#bib.bib28))构建带有社区摘要的知识图谱并通过图摘要进行检索,而LightRAG(Guo等人,2025 (https://arxiv.org/html/2609.02894#bib.bib48))通过简化索引和快速双层检索提升效率。HippoRAG(Gutiérrez等人,2024 (https://arxiv.org/html/2609.02894#bib.bib29))构建受记忆启发的知识图谱并通过个性化PageRank检索,HippoRAG 2(Gutiérrez等人,2025 (https://arxiv.org/html/2609.02894#bib.bib32))通过更深入的段落整合扩展了HippoRAG。尽管具有推理优势,基于图的RAG方法计算成本更高,且对于许多可由传统RAG有效解决的简单查询而言是不必要的。
### 混合RAG。
混合RAG的动机源于用户查询表现出不同复杂度,且单一检索策略无法在所有查询上均达到最优的观察。早期混合框架主要关注文本检索(Mallen等人,2023 (https://arxiv.org/html/2609.02894#bib.bib60);Jeong等人,2024 (https://arxiv.org/html/2609.02894#bib.bib59))。例如,Adaptive-RAG(Jeong等人,2024 (https://arxiv.org/html/2609.02894#bib.bib59))使用分类器在单步文本检索、多步文本检索或非检索路径间动态路由查询。随着基于图RAG的兴起,近期工作探索了结合非结构化文本检索和结构化图检索的混合框架。HyPA-RAG(Kalra等人,2025 (https://arxiv.org/html/2609.02894#bib.bib61))直接整合文本和图证据,而HybGRAG(Lee等人,2025b (https://arxiv.org/html/2609.02894#bib.bib54))根据LLM是否能从查询中提取相关实体来选择性激活文本或图检索。类似地,Han等人(2025 (https://arxiv.org/html/2609.02894#bib.bib58))采用基于LLM的分类器,根据查询是基于事实还是推理型来路由至文本或图检索。然而,现有的文本-图混合RAG方法要么总是调用图检索,要么依赖基于LLM的分类器进行路由,这带来了巨大的计算开销并紧密耦合于底层LLM的能力。
## 3 R2Adapter
本节我们将介绍R2Adapter,一个由路由器和重写器组成的即插即用适配器。在3.1节 (https://arxiv.org/html/2609.02894#S3.SS1),我们提供框架概述。然后,我们在3.2节 (https://arxiv.org/html/2609.02894#S3.SS2)和3.3节 (https://arxiv.org/html/2609.02894#S3.SS3)分别介绍路由器和重写器。
输入:用户查询 \(q\),路由器 \(\mathcal{R}\),重写器 \(\mathcal{W}\),传统RAG系统 \(\texttt{RAG}_{p}\),基于图的RAG系统 \(\texttt{RAG}_{g}\)。
输出:生成的回答 \(a\)。
1 \(r \leftarrow \mathcal{R}(q)\); // 路由
2 if \(r = \textsc{Passage}\) then /\* 基于段落的传统RAG \*/
3 \(a \leftarrow \texttt{RAG}_{p}(q)\);
4 else /\* 基于图的RAG \*/
5 if \(\mathcal{R}\) 对 \(q\) 不确定 then
6 \(q' \leftarrow \mathcal{W}(q)\); // 重写
7 else
8 \(q' \leftarrow q\);
9 end if
10 \(a \leftarrow \texttt{RAG}_{g}(q')\);
11 end if
12 return \(a\);
算法1 R2Adapter
### 3.1 整体框架
图2 (https://arxiv.org/html/2609.02894#S1.F2)展示了R2Adapter的整体架构。给定输入用户查询 \(q\),R2Adapter作为一个轻量级的检索前适配器,决定下游RAG系统应如何处理该查询。该适配器包含两个顺序组件:一个预测查询对传统和基于图RAG偏好度的路由器,以及一个对路由至基于图RAG但存在不确定性的查询进行选择性优化的重写器。具体而言,路由器以原始查询作为输入,产生路由决策,表明该查询可能受益于传统还是基于图的检索。预测为可由传统RAG解决的查询直接转发至基于段落的RAG流程,避免不必要的图遍历。对于路由至基于图RAG的查询,R2Adapter进一步考虑路由决策的置信度。当路由器置信度较低时,查询被传递给查询重写器,该重写器对原始输入进行重新表述,以更好揭示其潜在关系结构。重写后的查询随后用于基于图的检索和后续回答生成。R2Adapter的算法描述如算法1 (https://arxiv.org/html/2609.02894#alg1)所示。
参考图3:用于路由器训练语料库的自动标注流程。
### 3.2 路由器
我们提出一个轻量级路由器,预测每个查询对传统和基于图RAG的偏好。以下部分描述其训练语料库的构建,以及训练和路由过程的细节。
#### 3.2.1 训练语料库构建
如图3 (https://arxiv.org/html/2609.02894#S3.F3)所示,我们设计了一个自动标注流程来构建路由器的训练语料库。该语料库基于HotpotQA(Yang等人,2018 (https://arxiv.org/html/2609.02894#bib.bib45))的“Hard”子集构建。对于每个查询,我们评估两种RAG范式:(1)采用基于段落检索(Lewis等人,2020 (https://arxiv.org/html/2609.02894#bib.bib19))并使用NV-Embed-v2(Lee等人,2025a (https://arxiv.org/html/2609.02894#bib.bib55))作为检索器的传统RAG系统;以及(2)使用HippoRAG 2(Gutiérrez等人,2025 (https://arxiv.org/html/2609.02894#bib.bib32))的基于图RAG系统。每个系统检索一个文档排名列表,我们计算相关文档的平均排名作为检索质量的度量。基于此标准,我们分配一个双维度适用性标签 \(\mathbf{y}=[y_p, y_g]\),其中 \(y_p, y_g \in \{0,1\}\) 分别表示传统RAG或基于图RAG是否适用于该查询。平均文档排名较低的检索范式被标记为适用。当两种范式实现相同的平均排名时,两者均被视为适用,产生标签 \([1,1]\)。相似文章
SchemaRouter:面向高效异构智能体RAG的字段感知工具路由
SchemaRouter为异构智能体RAG系统引入了一个轻量级的模式图路由层,通过仅选择必要的工具和字段来最小化检索开销,同时保持答案准确性和出处归因。
我们开源了一个无图的多跳RAG框架——在基准测试上匹配Graph-RAG的准确率,无需重建成本(Apache-2.0)
MOTHRAG是一个无图的多跳RAG框架,在基准测试上匹配GraphRAG和HippoRAG等基于图的系统的准确率,同时通过使用密集索引和查询时编排避免昂贵的图重建。
RAG-Stack:协同优化RAG服务性能与质量
本文介绍了RAG-Stack,一个通过高效探索算法-系统联合配置空间来协同优化RAG服务性能与答案质量的框架。它找到的Pareto前沿比现有配置搜索方法覆盖了显著更广的质量-性能空间。
ScalableRAG:零摄入成本的高质量RAG
本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。
Routed Graph Handoff: 多智能体LLM委托中的自适应格式选择
Routed Graph Handoff 提出一个轻量级路由器,在多智能体LLM系统的智能体间通信中自适应地选择结构化图或自然语言,从而在降低标记成本的同时提高基准性能。