从自适应列表排序角度重新审视自适应检索增强生成的必要性
摘要
本文提出了 AdaRankLLM,一个自适应检索框架,通过列表排序动态过滤检索到的段落,对自适应 RAG 的必要性提出质疑。研究表明自适应检索对于较弱模型充当噪声过滤器,对于更强模型充当成本效率优化器,在多个数据集和 LLM 上进行了广泛实验。
arXiv:2604.15621v1 公告类型:交叉
摘要:自适应检索增强生成(Adaptive Retrieval-Augmented Generation)旨在通过动态判断是否需要检索补充段落来缓解无关噪声的干扰。然而,随着大语言模型对噪声鲁棒性的提升,自适应检索的必要性值得重新评估。本文重新思考这一必要性,并提出 AdaRankLLM,一个新颖的自适应检索框架。为了有效验证自适应列表重排的必要性,我们首先开发了一个采用零样本提示和段落 dropout 机制的自适应排序器,并将其生成结果与静态固定深度检索策略进行对比。此外,为了使较小的开源 LLM 具备精确的列表排序和自适应过滤能力,我们引入了一个由数据采样和增强技术增强的两阶段渐进式蒸馏范式。在三个数据集和八个 LLM 上的广泛实验表明,AdaRankLLM 在大多数场景中都能持续实现最优性能,同时显著降低上下文开销。关键是,我们的分析揭示了自适应检索角色的转变:它对较弱模型作为关键噪声过滤器以克服其局限性,而对更强的推理模型作为成本高效的效率优化器。
查看缓存全文
缓存时间: 2026/04/20 08:30
# 重新思考自适应检索增强生成的必要性:通过自适应列表式排序的视角
来源: https://arxiv.org/html/2604.15621
Jun Feng1,Jiahui Tang2,Zhicheng He2,Hang Lv2,Hongchao Gu2, Hao Wang2,Xuezhi Yang1,Shuai Fang1 1合肥工业大学,2中国科学技术大学
###### 摘要
自适应检索增强生成(Adaptive Retrieval-Augmented Generation)旨在通过动态确定检索补充段落的必要性来减轻无关噪声的干扰。然而,随着大语言模型对噪声鲁棒性的提高,自适应检索的必要性值得重新评估。本文重新审视这一必要性,并提出 AdaRankLLM,一个新颖的自适应检索框架。为了有效验证自适应列表式重排的必要性,我们首先开发了一个采用零样本提示和段落丢弃机制的自适应排序器,并将其生成结果与静态固定深度检索策略进行比较。此外,为了使较小的开源大语言模型具备精确的列表式排序和自适应过滤能力,我们引入了一个由数据采样和增强技术增强的两阶段渐进蒸馏范式。在三个数据集和八个大语言模型上的大量实验表明,AdaRankLLM 在大多数场景中持续达到最优性能,同时显著降低了上下文开销。更关键的是,我们的分析揭示了自适应检索的角色转变:对于较弱的模型,它充当关键噪声过滤器以克服其限制;对于更强的推理模型,它作为经济高效的性能优化器。我们的代码可在 USTC-StarTeam/adaptive-listwise-ranking-rag (https://github.com/USTC-StarTeam/adaptive-listwise-ranking-rag) 获得。
## I 引言
参见图 1:AdaRankLLM 的框架。左侧展示两个示例来演示自适应排序器的工作方式。右侧概述了数据收集和模型训练过程,用于蒸馏一个高效的排序器。
检索增强生成(RAG)是一个关键范式,通过整合外部知识来增强大语言模型[18,27,25,12]。通过在检索到的段落基础上进行生成,RAG 能有效缓解幻觉[53]并便于持续知识更新[16]。然而,其有效性得不到保证;最近的研究[34,37]表明,无差别检索往往会引入无关噪声。虽然标准 RAG 系统通常检索固定数量的段落,但这种静态策略难以平衡信息覆盖与噪声干扰的关系:检索过少的段落会面临遗漏相关信息的风险,而检索过多则会引入降低模型性能的噪声。
为了解决这一困境,自适应检索[2]已成为一个主流解决方案。通过动态确定何时以及检索什么内容,它旨在保护模型免受无关上下文的影响,历来取得了显著的收益。然而,大语言模型的格局正在迅速演变。最近的工作[41]表明,现代基础模型对检索噪声的鲁棒性日益增强,能够通过强大的内部注意力机制忽略无关信息。这一演变引发了一个根本性问题:对于这些日益强大的 RAG 系统,自适应检索是否仍然必要?
为了调查这一问题,我们提出 AdaRankLLM,一个将自适应排序与指令蒸馏相融合的框架。我们的方法基于一个严格的检索必要性判断机制:一个配备段落丢弃机制的自适应排序器。该模块采用零样本列表式提示来评估段落相关性,明确丢弃无关候选或在没有相关段落时输出终止令牌。为了确保这一验证能力不局限于成本高昂的大型模型,我们进一步集成了一个两阶段渐进蒸馏范式。通过利用基于聚类的采样和数据增强,我们将列表式排序和自适应过滤技能从教师模型转移到较小的开源骨干网络,使我们能够在不同模型能力和部署约束下验证自适应检索的实用性。
我们在三个基准测试上对八个大语言模型进行了广泛实验,涵盖从较小的开源骨干到先进推理增强架构的模型。结果表明,AdaRankLLM 在大多数场景中持续达到最优性能,同时显著降低上下文开销。更关键的是,我们的分析揭示了一个明确的区别:对于较弱的模型,自适应检索充当**关键噪声过滤器**以确保生成质量;对于先进模型,虽然性能提升有限,但它通过显著降低推理成本而充当**重要效率优化器**。
我们的主要贡献可总结如下:
- •我们检视了现代大语言模型自适应 RAG 的必要性,超越传统观点来评估其在不同能力模型中的独特实用性。
- •我们提出 AdaRankLLM,一个采用段落丢弃机制的自适应排序器和指令蒸馏框架来赋予较小模型精确的噪声过滤能力。
- •在八个大语言模型上的广泛实验揭示了一个功能区别:自适应检索对较弱模型充当关键噪声过滤器以确保质量,对先进模型充当重要效率优化器。
## II 相关工作
**段落排序**。传统排序方法主要依赖逐点式[35]或成对式[33]评分器,但往往忽视段落之间的关联,促使向基于大语言模型的列表式方法[28,22,24]转变。虽然早期蒸馏尝试如 RankVicuna[31]和 RankZephyr[32]成功将列表式能力转移到 7B 模型,但它们受到仅解码器架构二次复杂度的限制。最近的进展解决了这些限制:LiT5[40]重新引入了 Fusion-in-Decoder (FiD) 架构以实现线性缩放,而 Rank-R1[55]通过群体相对策略优化(GRPO)整合了思维链(CoT)推理以明确证明相关性。进一步降低延迟,非生成式方法直接利用段落嵌入[23]或注意力模式[4]。我们的方法与这一轨迹一致,通过自适应能力增强零样本列表式蒸馏。
**自适应检索**。最近的研究[34,37,13,20]表明 RAG 性能容易受到无关信息的影响。早期方法如 FLARE[15]和 Self-RAG[2]依赖令牌概率或学习的反射令牌,往往导致高推理或微调成本。最近的研究转向内部状态监控:CTRLA[21]和 TARG[46]利用"诚实"方向和前缀 logits 来控制检索,无需辅助分类器。对于复杂推理,FAIR-RAG[3]、REPAIR[17]和 RAPID[8]引入结构化、计划感知的循环来基于中间步骤而非初始查询触发"中途"检索。此外,成本感知强化学习策略[10]动态调整检索深度。然而,它们的复杂性阻碍了零样本泛化和部署效率,推动了我们轻量级框架的开发。
## III 方法
### III-A 问题定义
给定用户查询 x 和从大规模语料库 C 检索得到的候选段落集合 P={p₁,p₂,...,pₘ}(其中 m 为候选数量),自适应检索增强生成的目标是识别最优有序子集 A⊆P。此过程旨在最大化所选段落与 x 的相关性,同时过滤噪声。关键地,结果集大小 |A| 是动态的,取决于查询复杂性。集合 A 可以从空集 ∅(当检索不必要时)到完整候选集。最后,所选段落 A 和查询 x 作为输入提供给生成器以产生响应 y=LLM(A;x)。
### III-B 带段落丢弃的自适应排序器
为了将粗糙候选集 P 转化为精细的自适应集 A,我们提出了**自适应排序器**,推进了列表式重排的范式。与仅对固定候选列表进行排列的常规重排器不同,我们的模块集成了段落丢弃机制来动态过滤无关噪声,同时捕捉段落间的相互关系。
具体地,我们设计了一个零样本对话提示,指导大语言模型同时执行相关性评估和选择。候选集 P 中的每个段落都被赋予唯一标识符(例如"[1]")。不是强制完整排列,而是指导大语言模型仅选择有助于回答查询的段落并按相关性对其排序。关键地,段落丢弃机制启用了拒绝选项:如果模型确定某个段落(甚至整个集合)无关,它会明确将其排除在输出列表 A 之外。在极端情况下,如果未找到相关信息,模型会输出特殊终止令牌"[0]"。具体的提示结构在图 2 中展示。在此自适应排序过程之后,我们解析生成的标识符列表来构造最终上下文集 A={pᵣ₁,...,pᵣₙ},其中子集大小 n 由模型的相关性判断动态确定。
### III-C 指令蒸馏
虽然 GPT-4 等专有大语言模型展现了卓越的零样本自适应排序能力,但其成本高昂阻碍了直接大规模部署。因此,我们旨在使用渐进两阶段范式将这些能力蒸馏到紧凑的开源模型中,以平衡蒸馏成本和数据质量。
**第一阶段:结构对齐**。我们利用 GPT-3.5 从 MSMARCO V1 生成大规模数据集。这一经济高效的初始化教导学生模型基本的列表式输出模式和基础相关性排序,在之前建立了牢固的结构基础。
**第二阶段:自适应细化**。为了注入精确的段落丢弃能力,我们依赖 GPT-4 的卓越推理。为了最小化成本,我们对查询嵌入应用 K-means 聚类来采样代表性子集。GPT-4 对这些选定的查询进行标注,以微调学生的决策边界来区分有效证据和噪声。
最后,通过将自适应排序器与段落丢弃和指令蒸馏相整合,我们获得了一个 AdaRankLLM,它能够选择必要的段落,同时保持效率和可访问性。
## IV 实验设置
表 I:实验中使用的三个数据集。
### IV-A 数据集
我们在三个多样化的公开数据集上验证方法:ASQA[38]、QAMPARI[1] 和 ELI5[6]。与标准协议[7]一致,我们对 ASQA 采用精确匹配(EM),对 QAMPARI 采用 F1 分数,对 ELI5 采用声明召回率。为了评估综合能力,我们还报告了一个 Overall* 指标,计算为这些分数的平均值。详细的数据集信息在表 I 中提供。
### IV-B 基线
我们将 AdaRankLLM 与分为三组的多个基线进行比较:(1)**Vanilla-k**:使用检索段落的模型,其中 k 表示提供给大语言模型的段落数。(2)**Rerank-k**:采用重排段落的模型,k 表示提供给大语言模型的重排段落数。使用 RankGPT4[39] 作为重排器。(3)**AdaRank-GPT4**:利用我们提出的自适应排序提示(第 III-B 节)与 GPT-4 的模型,用作验证自适应 RAG 必要性的基线。此外,我们报告每个骨干的 **Oracle** 值,代表在选择最优重排段落数(k∈[0,10])时的理论最优性能。
### IV-C 模型
为了全面调查自适应检索必要性在不同模型能力中的作用,我们在七个骨干模型上进行实验:Alpaca-7B、Mistral-7B、GPT-3.5、GPT-4o、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Qwen3-8B(分别在 enable_thinking=False 和 True 下评估)。这些模型跨越开源和专有架构的多样光谱。
参见图 2:AdaRankLLM 中用于基于相关性的段落选择和重排的提示模板的插图。
### IV-D 实现细节
#### 训练细节
我们在 Mistral-7B-v0.1[14] 上使用 MSMARCO V1[30] 数据集的子集对 AdaRankLLM 进行微调。数据包括 100K 个查询,每个查询具有前 20 个 BM25 检索的段落,截断到 10 以与典型 RAG 设置对齐。我们对第一阶段使用所有 100K 个查询,对第二阶段使用 ADA2 嵌入[29]和 k-means 聚类(k=20)采样 5K 个查询。每个阶段训练三个时期,学习率为 5e-6(余弦衰减),批大小为 64。
#### 评估细节
对于所有三个数据集,我们利用来自 ALCE[7] 的预处理第一阶段检索结果,并对所有骨干模型应用官方聊天模板。关于指标实现,我们严格遵循 ALCE 代码库:对 ASQA 采用 STR-EM,对 ELI5 采用基于 T5-11B 的 TRUE 模型[11]来验证声明蕴含关系。
表 II:Alpaca-7B、Mistral-Instruct、GPT-3.5、GPT-4o、Llama、Qwen2.5 的结果相似文章
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。
RIMS:通过平滑多对聚合进行偏好优化以用于小规模语言模型检索增强生成
本文提出了RIMS,一种面向小规模语言模型在检索增强生成中的三阶段偏好优化框架,利用合成思维链数据和可微软聚合机制来提高对噪声证据的鲁棒性。实验表明,在多跳问答基准上,该方法相较于基线持续取得改进。
检索增强生成解决了大多数团队实际上并不存在的问题
文章论点是检索增强生成(RAG)在AI系统中经常被误用,真正的问题在于上下文策展而非检索。它表明RAG仅对大规模、频繁变化的语料库真正有益。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
DebiasRAG:一种通过检索增强生成实现大语言模型公平生成的无调优路径
DebiasRAG 提出了一种无调优、查询特定的去偏框架,利用检索增强生成来减少大语言模型中的社会偏见,同时不降低其原有能力。