SAGE:面向生产级RAG系统的SLO感知自适应检索策略

arXiv cs.LG 论文

摘要

SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。

arXiv:2608.08237v1 公告类型:新论文 摘要:生产环境中的检索增强生成(RAG)系统在尾延迟和基础设施成本方面受到严格的服务级别目标(SLO)约束。然而,标准检索流程依赖固定的检索预算,忽略了查询难度,导致简单查询过度检索、困难查询检索不足,迫使运维人员在答案质量与SLO合规性之间做出权衡。本文提出SAGE,一种基于学习的SLO感知自适应检索策略,可为每个查询动态选择段落数量k。SAGE利用从初始检索中提取的轻量级特征(如分数分布、排名差距、词汇信号),并通过离线模仿学习从近似最优延迟-质量权衡的oracle策略进行训练。推理时,SAGE不增加任何LLM调用,且开销极低。在Natural Questions数据集上,在5秒P95延迟SLO约束下,SAGE达到95%的SLO合规性,而最佳静态基线(k=20)仅为30%;同时P95延迟降低36%,检索成本降低51%,仅损失2个百分点的精确匹配(EM)准确率。在Natural Questions上训练的单一策略可泛化至HotpotQA、UnSeenTimeQA以及四个LLM系列(Llama、Qwen、Mistral、Gemma),一致地带来+45至52个百分点的SLO提升,且无质量下降。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:10

# SAGE:面向生产级 RAG 系统的 SLO 感知自适应检索
Source: https://arxiv.org/html/2608.08237
Muhammad Faizan Raza Engineering Pennsylvania State University Great Valley Malvern, PA, USAmfr5933@psu\.edu ORCID: 0009\-0005\-3256\-1130Shuo \(Luna\) Yang Business Division Pennsylvania State University Brandywine Media, PA, USAsfy5287@psu\.edu ORCID: 0000\-0003\-2390\-243XSatish Mahadevan Srinivasan Engineering Pennsylvania State University Great Valley Malvern, PA, USAsus64@psu\.edu ORCID: 0000\-0003\-1377\-3726

###### 摘要

生产环境中的检索增强生成(RAG)系统在严格的尾部延迟和基础设施成本服务等级目标(SLO)约束下运行。然而,标准检索流程依赖忽略查询难度的固定检索预算,对简单查询过度检索,对困难查询检索不足,迫使运维人员在答案质量与 SLO 合规率之间进行取舍。

本文提出 SAGE,一种可学习的*SLO 感知自适应检索策略*,能够为每个查询动态选择段落数量*k*。SAGE 使用从初始检索中提取的轻量级特征(如分数分布、排名间隙、词汇信号),并通过模仿学习离线训练,以近似最优延迟–质量权衡的 oracle 为标签。推理时,它不引入任何 LLM 调用,且开销极小。

在 Natural Questions 上,在 5 秒 P95 延迟 SLO 下,SAGE 实现了 95% 的 SLO 合规率,而最佳静态基线(k=20)仅为 30%;P95 延迟降低 36%,检索成本降低 51%,精确匹配(EM)仅损失 2 个百分点。一个仅在 Natural Questions 上训练的策略可泛化到 HotpotQA、UnSeenTimeQA 以及四个 LLM 系列(Llama、Qwen、Mistral、Gemma),在不损失质量的情况下持续带来 +45–52 个百分点的 SLO 改进。

## I 引言

大型语言模型(LLM)越来越依赖*检索增强生成*(RAG)来减少幻觉并引入最新知识[1 (https://arxiv.org/html/2608.08237#bib.bib1),2 (https://arxiv.org/html/2608.08237#bib.bib2),3 (https://arxiv.org/html/2608.08237#bib.bib3),4 (https://arxiv.org/html/2608.08237#bib.bib4)]。在生产环境中,这些系统在严格的*服务等级目标*(SLO)下运行,不仅约束平均延迟,还约束尾部延迟(如 P95 或 P99)和基础设施成本。在搜索和客户支持等面向用户的应用中,满足此类 SLO 至关重要,因为缓慢或不一致的响应会直接影响用户参与度和运营支出[5 (https://arxiv.org/html/2608.08237#bib.bib5)]。

然而,大多数已部署的 RAG 流程仍依赖全局调优的、*固定*的每查询检索预算*k*。运维人员凭经验选择*k*(例如*k*=10 或 20),以平衡答案质量和系统负载,然后对所有流量统一应用该选择。这种设计与真实世界的查询分布从根本上不一致:简单的事实型问题通常只需少量段落即可回答,而困难的多跳或时间敏感查询则确实受益于更深的检索。单一的全局*k* 不可避免地对简单查询过度投入,对困难查询投入不足。当*k* 设置得足够高以保护答案质量时,由此产生的检索和重排序工作负载会推高尾部延迟和成本,导致广泛的 SLO 违规。

近期关于自适应和主动 RAG 的研究探索了根据模型不确定性或效用信号来调节检索,决定*是否*检索、*何时*停止迭代,或*调用哪种*检索策略[6 (https://arxiv.org/html/2608.08237#bib.bib6),7 (https://arxiv.org/html/2608.08237#bib.bib7),8 (https://arxiv.org/html/2608.08237#bib.bib8),9 (https://arxiv.org/html/2608.08237#bib.bib9)]。虽然这些方法表明自适应检索可以提高事实性和效率,但并未直接针对生产 SLO 进行优化:许多方法需要额外的 LLM 调用,涉及复杂的多步协议,或者优化仅间接反映延迟百分位数和成本的替代目标。自适应 RAG 算法与必须在固定硬件预算下满足合同化 SLO 的运维人员需求之间仍存在差距。

本文通过将检索视为显式延迟和成本约束下的*每查询资源分配决策*来弥合这一差距。我们提出 SAGE,一种*SLO 感知的自适应检索*策略,在生成之前为每个查询预测合适的检索预算*k*。SAGE 完全基于标准 RAG 栈中已有的轻量级特征——BM25 和密集检索器分数、排名统计以及简单词汇信号——来估计查询难度和额外段落的边际价值。该策略使用在目标 P95 SLO 下通过预算扫描获得的标签离线训练。

在 Natural Questions 上,在 5 秒 P95 SLO 下,SAGE 将 SLO 合规率从 30%(最佳静态 k=20)提高到 95%,检索成本大约减半,EM 仅下降 2 个百分点,并且同一策略可泛化到 HotpotQA、UnSeenTimeQA 以及 Llama、Qwen、Mistral 和 Gemma 骨干模型。

我们的贡献有三点:(1) 我们将生产 RAG 部署形式化为显式延迟和成本 SLO 下的决策问题,揭示固定-k 检索为何与异构查询难度不一致;(2) 我们提出 SAGE,一种可学习的 SLO 感知自适应检索策略,仅使用检索侧特征和预算扫描产生的离线标签来选择查询特定的预算,运行时开销可忽略不计;(3) 我们提供了广泛的实证研究,表明 SAGE 显著提高 SLO 合规率和延迟表现,降低检索成本,并在无需重新训练的情况下跨数据集和 LLM 家族泛化,使其成为生产 RAG 系统的实用构建模块。

## II 背景与相关工作

### II-A RAG 与自适应检索

检索增强生成(RAG)通过非参数方式为参数化 LLM 提供大规模文本语料库访问。在原始公式中,Lewis*等人*将密集检索器与序列到序列生成器耦合,将检索到的段落视为潜变量,并在训练和推理过程中对其取边际化[1 (https://arxiv.org/html/2608.08237#bib.bib1)]。REALM 通过掩码语言建模和潜在检索联合优化检索器和编码器,将检索融入预训练[2 (https://arxiv.org/html/2608.08237#bib.bib2)];Dense Passage Retrieval(DPR)确立了用于开放域问答的密集双编码器检索,而 Fusion-in-Decoder 表明随着检索段落增多,准确率可以持续提升[3 (https://arxiv.org/html/2608.08237#bib.bib3),10 (https://arxiv.org/html/2608.08237#bib.bib10),11 (https://arxiv.org/html/2608.08237#bib.bib11)]。与此同时,BM25[12 (https://arxiv.org/html/2608.08237#bib.bib12)] 等稀疏词法方法仍被广泛部署,而 Reciprocal Rank Fusion(RRF)等简单排名融合方案始终优于单个排序器[13 (https://arxiv.org/html/2608.08237#bib.bib13)],这推动了结合密集与稀疏信号的混合栈的采用,我们将其作为 SAGE 的基础。

FLARE、Self-RAG、IRCoT、DRAGIN 和 SeaKR 等主动检索方法根据模型不确定性、思维链状态或内部信号来调节检索,通过交错检索、生成和自我反思来提高事实性[6 (https://arxiv.org/html/2608.08237#bib.bib6),7 (https://arxiv.org/html/2608.08237#bib.bib7),14 (https://arxiv.org/html/2608.08237#bib.bib14),15 (https://arxiv.org/html/2608.08237#bib.bib15),16 (https://arxiv.org/html/2608.08237#bib.bib16)]。其他工作侧重于控制上下文大小:Adaptive-k 根据相似度分数分布选择检索段落数量,而 Stop-RAG 将迭代式 RAG 形式化为有限时域决策过程,并学习何时停止检索[8 (https://arxiv.org/html/2608.08237#bib.bib8),9 (https://arxiv.org/html/2608.08237#bib.bib9)]。这些方法证明了查询相关和状态相关检索的价值,但并未针对生产 SLO 进行显式优化,且通常需要额外的 LLM 调用或复杂的多步协议。SAGE 与它们是互补的:它假定一个强大的混合检索层,仅专注于在显式延迟和成本约束下通过轻量级策略为每个查询分配*多少*检索容量。

### II-B 尾部延迟、SLO 与策略学习

在大规模分布式系统中,尾部延迟而非平均延迟主导用户体验。Dean 和 Barroso 表明,在高度并行的服务中,即使每个组件出现适度变慢,也会导致 P95/P99 延迟的显著恶化,这促使设计显式针对百分位指标而非均值[5 (https://arxiv.org/html/2608.08237#bib.bib5)]。在 LLM 的背景下,vLLM 等系统和近期的 SLO 感知调度器共同优化吞吐量、成本和延迟[17 (https://arxiv.org/html/2608.08237#bib.bib17),18 (https://arxiv.org/html/2608.08237#bib.bib18),19 (https://arxiv.org/html/2608.08237#bib.bib19)]。这些服务层优化在检索的*下游*运行;而我们的工作针对的是*上游*检索预算,后者通常在 RAG 部署中主导端到端延迟。

在方法论上,SAGE 基于模仿学习。行为克隆和 Dataset Aggregation(DAgger)[20 (https://arxiv.org/html/2608.08237#bib.bib20)](见 [21 (https://arxiv.org/html/2608.08237#bib.bib21)] 的综述)形式化了如何在协变量偏移下从专家示范中学习策略。我们采用一种更简单的离线变体:通过对离散预算集合进行穷举扫描获得的标签,为每个查询选择满足目标 P95 SLO 的最小*k*,SAGE 学习从紧凑的检索特征中模仿这些决策。由此产生的策略可以看作一种在延迟和成本约束下分配检索资源的学习式决策规则,能够泛化到事实型、多跳和时间敏感 QA 基准以及多个 LLM 家族。

## III 问题定义与评估指标

### III-A SLO 下的检索决策

对于每个传入查询*q*,检索栈生成候选段落的排序列表。*检索预算*k* 指定选择并拼接多少个排名靠前的段落作为 LLM 的上下文。检索策略

π:q↦k∈K(1)

在生成前为每个查询选择预算。在 SAGE 中,π 实现为轻量级检索侧特征的学习函数;这里我们抽象地将其视为从查询到离散预算的映射。

给定查询 q 和预算 k,系统返回答案 y^(q,k),端到端延迟为 L(q,k)∈R+,从请求到达测量到 LLM 响应完成。较大的预算通常由于额外检索和预处理工作而在期望上增加延迟。

答案质量使用精确匹配(EM)以及相关时的检索导向指标(如 Recall@20)来评估。对于查询分布 D,我们记 Q(π)=Eq∼D\[sEM(y^(q,π(q)),y(q))\] 为策略 π 的期望 EM。

生产系统在延迟服务等级目标(SLO)下运行,该目标以尾部百分位形式给出;令 T 表示目标 P95 延迟。我们将策略的 SLO 合规率定义为 SLOComp(π)=Eq∼D\[I\[L(q,π(q))≤T\]\],即端到端延迟满足 SLO 的查询比例。在我们的实验中 T=5 秒。

我们通过期望预算 Eq\[π(q)\] 来近似检索成本,并报告归一化成本,其中高质量静态基线(如 k=20)设为 100%,这足以捕捉自适应策略的相对节省。

### III-B 带约束的目标与评估指标

设计目标是在延迟和成本约束下最大化答案质量:

max_π Q(π) (2)
s.t. SLOComp(π) ≥ α,
Eq\[π(q)\] ≤ β,

其中 α 是目标 SLO 合规率(例如 0.95),β 限制平均检索工作量。静态固定-k 基线对应于形式为 π(q)≡k⋆ 的策略;它们易于实现,但无法适应异构查询难度,迫使运维人员在整体上牺牲质量或承受 SLO 违规。

精确求解方程(2)是困难的,因为质量和延迟都依赖于复杂的系统行为以及未知的部署分布。因此,SAGE 采用模仿学习方法:对于每个训练查询,我们在有限的预算网格 k∈K 上穷举评估,在 SLO 约束下选择近似最优预算,然后训练一个参数化分类器,使其从可观察的检索特征中模仿这些 oracle 决策。这保留了方程(2)的决策解释,同时将其简化为监督学习。

在实证结果(第 VI 节)和表 I 中,我们使用 SLO 合规率、P95 延迟、EM、平均 k 和相对成本(归一化到静态配置 k=20)来总结每个策略。

## IV 系统架构与策略学习

### IV-A 端到端架构

图 1 展示了嵌入标准生产 RAG 流水线中的 SAGE。

见图注图 1:混合 RAG 流水线中的 SAGE 系统架构。策略使用轻量级检索特征选择查询特定的预算 k,决定将多少个段落传递给 LLM,同时 SLO 监控跟踪端到端延迟和合规率。对于每个传入查询 q,系统执行以下步骤:

1. 混合检索。查询被发送到稀疏(BM25)和密集(BGE-M3)后端,其排序列表通过 Reciprocal Rank Fusion(RRF)融合。
2. 特征提取。从融合列表中,我们计算特征向量 φ(q),捕获分数统计、排名间隙和稀疏–密集一致性指标。
3. 自适应预算选择。SAGE 策略将 φ(q) 映射到预算 k∈K={2,3,5,7,10,15,20,25,30},决定保留多少个段落。
4. 上下文组装与监控。将 top-k 段落和查询传递给 LLM 以产生 y^(q,k),并记录 k 和端到端延迟 L(q,k) 用于 SLO 监控。

SAGE 增加的开销可忽略不计,因为策略是一个轻量级 RandomForest 分类器,其推理时间(<1 ms)远小于检索和生成时间。

### IV-B 策略模型

SAGE 策略实现为一个 RandomForest 分类器(100 棵树,最大深度 10),将 φ(q) 映射到 K 上预算的类别分布。在推理时,我们取

πθ(q)=arg max_{k∈K} pθ(k∣φ(q)),

可选地在平局时偏向较小预算以鼓励保守检索。离散集合 K 涵盖从 k=2 到 30 的预算,平

相似文章

GRASP:面向代理型RAG的粒度感知搜索策略

Hugging Face Daily Papers

介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。