上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL 论文

摘要

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

arXiv:2605.26356v1 公告类型:新 摘要:上下文学习最近被证明与线性自注意力模型中的隐式梯度下降相关,表明上下文可以引发前向传播更新。检索增强生成(RAG)同样依赖上下文,但检索到的文档通常被视为静态证据而非适应信号。本文将RAG作为上下文优化过程进行研究。首先,我们证明一个线性自注意力层可以在统一的线性化RAG目标(涵盖基于投影和基于点积的检索接口)上实现一步梯度下降。这给出了一个精确的框架,其中检索增强预测与上下文优化相重合。我们并不将此结果作为LLM计算的字面模型,而是作为调整查询与检索证据之间交互的指南。接着,我们测试了这种对应关系的边界:在受控的线性扩展下保持稳定,但在非线性架构下变得依赖于特征分布。最后,我们将这一观点转化为适用于冻结RAG LLM的轻量级方法。该方法保持检索器和主干网络固定,并预测一个上下文条件更新到生成器侧的证据使用接口。在七个问答基准、两个检索器和两个冻结LLM主干上,这种仅前向传播的更新改进了共享接口基线,可迁移到未见任务,并以远低于每查询成本的方法逼近测试时梯度适应。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:03

# 面向检索增强生成的上下文优化:梯度下降视角
来源:https://arxiv.org/html/2605.26356
李明辰¹,黄佳谭²¹,张楚旭²,赵亮³,洪宇¹ ¹马萨诸塞大学阿默斯特分校 ²康涅狄格大学 ³埃默里大学

###### 摘要

上下文学习最近被证明可等价于线性自注意力模型中的隐式梯度下降,这表明上下文能引发前向传播更新。检索增强生成(RAG)同样依赖上下文,但检索文档通常被视为静态证据而非适应信号。本文将 RAG 视为一种上下文优化过程。首先,我们证明单层线性自注意力可对统一线性化 RAG 目标(涵盖基于投影和基于点积的检索接口)执行一步梯度下降。这给出了一个精确框架,其中检索增强预测与上下文优化趋于一致。我们并非将此结果视为 LLM 计算的字面模型,而是作为调整查询与检索证据间交互的指南。随后,我们检验该对应关系的边界:在受控线性扩展下保持稳定,但在非线性架构下变得依赖特征分布。最后,我们将此视角转化为面向冻结 RAG LLM 的轻量级方法。该方法保持检索器和主干网络不变,预测一个上下文条件化的更新作用于生成器侧的证据使用接口。在七个 QA 基准、两个检索器以及两个冻结 LLM 主干上,这种仅前向传播的更新改进了共享接口基线,可迁移至留出任务,并以更低的单查询成本逼近测试时梯度适应的性能。

## 1 引言

大型语言模型(LLM)在众多自然语言任务中表现出色,但将其适应静态预训练语料之外的知识仍然困难。检索增强生成(RAG)(Lewiset al.,2020 (https://arxiv.org/html/2605.26356#bib.bib7)) 通过将冻结的 LLM 条件化为从外部语料库检索的文档来解决这一局限。然而,仅靠检索无法解决完整的适应问题。在检索到相关文档后,模型仍需决定如何针对新任务、新领域或新查询分布使用这些文档。

现有的 RAG 系统通常通过三种方式处理此问题。第一种是保持检索器和生成器均固定,仅将检索文档预置到输入中。此策略高效,但将检索文档视为静态证据,模型无法调整证据的使用方式。第二种是微调检索器、生成器或两者兼有。这能提升任务性能,但当任务或领域变化时,需要额外训练且代价高昂。第三种是使用上下文学习(ICL),即在推理时提供少量输入-输出示例。ICL 的优势在于避免完整的模型重训练,但这些示例是仅提供额外演示,还是能引发 RAG 模型对检索证据使用方式的系统性更新,目前尚不清楚。

本文提出一个简单问题:检索证据和少量 RAG 示例能否不仅作为读取的上下文,还能作为调整模型证据使用方式的信号?回答该问题需要连接两个大多被独立研究的视角。一方面,近期理论表明,在线性自注意力下,上下文学习可实现对上下文示例的梯度下降 (von Oswaldet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib6); Akyüreket al.,2023 (https://arxiv.org/html/2605.26356#bib.bib28); Mahankaliet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib4))。这表明上下文可以像前向传播更新一样运作,而不仅仅是附加的输入文本。另一方面,RAG 引入了标准 ICL 理论中缺失的结构:一个查询、检索到的文档、查询-证据交互,以及必须结合它们生成答案的生成器。目前尚不清楚 ICL 的梯度下降视角能否扩展到检索增强预测,以及这种视角能否指导实际 RAG 系统中的实用适应。

本文从上下文优化的角度研究 RAG。我们的目标并非声称现代检索增强 LLM 在推理时真的进行梯度下降。相反,我们利用受控的线性设置来识别这种更新可能作用于何处。在线性 RAG 中,相关的更新作用于查询与检索证据之间的交互。这为 LLM 规模的 RAG 提供了一个简单的设计原则:不改变检索到的文档,而是调整冻结生成器如何使用已检索文档。受此原则指导,我们提出一种面向冻结 RAG LLM 的仅前向传播适应方法。该方法保持外部检索器和 LLM 主干固定,仅通过 LoRA 实现一个轻量级生成器侧证据使用接口的适应。在推理时,给定新的小样本 RAG 演示,预测器在单次前向传播中产生更新,使生成器能够调整其对检索文档的使用方式,而无需在新数据集上重新训练。

我们分三步发展这一思想。**首先**,我们证明单层线性自注意力可在统一线性化 RAG 目标(涵盖基于投影和基于点积的检索接口)上执行一步梯度下降。**其次**,我们测试这种对应关系在精确构造之外的适用范围。一个经过训练的自注意力层在受控线性偏移、文档数量变化和堆叠深度下,与构造的梯度下降预测器高度匹配;而非线性架构和真实世界回归数据则揭示了特征分布上的明确依赖性。**第三**,我们利用优化视角指导 LLM 规模的 RAG 适应。在七个 QA 基准、两个检索器和两个冻结 LLM 主干上,预测更新改进了共享接口基线,可迁移至留出任务,并以更低的单查询成本逼近测试时梯度适应的性能。我们的贡献总结如下:

- •**线性 RAG 的上下文优化视角**。我们将 ICL 作为梯度下降的视角从仅生成器预测扩展到检索增强预测。我们证明单层线性自注意力可在统一线性化 RAG 损失(涵盖线性投影和点积检索接口)上执行一步梯度下降。我们还展示了堆叠 \(K\) 层线性自注意力可为线性 RAG 提供多步上下文优化视图。
- •**超越精确线性设置的边界分析**。我们测试了线性构造何时保持预测性、何时失效。在合成线性回归任务上,经过训练的自注意力层在分布偏移、文档数量变化和堆叠深度下,与构造的梯度下降预测器高度匹配。在非线性架构和四个真实世界回归数据集上,对齐程度以结构化方式退化,并变得对特征分布敏感。
- •**无需测试时反向传播的证据使用适应**。我们利用优化视角指导冻结 RAG LLM 中的适应。我们不改变外部检索器,而是通过 Q/K/V LoRA 模块实现生成器侧证据使用接口的适应。一个小的上下文条件化预测器平摊了由自动梯度定义的 \(K\) 步 SGD 更新到该接口。在七个 QA 基准、两个主干和两个检索器上,预测更新改进了共享接口基线,可迁移至留出领域,并以更低的单查询成本逼近测试时梯度适应的性能。

## 2 相关工作

检索增强生成(RAG)将语言模型条件化为从外部语料库检索的文档 (Lewiset al.,2020 (https://arxiv.org/html/2605.26356#bib.bib7); Guuet al.,2020 (https://arxiv.org/html/2605.26356#bib.bib19); Karpukhinet al.,2020 (https://arxiv.org/html/2605.26356#bib.bib9); Izacard and Grave,2021 (https://arxiv.org/html/2605.26356#bib.bib39); Borgeaudet al.,2022 (https://arxiv.org/html/2605.26356#bib.bib37); Zhanget al.,2025a (https://arxiv.org/html/2605.26356#bib.bib23))。先前工作通过更好的检索、提示、证据融合以及检索器-生成器联合训练提升了 RAG (Ramet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib36); Asaiet al.,2024 (https://arxiv.org/html/2605.26356#bib.bib38); Huanget al.,2026 (https://arxiv.org/html/2605.26356#bib.bib16); Zhanget al.,2025b (https://arxiv.org/html/2605.26356#bib.bib18))。我们的关注点是互补的:不改变检索哪些文档,而是研究冻结生成器如何适应已检索证据的使用。我们将此贡献与三方面工作进行定位。

#### 上下文学习作为梯度下降。

不断增长的理论研究将上下文学习解释为隐式优化。在线性自注意力下,单次 ICL 前向传播可实现一步梯度下降,堆叠层则可实现多步 (von Oswaldet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib6); Akyüreket al.,2023 (https://arxiv.org/html/2605.26356#bib.bib28); Mahankaliet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib4); Daiet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib42))。后续工作将此视角扩展到预条件梯度下降 (Ahnet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib40))、上下文算法选择 (Baiet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib41))、深度的作用 (Vladymyrovet al.,2024 (https://arxiv.org/html/2605.26356#bib.bib17); Gatmiryet al.,2024 (https://arxiv.org/html/2605.26356#bib.bib5)) 以及注意力的核回归解释 (Shenet al.,2026 (https://arxiv.org/html/2605.26356#bib.bib2); Ren and Liu,2024 (https://arxiv.org/html/2605.26356#bib.bib1))。这些分析主要研究仅生成器设置,通常通过线性回归或简化注意力进行。RAG 引入了额外结构,包括检索文档、查询-证据交互以及证据条件化生成。我们将梯度下降视角扩展到线性化 RAG 设置,并利用它识别证据使用适应应作用于何处。

#### 上下文条件化权重预测。

另一条工作路线学习从少量上下文产生模型更新的辅助网络。HyperTuning (Phanget al.,2023 (https://arxiv.org/html/2605.26356#bib.bib29)) 从小样本示例预测软提示或低秩权重。HyperFlow (Kimet al.,2025 (https://arxiv.org/html/2605.26356#bib.bib31)) 学习支持条件化的微调动态。MAC (Tacket al.,2024 (https://arxiv.org/html/2605.26356#bib.bib32)) 将文档映射到内存调谐。MEND (Mitchellet al.,2022 (https://arxiv.org/html/2605.26356#bib.bib33)) 将微调梯度映射到知识编辑。RAG-GD 遵循从上下文预测更新的一般模板,但在目标和适应位点上有所不同。目标不是下游任务损失、元学习目标、内存目标或单一编辑梯度。相反,预测器匹配由 RAG 格式演示诱导的自动梯度定义的 \(K\) 步 SGD 更新。适应参数也限制在生成器侧的证据使用接口,而检索器和主干保持不变。

#### 测试时适应。

标准适应要么在部署前更新模型参数(如微调和 LoRA (Huet al.,2022 (https://arxiv.org/html/2605.26356#bib.bib35))),要么在推理时保持模型不变(如纯 ICL)。测试时训练 (Sunet al.,2020 (https://arxiv.org/html/2605.26356#bib.bib34)) 介于两者之间,为每个测试实例更新参数,但这需要逐实例反向传播,对大型 LLM 而言代价高昂。近期研究比较了 ICL、微调和可训练 RAG 作为系统级适应策略 (Wanget al.,2024a (https://arxiv.org/html/2605.26356#bib.bib21); Mosbachet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib20); Liet al.,2025 (https://arxiv.org/html/2605.26356#bib.bib24))。RAG-GD 以相同目标(推理时适应)为目标,但平摊了更新:一个小预测器在单次前向传播中向生成器的证据使用接口发出 LoRA 更新。因此,它在部署时避免了通过 LLM 的反向传播,同时保持外部检索器和冻结主干不变。

## 3 线性 RAG 设置:自注意力实现梯度下降

本节建立我们 RAG 上下文优化视角的线性基础。我们研究一个受控设置,其中检索增强预测和梯度下降可以精确连接。目标并非字面建模现代 RAG 系统:真实检索器涉及离散文档选择,现代 LLM 深度且非线性。相反,我们分离出一个可微的检索增强预测问题,并证明单层线性自注意力可以实现一步梯度下降产生的预测偏移。证明和显式构造见附录 A (https://arxiv.org/html/2605.26356#A1),检索变体的推导见附录 B (https://arxiv.org/html/2605.26356#A2)。

### 3.1 自注意力

我们从参数化为 \(\theta=\{P_h,V_h,K_h,Q_h\}_{h=1}^H\) 的多头自注意力模块开始。给定 tokens \(\{e_1,\ldots,e_N\}\subset\mathbb{R}^d\),token \(e_j\) 的更新为

\[
e_j \leftarrow e_j + \mathrm{SA}_\theta(j,\{e_i\}_{i=1}^N) = e_j + \sum_h P_h V_h \,\mathrm{softmax}(K_h^\top q_{h,j}),
\]
(1) 其中 \(V_h\), \(K_h\), \(q_{h,j}\) 分别是第 \(h\) 头的值矩阵、键矩阵和查询向量。遵循 (von Oswaldet al.,2023 (https://arxiv.org/html/2605.26356#bib.bib6); Vladymyrovet al.,2024 (https://arxiv.org/html/2605.26356#bib.bib17)),移除 softmax 和偏置项以获得线性自注意力(LSA)更新:

\[
e_j \leftarrow e_j + \mathrm{LSA}_\theta(j,\{e_i\}_{i=1}^N) = e_j + \sum_h P_h V_h K_h^\top q_{h,j}.
\]
(2)

### 3.2 统一线性化 RAG 预测器

我们使用检索增强预测的线性化抽象。该抽象不建模离散的 top-\(k\) 选择,而是捕捉一个可微接口,其中查询特征和检索派生特征共同决定预测。基于投影的检索接口 (Lewiset al.,2020 (https://arxiv.org/html/2605.26356#bib.bib7)) 和基于点积的检索接口 (Karpukhinet al.,2020 (https://arxiv.org/html/2605.26356#bib.bib9)) 都可以写为 \(y = W_1 x_1 + W_2 x_2\),其中 \(x_1\) 表示查询侧特征,\(x_2\) 表示检索派生特征。对于基于投影的接口,我们设 \(x_1 = x_q\), \(x_2 = D\), 以及 \(W_2 \triangleq W_1 W_d\),其中 \(W_d\) 将文档嵌入投影到预测空间。对于基于点积的接口,我们设 \(x_1 = x_2 = x_q\) 和 \(W_2 = W_z \left(\sum_i d_i d_i^\top\right) M^\top\)。

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。

语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。

从自适应列表排序角度重新审视自适应检索增强生成的必要性

arXiv cs.CL

本文提出了 AdaRankLLM,一个自适应检索框架,通过列表排序动态过滤检索到的段落,对自适应 RAG 的必要性提出质疑。研究表明自适应检索对于较弱模型充当噪声过滤器,对于更强模型充当成本效率优化器,在多个数据集和 LLM 上进行了广泛实验。