RIMS:通过平滑多对聚合进行偏好优化以用于小规模语言模型检索增强生成
摘要
本文提出了RIMS,一种面向小规模语言模型在检索增强生成中的三阶段偏好优化框架,利用合成思维链数据和可微软聚合机制来提高对噪声证据的鲁棒性。实验表明,在多跳问答基准上,该方法相较于基线持续取得改进。
查看缓存全文
缓存时间: 2026/07/21 06:42
# Rims:面向小型LLM检索增强生成的基于平滑多对聚合的偏好优化 来源:https://arxiv.org/html/2607.16431 Pei Tian1, Zihan Dong2, Tianci Liu3, Linjun Zhang2, Haoyu Wang4 1哥伦比亚大学计算机科学系 2罗格斯大学统计系 3普渡大学电气与计算机工程学院 4纽约州立大学奥尔巴尼分校计算机科学系 [email protected]; [email protected] ###### 摘要 小型语言模型(SLMs)在资源受限环境下进行检索增强生成(RAG)时具有吸引力,但其有限的容量使其对噪声或虚假的检索证据高度敏感。现有的基于偏好的方法(如RoseRAG)通过硬argmin/argmax仅选择最难的单一偏好对,丢弃了其余信号;其他方法则将多个对视为独立的二元比较,导致数据利用率低。我们提出Rims,一个三阶段偏好优化框架,包括:(1)使用目标SLM本身通过拒绝采样生成合成链式思维偏好数据,不依赖专有模型;(2)一种可微分的软聚合机制,用平滑算子替换硬选择,保留来自所有偏好对的梯度信号,同时保持边际感知选择的判别结构;(3)将平滑目标应用于多种对齐算法的偏好优化。我们从理论上证明,平滑近似具有可控的误差界,并且平滑聚合相比硬选择能够实现与Oracle目标更紧密的梯度对齐。在四个多跳问答基准上的实验表明,我们的方法在多个SLM骨干网络上优于现有最先进基线,在噪声检索条件下在精确匹配和F1得分上持续取得提升。我们的实现可在https://github.com/tptrix29/RIMS获取。 ## 1 引言 大型语言模型(LLMs)(Achiam et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib36); Comanici et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib37); Yang et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib38); Grattafiori et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib39))通过在预训练期间学习大量语言和世界知识,在许多自然语言任务上取得了强劲性能。然而,它们高昂的计算和内存需求限制了在资源受限环境(如设备端系统或低基础设施环境)中的实际部署(Zhou et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib40); Xu et al., 2024b (https://arxiv.org/html/2607.16431#bib.bib41))。为解决此问题,参数量大幅减少的小型语言模型(SLMs)因其推理成本低、可移植性和易于部署而成为一种有前景的替代方案(Belcak et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib42); Lu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib43); Vernikos et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib44))。 尽管计算效率高,但SLM本质上无法像大型模型那样内化大量知识,其有限的容量通常导致在知识密集型任务上语义理解和泛化能力较弱(Ovadia et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib45))。检索增强生成(RAG)(Lewis et al., 2021 (https://arxiv.org/html/2607.16431#bib.bib46); Gao et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib63); Jiang et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib62))提供了一种自然的补救措施:将模型与外部知识源相结合,使其能够回答需要超出预训练参数的最新或领域特定信息的查询。将RAG应用于SLM可以通过将事实基础卸载到外部检索组件来显著提升性能(Wang et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib49); Asai et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib50); Xu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib51))。然而,即使使用RAG,对于小型模型来说,稳健地整合检索内容仍然具有挑战性:其有限的容量使得难以从干扰项中区分相关证据,难以推理多个检索段落,以及在生成过程中抑制噪声或矛盾上下文(Yoran et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib47); Liu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib12))。这凸显了需要超越检索质量、直接改进SLM学习利用不完美证据的机制。 现有提高SLM在RAG下鲁棒性的方法可分为三大类。基于提示的方法(Wang et al., 2025a (https://arxiv.org/html/2607.16431#bib.bib33); 2024 (https://arxiv.org/html/2607.16431#bib.bib21))指导模型忽略无关的检索内容,但其有效性依赖于模型自身识别噪声的能力,这一假设对于SLM往往不成立。监督微调(SFT)(Yoran et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib47); Wei et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib22))使模型与精心策划的指令-响应对对齐,但对检索上下文中的噪声高度敏感,且容易在能力有限的SLM上对不完美证据过拟合(Chu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib48))。第三类工作是偏好优化(Rafailov et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib9); Xu et al., 2024a (https://arxiv.org/html/2607.16431#bib.bib10); Hong et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib11); Ethayarajh et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib60); Meng et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib61)),它通过学习相对质量信号而非固定目标,提供了一种更灵活的替代方案(Liu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib12); Chen et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib35))。然而,在噪声RAG条件下有效构建和利用偏好数据仍然是一个开放挑战。 在RAG设置中,偏好优化特别有吸引力,因为它从相对质量比较中学习,而不是将任何单个响应视为真实答案,因此天然比监督微调对噪声检索上下文更具鲁棒性。此外,通过链式思维提示的拒绝采样等技术为每个查询采样多个响应,可以轻松获得多个偏好和非偏好候选,从而为每个训练实例提供丰富的多对偏好数据。尽管存在如此丰富的监督信号,现有方法仅利用了其中一小部分。具体而言,当单个查询有多个可用偏好对时,RoseRAG(Liu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib12))仅根据初始模型似然选择单一最难的偏好对,完全丢弃其余信号,并且在整个训练过程中固定选择,即使策略演变也是如此。NCA(Chen et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib35))聚合了多个负响应,但未联合建模正候选,导致对可用偏好结构的利用不完整。在这两种情况下,丰富的多对偏好信息被严重未充分利用,这激发了对一种能够充分利用优化过程中所有可用偏好对的原则性机制的需求。 为了解决这些局限性,我们提出了一种面向小型LLM检索增强生成的基于平滑多对聚合的偏好优化框架(Rims)。给定通过链式思维(CoT)(Wei et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib18))拒绝采样为每个查询生成的多个偏好对,Rims引入了一种可微分的软聚合机制,用平滑的、受温度控制的算子替换硬对选择。该算子将所有正负候选整合为一个统一的伪对,保留了来自每个候选的梯度信号,同时保持了边际感知选择的判别结构。平滑目标是通用的,可应用于多种偏好优化算法(Rafailov et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib9); Xu et al., 2024a (https://arxiv.org/html/2607.16431#bib.bib10); Hong et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib11))。通过在相同问题的多个样本上自适应地聚合梯度信号,Rims提升了模型从噪声检索上下文中识别和整合相关证据的能力。我们进一步提供了理论保证:平滑目标具有可控的近似误差,并且其梯度更新在理论上比硬选择的梯度更接近Oracle。 我们的贡献可总结如下: - •我们提出Rims,一个面向基于SLM的RAG的偏好优化框架,该框架使用目标SLM本身通过拒绝采样生成多对CoT偏好数据,而不依赖专有模型。 - •我们引入了一种可微分的软聚合机制,将多个偏好对整合为一个统一的、算法无关的目标,替换硬对选择,同时保留边际感知优化的判别结构。 - •我们提供了理论分析,表明基于LSE的平滑具有可控的近似误差界,并且在噪声奖励估计下,平滑聚合相比硬选择能够实现与Oracle目标更紧密的梯度对齐。 - •在两个SLM骨干网络上的四个多跳问答基准实验表明,Rims持续优于现有的最先进基线。 ## 2 相关工作 检索增强生成(RAG)已成为通过将生成过程建立在外部语料库上来缓解语言模型知识局限性的有效范式。虽然早期的RAG框架(Izacard et al., 2022 (https://arxiv.org/html/2607.16431#bib.bib53))主要针对大型语言模型(LLMs)设计,但最近的研究(Wang et al., 2023 (https://arxiv.org/html/2607.16431#bib.bib49); Li et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib54); Yu et al., 2024b (https://arxiv.org/html/2607.16431#bib.bib55))探索了将RAG适配到SLM以提高资源受限环境下的效率和可部署性。然而,由于表征能力有限,SLM特别容易受到噪声或无关检索上下文的影响,常常导致推理退化并产生幻觉输出(Yoran et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib47))。先前的工作如Blendfilter(Wang et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib21))和RobustRAG(Xiang et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib2))试图通过基于提示的过滤来解决这个问题,但这些方法高度依赖于模型识别不相关上下文的内在推理能力,而这对SLM来说通常不足。与此同时,一些方法(Wei et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib22); Yu et al., 2024a (https://arxiv.org/html/2607.16431#bib.bib57))研究了通过在RAG检索内容合成数据上进行监督微调来训练LLM处理噪声上下文,但它们在噪声检索条件下鲁棒性显著降低。 基于偏好的优化方法(Zhang et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib58); Dong et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib59))通过直接从相对偏好中学习,作为监督微调的替代方案已受到关注,在噪声RAG设置下提供了改进的鲁棒性。然而,大多数方法依赖单对比较,未充分利用多个候选响应中可用的更丰富监督,这激发了近期关于多对偏好优化的研究工作。RoseRAG(Liu et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib12))通过基于模型似然选择最难的正负对,引入了边际感知偏好优化,提高了对噪声检索的鲁棒性,但丢弃了其余偏好信号。噪声对比对齐(NCA)(Chen et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib35))则在对比框架内聚合多个负响应,增强了鲁棒性但忽略了正候选之间的结构关系。其他近期工作(Xie et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib3); Gupta et al., 2025 (https://arxiv.org/html/2607.16431#bib.bib4); Wang et al., 2025b (https://arxiv.org/html/2607.16431#bib.bib5); Le et al., 2024 (https://arxiv.org/html/2607.16431#bib.bib6))探索了各种利用每个查询多个响应的策略,包括选择性子集采样、多视角偏好信号和多个参考分布,但它们通常依赖于硬选择或启发式聚合,限制了结构化多对偏好数据的充分利用。 相比之下,我们的框架通过可微分的平滑机制将多个偏好对联合纳入一个单一的优化目标,在保持计算效率的同时保留了信息信号。 ## 3 预备知识 我们简要回顾标准的检索增强生成框架、偏好优化和边际感知偏好选择,这些构成了我们方法的基础。 ### 3.1 检索增强生成 给定一个参数化为θ的语言模型、一个知识库K={Ki}i=1k(其中k表示文档数量)、一个检索器R(·)和一个查询q,标准的检索增强生成(RAG)框架遵循先检索后生成的范式。具体来说,它首先从知识库中检索前K个相关文档,然后根据检索到的信息生成答案。该过程可表述为: Kq = R(q, K; K), y ∼ Pθ(y ∣ PromptCoT(q, Kq)) (1) 其中y表示生成的响应,PromptCoT(·)表示链式思维提示。 ### 3.2 偏好优化 语言模型的偏好对齐传统上依赖于多阶段程序,例如基于人类反馈的强化学习(RLHF)(Ouyang et al., 2022 (https://arxiv.org/html/2607.16431#bib.bib64); Bai et al., 2022 (https://arxiv.org/html/2607.16431#bib.bib65)),这需要一个额外的参考模型来指导和稳定训练。最近的进展导致了一类直接从偏好数据中学习的方法,避免或简化了显式奖励建模。这些方法通常针对给定提示x的偏好对(yw, yl)优化策略πθ,其中yw表示偏好响应,yl表示非偏好响应。此类目标的一般形式可以表示为: L(θ) = Lbase(πθ) - λ E(x,yw,yl)[log σ(β · hθ(yw, yl, x))]
相似文章
从自适应列表排序角度重新审视自适应检索增强生成的必要性
本文提出了 AdaRankLLM,一个自适应检索框架,通过列表排序动态过滤检索到的段落,对自适应 RAG 的必要性提出质疑。研究表明自适应检索对于较弱模型充当噪声过滤器,对于更强模型充当成本效率优化器,在多个数据集和 LLM 上进行了广泛实验。
DebiasRAG:一种通过检索增强生成实现大语言模型公平生成的无调优路径
DebiasRAG 提出了一种无调优、查询特定的去偏框架,利用检索增强生成来减少大语言模型中的社会偏见,同时不降低其原有能力。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。