Shapley上下文剪枝:面向上下文重排序与剪枝的合作博弈视角

arXiv cs.AI 论文

摘要

本文提出了Shapley上下文剪枝(SCP),一种用于RAG系统中上下文重排序和剪枝的合作博弈论框架。它采用Deep Sets架构和蒙特卡洛采样,高效地归因句子重要性,通过轻量级的3M参数价值网络实现了有竞争力的下游问答性能。

arXiv:2607.16209v1 公告类型:新 摘要:上下文重排序和剪枝已成为提高现代检索增强生成(RAG)系统效率的关键,但一个可解释且统一的框架仍未被充分探索。先前的工作主要强调词汇检索、交叉编码器架构、模型蒸馏和低秩适应(LoRA),大多依赖于启发式损失函数和经验性归因。本文提出了Shapley上下文剪枝(SCP),一种新颖的上下文重排序框架,通过将上下文建模为合作博弈,为重要性归因建立了合作博弈论视角。为了平衡细粒度和粗粒度表示之间的权衡,我们采用Deep Sets架构来近似句子级别的置换不变价值函数,利用预训练语言模型作为句子嵌入器,并通过成对边际排序损失进行优化。为了在不牺牲数学严谨性的前提下确保实际可扩展性,我们利用蒙特卡洛采样进行高效的训练和推理,为保留Top-K子集排名提供了形式化的理论误差界和样本复杂度保证。此外,我们进行了全面的实验——涵盖支持句子召回、大海捞针(NIAH)评估、长上下文问答和多跳推理——以及关于嵌入质量和归因策略的严格消融研究。该模型在稳健基线上取得了有竞争力的下游问答性能。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:37

# ShapleyContextPruning: 一种用于上下文重排序与裁剪的合作博弈视角

**来源**: https://arxiv.org/html/2607.16209

闫乔陈\*,侯东盛\*,芮雨涵\*,曹真,刘烨庞†  
南方科技大学  
\{12412115, 12410421\}@mail\.sustech\.edu\.cn, ruiyuhan0110@gmail\.com, 12410102@mail\.sustech\.edu\.cn, liuyp1@sustech\.edu\.cn  
\*同等贡献。†通讯作者。

###### 摘要

上下文重排序与裁剪已成为提升现代检索增强生成(RAG)系统效率的关键技术,然而一个可解释且统一的框架仍待深入探索。以往工作主要关注词汇检索、交叉编码器架构、模型蒸馏和低秩适应(LoRA),大多依赖于启发式损失函数和经验性归因。本文提出Shapley上下文裁剪(SCP),一个新颖的上下文重排序框架,通过将上下文建模为一个合作博弈,为重要性归因建立了合作博弈论的视角。为了平衡细粒度与粗粒度表征之间的权衡,我们采用Deep Sets架构在句子级别近似一个置换不变的价值函数,利用预训练语言模型作为句子嵌入器,并通过成对边际排序损失进行优化。为了在不牺牲数学严谨性的前提下实现实际可扩展性,我们利用蒙特卡洛采样进行高效的训练与推理,并为保留Top-K子集排序提供了形式化的理论误差界限和样本复杂度保证。此外,我们进行了全面的实验——涵盖支持句召回、大海捞针(NIAH)评估、长上下文问答和多跳推理——并针对嵌入质量和归因策略进行了严格的消融研究。该模型在鲁棒的基线上取得了具有竞争力的下游问答性能。值得注意的是,我们的框架将归因逻辑解耦为一个极为轻量级的300万参数价值网络原型,该原型运行在标准句子嵌入之上,凸显了其模块化效率和作为可扩展上下文过滤器的部署可行性。此外,我们还提供了多个案例研究,包括稳健性论证和实际应用场景分析。除了实际贡献,我们还为上下文分析提出了一个直观的理论蓝图——“上下文景观”(landscape of the context),为信息聚合提供了结构性视角。最后,基于我们的实证观察,我们提出了若干假设和开放研究问题,供未来探索。

## 1 引言

参照图1

**图1:** 概念演化概览以及SCP与以往方法的区别。SCP将组件间的交互显式建模为一个合作博弈,而非简单的集合或序列。受可解释AI(XAI)理论启发,SCP将受限的方法论扩展到更广泛的场景,即上下文重排序。

参照图2

**图2:** 架构概览。SCP框架包含三个主要组件:(i) 嵌入器:可以是任何预训练嵌入模型。(ii) 价值函数:评估句子子集的价值。(iii) Shapley估计器:基于价值函数估计每个句子的Shapley值。输出是基于Shapley值的句子排序列表,可用于裁剪。与XAI中事后解释不同,SCP主动学习一个直接优化支持句排序的价值函数,从而确保Shapley值对下游任务有意义。

检索增强生成(RAG)[24 (https://arxiv.org/html/2607.16209#bib.bib24)]已成为缓解大语言模型(LLM)幻觉并扩展其知识边界的主流范式。现代RAG系统通常将检索、重排序和裁剪分为两个阶段:首先,应用粗粒度模型(如BM25[37 (https://arxiv.org/html/2607.16209#bib.bib37)]、双编码器[36 (https://arxiv.org/html/2607.16209#bib.bib36)])高效过滤候选组件;其次,利用细粒度模型(如交叉编码器[33 (https://arxiv.org/html/2607.16209#bib.bib33)])进行重排序和裁剪。然而,随着检索文档在长度和复杂性上的增长,处理广泛的上下文会带来高昂的计算成本,并常常以无关噪声分散模型注意力。现有方法经常级联语言模型与低秩适应(LoRA)或蒸馏技术;然而,它们的损失函数和归因机制主要依赖于启发式和经验观察。因此,系统理论背景的缺乏导致设计依赖于经验,限制了透明架构改进所必需的分析严谨性。在最近的一项综述[30 (https://arxiv.org/html/2607.16209#bib.bib30)]中,研究者提出了一个上下文建模的抽象理论框架,其中上下文组件通过组装函数A\(c1,c2,...,cn\)进行聚合。目标是找到一个上下文生成函数,最大化LLM后续输出质量的期望。这个公式直观上类似于博弈论中的“联盟”概念,直接激发了我们将Shapley值集成到重排序阶段的想法。

在本文中,我们提出Shapley上下文裁剪(SCP),一个新颖的框架,超越了现有启发式方法的可解释性限制,利用合作博弈论提高粗粒度重排序的准确性。我们的主要贡献总结如下:

##### 上下文工程的新颖归因视角

与传统的启发式归因技术不同,我们在句子级别引入Shapley值,建立了一个稳健的、理论启发的归因机制。我们自然地采用一个基于集合的价值函数,配合成对排序监督,并借助Shapley值生成列表式裁剪输出。超越实现,这项工作通过合作博弈论提供了一种连接工程与理论的概念性方式。参见图1 (https://arxiv.org/html/2607.16209#S1.F1)概览。我们在附录A (https://arxiv.org/html/2607.16209#A1)中讨论了更广泛的愿景和未来方向。

##### 用于RAG系统的粗粒度重排序原型

我们提出了一个可操作的基于Shapley值的重排序和裁剪框架,专为初步上下文裁剪阶段设计——此时原始文本极其冗长,需要一种激进、粗粒度的过滤器。通过根据计算的Shapley值对句子进行重排序,该机制系统地保留了最能贡献于下游生成任务的最具信息量的句子“联盟”。这种方法在效率与准确性权衡上提供了一个新颖、高度可扩展的视角,优先考虑结构完整性而非仅仅追求最先进的基准。参见图2 (https://arxiv.org/html/2607.16209#S1.F2)架构概览。

##### 工程实现与全面实验验证

我们在多个严格的基准上验证了SCP,涵盖支持句召回、大海捞针(NIAH)任务、长上下文问答和多跳推理。我们的结果确认SCP保持了有竞争力的整体性能,在MuSiQue、2WikiMH和HotpotQA等数据集上验证了其可行性。为了进一步验证我们的方法,我们进行了广泛的消融研究,分析了嵌入选择、蒙特卡洛采样预算以及针对经典方法(如留一法)的比较归因策略的影响。此外,我们提供了案例研究和实证稳健性分析。关键的是,为了隔离并验证SCP消融的有效性,我们在独立于端到端RAG混淆因素的情况下进行评估。最终,SCP框架引入了一种通用方法论,不仅适用于上下文裁剪——还可扩展到通用组件重排序、特征选择和软件测试用例优化。通过将严谨的理论基础与可扩展实现相结合,该框架为更广泛的科学社区贡献了一个稳健的分析工具。

## 2 相关工作

最近的上下文裁剪方法可分为四类。*(i)* 令牌级提示压缩(LLMLingua-2[20 (https://arxiv.org/html/2607.16209#bib.bib20),35 (https://arxiv.org/html/2607.16209#bib.bib35)]和Selective Context[25 (https://arxiv.org/html/2607.16209#bib.bib25)])通过基于惊奇度的选择压缩提示,但依赖于局部令牌信号,缺乏跨句子的合作建模;我们将LLMLingua-2作为基线。*(ii)* 基于BERT的句子级裁剪(Provence[5 (https://arxiv.org/html/2607.16209#bib.bib5)])使用Transformer风格的自适应过滤内容。*(iii)* 抽取式和抽象式压缩器(RECOMP[49 (https://arxiv.org/html/2607.16209#bib.bib49)])将段落浓缩为新的表示,这与严格的句子选择重排序不同。*(iv)* 任务专用系统(SWE-Pruner[48 (https://arxiv.org/html/2607.16209#bib.bib48)])表明,结构感知的裁剪在领域特定设置中能带来收益,强调了将裁剪与下游任务结构对齐的必要性。

在标准RAG流水线中,检索和重排序决定了有效上下文长度。稀疏检索(BM25[37 (https://arxiv.org/html/2607.16209#bib.bib37)])仍然是一个强大的词汇基线,而稠密检索(DPR[22 (https://arxiv.org/html/2607.16209#bib.bib22)])和交叉编码器重排序器[33 (https://arxiv.org/html/2607.16209#bib.bib33)]以更高的计算成本改进了语义匹配。像FiD[19 (https://arxiv.org/html/2607.16209#bib.bib19)]这样的模型表明,跨段落交互对于多跳推理至关重要。同时,“迷失在中间”[27 (https://arxiv.org/html/2607.16209#bib.bib27)]以及相关综述[26 (https://arxiv.org/html/2607.16209#bib.bib26)]揭示,LLM未能充分利用长上下文,这激励了在生成之前进行选择性的、高质量的裁剪。

特征归因研究也凸显了局部相关性与整体贡献之间的差距:注意力权重[6 (https://arxiv.org/html/2607.16209#bib.bib6)]不等同于特征重要性,而梯度方法如综合梯度[41 (https://arxiv.org/html/2607.16209#bib.bib41)]缺乏到离散的、基于集合的上下文选择的直接映射。

学习排序工作涵盖逐点[7 (https://arxiv.org/html/2607.16209#bib.bib7)]、成对[16 (https://arxiv.org/html/2607.16209#bib.bib16)]、集合级[53 (https://arxiv.org/html/2607.16209#bib.bib53)]和列表级[3 (https://arxiv.org/html/2607.16209#bib.bib3)]范式。OptiSet[21 (https://arxiv.org/html/2607.16209#bib.bib21)]通过选择最优组件组合追求集合级建模,与我们的目标——优化离散联盟——一致。与我们设置更接近的是LooComp[9 (https://arxiv.org/html/2607.16209#bib.bib9)],它应用留一法(LOO)目标结合LoRA进行上下文裁剪。我们在两个关键方面有所不同:(i) 我们从零开始训练一个独立的300万参数Deep Sets价值函数,将归因与嵌入器解耦;(ii) 我们的分析(附录C.4.2 (https://arxiv.org/html/2607.16209#A3.SS4.SSS2))表明,LOO在语义冗余下会失效,为重复句子分配接近零的分数,而Shapley归因——对所有联盟边际贡献的平均——本质上抵抗这种失败模式。

将Shapley归因应用于子集需要一个置换不变的价值函数,Deep Sets[52 (https://arxiv.org/html/2607.16209#bib.bib52)]是典型选择;我们保持估计器轻量级,以避免有限潜在维度下的表示瓶颈[46 (https://arxiv.org/html/2607.16209#bib.bib46)]。

Shapley值[40 (https://arxiv.org/html/2607.16209#bib.bib40)]起源于合作博弈论,量化一个组件在所有联盟上的期望边际贡献——这种归因方案自然地与上下文裁剪对齐,其中一个在孤立状态下无关紧要的句子,在与桥接证据协同作用时可能变得关键。然而,现有的基于Shapley的框架各自牺牲了一个关键属性:Data Shapley[11 (https://arxiv.org/html/2607.16209#bib.bib11)]实现了可解释性和冗余稳健性,但本质上不可扩展,因为每次评估v(S)都需要重新训练底层模型;SHAP[29 (https://arxiv.org/html/2607.16209#bib.bib29)]通过沿着特征维度而非样本进行归因来解释固定模型,因此不对上下文单元排序;TokenSHAP[12 (https://arxiv.org/html/2607.16209#bib.bib12)]在过度细粒度的令牌粒度上操作,使用硬编码的价值函数(如TF-IDF余弦相似度),丢弃了更丰富的语义信号。SCP通过*学习*一个专门的、置换不变的句子级价值函数来弥合这一差距,同时提供可扩展性、可解释性和冗余稳健性。除了裁剪,这个学习到的价值函数为上下文工程开辟了新的方向——分层上下文结构、桥接句子分析和基于树的上下文管理——我们在附录A (https://arxiv.org/html/2607.16209#A1)中探讨了这些。

总之,虽然SCP建立在已建立的理论要素之上——Shapley值、Deep Sets和合作博弈——但其贡献在于首次回答了如何将Shapley归因实际应用于上下文重排序的问题,并为更系统化和可解释的上下文裁剪与管理提供了一个新颖的蓝图。参见表1 (https://arxiv.org/html/2607.16209#A1.T1)进行详细比较。

## 3 Shapley上下文裁剪(SCP)

### 3.1 Shapley值

我们从合作博弈论引入Shapley值[40 (https://arxiv.org/html/2607.16209#bib.bib40)]作为我们上下文裁剪方法的理论基础。Shapley值是合作博弈论中的一个解概念,旨在根据每个玩家对整体结果的个体贡献,公平地分配总收益(或成本)。

###### 定义3.1 (Shapley值)。考虑一个合作博弈,玩家集合为N,特征函数为v: 2^N → R,该函数为每个玩家联盟分配一个价值。玩家i ∈ N的Shapley值φ_i(v)定义为:

φ_i(v) = ∑_{S ⊆ N \ {i}} (|S|!(|N|-|S|-1)!)/|N|! [v(S∪{i}) - v(S)]

其中求和遍历所有不包含玩家i的N的子集S。

##### 原理

我们从Shapley值中汲取灵感,设计了一个基于排序的重要性估计器。尽管我们学习到的价值函数v_θ由于其数据驱动而非公理构造,并不严格满足所有Shapley公理,但Shapley公式作为我们基于联盟的重要性聚合的概念基础。虽然我们放松了这些公理约束以最大化表示能力,但通过有针对性的训练正则化重新引入特定的理论约束,为未来研究提供了一个有前景的方向,以桥接经验灵活性与形式保证。参见附录A.1 (https://arxi

相似文章

将RAG上下文修剪到答案实际所需的内容

Hacker News Top

Kapa.ai 描述了他们在RAG流程中的检索和生成之间添加了一个小型LLM修剪器,该修剪器丢弃了68%的上下文,同时保持了96%的召回率,将查询成本降低了三分之一。

量化RAG系统中的先验主导性

arXiv cs.CL

本文介绍了归一化上下文利用(NCU)指标,用于量化RAG系统中上下文信息的增益。该指标挑战了规模定律,表明在严格的事实提取中,小语言模型由于较低的“先验主导性”可以与更大模型匹敌甚至更优,并且一个商业API在对抗性设置中经常覆盖外部证据。