检索增强生成中的归因-压缩前沿
摘要
本文研究了检索增强生成中上下文压缩与引用归因之间的权衡,评估了多种压缩方法,并揭示了答案质量与归因准确性之间的显著差距。
arXiv:2609.14245v1 公告类型:新
摘要:在检索增强生成中,上下文压缩减少了生成器的输入,但仅凭答案质量无法表征引用归因。我们测量了不同压缩方法和预算下的引用归因,比较了在固定生成器和主要蕴含评估器下,在ASQA和QASPER上的重排序、抽取式选择、抽象式摘要、令牌修剪和抽取-聚类-重写构建。在ASQA上,名义预算0.25(实际压缩0.08)时,RECOMP风格压缩器的引用相对于其摘要得分为0.86精度,但相对于源片段在我们的重归因协议下为0.12。这些估计依赖于一个共享的NLI模型用于片段恢复和引用评分,并缺乏独立的人类校准。抽取式选择的观察到的基于精度在名义预算从ASQA上下文的二分之一到十分之一之间范围为0.43到0.49,同时答案质量下降。对于相同的RECOMP设置,源恢复后的声明验证产生的未支持率为0.88,而检查摘要时为0.17。这一差距在超出缺失来源的结构拒绝后仍然持续,但仍然依赖于评估器。一个200问题的TRUE T5-XXL审计也在固定和重新计算的源映射下发现了发出-基于差距,未建立人类校准的支持率。
查看缓存全文
缓存时间: 2026/09/15 08:52
# 检索增强生成中的归属–压缩前沿
来源:https://arxiv.org/html/2609.14245
Deepanshu Mody
###### 摘要
上下文压缩减少了检索增强生成中生成器的输入,但答案质量本身并不能表征引用归属。我们在ASQA和QASPER数据集上,使用固定的生成器和主要蕴含评估器,测量了不同压缩方法和预算下的引用归属,比较了重排序、抽取式选择、抽象式摘要、token剪枝,以及一种抽取-聚类-重写构造方法。在ASQA数据集上,名义0.25预算(实际达到的压缩比为0.08)下,一种RECOMP风格压缩器的引用与其摘要相比精度为0.86,但根据我们的可重归属协议,与源文本片段相比精度仅为0.12。这些估计依赖于一个用于片段恢复和引用评分的共享NLI模型,并且缺乏独立的人工校准。抽取式选择方法在ASQA上下文从一半到十分之一的名义预算范围内,其观察到的基于证据的精度在0.43到0.49之间,而答案质量则有所下降。对于相同的RECOMP设置,在恢复源片段后进行声明验证,其不支持率为0.88,而直接检查摘要时仅为0.17。这种差距在结构性地拒绝缺失来源之后依然存在,但仍然依赖于评估器。一项针对200个问题的TRUE T5-XXL审计也发现了在固定和重新计算的源映射下,“生成”与“基于证据”之间的差距,但未能建立经过人工校准的“支持”率。
## 1引言
上下文压缩减少了检索增强生成中生成器的输入(RAG)(Xu et al., 2024; Jiang et al., 2024; Pan et al., 2024; Chirkova et al., 2025)。引用级别的归属需要*可定位的*证据:读者必须能够检索并检查所引用的来源(Rashkin et al., 2023; Bohnet et al., 2022)。当引用指向的是压缩器生成的文本,而该文本缺乏其支持源片段时,抽象式压缩可能会中断这种关联。当压缩器生成的文本的一致性被视作来自原始来源的支持证据时,我们称之为*归属洗白*。在ASQA数据集上,名义预算0.25(实际达到的压缩比为0.08)下,一种RECOMP风格压缩器的引用与其摘要相比精度为0.86,但根据我们的恢复协议,与源文本片段相比精度仅为0.12。这些自动评分依赖于一个共享的NLI评估器和有限的候选搜索;它们尚未经过独立校准。
相关工作已经指出了压缩下答案质量与引用证据基础之间的差异(Li et al., 2026a),同时引用支持并不等于因果性依赖于证据(Wallat et al., 2025)。我们跨压缩器类型和两个数据集考察了这个问题,报告了实际达到的上下文比例、明确的源恢复规则以及在相同问题上的配对比较。我们的测量关注自动评估协议下的源支持;并未测试因果引用忠实性。
我们进行了一项受控测量研究,使用固定的生成器(带ALCE式编号上下文引用提示的Qwen2.5-7B-Instruct)、固定的评估器(DeBERTa-v3-base,使用MNLI+FEVER+ANLI训练,阈值τ=0.5),以及以生成器-tokenizer token计算的名义预算集{0.5, 0.25, 0.1, 0.05}。我们的贡献是:
- • **归属–压缩前沿**。比较了重排序、抽取式选择、抽象式方法、token剪枝、ECR以及一个恒等参照基准在实际达到的上下文比例下的表现。所有设置共享来自271篇论文的944个成功ASQA问题和976个QASPER问题;配对测试量化了它们的差异。
- • **可重归属协议**。一个没有声明来源的单元,当NLI模型预测其能被某个候选源片段蕴含时,被视为“可重归属”;恢复的源片段支持*基于证据的*引用评分,同时还有与压缩文本对比的*生成的*引用评分。
- • **三种验证模式**。我们区分了与摘要的一致性、声明来源的可获得性以及源恢复后的声明支持。在仅检查声明来源的结构性拒绝与恢复后的实测拒绝被区分开来。
- • **抽取-聚类-重写(ECR)观察**。一种简单的构造方法贪心地合并近重复句子,并引用每个聚类的所有成员;配对比较量化了其在不同预算下与抽取方法在测量上的差异。
## 2相关工作
#### 用于RAG的上下文压缩
文本压缩器选择或改写检索到的材料。选择方法包括查询感知的token剪枝(Jiang et al., 2024)、蒸馏的token分类(Pan et al., 2024)、带重排序的句子剪枝(Chirkova et al., 2025)以及证据性引导选择(Jeong et al., 2025)。RECOMP为端任务性能训练抽取式和抽象式压缩器(Xu et al., 2024),而FaviComp在重写过程中结合了检索上下文与参数知识(Jung et al., 2025)。其输出是否保留可定位的源链接取决于集成方式:我们的抽取式和ECR实现声明了源ID,而我们的LLMLingua-2集成省略了token到源的映射。软压缩器使用学习到的表示,包括要点token(Mu et al., 2023)、ICAE记忆槽(Ge et al., 2024)、文档嵌入(Cheng et al., 2024)和多上下文嵌入(Rau et al., 2025);这些不在我们的实验范围内。
#### 归属生成与引用评估
AIS框架评估陈述是否由已识别的来源支持(Rashkin et al., 2023)。自动归属和蕴含评估(Bohnet et al., 2022; Honovich et al., 2022)为ALCE的引用精确率和召回率指标提供了信息(Gao et al., 2023),我们对此进行了调整。QASPER提供了针对研究论文的问题,并带有标注员标记的证据(Dasigi et al., 2021)。LongCite研究了长上下文下的细粒度引用生成(Zhang et al., 2025),这是评估固定生成器下压缩的一个互补方向。
#### 压缩与引用可靠性
Li et al. (2026a) 在ASQA上研究了Self-RAG与LLMLingua-2和前缀截断,发现引用基础的退化比答案质量更严重,并研究了分层证据保留。我们的研究增加了在ASQA和QASPER上的跨家族比较,区分了声明和恢复的源映射,并报告了针对实际达到的上下文比例的“生成的”和“基于证据的”分数。概念性发现有重叠;我们的贡献在于实验覆盖范围和明确的评估与报告程序,而非对这种差异的优先权。Wallat et al. (2025) 区分了引用正确性和因果忠实性,并研究了事后合理化。我们基于NLI的支持分数并未确定生成器是否因果性地依赖于所引用的证据。ALCE的摘要-上下文消融也说明了正确性-引用权衡(Gao et al., 2023);信息保留研究考察了压缩下的证据基础(Łajewska et al., 2025),而人工评估考察了随着输出抽象程度变化的可验证性(Worledge et al., 2024)。
#### 来源与结构化表示
相关的来源导向设计包括CAMS中的声明锚定多文档摘要(Guan, 2026)、代理记忆中的预算化证据保留(Li et al., 2026b)以及来源感知的分层记忆(Zhu et al., 2026)。结构化检索索引使用原子命题(Chen et al., 2024)、递归摘要树(Sarthi et al., 2024)或图社区摘要(Edge et al., 2024)。这些设计启发了紧凑表示与源证据之间的显式链接,但在此未作为压缩器进行评估。基于注意力的解释仍存在争议(Jain and Wallace, 2019; Wiegreffe and Pinter, 2019)。基于槽的表示(Locatello et al., 2020; Tan and Kok, 2025; Ibtehaz and Kihara, 2026)提出了另一种可能的压缩机制;其内部结构是否能提供经验证的源归属是一个未被验证的未来方向。
## 3测量压缩下的归属
### 3.1实验设置
我们的流程是:检索→压缩→生成→评估。压缩器将检索到的片段(按句子分割,每个带有一个稳定的源id,*sid*)映射到一个*单元*序列,每个单元要么声明来源——它从哪些sid中被选中,如抽取式家族;要么不声明来源,如抽象式家族。生成器将这些单元视为编号的上下文,并按照ALCE风格被提示,在每个答案句子后附加带方括号的单元引用(Gao et al., 2023)。引用质量使用一个NLI评估器按可归属于已识别来源的意义对每个答案陈述进行评分(Rashkin et al., 2023; Bohnet et al., 2022):一个陈述被*召回*,当且仅当其可解析引用来源的连接蕴含它;一个引用是*精确的*,当且仅当该连接蕴含该陈述,并且,此外,被引用的来源单独就能蕴含该陈述,或者移除该来源会破坏该连接的蕴含关系(Gao et al., 2023)。我们使用DeBERTa-v3-base(MNLI+FEVER+ANLI),阈值τ=0.5,将每个NLI输入截断到512个模型token。下文中的蕴含决策是该模型的预测,并非对源支持的独立验证判断。仅在恒等参照设置中出现单样本执行失败(ASQA的948个中有4个,QASPER的1005个中有29个);每个主要设置都排除了这些相同的问题ID,并保留了失败计数。
### 3.2“生成的”与“基于证据的”引用
我们对每次运行从两个视角进行评分。我们将精确率写作P,召回率写作R,下标e代表“生成的”,g代表“基于证据的”。“生成的”分数将引用与生成器实际看到的单元文本进行对比;它衡量了与压缩上下文的一致性,这正是当压缩单元被视为可引用文档时所隐含测量的。“基于证据的”首先将每个引用解析到检索到的源片段,然后与之对比评分。声明了来源的单元解析到其声明的sid。未声明来源的单元通过我们的*可重归属*协议:根据词汇相似度对源片段进行排序,在排名前10的候选片段上运行NLI,并保留那些在阈值τ下被判断为单独蕴含该单元的片段。一个没有恢复片段的引用无法获得精确率分数,并且在此协议下无法支持召回率。*重归属率*是在示例平均中,未声明来源的单元中至少有一个恢复片段的比例。
#### 评估器依赖性
同一个NLI模型既用于过滤恢复的片段,也用于评分引用支持,这造成了循环风险:选择和评估误差可能相关。词汇检索可能遗漏改写,而单片段测试可能拒绝那些仅由组合证据支持的单元。因此,恢复失败并不能证明源中不存在支持,而整体评分偏差的方向是未知的。附录C报告了第二个评估器的敏感性检查;人工校准仍然缺失。
“生成的”–“基于证据的”差距是*归属洗白*的一个操作性诊断:声明获得了针对压缩文本的评分,但这些文本并未通过我们协议接受的源映射得到支持。这本身并不能区分是证据缺失,还是恢复或NLI错误。
#### 名义压缩与实际压缩
预算名义上是每个示例检索上下文的比例分数{0.5, 0.25, 0.1, 0.05},以生成器-tokenizer token强制实施。抽取式家族能紧密跟踪其预算,但抽象式压缩器输出其解码器的输出:RECOMP在所有四个名义预算下,在ASQA上实现的实际压缩比为0.05–0.08,在QASPER上约为0.015——不同的名义操作点坍缩在一起。因此,所有曲线在压缩轴上使用*实际达到的*比例;若按名义预算绘图,在最坏情况下会将抽象式系统放置到错误的数量级上。
### 3.3三种验证模式
我们将每个答案分解为声明(即剥离引用标记后的陈述句;参见原子事实分解,Min et al., 2023),并针对从其引用单元中汇集的证据检查每个声明。**摘要检查**汇集了被引用单元自身的文本。**片段检查**仅汇集被引用单元*声明的*源片段;没有此类证据的声明被视为无支持,无需调用NLI。我们将此仅声明模式保留为“片段检查”标签,它不同于基于证据的引用评分:它不恢复缺失片段。对于未声明来源的方法,其1.00的不支持率是此策略的结果,并非每个声明都缺乏源支持的经验估计。**恢复源检查**首先将单元解析到声明的片段,或在缺失时解析到用于基于证据引用评分的同一协议恢复的片段。它在验证每个声明之前对汇集的源ID进行去重;证据缺失仍计为无支持。我们在名义0.25设置下,对RECOMP和LLMLingua-2在两个数据集上评估了这种第三模式。对于所有单元都声明来源的方法,恢复源检查和声明片段检查结果一致。我们报告了生成器输入、逻辑验证器输入(前提加假设)以及它们在声明片段检查下的总和,作为部分token成本代理(表2)。
#### QASPER上的证据选择
在QASPER(Dasigi et al., 2021)上,我们额外评估了压缩器自身的归属:声明的引用来源是否确实支持相关声明。相似文章
LLM归因指标能否迁移?跨数据集与构念的检索增强生成评估审计
本文对RAG系统在三种评估构念下的八种自动归因指标进行了审计,发现同一构念内没有单一指标能在数据集间迁移,挑战了将它们视为可互换的常见做法。
归因盲点:检测语言模型何时依赖记忆而非检索到的上下文
提出计算现实监测(Computational Reality Monitoring)方法,用于检测语言模型何时依赖预训练记忆而非检索到的上下文,从而解决检索增强生成中的归因盲点问题。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
语境之代价:在多模态检索增强生成中缓解文本偏差
本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。
为什么检索增强生成会失败:图视角
本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。