量化RAG系统中的先验主导性

arXiv cs.CL 论文

摘要

本文介绍了归一化上下文利用(NCU)指标,用于量化RAG系统中上下文信息的增益。该指标挑战了规模定律,表明在严格的事实提取中,小语言模型由于较低的“先验主导性”可以与更大模型匹敌甚至更优,并且一个商业API在对抗性设置中经常覆盖外部证据。

arXiv:2606.23695v1 Announce Type: new 摘要:检索增强生成(RAG)将大语言模型扎根于外部知识,然而当前的评估依赖于离散的启发式方法,这些方法遭受“认知盲目性”——无法区分真正的上下文信息提取与参数记忆回忆。为了解决这个问题,我们引入了归一化上下文利用(NCU)指标,利用零样本、专家和对抗条件下的连续token对数概率严格量化上下文信息增益。评估1.5B到72B参数范围的架构以及一个专有商业API表明,对于严格的事实提取(无思维链推理),传统规模定律表现出极端的收益递减:高效的小语言模型(SLM)与高容量架构匹配甚至更优。此外,我们证明“先验主导性”与模型规模和专有对齐相关。所评估的商业API不仅在近一半的对抗冲突中覆盖了明确的外部证据,而且当其参数先验被反驳时,经常遭受系统性的信心崩溃(负迁移)。我们的发现强调了SLM在严格提取工作流程中的结构性认知优势和优越的上下文遵循能力。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:43

# 量化RAG系统中的先验主导地位  
来源:https://arxiv.org/html/2606.23695  

###### 摘要  

检索增强生成(RAG)将大语言模型锚定在外部知识中,然而当前的评估依赖离散启发式方法,存在“认知盲区”——无法区分真实上下文信息提取与参数化记忆回忆。为解决这一问题,我们引入归一化上下文利用率(NCU)指标,利用零样本、Oracle和对抗条件下的连续token对数概率,严格量化上下文信息增益。对从1.5B到72B参数量的架构以及专有商业API的评估表明,对于严格事实提取(无思维链推理),传统扩展定律呈现极端递减收益:高效小语言模型(SLM)在性能上匹配甚至超越高容量架构。此外,我们证明“先验主导地位”与模型规模及专有对齐相关。被评估的商业API不仅在近半数的对抗性冲突中覆盖了明确的外部证据,而且当其参数化先验被矛盾时,经常遭受系统性置信度崩溃(负迁移)。我们的发现强调了SLM在严格提取流程中的结构性认知优势和优越的上下文遵从性。  

††本研究由ArtificialGate Ltd.独立开展并资助。作者担任Google & Reichman Tech School学术主任,以及以色列理工学院(Technion)和赖希曼大学(Reichman University)的外部讲师。  

## 1 引言  

随着大语言模型(LLM)获得广泛的通用推理能力,整合动态的、分布外知识仍然是一个根本性挑战。主流的知识整合范式——预训练基础模型或应用监督微调(FT)——受限于计算瓶颈、高延迟更新和灾难性遗忘。因此,检索增强生成(RAG)[20, 3, 12, 19] 已成为一种解耦知识与模型权重的标准机制,旨在将计算负担从参数化记忆回忆转移到主动上下文处理上。  

LLM的发展轨迹主要遵循既定的扩展定律[18, 13, 7, 6],这些定律认为更大的参数量可以预测性地带来更好的下游性能。然而,将此假设直接应用于RAG架构,暴露了当前评估框架中的方法论局限。标准开放域问答(QA)基准严重依赖离散的文本匹配启发式方法,如精确匹配(EM)或F1分数[27, 21, 25]。这些二元指标存在评估盲点:当模型在给定检索上下文后正确回答查询时,标准启发式方法无法确定模型是真正从文本中提取了目标信息,还是仅仅从其预训练权重中复述了答案。这种模糊性掩盖了真正的上下文利用率。大规模模型在RAG基准上的表面优势可能源于其广泛的先验知识,而非优越的上下文处理能力。此外,二元指标无法捕捉模型在面对对抗性上下文、知识冲突[4, 23, 24]或语义噪声时预测置信度的连续波动。  

为了严格区分参数化记忆与主动上下文提取,我们提出从离散文本匹配转向连续概率空间。在本文中,我们引入了**归一化上下文利用率(NCU)**指标。与传统的启发式方法不同,NCU利用零样本、Oracle和对抗条件下的连续长度归一化对数概率。通过隔离生成器组件并提供Oracle上下文——实际上评估上下文增强生成(CAG)——我们可以严格评估模型在暴露于上下文证据时对数不确定性的分数减少。本研究特别关注严格事实提取,不涉及思维链(CoT)推理范式。  

标准评估 | NCU概率框架  
查询 + 上下文 | LLM(标准)| 文本输出 | 离散匹配(EM)  
LLM评估(任意规模) | 零样本查询 | Oracle上下文  
先验:\(\log P_\theta(Y|Q)\) | 后验:\(\log P_\theta(Y|Q,C)\) | 连续NCU指标  
评估盲区  

**图1:概念架构:标准评估与NCU框架。** 传统指标(左侧)依赖二元文本匹配,无法区分参数化回忆与阅读理解。NCU框架(右侧)利用零样本和Oracle条件下的连续对数概率,隔离RAG上下文的信息增益。

为了实证探索这一框架,我们在三个不同的QA领域进行了受限推理。通过评估从1.5B开放权重小语言模型(SLM)到大规模模型(72B)以及一个专有商业API,并配合系统性扰动的上下文,我们绘制了上下文利用的经验边界。具体而言,本研究回答以下核心研究问题(RQ),概念性地展示在图2中:

- • **RQ1(提取扩展):** 增加参数量是否本质上改善了上下文提取,还是在严格提取任务中,标准扩展范式下呈现递减收益?
- • **RQ2(先验主导地位):** 参数化规模和专有对齐如何影响模型覆盖明确提供但矛盾的外部证据的倾向?
- • **RQ3(负迁移):** 在什么条件下,语义冲突会导致高容量模型遭受负迁移(即相对于其零样本基线的信息损失)?

对抗性上下文 \(C_{adv}\) 事实:\(Y_{adv}\)  
高容量模型(例如专有API)  
参数化权重  
指令:严格从上下文合成  
输出:\(Y_{true}\)  
**先验主导地位**  
权重分布:\(\mathbf{P(Y_{true}) \gg P(Y_{adv}|C_{adv})}\)  
拒绝  

对抗性上下文 \(C_{adv}\) 事实:\(Y_{adv}\)  
低容量模型(SLM 1.5B - 7B)  
弱先验处理器  
指令:严格从上下文合成  
输出:\(Y_{adv}\)  
**上下文遵从性**  
权重分布:\(\mathbf{P(Y_{adv}|C_{adv}) \gg P(Y_{true})}\)  

**图2:先验主导地位与上下文遵从性。** 知识冲突的概念化可视化。左侧:高容量模型可能因权重较大的参数化先验(\(P_{param} \gg P_{ctx}\))而覆盖矛盾的上下文。右侧:低容量SLM通常表现出更高的上下文遵从性,以更少的参数化约束处理外部证据。

通过实证分析,我们提出以下核心贡献:

1. **连续评估指标:** 我们定义并验证了NCU指标,提供了一个概率驱动的框架,将上下文处理与参数化记忆隔离,并针对不同模型的词汇表和分词差异进行归一化。
2. **提取扩展中的递减收益:** 我们实证证明了事实性基础任务中参数规模的严重递减收益。SLM(1.5B–7B)在上下文利用率方面与72B参数模型达到了统计上的同等水平,同时相对于商业API提供高达70倍的推理延迟降低。
3. **先验主导地位与负迁移的量化:** 我们识别出高容量模型的一个可测量的漏洞:当面临明确的外部冲突时,它们经常覆盖上下文(先验主导地位)并容易遭受系统性置信度崩溃(负迁移),而SLM则保持更高的认知稳定性。

本文其余部分结构如下:第2节回顾RAG评估和扩展定律的相关文献。第3节构建理论指标。第4节详述我们的方法论。第5节呈现我们的实证发现。第6节讨论操作含义。第7节承认局限性,第8节总结。

## 2 相关工作  

RAG的有效性根本上取决于模型优先考虑外部证据而非内部先验的能力。本节将我们的NCU框架置于有关RAG评估、扩展定律和知识冲突解决的文献背景中。

### 2.1 RAG评估的演变  

早期的RAG架构主要使用离散词法指标进行评估,如EM和F1分数[20]。随着LLM的发展,评估范式转向“LLM作为评判者”框架[9, 29, 40]。然而,近期研究强调了这些离散评估的局限性,指出二元启发式方法存在“认知盲区”[33]。因此,评估正转向信息论基准和token级对数概率追踪[41, 43]。我们的连续NCU指标在此基础上,形式化了预测不确定性的分数减少。虽然像RAGAS和ARES这样的“LLM作为评判者”框架在精确匹配方面取得了进展,但它们通常依赖另一个黑盒模型的推理,这可能引入自身偏差并缺乏透明度。相比之下,我们的NCU指标利用直接的token级对数概率,提供了一个更客观、可重复且细粒度的度量,衡量模型在接触外部上下文时内部置信度的变化。

### 2.2 扩展定律:预训练与推理提取  

标准的扩展定律[18, 13]通常假设更大的参数量会提升下游能力。然而,近期关于RAG的研究表明存在更复杂的动态。RAG的推理扩展定律揭示了生成器大小与检索有效性之间的非线性关系[42]。同时,文献表明参数化记忆与模型整合动态检索的意愿之间存在权衡[31]。

### 2.3 小语言模型的复兴  

大规模LLM的计算开销激发了人们对SLM的兴趣[32, 11]。当代流程越来越多地将SLM定位为动态输出重写器[34]、协作推理路由器或高效的上下文引导[5]。此外,针对结构化提取任务微调SLM,在实证中显示出与大规模模型零样本提示相比具有竞争性效能[2, 14, 16]。我们的研究旨在为这种架构转变提供量化视角,突出SLM在纯提取流程中潜在的上下文遵从性。

### 2.4 知识冲突与认知固执  

参数化记忆与外部检索的交集常常导致知识冲突[23, 4, 15]。虽然“中间迷失”现象确立了LLM可能因空间约束而忽略上下文[22],但近期文献探索了认知抑制[36]。基准测试和解决框架[39, 38]观察到,高度参数化的模型可能过度信任内部权重,有时会拒绝矛盾的外部证据[1, 44, 10, 35]。我们的研究综合了这些观察,通过数学度量将此漏洞定义为**先验主导地位**,同时认识到对齐机制在塑造此行为中的假设性作用。

虽然现有文献越来越承认离散指标的局限性以及高容量模型在知识冲突期间的复杂行为,但一个统一的、连续的指标——能够稳健地将信息提取与参数化记忆隔离开来,并跨不同分词器进行归一化——仍然未得到充分探索。本研究通过提出长度归一化的NCU框架来解决这一空白。

## 3 认知不确定性与上下文利用率  

为了量化模型的上下文处理,我们从离散启发式方法转向连续概率空间。基于香农的基础通信理论[30, 8],我们通过信息论的视角构建RAG框架。在此范式中,外部上下文充当一个辅助信息通道,专门用于解决模型关于用户查询的预测不确定性。这种对内部不确定性的持续监测,与将推理建模为易受运行时认知漂移影响的随机推断过程的新兴范式[26]一致。

令 \(Q\) 表示用户查询,\(Y = (y_1, y_2, \dots, y_k)\) 表示由 \(k\) 个token组成的地面真值目标序列,\(\theta\) 表示LLM的参数。由于不同模型采用不同的分词方案(词汇表),直接比较跨架构的对数概率原始和存在数学缺陷。因此,我们通过token序列长度对联合概率进行归一化,以得到每个token的平均对数概率。在零样本设置中,模型的置信度严格由其参数化先验决定。为了统一地捕捉此信息内容,我们将长度归一化的概率映射到香农熵,定义先验认知不确定性 \(S_{prior}\) 为:

\[
S_{prior} = -\frac{1}{k} \sum_{i=1}^{k} \log P_\theta(y_i | y_{<i}, Q)
\]

其中 \(y_{<i}\) 表示序列中前 \(i-1\) 个token。类似地,在提供Oracle上下文 \(C\)(即包含目标事实的真实相关文本)的情况下,后验不确定性 \(S_{post}\) 为:

\[
S_{post} = -\frac{1}{k} \sum_{i=1}^{k} \log P_\theta(y_i | y_{<i}, Q, C)
\]

现在,上下文的信息增益可以通过先验与后验不确定性之间的分数减少来量化。我们定义归一化上下文利用率(NCU)为:

\[
\text{NCU} = \frac{S_{prior} - S_{post}}{S_{prior}} = 1 - \frac{S_{post}}{S_{prior}}
\]

当 \(S_{post} < S_{prior}\) 时,NCU为正,表示上下文降低了不确定性。若 \(S_{post} > S_{prior}\),则NCU为负,表明负面转移或认知失调。通过将此度量归一化到 \([0, \infty)\) 范围,我们允许在不同模型架构和词汇表之间进行公平比较。

相似文章

RAG 能知道检索错误吗?在知识冲突下诊断上下文遵从性

arXiv cs.CL

本文提出了一种名为“上下文驱动分解”(CDD)的探针,用于诊断检索增强生成(RAG)系统在面对检索上下文与参数化知识冲突时,是否遵从检索上下文。同时,发布了 Epi-Scale 基准测试,以便在多种模型家族中进行系统性研究。

哪种RAG范式在大规模下胜出?检索增强生成范式的规模化研究

arXiv cs.CL

本文通过控制变量,对词汇型、密集向量型、图基型和智能体型RAG范式在从1,000到512,000篇文档的语料规模范围内进行了规模化比较研究。研究发现BM25在准确性与成本之间取得了最佳平衡,而图基型RAG面临高昂的构建成本,限制了其扩展性。

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。