上下文分配的规律:生成式搜索中的因果度量与闭环编排

Hugging Face Daily Papers 论文

摘要

本文通过因果度量上下文利用率,识别出RAG评估指标中的缺陷,证明狭窄的顺序上下文比宽广上下文提高召回率,并引入子模调度器进行优化分配。

随着检索增强生成(RAG)转向多样化的投资组合生成,它受到两个关键瓶颈的阻碍:证据利用测量的缺陷和上下文预算分配的次优。我们顺序解决这两个问题。 为了解决测量问题,我们揭示了一个普遍存在的'诊断幻觉':标准相关性代理在硬负样本上灾难性地失效。我们用一种高效的因果留一法探测器替代它们,该探测器准确隔离生成依赖并正式校准LLM注意力的结构稀释。 为了解决分配问题,我们在去混淆因子网格中部署此因果探测器。我们证明,普遍采用的整体上下文扩宽策略是一种被相关性衰减惩罚的架构陷阱。相反,通过在多个顺序生成中迭代分配计算,驱动了投资组合召回率的变革性提升,绝对百分点增加16.7--20.5,并稳健地扩展到32B模型。 最后,我们将这些解决方案统一为一个可部署的闭环子模调度器。通过增强的归因引导对比解码器来覆盖LLM注意力惯性,我们的架构系统地强制集成新证据。通过主导经典的开环基线,我们建立顺序、反馈驱动的编排作为生成式搜索的确定性范式。我们的代码、数据和因果度量工具可在https://github.com/PeiYangLiu/ascp获取。
查看原文
查看缓存全文

缓存时间: 2026/08/25 16:37

论文页面 - 上下文分配的定律:生成式搜索中的因果度量与闭环编排

来源:https://huggingface.co/papers/2608.23252 我们发现,RAG 社区用来检查“模型是否真正使用了此文档”的度量标准,大多测量的是错误的目标。

在标准评估池中——负样本是针对无关查询检索的段落——BM25 和查询-文档余弦相似度在识别生成器所依赖的证据方面,表现几乎完美(AUC 0.99)。如果将填充物换成同一查询的、主题密集但不包含答案的硬负样本,它们的表现就会下降到接近随机水平(0.57)。因果留一探测法几乎没有任何变化(0.85 → 0.85)。这种表面上的可靠性,是干扰项过于容易所造成的假象。

这一点至关重要,因为这些代理指标正是人们用来决定哪些内容应放入上下文的依据。一旦我们通过因果方式来衡量利用率,一个清晰的分配规律就会显现:在固定的 k×T 个证据槽位预算下,将其分配给多个狭窄的顺序上下文,比使用一个宽泛的上下文,在整体召回率上能带来 16.8-20.5 个百分点的绝对提升,并且这种差距在 32B 规模下依然存在。扩大上下文主要只是为一个答案带来轻微改善,而无法触及其余的答案空间。

我们通过一个子模调度器来实现闭环,它在每一轮读取探测器的反馈,以降低已饱和证据的优先级,并提升未充分使用证据的优先级(相比所有基于选择的基线,PR 提升 +0.033 到 +0.081,Benjamini-Hochberg q < 0.001)。

代码和因果度量方法已发布——包括一个包含 11,500 条记录的基准数据集,其必要证据集在构造时即已知晓,因此你可以检验自己的归因方法是否能在从“异查询”负样本切换到“同查询”负样本时依然有效。

📄https://arxiv.org/abs/2608.23252 💻https://github.com/PeiYangLiu/ascp 🤗https://huggingface.co/datasets/PeiyangLiu/ascp-context-attribution

相似文章

RAG 能知道检索错误吗?在知识冲突下诊断上下文遵从性

arXiv cs.CL

本文提出了一种名为“上下文驱动分解”(CDD)的探针,用于诊断检索增强生成(RAG)系统在面对检索上下文与参数化知识冲突时,是否遵从检索上下文。同时,发布了 Epi-Scale 基准测试,以便在多种模型家族中进行系统性研究。

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。