上下文分配的规律:生成式搜索中的因果度量与闭环编排
摘要
本文通过因果度量上下文利用率,识别出RAG评估指标中的缺陷,证明狭窄的顺序上下文比宽广上下文提高召回率,并引入子模调度器进行优化分配。
查看缓存全文
缓存时间: 2026/08/25 16:37
论文页面 - 上下文分配的定律:生成式搜索中的因果度量与闭环编排
来源:https://huggingface.co/papers/2608.23252 我们发现,RAG 社区用来检查“模型是否真正使用了此文档”的度量标准,大多测量的是错误的目标。
在标准评估池中——负样本是针对无关查询检索的段落——BM25 和查询-文档余弦相似度在识别生成器所依赖的证据方面,表现几乎完美(AUC 0.99)。如果将填充物换成同一查询的、主题密集但不包含答案的硬负样本,它们的表现就会下降到接近随机水平(0.57)。因果留一探测法几乎没有任何变化(0.85 → 0.85)。这种表面上的可靠性,是干扰项过于容易所造成的假象。
这一点至关重要,因为这些代理指标正是人们用来决定哪些内容应放入上下文的依据。一旦我们通过因果方式来衡量利用率,一个清晰的分配规律就会显现:在固定的 k×T 个证据槽位预算下,将其分配给多个狭窄的顺序上下文,比使用一个宽泛的上下文,在整体召回率上能带来 16.8-20.5 个百分点的绝对提升,并且这种差距在 32B 规模下依然存在。扩大上下文主要只是为一个答案带来轻微改善,而无法触及其余的答案空间。
我们通过一个子模调度器来实现闭环,它在每一轮读取探测器的反馈,以降低已饱和证据的优先级,并提升未充分使用证据的优先级(相比所有基于选择的基线,PR 提升 +0.033 到 +0.081,Benjamini-Hochberg q < 0.001)。
代码和因果度量方法已发布——包括一个包含 11,500 条记录的基准数据集,其必要证据集在构造时即已知晓,因此你可以检验自己的归因方法是否能在从“异查询”负样本切换到“同查询”负样本时依然有效。
📄https://arxiv.org/abs/2608.23252 💻https://github.com/PeiYangLiu/ascp 🤗https://huggingface.co/datasets/PeiyangLiu/ascp-context-attribution
相似文章
动态上下文调度:超越静态环境的学习
该论文提出动态上下文调度方法,旨在增强上下文强化学习的泛化能力,实验表明在模拟环境中在分布外和分布内区域均实现性能提升。
什么能保存到上下文中:预算受限多跳RAG的诊断方法与子模证据打包的改进时机
本文引入了answer-in-context,一种用于预算受限多跳RAG的诊断指标,用于衡量黄金答案是否存在于打包后的读者上下文中,并提出了一种子模证据打包方法,在特定条件下优于启发式方法。
RAG 能知道检索错误吗?在知识冲突下诊断上下文遵从性
本文提出了一种名为“上下文驱动分解”(CDD)的探针,用于诊断检索增强生成(RAG)系统在面对检索上下文与参数化知识冲突时,是否遵从检索上下文。同时,发布了 Epi-Scale 基准测试,以便在多种模型家族中进行系统性研究。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
Shapley上下文剪枝:面向上下文重排序与剪枝的合作博弈视角
本文提出了Shapley上下文剪枝(SCP),一种用于RAG系统中上下文重排序和剪枝的合作博弈论框架。它采用Deep Sets架构和蒙特卡洛采样,高效地归因句子重要性,通过轻量级的3M参数价值网络实现了有竞争力的下游问答性能。