用于检索增强生成的双置信对比解码
摘要
提出双置信对比解码(DCCD),一种无需训练的检索增强生成方法,通过结合文档级和词元级置信信号处理多文档场景中的上下文内部冲突,并引入事实冲突问答基准DRQA。
arXiv:2607.00570v1 公告类型:新
摘要:检索增强生成(RAG)日益要求模型从多个检索到的文档中回答问题,其中只有部分来源是相关的,而检索到的文档集合可能包含过时、嘈杂或相互矛盾的证据。现有的对比解码方法主要聚焦于解决模型内部记忆与检索上下文之间的冲突。相比之下,我们研究了多文档RAG中上下文内部冲突这一补充问题。为评估这一场景,我们引入了DRQA,一个源自企业深度研究场景的事实冲突问答基准,其中答案基于合成的企业特定事实,这些事实设计为无法从模型内部记忆中恢复。我们进一步提出了双置信对比解码(DCCD),一种无需训练的解码方法,它结合了文档级置信度(估计文档是否足以回答问题)和词元级置信度(估计该文档是否支持下一个词元的可信预测)。DCCD利用这些双置信信号选择正负文档条件流,并根据其置信度差距缩放文档级对比项。在DRQA和标准多文档问答基准上,DCCD在全部上下文和对比解码基线中取得了最佳平均性能,在DRQA上提升最大。这些结果凸显了当检索证据内部存在冲突时,具有源感知和置信门控的解码的重要性。
查看缓存全文
缓存时间: 2026/07/02 05:37
# 双置信度对比解码用于检索增强生成 来源:https://arxiv.org/abs/2607.00570 查看PDF(https://arxiv.org/pdf/2607.00570) > **摘要:**检索增强生成(RAG)越来越要求模型根据多篇检索文档回答问题,但其中只有部分来源是相关的,而检索到的文档集合可能包含过时、混乱或矛盾的证据。现有的对比解码方法主要关注解决模型内部记忆与检索上下文之间的冲突。相比之下,我们研究了多文档RAG中一个互补的问题——上下文内部冲突。为了评估这一场景,我们引入了DRQA,一个源自企业深度研究场景的事实冲突问答基准,其中答案基于合成企业特定事实,这些事实设计为无法从模型内部记忆中恢复。我们进一步提出了双置信度对比解码(DCCD),这是一种无需训练的解码方法,结合了文档级置信度(评估一篇文档是否足以回答问题)和词元级置信度(评估该文档是否支持置信的下一词元预测)。DCCD利用这些双置信度信号选择正负文档条件流,并根据它们的置信度差值缩放文档级对比度。在DRQA和标准多文档问答基准上,DCCD在全文上下文和对比解码基线中取得了最佳平均性能,且在DRQA上提升最大。这些结果凸显了当检索到的证据内部存在冲突时,采用信源感知、置信度门控解码的重要性。 ## 提交历史 来自:Raymond Li \[查看邮箱(https://arxiv.org/show-email/352905cb/2607.00570)\] **\[v1\]**2026年7月1日周三 07:55:21 UTC(114 KB)
相似文章
从上下文感知到冲突感知:将对比解码推广到LLM中的知识冲突
该论文将对比解码推广到一种冲突感知范式,该范式在外部上下文和参数先验之间动态分配权威,提出了TriState-Bench评估协议,并引入了自适应机制路由(ARR)来解决修正与抵抗之间的不对称性。
Disco-RAG: 话语感知检索增强生成
Disco-RAG 提出了一个话语感知的检索增强生成框架,通过块内话语树和块间修辞图整合话语信号,以改进大语言模型的知识综合能力。该方法在问答和摘要生成基准测试中达到最先进的效果,无需微调。
ConflictRAG:检测并解决检索增强生成中的知识冲突
ConflictRAG是一种冲突感知的RAG框架,能够在检索文档中检测、分类并解决知识冲突,在基线方法上实现了88.7%的检测F1值和5.3–6.1%的正确率提升,同时将API成本降低了62%。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。
DynaKRAG: 多跳检索增强生成中可学习证据控制的统一框架
DynaKRAG提出了一种用于多跳检索增强生成的统一框架,该框架学习状态条件策略以选择证据操作,在HotpotQA、2Wiki和MuSiQue上优于基线。