面向Agentic RAG管道的贝叶斯不确定性传播:关于多跳问答的概念验证研究

arXiv cs.AI 论文

摘要

本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。

arXiv:2607.00972v1 公告类型:新 摘要:可信赖地部署Agentic检索增强生成(RAG)系统需要机制来估计多阶段推理管道何时可能失败。本文提出了一种不确定性感知的Agentic检索增强生成(RAG)框架,其中规划器、评估器和生成器阶段产生源自语义分歧和生成器自我评估的不确定性信号。这些信号通过贝叶斯网络(BN)传播,以估计系统级不确定性,并提供跨工作流潜在故障点的节点级指标。该方法使用GPT-3.5-Turbo和GPT-4.1-Nano在StrategyQA和HotpotQA上进行了评估,使用接收者操作特征曲线下面积(AUROC)、准确率-拒绝曲线下面积(AUARC)、期望校准误差(ECE)和Brier分数来评估区分度、选择性预测和校准。结果表明,贝叶斯传播在HotpotQA上更有效,其中不确定性在多跳推理阶段累积,而StrategyQA则暴露了由于校准不良和上游信号不可靠导致的局限性。该研究将贝叶斯不确定性传播定位为一种有前景但初步的机制,用于监控Agentic RAG系统,需要在工业领域(如海上风电(OSW)维护决策支持)进行未来验证。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:41

# 代理式RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究

来源: https://arxiv.org/html/2607.00972

11institutetext:赫尔大学, 赫尔 HU6 7RX, 英国  
11email:l\.donaldson\-2020@hull\.ac\.uk

###### 摘要

代理式检索增强生成(RAG)系统的可信部署需要能够估计多阶段推理管道何时可能失效的机制。本文提出了一种不确定性感知的代理式检索增强生成(RAG)框架,其中规划器、评估器和生成器阶段产生源自语义分歧和生成器自我评估的不确定性信号。这些信号通过贝叶斯网络(BN)进行传播,以估计系统级不确定性,并提供跨工作流潜在故障点的节点级指标。该方法在StrategyQA和HotpotQA上使用GPT-3.5-Turbo和GPT-4.1-Nano进行评估,采用受试者工作特征曲线下面积(AUROC)、准确率-拒绝曲线下面积(AUARC)、期望校准误差(ECE)和Brier分数来评估区分能力、选择性预测和校准。结果表明,贝叶斯传播在HotpotQA上更为有效,因为不确定性在多跳推理阶段累积;而StrategyQA则暴露了由于校准不佳和上游信号不可靠导致的局限性。本研究将贝叶斯不确定性传播定位为一种有前景但初步的机制,用于监控代理式RAG系统,未来需要在工业领域(如海上风电(OSW)维护决策支持)进行验证。

AI驱动的工业决策支持系统

## 1 引言

随着大型语言模型(LLM)越来越多地集成到工业工作流中,它们自动执行日常任务并提供对人类可理解的复杂数据解释的能力,有望提高广泛行业的运营效率。随着对这些系统信心的增长,它们预计将在关键业务流程中扮演越来越重要的角色。一个潜在的应用领域是海上风电(OSW)维护调度,其中涡轮机复杂性增加和风电场容量扩大,需要解释大量运行数据以支持维护规划。最近的研究已展示了基于LLM的决策支持和安全监控在该领域的潜力,同时也强调了需要可靠的运行时监控和可信任的不确定性估计[16 (https://arxiv.org/html/2607.00972#bib.bib28)]。

### 1.1 背景与动机

在专业领域采用LLM伴随着透明度、可靠性和信任方面的重大挑战。在医疗保健领域,无法检查生成建议背后的推理过程可能会影响临床决策和患者安全,而隐私考虑则使部署进一步复杂化[13 (https://arxiv.org/html/2607.00972#bib.bib5),1 (https://arxiv.org/html/2607.00972#bib.bib2)]。类似的担忧出现在金融和法律应用中,不透明的推理使监管合规和决策审计变得困难[1 (https://arxiv.org/html/2607.00972#bib.bib2),13 (https://arxiv.org/html/2607.00972#bib.bib5)]。在调度、制造和预测性维护(PdM)中,操作员通常需要可理解的解释才能信任自动决策,然而传统的黑盒模型对其输出背后的推理提供了有限的洞察[13 (https://arxiv.org/html/2607.00972#bib.bib5),20 (https://arxiv.org/html/2607.00972#bib.bib9),9 (https://arxiv.org/html/2607.00972#bib.bib10)]。

检索增强生成(RAG)部分解决了这些限制,通过将生成的响应基于检索到的知识来源,使得支持证据可以被人类操作员检查和验证[2 (https://arxiv.org/html/2607.00972#bib.bib4),3 (https://arxiv.org/html/2607.00972#bib.bib8),15 (https://arxiv.org/html/2607.00972#bib.bib29)]。混合和多智能体架构(MAA)通过将复杂任务分解给专门的智能体或结合LLM推理与领域特定模型,进一步改进了推理,产生更可解释的推理工作流[8 (https://arxiv.org/html/2607.00972#bib.bib6),19 (https://arxiv.org/html/2607.00972#bib.bib7)]。与此同时,诸如ReAct和上下文工程之类的提示范式通过外部工具使用和结构化上下文指导提高推理一致性[1 (https://arxiv.org/html/2607.00972#bib.bib2),14 (https://arxiv.org/html/2607.00972#bib.bib3)]。

尽管这些方法提高了推理质量和可解释性,但它们没有显式地模拟不确定性如何在顺序推理阶段之间传播。在多智能体RAG管道中,规划、检索或评估过程中引入的不确定性可能会影响下游决策,并最终影响最终响应的可靠性。这促使开发轻量级的不确定性传播方法,能够在整个推理工作流中监控置信度。

本文的贡献有三方面:

1.  我们提出了一种用于代理式RAG系统的轻量级不确定性感知监控架构,其中规划器、评估器和生成器智能体在多阶段推理过程中产生互补的不确定性信号。
2.  我们引入了一种基于贝叶斯网络(BN)的不确定性传播模型,该模型将节点级不确定性估计组合成可解释的系统级置信度估计,能够指示哪些阶段对系统级不确定性贡献最大。
3.  我们使用GPT-3.5-Turbo和GPT-4.1-Nano在StrategyQA和HotpotQA多跳问答基准上进行了概念验证实证评估,展示了贝叶斯不确定性传播在多个不确定性评估指标上的优势和局限性,包括受试者工作特征曲线下面积(AUROC)、准确率-拒绝曲线下面积(AUARC)、期望校准误差(ECE)和Brier分数。

## 2 不确定性量化方法论

代理式RAG系统作为顺序决策过程运行,可以建模为部分可观测马尔可夫决策过程(POMDP)[12 (https://arxiv.org/html/2607.00972#bib.bib19)]。由于每个阶段依赖于先前的决策,规划、检索或评估过程中引入的不确定性可能会在工作流中传播,导致级联错误和语义漂移。因此,需要可靠的不确定性量化来监控多阶段推理过程中的置信度。

### 2.1 词元级熵

也称为朴素熵,它表示LLM在文本生成过程中单个词片或字符级别的不确定性[5 (https://arxiv.org/html/2607.00972#bib.bib20)]。在自回归模型中,这种不确定性来自于模型词汇表中所有可能下一个词元的softmax概率分布。给定输入xx和模型参数θ\\theta,输出yy的预测分布可以写为pθ\(y\|x\)p\_\{\\theta\}\(y\|x\),对于长度为LL的生成输出序列y=\(z1,...,zL\)y=\(z\_\{1\},\.\.\.,z\_\{L\}\),概率可以分解为条件词元概率:

pθ\(y∣x\)=∏t=1Lpθ\(zt∣z<t,x\)p\_\{\\theta\}\(y \\mid x\)=\\prod\_\{t=1\}^\{L\} p\_\{\\theta\}\\left(z\_\{t\} \\mid z\_\{<t\}, x\\right)

词元级熵通过对序列长度进行归一化来计算:

Htoken\(y∣x\)=−1L∑t=1Llogpθ\(zt∣z<t,x\)H\_\{\\text \{token\}\}\(y \\mid x\)=-\\frac\{1\}\{L\} \\sum\_\{t=1\}^\{L\} \\log p\_\{\\theta\}\\left(z\_\{t\} \\mid z\_\{<t\}, x\\right)

### 2.2 语义熵

语义熵通过对语义等价生成的聚类来估计模型的不确定性[3 (https://arxiv.org/html/2607.00972#bib.bib8),5 (https://arxiv.org/html/2607.00972#bib.bib20)]。对于模型参数的固定集,通过对多个输出序列进行自举抽样,并通过基于双向熵的近似来估计语义熵。语义熵HsemH\_\{\\text \{sem\}\}的计算方法为:生成NN个样本并通过自然语言推理(NLI)评估它们之间的语义等价性。如果两个样本在统计上是可互换的,它们被分配到同一个语义等价类中,不确定性度量估计为:

Hsem\(y∣x\)=−∑cp\(c\|x\)logp\(c\|x\)H\_\{\\text \{sem\}\}(y \\mid x)=-\\sum\_\{c\} p(c \\mid x) \\log p(c \\mid x)

其中p\(c\|x\)p(c \\mid x)是输出样本属于语义类cc的近似概率。对于不确定性传播,语义熵在代理式RAG管道的规划器和评估器节点上实现,用于监控检索计划的变化和评估摘要的不确定性。

### 2.3 P(True)

P(True)是一种LLM不确定性估计技术,它通过提示模型自评估其生成回答的正确性来工作。这通常以是/否问题的形式呈现,例如"您对上述回答正确的置信度如何?"或"上述回答是否准确?"对于代理式RAG管道,P(True)被作为P(True)表示生成器对自己的回答是正确的置信度的衡量标准。与词元级熵和语义熵不同,P(True)是直接通过模型的内部置信度推断产生的,因此是一种比基于概率的熵估计更直接的不确定性度量,但存在固有校准问题[10 (https://arxiv.org/html/2607.00972#bib.bib22),18 (https://arxiv.org/html/2607.00972#bib.bib27)]。

### 2.4 代理式RAG管道

图1 (https://arxiv.org/html/2607.00972#S2.F1 "图1   代理式RAG不确定性传播工作流:多步骤推理管道,规划、检索、评估后,三个不确定性信号(语义熵、语义熵、P(True))馈入贝叶斯网络,产生最终输出和系统级不确定性。") 说明了所提出的不确定性传播工作流。初始查询被传递给规划器智能体,该智能体使用语义熵Hsem\(Plan\)H\_\{\\text \{sem\}\}(\\text \{Plan\})生成检索计划,然后将该计划转发给检索器。然后,评估器智能体检查每个检索结果的语义熵Hsem\(Eval\)H\_\{\\text \{sem\}\}(\\text \{Eval\})。最后,生成器智能体产生最终输出并输出P(True)自评估不确定性估计。在此示例中,规划器产生的不确定性最高,将系统级贝叶斯网络后验推向高不确定性区域,从而提醒人类操作员输出可能不可靠。

### 2.5 贝叶斯网络不确定性传播

采用朴素贝叶斯网络来组合代理式RAG管道的各个节点产生的不确定性信号。将规划器、评估器和生成器节点的概率被建模为二元变量,确定性OR门建模为:如果任何节点指示失败的可能性很高(即不确定性高),则系统整体失败的概率很高。这产生了一个保守的不确定性估计,对于维护调度等安全关键应用是合适的,在这些应用中低估不确定性可能比高估更有害。

节点级别的不确定性通过将连续的不确定性分数转换为概率来获得:根据不确定性分数相对于训练期间观察到的中位数的位置,节点状态被分配为高不确定性(P(Failure) = 0.95)或低不确定性(P(Failure) = 0.05)。这些概率输入到确定性OR门,产生系统级失败概率,该概率对任何单个节点的高不确定性信号敏感。

## 3 实验设置

### 3.1 基准

使用两个多跳问答基准:StrategyQA和HotpotQA。StrategyQA需要是/否答案,需要策略性推理,通常需要多个推理步骤才能到达结论。HotpotQA需要提取性答案,通常需要结合来自多个维基百科文档的信息。使用文档检索器,在每个基准中从相关的维基百科语料库中检索每个问题最相关的前20个文档。

### 3.2 提示策略

每个管道节点使用特定提示来模拟其角色。规划器提示:"给定问题,提出一个搜索查询来查找答案。只提供搜索查询。" 评估器提示:"给定问题和候选答案,评估该答案是否正确。输出'是'或'否'。" 生成器提示:"根据提供的上下文回答问题。" 对于P(True)生成,附加提示:"您对上述回答正确的置信度如何?输出一个介于0和1之间的数字。" 未进行系统提示工程,因为本研究旨在评估不确定性传播,而不是最大化性能。

### 3.3 模型

使用OpenAI的GPT-3.5-Turbo和GPT-4.1-Nano。这些模型代表了不同的能力和成本效率水平:GPT-4.1-Nano以更低的推理成本提供改进的性能,使其适合可扩展的工业部署,而GPT-3.5-Turbo作为基线。模型通过标准的聊天完成API调用。

### 3.4 评估指标

使用四个评估指标:AUROC、AUARC、ECE和Brier分数。AUROC通过在所有阈值下绘制真正例率与假正例率来评估区分能力。AUARC评估选择性预测性能,衡量模型在拒绝一定比例低置信度预测时的性能改进。ECE通过将预测概率分箱并计算平均预测概率与观测频率之间的绝对差来量化校准。Brier分数测量预测概率与真实结果之间的均方误差。

### 3.5 不确定性传播与基准

使用所提出的贝叶斯网络(Overall BN)来组合来自三个节点的信号:规划器的Hsem、评估器的Hsem和生成器的P(True)。将这些组合的系统级后验概率与每个单独的管道节点进行比较。此外,还使用一个基线不确定性传播方法(UProp),该方法计算节点概率的加权平均值,权重为各节点在基准评估上的归一化AUROC分数,以提供一种非贝叶斯组合方法进行比较。

### 3.6 实现细节

对于每个基准,使用包含100个样本的代表性子集进行评估。对于语义熵估计,每个节点生成10个样本,使用基于NLI的聚类。P(True)自评估信号通过单一提示获得。在比较分析中,AUROC和AUARC值通过对每个分数阈值的失败预测与真实失败标签进行评估来计算。ECE使用10个等宽分箱计算。

## 3.7 结果

表1:AUROC结果,跨基准、每节点和BN后验(Overall)。值>0.5表示优于随机区分。

| 节点 | StrategyQA GPT-3.5 | StrategyQA GPT-4.1-Nano | HotpotQA GPT-3.5 | HotpotQA GPT-4.1-Nano |
| --- | --- | --- | --- | --- |
| Planner Hsem | 0.501 | 0.548 | 0.588 | 0.599 |
| Evaluator Hsem | 0.497 | 0.526 | 0.564 | 0.572 |
| Generator P(True) | 0.746 | 0.767 | 0.702 | 0.723 |
| Overall BN | 0.721 | 0.786 | 0.704 | 0.792 |
| UProp Baseline | 0.745 | 0.772 | 0.706 | 0.785 |

如表2所示,AUROC结果显示了两个基准上的对比行为。在StrategyQA上,生成器提供最强的单个不确定性信号,而规划器和评估器接近随机,限制了贝叶斯不确定性传播的有效性。因此,对于GPT-3.5-Turbo,Overall BN仍低于UProp基线,尽管对于GPT-4.1-Nano它超过了基线。相比之下,在HotpotQA上所有节点都达到高于随机的区分能力,Overall BN与UProp具有竞争力,对于GPT-4.1-Nano超过基线,而对于GPT-3.5-Turbo仅略低于基线。这些结果表明,当不确定性在多个推理阶段累积时,贝叶斯不确定性传播最有效。

表3:跨基准的AUARC结果。值越高表示在选择性预测下准确率提升越大。粗体表示每行最高AUARC值。

| 节点 | StrategyQA GPT-3.5 | StrategyQA GPT-4.1-Nano | HotpotQA GPT-3.5 | HotpotQA GPT-4.1-Nano |
| --- | --- | --- | --- | --- |
| Planner Hsem | 0.015 | 0.009 | 0.026 | 0.033 |
| Evaluator Hsem | 0.012 | 0.011 | 0.019 | 0.021 |
| Generator P(True) | 0.128 | 0.169 | 0.046 | 0.067 |
| Overall BN | 0.124 | 0.203 | 0.052 | 0.079 |
| UProp Baseline | 0.130 | 0.172 | 0.048 | 0.070 |

表3中呈现的AUARC结果补充了AUROC分析,评估了选择性预测性能。在StrategyQA上,生成器提供最强的单个不确定性估计,表明在较简单的基准上P(True)自评估对于有效的选择性预测是足够的。相比之下,Overall BN在HotpotQA上实现了最高的AUARC,表明随着推理复杂性的增加,结合多个管道阶段的不确定性变得越来越有益。尽管在HotpotQA上AUROC有所提高,但AUARC下降,这很可能反映了该基准的基线准确率明显更低,说明区分质量和选择性预测效用捕捉了不确定性估计的不同方面。

表4:跨基准、每节点和BN后验(Overall)的ECE。值越低表示校准越好。粗体表示每行最佳ECE分数。

| 节点 | StrategyQA GPT-3.5 | StrategyQA GPT-4.1-Nano | HotpotQA GPT-3.5 | HotpotQA GPT-4.1-Nano |
| --- | --- | --- | --- | --- |
| Planner Hsem | 0.213 | 0.271 | 0.297 | 0.284 |
| Evaluator Hsem | 0.208 | 0.217 | 0.276 | 0.239 |
| Generator P(True) | 0.132 | 0.054 | 0.081 | 0.063 |
| Overall BN | 0.310 | 0.339 | 0.094 | 0.127 |
| UProp Baseline | 0.090 | 0.040 | 0.081 | 0.066 |

表4中呈现的ECE结果表明校准高度依赖于基准。在StrategyQA上,Overall BN明显高估了失败概率,表明即使模型回答正确,确定性OR门也传播了保守的不确定性估计。相比之下,在HotpotQA上校准显著改善,其中更高的任务难度与BN的不确定性估计更紧密地对齐。在HotpotQA上,生成器仍然是最强的单个不确定性信号,尽管其校准弱于StrategyQA上的规划器和评估器。评估器节点本身的校准在不同基准上不一致,这强化了生成器节点的不确定性信号在识别失败方面是最可靠的来源,尽管在绝对意义上尚未校准。

表5:跨基准、每节点和BN后验(Overall)的Brier分数。值越低表示概率准确性越好。随机基线为0.25;低于此值表示优于随机校准。粗体表示每行最佳Brier分数。

| 节点 | StrategyQA GPT-3.5 | StrategyQA GPT-4.1-Nano | HotpotQA GPT-3.5 | HotpotQA GPT-4.1-Nano |
| --- | --- | --- | --- | --- |
| Planner Hsem | 0.249 | 0.247 | 0.244 | 0.240 |
| Evaluator Hsem | 0.251 | 0.248 | 0.246 | 0.242 |
| Generator P(True) | 0.136 | 0.095 | 0.204 | 0.182 |
| Overall BN | 0.259 | 0.276 | 0.058 | 0.089 |
| UProp Baseline | 0.058 | 0.042 | 0.196 | 0.171 |

表5中呈现的Brier分数结果强化了ECE分析中观察到的校准趋势。StrategyQA表现出较差的概率校准,反映了预测失败概率与观测失败概率之间的系统性不匹配。相比之下,Overall BN在HotpotQA上实现了显著改善的Brier分数,表明随着任务复杂性的增加,其概率估计变得更加准确。总体而言,ECE和Brier分数结果表明,当底层不确定性更好地反映推理任务的真实难度时,所提出的贝叶斯不确定性传播框架产生校准更好的置信度估计。

## 4 评估

### 4.1 贝叶斯网络是否比单个节点更有价值?

评估表明,贝叶斯不确定性传播的益处取决于所组合的不确定性信号的可靠性。在HotpotQA上,Overall BN始终优于单个管道节点,表明在多个推理阶段传播不确定性提供了额外的预测价值。相比之下,StrategyQA由生成器不确定性信号主导,表明传播较弱的规划器和评估器信号会降低整体性能,并且在较简单的查询上,单独使用生成器节点的P(True)自评估技术就足以预测不确定性。这种行为突显了确定性OR门的一个局限性,即它平等地对待所有不确定性信号,无法降低不可靠上游节点的权重。

### 4.2 任务复杂性是否影响不确定性传播?

结果表明任务复杂性对贝叶斯不确定性传播的有效性有显著影响。与StrategyQA相比,HotpotQA表现出更强的区分和校准性能,表明当推理需要多个检索和推理阶段时,不确定性估计变得更有信息量。尽管在HotpotQA上选择性预测性能下降,但这很可能是该基准的基线准确率显著较低的结果,而不是不确定性估计较差。总体而言,这些发现表明当不确定性在多步骤推理过程中累积时,不确定性传播提供最大的益处。

### 4.3 校准与区分之间的权衡

实验展示了依赖于任务难度的校准与区分之间的明确权衡。虽然BN在HotpotQA上提供了更强的校准,但StrategyQA暴露了其高估失败概率的倾向,反映了确定性OR门引入的保守行为。这种保守性对于较简单任务上校准良好的概率估计是不理想的,但在安全关键环境中可能是有利的,因为未能识别出不正确的响应通常比发出不必要的警告代价更高。因此,尽管当前框架对于通用应用需要改进校准,但其风险规避行为可能非常适合诸如OSW维护调度等工业决策支持领域。

### 4.4 局限性

存在三个主要局限性制约了当前结果的泛化性。首先是确定性OR门无法适应基准特定的节点可靠性。如表2所示,规划器和评估器节点在StrategyQA上显示出低于随机的AUROC分数,但在OR门中与生成器权重相同,在Overall后验中引入噪声,并在该基准上导致了低于UProp的AUROC值(GPT-4.1-Nano的Overall AUROC除外)。具有学习抑制参数的噪声OR参数化将通过降低经验上不可靠的节点信号的权重来解决这个问题。这是现有框架内最有效的架构改进。

其次,P(True)自评估信号表现出系统性的保守性,因为生成器在广泛的答案上分配了高不确定性分数。这在StrategyQA上产生了强的AUROC但差的Brier分数。使用诸如在保留验证集上拟合等渗回归或Platt缩放的后校准方法,将允许将区分质量与校准质量解耦。预计这将显著改善StrategyQA上的Brier分数,而不会降低AUROC分数。

第三个局限性是,本研究中两个基准使用的维基百科检索环境与OSW维护调度应用中使用的知识库不同。不确定性信号在领域特定设置中会表现不同,当前结果应被解释为在公开可用的多跳基准上的概念验证,而不是在目标工业领域中性能的直接验证。

## 5 结论

本文提出了一种轻量级的不确定性感知代理式RAG框架,其中通过词元级熵、语义熵和P(True)自评估在每个节点独立性估计不确定性,并使用贝叶斯网络传播以提供系统级置信度估计。在StrategyQA和HotpotQA上的概念验证评估显示,贝叶斯不确定性传播在多个推理阶段累积的不确定性提供信息量方面最为有效。然而,确定性OR门在组合不可靠节点信号时引入了保守性,突出了通过学习的噪声OR参数化进行自适应加权的重要性。在较简单的任务上,单独的P(True)自评估信号足以提供强区分,而贝叶斯传播则增加了有限的价值。尽管存在这些限制,所提出的框架在监控代理式RAG系统方面显示了前景,提供了一种轻量级机制来估计工作流中的系统级和节点级不确定性。未来的工作应通过使用学习的节点权重、后校准技术和领域特定知识基础进行实证验证来扩展这些结果,特别是在诸如海上风电维护等工业决策支持系统中。

相似文章

从投票到智能体协作:面向答案类型的BioASQ 14b大语言模型流水线

arXiv cs.CL

本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。