幻觉雪球效应:多智能体LLM流水线中错误传播的状态转换建模

arXiv cs.AI 论文

摘要

本文将多智能体LLM流水线中的幻觉传播建模为马尔可夫过程,表明错误在各个阶段变得越来越难以检测,并提出早期验证以降低存活率。

arXiv:2608.14588v1 公告类型:新 摘要:顺序多智能体LLM流水线在交接时未进行验证就链接专门化智能体,造成了具有可衡量严重后果的结构性缺陷。我们表明,在阶段1注入的幻觉不仅仅是持续存在;它们会转变:原始数字事实变为派生计算,然后变为叙述性文本,再变为编辑批准的结论。在每次转变中,可检测性几乎不可逆地下降。我们将其形式化为幻觉雪球效应,这是一个基于四个状态(原始事实 $\to$ 派生 $\to$ 叙述 $\to$ 不可见)的一阶马尔可夫过程,通过经验测量的每个边界逃逸概率分别为24.6%、48.3%和89.3%。在FinanceBench上对一个4智能体金融分析流水线注入的346个幻觉进行测试,GPT-4o的检测率从阶段1的72.0%下降到阶段4的50.9%,23.7%的幻觉在最终输出中完全未被检测。即使是最强的测试模型(Qwen3.5-397B-A17B,阶段1检测率87.0%)也面临结构性上限;投影的阶段4检测率仅为${\sim}$60--65%。关键的是,使用相同RAG验证工具的边界门控将幻觉存活率从58.4%降低到16.2%,相比之下流水线末端检查(Cohen's $h = -0.911$, $p < 0.000001$),而仅进行末端检查仅比不验证提高2.3个百分点。验证时机比是否验证更为重要。我们的模型预测了n智能体线性流水线的存活率,并规定了最优验证资源分配:首先在$S_1{\to}S_2$处投资,其中75.4%的幻觉仍可捕获,而不是在$S_3{\to}S_4$处,那里89.3%已经逃逸。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:50

# 在多智能体LLM流水线中将错误传播建模为状态转换
来源:https://arxiv.org/html/2608.14588

## 幻觉雪崩:在多智能体LLM流水线中将错误传播建模为状态转换

###### 摘要

顺序多智能体LLM流水线在交接时链式连接专业智能体而无验证,造成了一个可测量且后果严重的结构性缺陷。我们发现,在阶段1注入的幻觉不会简单地持续存在;它们会发生转化:原始数值事实变为派生计算,再变为叙述性文字,最后成为经编辑认可的结论。在每次转化中,可检测性几乎不可逆地下降。我们将此形式化为幻觉雪崩效应,这是一个关于四个状态(原始事实→派生计算→叙述文字→不可见)的一阶马尔可夫过程,其实测各边界逃逸概率分别为24.6%、48.3%和89.3%。在FinanceBench的四智能体财务分析流水线中,跨346个自动注入的幻觉,gpt-4o的检测率从阶段1的72.0%下降至阶段4的50.9%,且有23.7%的幻觉在最终输出中完全未被检测到。即使是测试过的最强模型(Qwen3.5-397B-A17B,阶段1为87.0%)也面临结构性上限;预计阶段4的检测率仅约为60–65%。关键的是,使用相同RAG验证工具的边界门控将幻觉存活率从58.4%降低至16.2%,相比流水线末端检查(Cohen's h = -0.911, p < 0.000001)效果显著,而仅在末端检查相比无验证仅改善2.3个百分点。验证的时机比是否验证更为重要。我们的模型预测了n智能体线性流水线的存活率,并规定了最优验证资源分配:首先在S1→S2处投入,此处仍有75.4%的幻觉可被捕捉,而非在S3→S4处,那里89.3%的幻觉已逃逸。

多智能体LLM流水线,幻觉传播,错误复合,智能体AI可靠性,检索增强验证,马尔可夫错误模型,流水线验证,事实一致性

## 1 引言

多智能体LLM流水线已成为复杂、高风险AI任务的主导架构。LangGraph(LangChain AI,2024)、AutoGen(Wu et al.,2023)和CrewAI(CrewAI Inc.,2024)等框架使得按顺序链接专业智能体变得轻而易举:研究员→分析师→作家→审核员。每个智能体仅接收其前驱的文本输出,无溯源元数据、无置信度分数、也无权访问源文档。每个智能体完全信任其前驱。这一架构选择具有可测量且惊人严重的后果。

考虑在阶段1引入的幻觉:“销售成本为712亿美元”(真实值:631亿美元)。到阶段2,分析师计算出“同比增长8.3%”,这是一个基于虚构基数的派生主张。在阶段3,作家生成“波音面临重大成本阻力,销售成本增长8.3%至712亿美元,反映出供应链中断。”在阶段4,审核员认可其为“结构良好、推理合理的分析”,因为它未被提供源文档,只能检查内部一致性。幻觉已被彻底“洗白”。

先前工作将幻觉缓解视为寻找更好的检测器。我们证明对于顺序多智能体系统,这种框架根本不完整。gpt-4o的检测率从阶段1的72.0%下降至阶段4的50.9%,无论检测器复杂度如何,均衰减21.1个百分点。流水线末端验证相比无验证仅改善2.3个百分点(存活率从60.7%至58.4%),因为验证原始主张所需的信息已被上游转化在结构上破坏。正确的框架是传播控制,而非检测。

我们提出了三个实验和一个理论模型。†††代码和结果见https://github.com/prabhjotschugh/hallucination-snowball。第3.2节测量了跨阶段的可检测性衰减。第3.3节表征了LLM怀疑性的结构上限。第3.4节证明了边界门控将存活率从58.4%降低至16.2%,相比末端检查改善42.2个百分点(Cohen's h = -0.911, p < 0.000001),内部一致性质量成本从4.44降至3.93。第4节将传播形式化为具有实测转移概率的马尔可夫过程,并规定了最优门控部署位置。图1展示了四个状态及其经验测量的逃逸概率。尽管我们在财务分析中演示了这一点(因其具有明确的数值基准事实),但转化机制是领域无关的:任何可核查事实能转化为自信叙述的流水线都面临相同的动态。链接提取和综合的医学摘要流水线、链接判例检索和案情摘要撰写的法律审查流水线,以及链接文献搜索和报告生成的研究自动化流水线,都存在相同的结构性缺陷。我们提供的测量基础设施和门控架构在结构上适用于所有这些领域,但特定领域的逃逸率需要在数字金融设置之外进行校准。

![图1](caption) 图1:幻觉传播的四状态马尔可夫过程。逃逸概率从24.6%上升至89.3%;在S3→S4处,近90%的幻觉在结构上无法被任何下游门控恢复。
## 2 背景与相关工作

### 2.1 单智能体幻觉检测

主流范式将幻觉视为孤立模型输出的属性。FActScore(Min et al.,2023)将生成内容分解为原子主张,并针对知识源进行验证。CoVe(Dhuliawala et al.,2024)使用自我验证链,模型检查自身输出。VeriScore(Song et al.,2024)将其扩展到长篇生成。SAFE(Wei et al.,2024)使用搜索增强的事实评估。所有这些都仅在我们称为S1的层面运作:在孤立中评估单个输出。没有模型考虑当一个智能体的幻觉输出成为下一个智能体的输入时会发生什么。我们的工作表明,在S1处可检测率为72.0%的幻觉,在三次转化后仅可被捕捉50.9%,使得单智能体评估对于顺序流水线来说框架不足。

### 2.2 多智能体辩论与协作

Du et al.(2024)表明多个LLM就同一问题进行辩论可提高推理能力。MAD(Liang et al.,2024)将其扩展到结构化对抗辩论。关键的是,两者都使用并行拓扑,所有智能体同时共享相同的事实基础。顺序传播——每个智能体仅看到前一个智能体的转化输出——在这一系列工作中结构性缺失。我们的故障模式是正交的,涉及通过LangGraph、AutoGen和CrewAI在生产中实际部署的架构。

### 2.3 多智能体系统中的信任与安全

TrustAgent(Hua et al.,2024)和关于流氓智能体(Yang et al.,2024)的工作研究多智能体环境中恶意智能体的蓄意对抗性操纵。我们的故障模式在本质上不同:它不需要对抗者。完全善意的智能体忠实地遵循指令会产生幻觉雪崩,因为架构在交接时没有提供纠错机制。这使得雪崩比对抗性威胁更普遍,因为后者需要恶意意图。

### 2.4 RAG与检索增强验证

Lewis et al.(2021)引入了检索增强生成,将LLM输出基于外部文档。后续工作(Gao et al.,2024)已将RAG扩展到多种场景。我们的边界门控受此系列工作启发,但部署在根本不同的层面:不是在生成前增强生成,而是在下一个智能体处理之前,在交接点验证智能体输出。关键的是,我们的门控是确定性数值匹配器(零LLM调用),而非检索系统;我们保留“RAG”标签仅是为了表明其基于事实的意图,而非机制。其部署原则——在交接时验证,而非在生成前验证——是新颖的。

### 2.5 并行与互补工作

AgentHallu(Liu et al.,2026)独立证实早期阶段错误主导下游故障;它事后诊断哪个智能体导致了幻觉,而我们测量可检测性在跨转化中如何衰减,并在转化发生前进行干预。VERIMAP(Xu et al.,2026)在DAG结构化工作流中实现了每子任务验证;我们的马尔可夫模型为门控在此类框架中何处产生最高回报提供了数据驱动的指导。CaveAgent(Ran et al.,2026)通过完全避免有损文本来减少“洗白”,这是一种以架构灵活性换取可验证性的正交缓解方式。比较边界门控与结构化交接基线仍然是一个重要的开放问题。

### 2.6 我们填补的空白

先前没有工作提供跨顺序智能体幻觉转化的数学框架,没有测量流水线中可检测性衰减最剧烈的位置,也没有通过实证证明验证时机比验证工具更重要。FMAI研讨会呼吁追踪级诊断和关于什么有效什么无效的明确证据。先前的工作两者皆无。我们解决了所有这三个问题。

## 3 实验

### 3.1 设置与注入协议

#### 流水线。

我们在LangGraph中实现了一个4智能体顺序流水线:

研究员→分析师→作家→审核员\\text{研究员}\\to\\text{分析师}\\to\\text{作家}\\to\\text{审核员}
所有智能体使用gpt-4o-mini(temperature=0.3)并配有特定角色的系统提示。研究员从SEC文件中提取精确数字。分析师仅使用研究员输出计算同比增长和比率。作家生成300-500字的专业叙述。审核员仅执行内部一致性检查,无权访问源文档。

#### 数据集。

我们在FinanceBench(Islam et al.,2023)上评估,这是150对来自真实SEC文件的专家注释财务QA对,具有精确的数值基准事实。我们排除了10个产生无注入数值的定性输出的问题,得到140个可用问题。所有问题通过gpt-4o-mini转换为复杂的多部分分析指令,以反映现实的流水线输入。

#### 注入协议。

我们使用基于确定性正则表达式和固定种子(RANDOM\_SEED=42)的扰动,在140个问题中自动注入346个幻觉(每个问题2-3个)。美元金额和较大数字乘以15-40%进行偏移;百分比加上3-12个百分点的加性偏移。注入发生在阶段1之后立即,任何下游智能体之前,迫使幻觉通过整个转化链传播。所有注入都记录有完整的元数据,支持精确复制。

#### 检测工具。

我们使用两个工具独立应用于四个阶段的输出。**gpt-4o法官**:一位无法获取基准事实的取证财务审计师,被指示仅通过内部推理标记可疑主张。**检索检查器**:一个完全确定性的数值匹配器(零LLM调用),将智能体输出与FinanceBench基准事实、证据字符串以及注入前研究员输出进行比较,容差为1%(比实验3中RAG门控使用的2%容差更严格,后者可容纳智能体引入的数值重新格式化,如将71.2B美元四舍五入为71B美元)。检索检查器代表理论检测上限;gpt-4o法官代表现实部署场景。

### 3.2 实验一:跨阶段的可检测性衰减

我们独立评估两个检测工具在所有四个流水线阶段的所有346个注入幻觉上的表现(表1)。

表1:各阶段检测率。衰减测量S1→S4。gpt-4o检测率从阶段1到阶段4下降了21.1个百分点。关键的是,82/346个幻觉(23.7%)在最终输出中完全未被任一工具检测到。零幻觉遵循全部未检测轨迹:每个注入的幻觉在阶段1都可被检测到。是流水线,而非幻觉本身,导致了不可见性。图2可视化了所有三种检测方法的可检测性衰减。

![图2](caption) 图2:幻觉可检测性在所有三种检测方法中单调衰减(n=346)。每个幻觉在S1处都可被检测;gpt-4o法官到S4下降了21.1个百分点,证实是流水线而非幻觉本身导致不可见性。
衰减集中于边界,而非均匀。最大降幅发生在S1→S2(gpt-4o:-11.6个百分点;检索:-18.8个百分点),原始数值事实变为需要逆计算验证的派生计算。第二个显著降幅发生在S2→S3(-7.2个百分点;-8.1个百分点),数字成为嵌入因果关系的叙述。S3→S4边界基本无效(-2.3个百分点;+2.1个百分点):审核员是编辑性的,而非转化性的。“洗白”发生在上游,而非在最终门控处。轨迹分析证实了系统性行为:10.7%的幻觉遵循✓→×→×→×(阶段1可检测,随后永久丢失),9.0%遵循✓→✓→×→×,合计占所有案例的23.4%(见附录A)。

### 3.3 实验二:LLM怀疑性的能力上限

我们测试一个足够强大的模型是否能克服结构检测上限(表2)。四个最先进的模型在阶段1(幻觉

相似文章

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。