超越最终答案:多智能体工业工作流中轨迹级幻觉的审计

arXiv cs.AI 论文

摘要

本文介绍了Trajel,一个用于审计多智能体工业工作流中轨迹级幻觉的数据集和评估框架,提出了五种幻觉分类法,并表明轨迹感知检测显著优于标准的后验验证。

arXiv:2605.24219v1 Announce Type: new 摘要:大语言模型(LLMs)正越来越多地被部署为自主智能体,能够进行推理、使用工具并执行多步操作。然而,大多数幻觉基准仍然只评估最终输出,忽略了源自中间思维-行动-观察步骤的错误。我们提出了Trajel,一个用于审计多智能体工业工作流中轨迹级幻觉的数据集和评估框架。Trajel引入了基于从AssetOpsBench中专家标注的智能体轨迹的五种幻觉分类法(事实性、指代性、逻辑性、过程性和范围性)。我们在子任务、轨迹和长上下文层面评估了监督检测模型。我们的结果表明,现有基准未能捕捉到最常见的故障模式,近一半的幻觉轨迹同时涉及多种类型,而具有高二元准确率的自动化检测器仍然对最微妙的类型分类错误。轨迹感知检测显著优于标准的后验验证,这使得基于分类法的评估对于更安全的智能体部署变得必要。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:06

# 超越最终答案:在多智能体工业工作流中审计轨迹层级的幻觉

来源:https://arxiv.org/html/2605.24219
Harshada Badave¹  Andrea Gomez²  Harshitha Narahari²  Sara Carter²  Vishwa Bhatt²  Aishani Rachakonda²  Santosh Borse¹  Shuxin Lin¹  Dhaval Patel¹  
¹IBM  ²哥伦比亚大学

###### 摘要

大型语言模型(LLMs)越来越多地被部署为能够推理、使用工具并在多步骤中自主行动的智能体。然而,大多数幻觉基准测试仍然只评估最终输出,忽略了源于中间"思考-行动-观察"步骤的失败。我们提出Trajel,这是一个用于审计多智能体工业工作流中轨迹层级幻觉的数据集和评估框架。Trajel引入了一个包含五种类型的幻觉分类体系(事实性、指代性、逻辑性、程序性和范围性),这些分类建立在来自AssetOpsBench的专家标注的智能体轨迹之上。我们在子任务、轨迹和长上下文级别基准测试了监督检测模型。我们的结果表明,最常见的失败模式被现有基准测试所遗漏,近一半的幻觉轨迹同时涉及多种类型,并且具有高二元精度的自动检测器仍然会错误分类最微妙的类型。轨迹感知检测显著优于标准的后验验证,这使得基于分类体系的评估对于更安全的智能体部署变得必要。

## 1 引言

从静态大型语言模型(LLMs)向自主智能体系统的转变代表了人工智能的一个基本前沿。在数据中心监控和基础设施维护等高风险的工业领域,智能体已不仅仅是文本生成器;它们是负责解析多模态信号、遵循严格程序并在类似*AssetOpsBench*[8 (https://arxiv.org/html/2605.24219#bib.bib1)]的多智能体框架中进行协调的决策实体。然而,随着这些系统获得自主性,它们也继承了一种更复杂、更危险的失败模式:**轨迹层级幻觉**。在智能体语境中,幻觉不仅仅是单个响应中的事实捏造;它是一种偏离证据的结构性偏差,会通过顺序的、工具介导的轨迹传播,常常导致级联的操作失败。

尽管这些系统至关重要,但AI评估的科学在很大程度上仍然局限于静态基准测试。当前的幻觉评估机制通常关注像摘要或问答这样的"一次性"任务,将每个实例视为孤立的输入-输出对。这种范式未能捕捉到智能体循环中的**时间**和**交互**动态。在一个涉及思考、行动和观察循环的多步骤工作流中,幻觉可能表现为程序跳过、对前一步骤实体的错误引用,或违反安全约束的超范围行动。此外,在交互循环中,幻觉的定义仍然非常模糊,常常与逻辑错误或工具执行失败混为一谈。这种粒度上的缺失使得几乎无法诊断系统失败是因为它误解了环境,还是因为它创造了一个不存在的状态。

为了提升智能体的可靠性,必须将幻觉置于评估生命周期的中心。经验证据表明,最先进模型之间的幻觉率差异巨大,揭示了不同架构在长时间跨度内维持基础事实的能力存在差异。为了弥合这一差距,我们引入了**Trajel**基准测试,这是一个专为在AssetOpsBench基础上对智能体轨迹进行严格再现、审计和压力测试而设计的框架。我们的方法超越了后验验证,对智能体轨迹进行精准分析,旨在解决一个根本性问题:*偏差从轨迹的何处开始?*

我们构建了一个高保真度的标注轨迹数据集,通过结合**LLM作为评判者**的细化方法和**盲审人工评审**来减少评估偏差。这些数据随后被用于基准测试Trajel ML建模框架,探索如何利用子任务级、轨迹级和长上下文建模来构建贯穿AI生命周期的稳健评估声明。

参见图注  
图1:Trajel框架概览

对NeurIPS数据集和基准测试方向的贡献:

- • **轨迹感知幻觉分类体系**。定义了五种幻觉类型(事实性、指代性、逻辑性、程序性、范围性),作为对思考、行动、观察轨迹的结构性谓词,将基础事实失败与推理错误和控制流违例区分开来。48.7%的幻觉轨迹同时表现出多种类型,证实了多标签表述的必要性。
- • **Trajel数据集**。来自6个模型和42个工业AssetOps任务的225个专家标注的智能体轨迹,在子任务和轨迹级别进行了标注。每个轨迹由LLM作为评判者和来自两个机构的盲审人工评审员独立评估,产生68.3%的人工识别幻觉率,以及自动与人工判断之间0.456的Cohen's κ系数。标注包括幻觉类型、在轨迹内的定位以及评审员的自由文本理由。
- • **Trajel ML建模框架**。基准测试了三种监督检测范式(基于BERT的子任务级分类、基于NLI的轨迹级分类以及基于Longformer的长上下文建模),每种范式均由特定幻觉类型的上下文需求驱动。
- • **执行信号的经验验证**。首次系统研究了哪些执行质量信号(任务完成度、数据检索准确性、结果验证、智能体序列正确性和推理清晰度)最可靠地预测了下游操作失败之前的幻觉。各模型的幻觉率从52.4%到81.0%不等,程序性幻觉占识别出失败的38.5%,清晰度与合理性信号作为单变量预测器达到了AUC = 0.908,优于所有训练的分类器。

这些工具、数据集和框架旨在改变评估声明的解读方式,推动高风险行业中更安全的智能体部署。

## 2 相关工作

ReAct[10 (https://arxiv.org/html/2605.24219#bib.bib3)]将推理和行动交织以暴露中间轨迹,而AgentBench[7 (https://arxiv.org/html/2605.24219#bib.bib4)]显示LLM性能在长时间跨度的任务中急剧下降。虽然AgentBench报告了规模扩展带来的收益,但MIRAGE[4 (https://arxiv.org/html/2605.24219#bib.bib9)]和TruthfulQA[6 (https://arxiv.org/html/2605.24219#bib.bib12)]表明,在复杂推理下,仅靠规模扩展并不能消除幻觉。WebArena[14 (https://arxiv.org/html/2605.24219#bib.bib10)]和HotpotQA[9 (https://arxiv.org/html/2605.24219#bib.bib11)]提供了人工标注的环境和多跳推理链,但大规模人工标注的智能体轨迹数据集仍然稀缺。

ToolBH[13 (https://arxiv.org/html/2605.24219#bib.bib6)]和MIRAGE-Bench[12 (https://arxiv.org/html/2605.24219#bib.bib7)]表明,智能体幻觉主要出现在中间推理和工具使用过程中,而非最终输出中,但两者均未将幻觉类型形式化为轨迹上的结构性谓词。这些工作,连同TruthfulQA,都依赖于LLM作为评判者的评估,导致监督式和混合式轨迹级分类器尚未得到充分探索。

Cognitive Mirage[11 (https://arxiv.org/html/2605.24219#bib.bib8)]对事实性、逻辑性和上下文错误进行了分类;MIRAGE增加了感知与推理的区分;MIRAGE-Bench引入了一个基于指令、历史和观察不一致性的智能体分类体系。它们都没有将程序性违例(中断的工作流排序)与范围性违例(由错误智能体做出的正确声明)分开,而这种区分在多智能体工业环境中至关重要。

多智能体扩展可以缓解某些幻觉,但也引入了协调挑战[2 (https://arxiv.org/html/2605.24219#bib.bib5)]。Cemri等人[3 (https://arxiv.org/html/2605.24219#bib.bib13)]提出了MAST,一个包含14种模式的失败分类体系,在超过1600条跨七个MAS框架的轨迹上进行了验证,但其类别涵盖一般的MAS失败,而非专门隔离幻觉。TRAJECT-Bench[5 (https://arxiv.org/html/2605.24219#bib.bib14)]评估了轨迹级工具使用正确性(选择、参数化、排序),但并未针对幻觉检测或多智能体工业工作流。这些工作共同促使我们将轨迹本身而非任何单个响应作为分析单元。

表1 (https://arxiv.org/html/2605.24219#S2.T1)从六个维度定位了Trajel。据我们所知,Trajel是第一个将工业多智能体轨迹与完整的轨迹级评估、结构基础分类体系、专家人工标注以及LLM作为评判者基线结合起来的基准测试。

表1:用于幻觉分析的智能体评估基准比较。
## 3 问题形式化

在将Trajel置于先前基准测试的背景下之后,我们现在正式定义研究的对象。我们将轨迹定义为结构化执行轨迹(§3.1 (https://arxiv.org/html/2605.24219#S3.SS1)),将幻觉类型基于该结构(§3.2 (https://arxiv.org/html/2605.24219#S3.SS2)),描述我们的基准测试支持的检测任务(§3.3 (https://arxiv.org/html/2605.24219#S3.SS3)),并陈述指导我们实验的研究问题(§3.4 (https://arxiv.org/html/2605.24219#S3.SS4))。我们的符号表示借鉴了GEPA[1 (https://arxiv.org/html/2605.24219#bib.bib2)]的复合AI系统形式化,并将其适应于AssetOpsBench[8 (https://arxiv.org/html/2605.24219#bib.bib1)]的多智能体、工具增强设置。

### 3.1 轨迹结构

我们将智能体工作流建模为一个复合AI系统 Φ = (M, C, T_tool),其中 M = ⟨M₁, ..., Mₖ⟩ 是一组由LLM驱动的智能体模块(每个模块有提示 πᵢ 和权重 θᵢ),C 是编排器(例如,ReAct 或 规划与执行),T_tool 是工具集(传感器API、预测端点、工单系统)。在AssetOpsBench中,K=4,智能体 A = {IoT, FSMR, TSFM, WO},涵盖感知、状态建模、时序预测和执行。

执行过程是一系列**步骤**,每个步骤由一个智能体产生的"思考-行动-观察"三元组构成:思考 τₜ(推理),行动 αₜ(工具调用),观察 ωₜ = T(αₜ)。

###### 定义 1(步骤与轨迹)

一个**步骤**是 sₜ = (aₜ, τₜ, αₜ, ωₜ),其中 aₜ ∈ A,t ∈ {1, ..., N}。一个**轨迹**是有序迹 T = (s₁, ..., sₙ);令 𝔗_Φ 表示所有此类轨迹的空间。

令 εₜ = {ω₁, ..., ωₜ₋₁} 表示在步骤 t 时的**证据集**,K 表示任务规范(约束、目标、允许范围)。在AssetOpsBench中,T 被序列化为一个单一的JSON数组——一个统一的、因果排序的信息流,其中每个步骤原则上都可以访问所有先前的证据,因此可能引用、错误引用或捏造上游内容。示例轨迹见附录A (https://arxiv.org/html/2605.24219#A1)。

轨迹结构依赖于任务:C 选择调用哪些智能体以及调用的顺序。唯一的硬结构约束是TSFM依赖于IoT;FSMR和WO可以出现在任何位置。因此,"正确"的结构必须从 K 推断出来,而不是从架构中直接读出,编排器选择错误的排序本身就是下游幻觉的一个来源。这正是轨迹级评估之所以必要的根本原因。

### 3.2 幻觉分类体系

在步骤 sₜ 处的幻觉是指 τₜ 或 αₜ 偏离了由 εₜ、K 和智能体角色所保证的内容。

###### 定义 2(幻觉)

令 gₜ ∈ {τₜ, αₜ}。一个**幻觉**是谓词:

h(gₜ | εₜ, K, aₜ) = 𝟙[ gₜ ⊭ εₜ ∨ gₜ ⊭ K ∨ gₜ ⊭ role(aₜ) ],  (1)

其中 ⊭ 表示不满足语义蕴含或约束,role(aₜ) 编码了智能体 aₜ 的操作职责。

我们将公式(1)细化成五个类别 H = {h^F, h^R, h^L, h^P, h^S},每个类别隔离一种不同的违例:

- • **事实性** (h^F): τₜ 或 αₜ 主张了一个被步骤 t 时的事实数据所矛盾的声明。*可以从单个步骤孤立地检测到。*
- • **指代性** (h^R): τₜ 或 αₜ 引用了一个在 {s₁, ..., sₜ₋₁} 中不存在的实体、观察或先前结果。*仅能通过轨迹历史检测到;模型"记住"了从未发生过的事情。*
- • **逻辑性** (h^L): τₜ 中的推理并非从其前提得出,即使那些前提是正确的。*是断裂的推理链而非断裂的证据链。*
- • **程序性** (h^P): αₜ 跳过、重新排序或捏造了 K 所要求的步骤,或者 τₜ 声称完成了一个轨迹中不存在的步骤。*若无规定工作流的知识则不可见。*
- • **范围性** (h^S): 智能体 aₜ 在其职责 role(aₜ) 之外行动或主张。*多智能体设置所特有:内容可能是正确的,但源自错误的智能体。*

### 3.3 检测任务

###### 定义 3(子任务级和轨迹级检测)

一个**子任务级检测器** f^sub: sₜ ↦ {0,1}^|H| 产生逐步骤、逐类别的预测。一个**轨迹级检测器** f^traj: 𝔗_Φ → {0,1} 标记任何包含幻觉的轨迹,通过聚合 f^traj(T) = ⋁_{t,c} f^sub_c(sₜ)。

我们针对专家标注的真实情况基准测试了三类评估器:(i) **人工标注** J_H: 𝔗_Φ → {0,1}^|H| 提供参考标签;(ii) **LLM作为评判者**,一个被提示的模型返回逐类别可能性;(iii) **训练好的ML分类器**(BERT, 自然语言推理, Longformer)通过经验风险最小化近似 J_H。标注程序、标注者间一致性和模型配置详见第5节 (https://arxiv.org/html/2605.24219#S5)。

### 3.4 研究问题

RQ1(普遍性)。各模型和任务中轨迹级幻觉的经验频率是多少?哪些类型最常见?# 超越最终答案:在多智能体工业工作流中审计轨迹层级的幻觉

来源:https://arxiv.org/html/2605.24219
Harshada Badave¹  Andrea Gomez²  Harshitha Narahari²  Sara Carter²  Vishwa Bhatt²  Aishani Rachakonda²  Santosh Borse¹  Shuxin Lin¹  Dhaval Patel¹  
¹IBM  ²哥伦比亚大学

###### 摘要

大型语言模型(LLMs)越来越多地被部署为能够推理、使用工具并在多步骤中自主行动的智能体。然而,大多数幻觉基准测试仍然只评估最终输出,忽略了源于中间"思考-行动-观察"步骤的失败。我们提出Trajel,这是一个用于审计多智能体工业工作流中轨迹层级幻觉的数据集和评估框架。Trajel引入了一个包含五种类型的幻觉分类体系(事实性、指代性、逻辑性、程序性和范围性),这些分类建立在来自AssetOpsBench的专家标注的智能体轨迹之上。我们在子任务、轨迹和长上下文级别基准测试了监督检测模型。我们的结果表明,最常见的失败模式被现有基准测试所遗漏,近一半的幻觉轨迹同时涉及多种类型,并且具有高二元精度的自动检测器仍然会错误分类最微妙的类型。轨迹感知检测显著优于标准的后验验证,这使得基于分类体系的评估对于更安全的智能体部署变得必要。

## 1 引言

从静态大型语言模型(LLMs)向自主智能体系统的转变代表了人工智能的一个基本前沿。在数据中心监控和基础设施维护等高风险的工业领域,智能体已不仅仅是文本生成器;它们是负责解析多模态信号、遵循严格程序并在类似*AssetOpsBench*[8 (https://arxiv.org/html/2605.24219#bib.bib1)]的多智能体框架中进行协调的决策实体。然而,随着这些系统获得自主性,它们也继承了一种更复杂、更危险的失败模式:**轨迹层级幻觉**。在智能体语境中,幻觉不仅仅是单个响应中的事实捏造;它是一种偏离证据的结构性偏差,会通过顺序的、工具介导的轨迹传播,常常导致级联的操作失败。

尽管这些系统至关重要,但AI评估的科学在很大程度上仍然局限于静态基准测试。当前的幻觉评估机制通常关注像摘要或问答这样的"一次性"任务,将每个实例视为孤立的输入-输出对。这种范式未能捕捉到智能体循环中的**时间**和**交互**动态。在一个涉及思考、行动和观察循环的多步骤工作流中,幻觉可能表现为程序跳过、对前一步骤实体的错误引用,或违反安全约束的超范围行动。此外,在交互循环中,幻觉的定义仍然非常模糊,常常与逻辑错误或工具执行失败混为一谈。这种粒度上的缺失使得几乎无法诊断系统失败是因为它误解了环境,还是因为它创造了一个不存在的状态。

为了提升智能体的可靠性,必须将幻觉置于评估生命周期的中心。经验证据表明,最先进模型之间的幻觉率差异巨大,揭示了不同架构在长时间跨度内维持基础事实的能力存在差异。为了弥合这一差距,我们引入了**Trajel**基准测试,这是一个专为在AssetOpsBench基础上对智能体轨迹进行严格再现、审计和压力测试而设计的框架。我们的方法超越了后验验证,对智能体轨迹进行精准分析,旨在解决一个根本性问题:*偏差从轨迹的何处开始?*

我们构建了一个高保真度的标注轨迹数据集,通过结合**LLM作为评判者**的细化方法和**盲审人工评审**来减少评估偏差。这些数据随后被用于基准测试Trajel ML建模框架,探索如何利用子任务级、轨迹级和长上下文建模来构建贯穿AI生命周期的稳健评估声明。

参见图注  
图1:Trajel框架概览

对NeurIPS数据集和基准测试方向的贡献:

- • **轨迹感知幻觉分类体系**。定义了五种幻觉类型(事实性、指代性、逻辑性、程序性、范围性),作为对思考、行动、观察轨迹的结构性谓词,将基础事实失败与推理错误和控制流违例区分开来。48.7%的幻觉轨迹同时表现出多种类型,证实了多标签表述的必要性。
- • **Trajel数据集**。来自6个模型和42个工业AssetOps任务的225个专家标注的智能体轨迹,在子任务和轨迹级别进行了标注。每个轨迹由LLM作为评判者和来自两个机构的盲审人工评审员独立评估,产生68.3%的人工识别幻觉率,以及自动与人工判断之间0.456的Cohen's κ系数。标注包括幻觉类型、在轨迹内的定位以及评审员的自由文本理由。
- • **Trajel ML建模框架**。基准测试了三种监督检测范式(基于BERT的子任务级分类、基于NLI的轨迹级分类以及基于Longformer的长上下文建模),每种范式均由特定幻觉类型的上下文需求驱动。
- • **执行信号的经验验证**。首次系统研究了哪些执行质量信号(任务完成度、数据检索准确性、结果验证、智能体序列正确性和推理清晰度)最可靠地预测了下游操作失败之前的幻觉。各模型的幻觉率从52.4%到81.0%不等,程序性幻觉占识别出失败的38.5%,清晰度与合理性信号作为单变量预测器达到了AUC = 0.908,优于所有训练的分类器。

这些工具、数据集和框架旨在改变评估声明的解读方式,推动高风险行业中更安全的智能体部署。

## 2 相关工作

ReAct[10 (https://arxiv.org/html/2605.24219#bib.bib3)]将推理和行动交织以暴露中间轨迹,而AgentBench[7 (https://arxiv.org/html/2605.24219#bib.bib4)]显示LLM性能在长时间跨度的任务中急剧下降。虽然AgentBench报告了规模扩展带来的收益,但MIRAGE[4 (https://arxiv.org/html/2605.24219#bib.bib9)]和TruthfulQA[6 (https://arxiv.org/html/2605.24219#bib.bib12)]表明,在复杂推理下,仅靠规模扩展并不能消除幻觉。WebArena[14 (https://arxiv.org/html/2605.24219#bib.bib10)]和HotpotQA[9 (https://arxiv.org/html/2605.24219#bib.bib11)]提供了人工标注的环境和多跳推理链,但大规模人工标注的智能体轨迹数据集仍然稀缺。

ToolBH[13 (https://arxiv.org/html/2605.24219#bib.bib6)]和MIRAGE-Bench[12 (https://arxiv.org/html/2605.24219#bib.bib7)]表明,智能体幻觉主要出现在中间推理和工具使用过程中,而非最终输出中,但两者均未将幻觉类型形式化为轨迹上的结构性谓词。这些工作,连同TruthfulQA,都依赖于LLM作为评判者的评估,导致监督式和混合式轨迹级分类器尚未得到充分探索。

Cognitive Mirage[11 (https://arxiv.org/html/2605.24219#bib.bib8)]对事实性、逻辑性和上下文错误进行了分类;MIRAGE增加了感知与推理的区分;MIRAGE-Bench引入了一个基于指令、历史和观察不一致性的智能体分类体系。它们都没有将程序性违例(中断的工作流排序)与范围性违例(由错误智能体做出的正确声明)分开,而这种区分在多智能体工业环境中至关重要。

多智能体扩展可以缓解某些幻觉,但也引入了协调挑战[2 (https://arxiv.org/html/2605.24219#bib.bib5)]。Cemri等人[3 (https://arxiv.org/html/2605.24219#bib.bib13)]提出了MAST,一个包含14种模式的失败分类体系,在超过1600条跨七个MAS框架的轨迹上进行了验证,但其类别涵盖一般的MAS失败,而非专门隔离幻觉。TRAJECT-Bench[5 (https://arxiv.org/html/2605.24219#bib.bib14)]评估了轨迹级工具使用正确性(选择、参数化、排序),但并未针对幻觉检测或多智能体工业工作流。这些工作共同促使我们将轨迹本身而非任何单个响应作为分析单元。

表1 (https://arxiv.org/html/2605.24219#S2.T1)从六个维度定位了Trajel。据我们所知,Trajel是第一个将工业多智能体轨迹与完整的轨迹级评估、结构基础分类体系、专家人工标注以及LLM作为评判者基线结合起来的基准测试。

表1:用于幻觉分析的智能体评估基准比较。
## 3 问题形式化

在将Trajel置于先前基准测试的背景下之后,我们现在正式定义研究的对象。我们将轨迹定义为结构化执行轨迹(§3.1 (https://arxiv.org/html/2605.24219#S3.SS1)),将幻觉类型基于该结构(§3.2 (https://arxiv.org/html/2605.24219#S3.SS2)),描述我们的基准测试支持的检测任务(§3.3 (https://arxiv.org/html/2605.24219#S3.SS3)),并陈述指导我们实验的研究问题(§3.4 (https://arxiv.org/html/2605.24219#S3.SS4))。我们的符号表示借鉴了GEPA[1 (https://arxiv.org/html/2605.24219#bib.bib2)]的复合AI系统形式化,并将其适应于AssetOpsBench[8 (https://arxiv.org/html/2605.24219#bib.bib1)]的多智能体、工具增强设置。

### 3.1 轨迹结构

我们将智能体工作流建模为一个复合AI系统 Φ = (M, C, T_tool),其中 M = ⟨M₁, ..., Mₖ⟩ 是一组由LLM驱动的智能体模块(每个模块有提示 πᵢ 和权重 θᵢ),C 是编排器(例如,ReAct 或 规划与执行),T_tool 是工具集(传感器API、预测端点、工单系统)。在AssetOpsBench中,K=4,智能体 A = {IoT, FSMR, TSFM, WO},涵盖感知、状态建模、时序预测和执行。

执行过程是一系列**步骤**,每个步骤由一个智能体产生的"思考-行动-观察"三元组构成:思考 τₜ(推理),行动 αₜ(工具调用),观察 ωₜ = T(αₜ)。

###### 定义 1(步骤与轨迹)

一个**步骤**是 sₜ = (aₜ, τₜ, αₜ, ωₜ),其中 aₜ ∈ A,t ∈ {1, ..., N}。一个**轨迹**是有序迹 T = (s₁, ..., sₙ);令 𝔗_Φ 表示所有此类轨迹的空间。

令 εₜ = {ω₁, ..., ωₜ₋₁} 表示在步骤 t 时的**证据集**,K 表示任务规范(约束、目标、允许范围)。在AssetOpsBench中,T 被序列化为一个单一的JSON数组——一个统一的、因果排序的信息流,其中每个步骤原则上都可以访问所有先前的证据,因此可能引用、错误引用或捏造上游内容。示例轨迹见附录A (https://arxiv.org/html/2605.24219#A1)。

轨迹结构依赖于任务:C 选择调用哪些智能体以及调用的顺序。唯一的硬结构约束是TSFM依赖于IoT;FSMR和WO可以出现在任何位置。因此,"正确"的结构必须从 K 推断出来,而不是从架构中直接读出,编排器选择错误的排序本身就是下游幻觉的一个来源。这正是轨迹级评估之所以必要的根本原因。

### 3.2 幻觉分类体系

在步骤 sₜ 处的幻觉是指 τₜ 或 αₜ 偏离了由 εₜ、K 和智能体角色所保证的内容。

###### 定义 2(幻觉)

令 gₜ ∈ {τₜ, αₜ}。一个**幻觉**是谓词:

h(gₜ | εₜ, K, aₜ) = 𝟙[ gₜ ⊭ εₜ ∨ gₜ ⊭ K ∨ gₜ ⊭ role(aₜ) ],  (1)

其中 ⊭ 表示不满足语义蕴含或约束,role(aₜ) 编码了智能体 aₜ 的操作职责。

我们将公式(1)细化成五个类别 H = {h^F, h^R, h^L, h^P, h^S},每个类别隔离一种不同的违例:

- • **事实性** (h^F): τₜ 或 αₜ 主张了一个被步骤 t 时的事实数据所矛盾的声明。*可以从单个步骤孤立地检测到。*
- • **指代性** (h^R): τₜ 或 αₜ 引用了一个在 {s₁, ..., sₜ₋₁} 中不存在的实体、观察或先前结果。*仅能通过轨迹历史检测到;模型"记住"了从未发生过的事情。*
- • **逻辑性** (h^L): τₜ 中的推理并非从其前提得出,即使那些前提是正确的。*是断裂的推理链而非断裂的证据链。*
- • **程序性** (h^P): αₜ 跳过、重新排序或捏造了 K 所要求的步骤,或者 τₜ 声称完成了一个轨迹中不存在的步骤。*若无规定工作流的知识则不可见。*
- • **范围性** (h^S): 智能体 aₜ 在其职责 role(aₜ) 之外行动或主张。*多智能体设置所特有:内容可能是正确的,但源自错误的智能体。*

### 3.3 检测任务

###### 定义 3(子任务级和轨迹级检测)

一个**子任务级检测器** f^sub: sₜ ↦ {0,1}^|H| 产生逐步骤、逐类别的预测。一个**轨迹级检测器** f^traj: 𝔗_Φ → {0,1} 标记任何包含幻觉的轨迹,通过聚合 f^traj(T) = ⋁_{t,c} f^sub_c(sₜ)。

我们针对专家标注的真实情况基准测试了三类评估器:(i) **人工标注** J_H: 𝔗_Φ → {0,1}^|H| 提供参考标签;(ii) **LLM作为评判者**,一个被提示的模型返回逐类别可能性;(iii) **训练好的ML分类器**(BERT, 自然语言推理, Longformer)通过经验风险最小化近似 J_H。标注程序、标注者间一致性和模型配置详见第5节 (https://arxiv.org/html/2605.24219#S5)。

### 3.4 研究问题

RQ1(普遍性)。各模型和任务中轨迹级幻觉的经验频率是多少?哪些类型最常见?

相似文章

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。