超越基于LLM的推理:轻量级GNN用于智能体故障归因
摘要
本文介绍了AFANet,一个用于多智能体系统中智能体故障归因的轻量级基于图的框架,它在性能上匹配或超越基于LLM的方法,同时计算成本显著降低。
arXiv:2608.18575v1 Announce Type: new
摘要:基于大语言模型(LLM)的多智能体系统(MAS)经常表现出复杂的故障模式,这常常导致智能体产生错误的结果。这促使了智能体故障归因任务:给定一个失败的多智能体轨迹,识别出有故障的智能体及其相应的错误类型。现有方法主要依赖LLM来执行故障归因,通过直接提示、在合成数据上微调或复杂的智能体流水线。虽然有效,但这些方法由于长上下文处理、昂贵的后训练和手工工作流而产生大量计算开销。此外,实证证据表明,即使是最先进的模型在现有基准上也仅达到有限的准确性,表明仅靠扩大模型规模是不够的。在这项工作中,我们重新审视这一任务,并质疑这种昂贵生成解决方案的必要性。我们介绍了AFANet,一个轻量级基于图的框架,通过步骤级语义信号和智能体级关系来建模交互轨迹。我们表明,在参数显著减少且推理成本接近零的情况下,AFANet(i)在领域内基准上匹配或超越基于LLM的基线,包括微调模型;(ii)在不同的GNN架构中保持稳健性能;(iii)可以通过在OOD基准上进行低成本的测试时适应进一步改进。我们的结果表明,有效的智能体故障归因不需要繁重的LLM推理,一种轻量级、结构化的方法可以实现强大的性能。
查看缓存全文
缓存时间: 2026/08/20 10:13
# 用于智能体故障归因的轻量级图神经网络 来源:https://arxiv.org/html/2608.18575 ## 超越基于大语言模型的推理:用于智能体故障归因的轻量级图神经网络 ### Ting-Wei Li 所属单位:伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州 电子邮箱:[[email protected]](mailto:) ### Yuanchen Bei 所属单位:伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州 电子邮箱:[[email protected]](mailto:) ### Xiao Lin 所属单位:伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州 电子邮箱:[[email protected]](mailto:) ### Hanghang Tong 所属单位:伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州 电子邮箱:[[email protected]](mailto:) ###### 摘要 基于大语言模型的多智能体系统通常表现出复杂的故障模式,这常常导致智能体产生错误的结果。这催生了智能体故障归因任务:给定一个失败的多智能体交互轨迹,识别出出错的智能体及其对应的错误类型。现有方法主要依赖大语言模型执行故障归因,或通过直接提示、在合成数据上微调,或通过复杂的智能体工作流。虽然这些方法有效,但由于长上下文处理、昂贵的后训练以及手工设计的工作流,它们会产生巨大的计算开销。此外,实证证据表明,即使是最先进的模型在现有基准测试上也只能达到有限的准确率,这表明仅靠扩大模型规模是不够的。在这项工作中,我们重新审视了这个任务,并质疑这种昂贵的生成式解决方案的必要性。我们引入了 AFANet,一个轻量级的基于图的框架,它通过步骤级的语义信号和智能体级的关系来建模交互轨迹。我们证明,使用显著更少的参数和近乎零的推理成本,AFANet(i)在领域内基准测试上达到或超越了基于大语言模型的基线,包括经过微调的模型,(ii)在不同图神经网络架构下保持稳健的性能,以及(iii)可以通过在 OOD 基准测试上进行低成本的测试时自适应进一步改进。我们的结果表明,有效的智能体故障归因不需要繁重的大语言模型推理,轻量级的结构化方法可以实现强大的性能。 图 1:我们提出的 AFANet 与大语言模型在归因准确率和效率方面的比较。AFANet 可以在产生显著更低的训练和推理成本的同时,达到与大语言模型相似或更好的性能。我们考虑的基础模型:Qwen-2.5-7B/14B-Instruct,分别简称为 7B/14B。我们还包括它们通过 SFT 后的变体(记为 S)和后续 GRPO 训练(记为 G),简称为 7B+S/14B+S 和 7B+S+G/14B+S+G。 ## 1 引言 基于大语言模型的多智能体系统已成为一种强大的范式,通过多个智能体之间的协调推理、工具使用和交互来解决复杂任务。尽管具有强大的能力,这些系统经常表现出复杂的故障模式,其中一个智能体引入的错误会在后续交互中传播,并最终导致错误的结果。这催生了智能体故障归因任务:给定一个失败的多智能体交互轨迹,识别出导致故障的出错智能体及其对应的错误类型。然而,由于交互周期长、智能体间的复杂依赖关系以及错误传播的模糊性,这项任务本身具有挑战性。即使是先进的推理模型或强大的商业模型,在此任务上也只能达到有限的准确率,这突显了在长轨迹中识别根本原因的困难。 现有方法主要将故障归因视为一个生成式推理问题,依赖大语言模型来分析交互轨迹并直接生成答案。这些方法通常涉及直接提示、在合成故障数据上微调,或复杂的多阶段智能体工作流。虽然这些方法提高了性能,但它们存在几个根本性的局限性。首先(效率瓶颈),由于长上下文处理、重复推理和昂贵的训练过程,它们会产生巨大的计算开销。其次(架构复杂性),它们通过多阶段工作流和手工设计的管道引入了显著的系统复杂性。最后(系统性低效),尽管付出了这些努力,它们的性能仍然有限,有时甚至被随机基线击败,这表明仅靠扩大模型规模不足以解决这个任务。这些观察引发了一个根本性的问题: > *智能体故障归因是否需要繁重的大语言模型推理?* 在这项工作中,我们挑战了这一主流范式,并认为可以使用轻量级模型更高效地解决智能体故障归因问题。我们提出了 AFANet,一个轻量级的图神经网络,它通过步骤级的语义信号和智能体级的结构信号来建模交互轨迹,而不是依赖昂贵的基于大语言模型的推理。通过显式地编码时间依赖性和智能体间交互,AFANet 捕获了故障传播的底层结构。具体来说,AFANet 以一种原则性的方式解决了智能体故障归因的核心挑战。首先,基于图的表示自然地建模错误传播和智能体间的依赖关系,从而能够准确地识别根本原因。其次,该模型以显著降低的计算成本运行,避免了长上下文推理和昂贵的后训练。通过大量实验,我们证明 AFANet 达到或超越了强大的基于大语言模型的基线,包括监督微调和强化学习增强模型,同时使用显著更少的参数并实现近乎零的推理成本(如图 1 所示)。我们进一步表明,AFANet 对架构选择具有鲁棒性,并且可以通过在 OOD 数据集上进行低成本的测试时自适应来改进。我们总结我们的贡献如下: - 我们为智能体故障归因引入了一个新视角:使用基于图的方法对故障轨迹进行建模足以实现有效的归因,而不是依赖大语言模型推理。 - 我们提出了 AFANet,一个轻量级的框架,通过轮次级的对话图对多智能体故障传播进行建模,通过图消息传递整合轮次级语义和时间/智能体内依赖关系。 - 我们证明,使用显著更低的训练和推理成本,AFANet 可以达到与大语言模型相竞争的性能。 - 我们进行了全面的消融研究,表明 AFANet 在不同架构选择下依然表现出色,并且可以通过低成本的测试时自适应进行改进。 ## 2 预备知识 ### 2.1 多智能体系统轨迹 令 \(\mathcal{A} = \{a_1, a_2, \dots, a_M\}\) 表示一组基于大语言模型的智能体。给定用户查询 \(q \in \mathcal{Q}\),一个多智能体系统尝试解决任务并产生一个交互轨迹 \(\mathcal{T} = \{(a_{i_t}, x_t)\}_{t=1}^T\),其中 \(T\) 是轨迹长度,\(a_{i_t} \in \mathcal{A}\) 是在步骤 \(t\) 选中的智能体,\(x_t \in \mathcal{X}\) 是该智能体生成的内容。每个轨迹 \(\mathcal{T}\) 与一个结果变量 \(o = g(\mathcal{T}, q) \in \{0, 1\}\) 相关联,其中 \(g\) 是结果验证器,\(o=0/1\) 分别表示任务失败/成功。 ### 2.2 智能体故障归因 令 \(\mathcal{E} = \{e_1, e_2, \dots, e_K\}\) 表示一组预定义的错误类型,\(K\) 是错误类型的数量。我们将标签空间定义为智能体空间和错误空间的笛卡尔积:\(\mathcal{L} = \mathcal{A} \times \mathcal{E}\)。给定一个失败的轨迹 \(\mathcal{T}\),智能体故障归因任务是预测一个标签子集 \(\mathcal{Y} \subseteq \mathcal{L}\),其中每个 \((a_j, e_k) \in \mathcal{Y}\) 表示智能体 \(a_j\) 犯下了类型为 \(e_k\) 的错误,且该错误对失败有贡献。因此,我们将 AFA 定义为针对每个智能体的多分类问题,我们的目标是学习一个映射函数 \(h: \mathcal{T} \to \{0, 1\}^{M \times (K+1)}\),其中第一个类别对应“干净”状态,其余 \(K\) 个类别对应每种错误类型。 ## 3 方法论 参见说明图 2:整体流程。给定一个失败的多智能体系统轨迹,我们首先将其转换为一个具有轮次级文本特征和时间/智能体级连接的对话图。然后,该图将通过我们提出的 AFANet 进行智能体故障预测。 在本节中,我们提出了一个轻量级的基于图的模型 AFANet 来处理智能体故障归因。给定一段对话,我们首先构建一个具有时间和智能体内部连接的轮次级图(第 3.1 节)。然后,我们介绍了我们提出的模型 AFANet,一个简单的图神经网络,它结合了偏差/统计信号和上下文语义来生成智能体级的表示(第 3.2 节)。接着,我们详细说明了学习目标(第 3.3 节),最后描述了 AFANet 的推理过程(第 3.4 节)。整体流程在图 2 中详细说明。 ### 3.1 对话图构建 我们首先将每个多智能体对话转换为一个具有轮次级节点的异构图。关键直觉是多智能体系统的故障不仅反映在各个轮次的语义内容中,也体现在一个智能体的贡献如何随时间演变以及如何与其他智能体交互。因此,我们将其表示为一个异构图,其中节点是对话轮次,边编码时间和智能体内部的依赖关系。我们在以下段落中详细说明节点特征和边的构建。 #### 轮次节点表示 给定一个失败的轨迹 \(\mathcal{T} = \{(a_{i_t}, x_t)\}_{t=1}^T\),我们构建一个图 \(\mathcal{G} = (\mathcal{V}, \mathcal{E})\),其中每个节点 \(v_t \in \mathcal{V}\) 对应对话中的一个轮次 \((a_{i_t}, x_t)\),节点数量为 \(|\mathcal{V}| = T\)。受近期异常检测文献的启发,我们旨在捕获异常偏差和统计模式,以推导出解决 AFA 有用的轮次级特征。关键直觉是,出错的智能体行为通常反映在交互动力学的不一致性中,而不仅仅是单个轮次的语义内容。为了高效地获取这些信号,我们首先通过将每个轮次视为一个文档,整个轨迹视为一个语料库,为每个对话构建 TF-IDF 表示(更多细节见附录 A)。然后,我们应用截断的 SVD 来获得低维密集表示:\(\mathbf{X}_{\mathrm{svd}} \in \mathbb{R}^{T \times r}\),其中 \(r\) 是秩大小。基于 \(\mathbf{X}_{\mathrm{svd}}\),我们计算一组偏差特征,捕获每个轮次在对话中偏离上下文的程度。我们将这些偏差特征连接起来,为每个轮次获得 \(\mathbf{x}^{\mathrm{dev}}_t\),并将它们在所有轮次上堆叠:\(\mathbf{X}_{\mathrm{dev}} = [\mathbf{x}_{\mathrm{dev}}^1 \| \cdots \| \mathbf{x}_{\mathrm{dev}}^T] \in \mathbb{R}^{T \times d_{\mathrm{dev}}}\),其中 \(d_{\mathrm{dev}}\) 是偏差特征的数量。此外,我们考虑统计特征 \(\mathbf{X}_{\mathrm{stat}} \in \mathbb{R}^{T \times d_{\mathrm{stat}}}\)(\(d_{\mathrm{stat}}\) 表示统计特征的数量),它们编码了非语义属性,如位置编码。最后,我们考虑从预训练句子编码器(例如 sentence-BERT)获得的密集语义特征,以捕获更丰富的上下文含义,得到 \(\mathbf{X}_{\mathrm{dense}} \in \mathbb{R}^{T \times d_{\mathrm{dense}}}\),其中 \(d_{\mathrm{dense}}\) 是嵌入维度。将这些部分堆叠在一起,我们得到轮次节点的初始特征矩阵:\(\mathbf{X} = \big[\mathbf{X}_{\mathrm{dev}} \; \| \; \mathbf{X}_{\mathrm{stat}} \; \| \; \mathbf{X}_{\mathrm{dense}}\big] \in \mathbb{R}^{T \times d}\),其中 \(d = d_{\mathrm{dev}} + d_{\mathrm{stat}} + d_{\mathrm{dense}}\) 是特征维度的数量。因此,每个轮次节点都与一个特征向量 \(\mathbf{x}_t = \mathbf{X}[t, :] \in \mathbb{R}^d\) 相关联。偏差和统计特征的正式定义推迟到附录 A。 #### 边的构建 我们构建两种类型的连接:时间进展和智能体内部依赖。首先,为了保留对话的顺序性,我们在相邻轮次之间添加双向的时间边:\((v_t, v_{t+1}) \in \mathcal{E}_{\mathrm{seq}}^{\rightarrow}, (v_{t+1}, v_t) \in \mathcal{E}_{\mathrm{seq}}^{\leftarrow}\)。其次,为了捕获由同一智能体产生的非相邻轮次之间的长程一致性,我们连接由同一智能体产生的轮次。对于两个轮次 \(u\) 和 \(v\),如果它们由同一个智能体产生,则添加一条边 \((u, v) \in \mathcal{E}_{\mathrm{agent}}\)。 ### 3.2 AFANet 架构 图 3:AFANet 架构概述。AFANet 由一个用于聚合智能体内部轮次信息的智能体内图神经网络和一个用于在智能体间进行轮次信息聚合的智能体间图神经网络组成。 在获得对话图后,我们引入 AFANet 架构来预测每个智能体的错误类型。具体来说,AFANet 旨在通过两个关键组件解决智能体故障归因的挑战:(1)智能体内图神经网络,用于聚合同一智能体的轮次信息以捕获其内部行为模式;(2)智能体间图神经网络,用于跨智能体聚合轮次信息以捕获交互依赖性。最后,我们使用一个分类头来预测每个智能体的错误标签。 #### 智能体内图神经网络 首先,我们利用智能体内边 \(\mathcal{E}_{\mathrm{agent}}\) 来聚合同一智能体的轮次信息。给定初始节点特征 \(\mathbf{X}\),我们应用图神经网络层,通过消息传递迭代更新节点表示。对于每个节点 \(v_t\),其表示 \(\mathbf{h}_t^{(l+1)}\) 在第 \(l+1\) 层通过聚合其邻居(包括自身)的表示来更新: \[ \mathbf{h}_t^{(l+1)} = \mathrm{UPDATE}^{(l)}\left(\mathbf{h}_t^{(l)}, \mathrm{AGGREGATE}^{(l)}\left(\{\mathbf{h}_s^{(l)} : s \in \mathcal{N}(t) \cup \{t\}\}\right)\right) \] 其中 \(\mathcal{N}(t)\) 是节点 \(t\) 在智能体内图中的邻居集合。\(\mathrm{AGGREGATE}\) 函数(例如均值、求和或最大池化)收集邻居信息,\(\mathrm{UPDATE}\) 函数(例如一个 MLP)结合聚合后的信息和节点自身的当前表示来产生新的表示。经过 \(L\) 层后,我们得到轮次表示 \(\mathbf{H} = [\mathbf{h}_1, \dots, \mathbf{h}_T]^\top\),其中每个 \(\mathbf{h}_t\) 编码了该轮次的局部上下文及其所属智能体的历史行为。 #### 智能体间图神经网络 接下来,我们利用智能体间的时间边 \(\mathcal{E}_{\mathrm{seq}}\) 来跨不同智能体的轮次传播信息。这使得模型能够捕获交互过程中的错误传播。我们应用另一个图神经网络层,使用时间边来更新节点表示。更新规则类似,但邻居集合现在由时间上的相邻轮次定义: \[ \mathbf{h}_t^{(L+1)} = \mathrm{UPDATE'}^{(L+1)}\left(\mathbf{h}_t^{(L)}, \mathrm{AGGREGATE'}^{(L+1)}\left(\{\mathbf{h}_s^{(L)} : s \in \mathcal{N}_{\mathrm{seq}}(t) \cup \{t\}\}\right)\right) \] 其中 \(\mathcal{N}_{\mathrm{seq}}(t)\) 是节点 \(t\) 在时间边图上的邻居集合。经过这个智能体间聚合层后,轮次表示 \(\mathbf{h}_t^{(L+1)}\) 现在包含了更广泛的对话历史信息。 #### 从轮次表示到智能体表示 为了进行最终的智能体级分类,我们需要将轮次表示聚合为每个智能体的单一表示。给定一个智能体 \(a_i\),我们识别出它所有的轮次集合 \(\mathcal{T}_i = \{t : a_{i_t} = a_i\}\)。然后,我们使用一个简单的聚合函数(例如平均池化)来获得智能体 \(a_i\) 的表示 \(\mathbf{z}_i\): \[ \mathbf{z}_i = \mathrm{POOL}\left(\{\mathbf{h}_t^{(L+1)} : t \in \mathcal{T}_i\}\right) \] 这为每个智能体产生一个固定长度的向量表示。 #### 分类头 最后,对于每个智能体 \(a_i\),我们将其表示 \(\mathbf{z}_i\) 输入到一个线性分类器(或一个简单的 MLP)中,以预测其错误标签(“干净”或具体的错误类型): \[ \hat{\mathbf{y}}_i = \mathrm{softmax}\left(\mathbf{W} \mathbf{z}_i + \mathbf{b}\right) \] 其中 \(\hat{\mathbf{y}}_i \in \mathbb{R}^{K+1}\) 是预测的错误类型概率分布,\(\mathbf{W}\) 和 \(\mathbf{b}\) 是可学习的参数。 ### 3.3 学习目标 我们使用标准的交叉熵损失来训练 AFANet。给定一个失败的轨迹,我们拥有真实的错误标签。对于每个智能体 \(a_i\),真实标签 \(y_i\) 是 \(K+1\) 个类别中的一个。损失函数 \(\mathcal{L}\) 计算在所有智能体上的平均交叉熵损失: \[ \mathcal{L} = -\frac{1}{M} \sum_{i=1}^M \sum_{c=0}^K \mathbb{1}[y_i = c] \log(\hat{y}_{i,c}) \] 其中 \(\hat{y}_{i,c}\) 是智能体 \(a_i\) 被预测为类别 \(c\) 的概率,\(M\) 是智能体的数量。我们最小化这个损失来更新模型参数。 ### 3.4 推理过程 在推理时,给定一个新的失败轨迹,我们首先构建对话图。然后,我们将其输入到训练好的 AFANet 中。模型执行前向传播:先通过智能体内图神经网络,再通过智能体间图神经网络,得到轮次表示,然后将其聚合为智能体表示,最后通过分类头得到每个智能体的预测错误类型。最终输出一个集合,列出每个被判定为出错的智能体及其预测的错误类型。 ## 4 实验 ### 4.1 实验设置 #### 数据集 我们在两个数据集上评估 AFANet:AEGIS 和 AEGIS-OOD。AEGIS 是一个用于智能体故障归因的基准测试,包含来自多个领域的失败轨迹。AEGIS-OOD 是一个在分布外数据上构建的测试集,用于评估泛化能力。两个数据集都包含多智能体对话轨迹及其对应的故障归因标签(智能体-错误类型对)。 #### 基线方法 我们将 AFANet 与以下基线进行比较: 1. **随机基线**:随机选择智能体并分配错误类型。 2. **预训练大语言模型**:使用 Qwen-2.5-7B/14B-Instruct 作为零样本或少样本推理器。 3. **监督微调大语言模型**:在 AEGIS 训练集上使用 SFT 微调 Qwen-2.5-7B/14B。 4. **强化学习增强大语言模型**:在 SFT 模型基础上使用 GRPO 进行进一步训练。 5. **商业大语言模型**:使用 GPT-4o 作为强大的黑盒基线。 #### 评估指标 我们使用以下指标来评估性能: - **准确率**:对于每个智能体,预测的错误类型是否与真实标签完全匹配。 - **宏观 F1 分数**:考虑所有错误类别(包括“干净”)的 F1 分数的平均值,适用于类别不平衡的情况。 - **配对准确率**:最严格的指标,要求同时正确识别出错的智能体 *和* 正确的错误类型。只有预测的 (智能体, 错误类型) 对与真实标签集合完全匹配时才算正确。 ### 4.2 主要结果 表 1:在 AEGIS 和 AEGIS-OOD 数据集上与基线的性能比较。我们报告准确率、宏观 F1 和配对准确率(%)。训练时间和推理时间(每条轨迹)也一并报告。 | 模型 | AEGIS Acc | AEGIS Macro F1 | AEGIS Pair Acc | AEGIS-OOD Acc | AEGIS-OOD Macro F1 | AEGIS-OOD Pair Acc | 训练时间 | 推理时间/每条轨迹 | 参数量 | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | 随机基线 | 25.3 | 25.1 | 8.2 | 25.0 | 25.0 | 7.9 | - | - | - | | 7B (零样本) | 42.1 | 41.8 | 18.5 | 38.7 | 38.3 | 15.2 | - | 26 hrs | 199s / 108s | 7B | | 14B (零样本) | 48.5 | 48.2 | 23.1 | 44.3 | 43.9 | 19.7 | - | 199s / 108s | 14B | | 7B SFT | 65.3 | 64.9 | 35.6 | 58.2 | 57.8 | 29.3 | 8.8 hrs | 367s / 231s | 7B | | 14B SFT | 72.1 | 71.8 | 42.3 | 64.5 | 64.1 | 35.6 | 8.8 hrs | 367s / 231s | 14B | | 14B SFT + GRPO | 74.0 | 73.7 | 45.8 | 66.2 | 65.9 | 37.8 | > 74 hrs | 367s / 231s | 14B | | **AFANet** | **80.8** | **80.5** | **65.0** | **75.3** | **75.0** | **58.1** | **1.1 hrs** | **1.16s / 0.37s** | **65K** | AFANet 与大语言模型相当或更优。我们在表 1 中展示了主要结果。AFANet 在两个领域内和 OOD 数据集上,与预训练、后训练和商业大语言模型基线相比,达到了有竞争力的或更优的平均性能。特别是,尽管不依赖于基于大语言模型的推理,AFANet 在配对级别指标上非常有效。我们注意到,配对级归因是最具挑战性和实际重要性的,因为它需要同时识别出错的智能体和正确的错误类型。在 AEGIS-OOD 数据集上,AFANet 的配对准确率(58.1%)显著超越了最强的基线(37.8%),显示了出色的泛化能力。 #### 效率比较 AFANet 在计算成本上具有显著优势。如表 1 所示,AFANet 的训练仅需 1.1 小时,而最大的基线(14B SFT + GRPO)训练超过 74 小时。在推理阶段,AFANet 处理一条轨迹仅需约 1 秒,而 14B 模型则需要超过 3 分钟。这证明了轻量级图方法在效率上的巨大优势。 ### 4.3 消融研究 我们进行消融研究以验证 AFANet 中各个组件的有效性。 - **移除智能体内/智能体间图**:仅使用时间边(移除智能体内边)或仅使用智能体内部边(移除时间边)都会导致性能显著下降,证明了同时建模两者的重要性。 - **特征分析**:比较使用偏差特征、统计特征和密集语义特征的不同组合。结果表明,三种特征的结合带来了最佳性能,其中密集语义特征贡献最大,但偏差和统计特征提供了重要的补充信号,特别是在捕获异常模式方面。 - **图神经网络层数**:研究智能体内和智能体间图神经网络的层数(L)。实验发现,1-2 层通常足以达到最佳性能,更深的网络可能会导致过拟合或性能饱和。 ### 4.4 测试时自适应 我们研究在 OOD 数据集(AEGIS-OOD)上进行低成本测试时自适应是否能进一步提高 AFANet 的性能。我们采用一种简单的方法:在测试时,仅使用 AEGIS-OOD 的一小部分有标签数据(例如 10%)来微调分类头(即第 3.2 节中定义的 \(\mathbf{W}\) 和 \(\mathbf{b}\)),而保持图神经网络部分冻结。实验表明,这种简单的自适应可以将配对准确率从 58.1% 提高到 61.3%,证明了 AFANet 的灵活性和适应性。 ## 5 讨论与结论 在本文中,我们研究了智能体故障归因任务,并对“需要繁重的大语言模型推理才能解决此任务”这一普遍假设提出了质疑。我们提出了 AFANet,一个轻量级的基于图的框架,通过步骤级的语义和智能体级的结构信号来建模故障传播轨迹。我们的实验结果表明,与需要巨大计算资源的大语言模型相比,AFANet 使用更少的参数和近乎零的推理成本,能够达到相当甚至更好的性能。此外,AFANet 对架构选择具有鲁棒性,并且可以通过低成本的测试时自适应来适应新的数据分布。 我们的工作指出了一个重要的方向:对于某些复杂的智能体行为分析任务,基于图的、结构化的轻量级方法可能比端到端的大语言模型推理更高效、更有效。未来的工作可以探索将 AFANet 扩展到更复杂的动态交互场景,或者与更先进的图神经网络架构相结合,以进一步提升性能和可解释性。
相似文章
Who&When Pro: 大语言模型真的能归因AI智能体中的故障吗?
本文介绍了Who&When Pro,一个用于AI智能体系统中自动故障归因的大规模基准,包含26个基准上的12,326条故障轨迹,并提供了关于大语言模型如何归因故障的见解。
当工具说了算:LLM代理盲目服从图神经网络工具,且更强的骨干模型服从得更彻底
本文通过实验测试了配备GNN工具的LLM代理是行使判断力还是盲目服从工具,发现代理在97.6%–99.2%的情况下与GNN保持一致,且更强的骨干模型服从得更彻底。这种服从的代价并不会随能力提升而减少,选择性调用仍然是一个开放问题。
StepFinder:一种用于多智能体系统故障归因的时间语义框架
StepFinder 是一个轻量级框架,仅在特征构建阶段使用LLM将执行日志编码为时间语义序列,然后应用参数高效的时间与注意力模块进行多智能体系统的故障归因。在Who&When基准测试中,与最快的基于LLM的方法相比,推理时间减少了79%。
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
从成功流程追溯代理失败
提出Oat,一种轻量级无监督方法,用于识别基于LLM的代理失败轨迹中的错误步骤。该方法利用仅在成功轨迹上训练的神经控制微分方程,在域内和域外设置下实现200-5000倍于提示基线的加速,并显著提升F1分数。