SMADE-IE:用于零样本信息抽取的稀疏多智能体证据驱动辩论框架

arXiv cs.CL 论文

摘要

SMADE-IE 是一个面向零样本信息抽取的稀疏多智能体框架,通过自适应模式选择器与基于 Toulmin 论证风格和贝叶斯更新的证据驱动辩论机制,在 NER、RE 和 JERE 任务的 9 个基准测试上超越现有基线,同时提升了 token 使用效率。

arXiv:2606.04691v1 Announce Type: new Abstract: 基于大语言模型(LLMs)的零样本信息抽取(IE)因其无需任务专项训练即可灵活适应新模式和领域而受到广泛关注。现有方法主要依赖整体提示、逐类型提示或多智能体辩论。然而,整体提示常出现边界错误和类型错误,而逐类型提示和多智能体辩论则带来跨类型冲突、冗余的智能体交互以及大量的 token 开销。为解决上述挑战,我们提出 SMADE-IE——一个面向零样本 IE 的稀疏证据驱动多智能体框架。SMADE-IE 首先采用自适应模式选择器,将输入动态路由至轻量级全局抽取模式或以类型为中心的抽取模式,从而减少不必要的类型筛选和推理噪声。对于存在冲突的预测结果,我们进一步引入证据驱动辩论机制,将论点结构化为 Toulmin 风格的组成要素,并通过外部证据评分和贝叶斯更新进行置信度聚合。在 NER、RE 和 JERE 任务的 9 个基准数据集上的实验结果表明,SMADE-IE 在持续超越现有零样本 IE 基线的同时,也通过稀疏智能体选择和早停辩论机制显著提升了 token 使用效率。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:17

# SMADE-IE:面向零样本信息抽取的稀疏多智能体证据驱动辩论框架
来源:https://arxiv.org/html/2606.04691
Kenfeng Huang1, Yi Cai1, Xin Wu1, Zikun Deng1, Li Yuan1† 1华南理工大学软件工程学院,广州,中国 kenfenghuang@gmail\.com, seyuanli@mail\.scut\.edu\.cn \{ycai, xinwu, zkdeng\}@scut\.edu\.cn

###### 摘要

基于大语言模型(LLM)的零样本信息抽取(IE)因其无需任务特定训练即可灵活适应新模式和领域而受到越来越多的关注。现有方法主要依赖整体提示、逐类型提示或多智能体辩论。然而,整体提示常出现边界和类型错误,而逐类型提示和多智能体辩论则引入了跨类型冲突、冗余的智能体交互以及大量的 token 开销。为解决上述挑战,我们提出 SMADE-IE——一个面向零样本 IE 的稀疏证据驱动多智能体框架。SMADE-IE 首先采用自适应模式选择器,将输入动态路由至轻量级全局抽取模式或类型中心抽取模式,减少不必要的类型选择和推理噪声。对于存在冲突的预测,我们进一步引入证据驱动辩论机制,将论点分解为 Toulmin 式组件,并通过外部证据评分和贝叶斯更新进行置信度聚合。在 NER、RE 和 JERE 任务共 9 个基准数据集上的实验结果表明,SMADE-IE 在性能上持续优于现有零样本 IE 基线,同时通过稀疏智能体选择和提前停止辩论提升了 token 效率。

SMADE-IE:面向零样本信息抽取的稀疏多智能体证据驱动辩论框架
††footnotetext:†通讯作者。

## 1 引言

信息抽取(IE)旨在从非结构化文本中提取结构化事实\(Li et al\.,2023b (https://arxiv.org/html/2606.04691#bib.bib17)\),支持知识图谱构建和问答等应用Liu et al\. \(2020 (https://arxiv.org/html/2606.04691#bib.bib21)\); Jain \(2020 (https://arxiv.org/html/2606.04691#bib.bib13)\)。代表性任务包括命名实体识别(NER)、关系抽取(RE)和联合实体关系抽取(JERE)Zeng et al\. \(2014 (https://arxiv.org/html/2606.04691#bib.bib46)\); Zheng et al\. \(2017 (https://arxiv.org/html/2606.04691#bib.bib50)\)。尽管有监督和指令微调的 IE 方法取得了强劲的性能\(Lu et al\.,2022 (https://arxiv.org/html/2606.04691#bib.bib25); Lou et al\.,2023 (https://arxiv.org/html/2606.04691#bib.bib23)\),但它们通常依赖大量标注、任务特定微调或固定模式,限制了对不断演变的实体类型、关系模式和领域的适应性\(Sainz et al\.,2024 (https://arxiv.org/html/2606.04691#bib.bib34); Fuente et al\.,2025 (https://arxiv.org/html/2606.04691#bib.bib5)\)。部分研究利用 LLM 的大量背景知识进行零样本 IE,实现对新模式和领域的灵活适应Xu et al\. \(2024 (https://arxiv.org/html/2606.04691#bib.bib43)\)。

早期基于 LLM 的零样本 IE 方法通常采用*整体提示*策略,在单一阶段内抽取所有元素\(Xie et al\.,2023 (https://arxiv.org/html/2606.04691#bib.bib42); Li et al\.,2024 (https://arxiv.org/html/2606.04691#bib.bib18)\)。尽管效率较高,该策略需要同时预测实体跨度和类型,往往导致实体遗漏、边界错误和类型混淆。如图1 (https://arxiv.org/html/2606.04691#S1.F1)\(a\)所示,模型遗漏了"John Smith",将"California"扩展为"in California",并将"Apple"误分类为 Product。

为缓解上述问题,近期工作引入了*逐类型提示*\(Li et al\.,2023a (https://arxiv.org/html/2606.04691#bib.bib16),2024 (https://arxiv.org/html/2606.04691#bib.bib18)\),通过独立提示分别抽取每种实体或关系类型。然而,独立生成的类型特定预测之间可能相互重叠或冲突。例如,在图1 (https://arxiv.org/html/2606.04691#S1.F1)\(b\)中,"Apple"同时被赋予 Organization 和 Product 两种类型。

为缓解此类冲突,近期的*多智能体辩论*方法为不同实体或关系类型部署专用智能体,并通过智能体间讨论来解决冲突预测\(Guan et al\.,2025 (https://arxiv.org/html/2606.04691#bib.bib7); Lu et al\.,2025 (https://arxiv.org/html/2606.04691#bib.bib24)\)。然而,穷举式的智能体交互仍然限制了其效率和可靠性。首先,由于每个样本通常只包含所有实体或关系类型中的一小部分(如表1 (https://arxiv.org/html/2606.04691#S1.T1)所示),对每个样本选择所有类型会引入不必要的 token 开销和计算成本。其次,错误的候选类型向辩论中注入无关上下文,使智能体偏离有意义的证据,导致不可靠的决策\(Fan et al\.,2026 (https://arxiv.org/html/2606.04691#bib.bib4); Shi et al\.,2023 (https://arxiv.org/html/2606.04691#bib.bib35); Liu et al\.,2024 (https://arxiv.org/html/2606.04691#bib.bib22); Yang et al\.,2025 (https://arxiv.org/html/2606.04691#bib.bib44); Tian et al\.,2026 (https://arxiv.org/html/2606.04691#bib.bib37)\)。例如,如图1 (https://arxiv.org/html/2606.04691#S1.F1)\(c\)所示,三个智能体(*PER*、*ORG* 和 *LOC*)对同一实体赋予不同类型,引发冗余讨论,掩盖有用证据并增加错误裁决的风险。最后,自由形式的辩论缺乏对主张、争议点和支撑证据进行建模的明确结构,难以系统地聚合置信度分数并达成稳定决策\(Choi et al\.,2026 (https://arxiv.org/html/2606.04691#bib.bib3)\)。如图1 (https://arxiv.org/html/2606.04691#S1.F1)\(c\)所示,Product 智能体认为"Apple 也可以是一种产品",而 Organization 智能体则声称"Apple 是一家科技公司"。若缺乏区分可靠证据与噪声或无关论点的结构化机制,此类辩论可能无法收敛,并产生大量 token 开销\(Choi et al\.,2026 (https://arxiv.org/html/2606.04691#bib.bib3)\)。

参见图注图 1:现有基于 LLM 的零样本 IE 方法。

| 任务 | 数据集 | 本体规模 | 平均类型数/样本 |
|------|--------|----------|----------------|
| NER | OntoNotes5 | 18 | 1.31 |
| NER | CrossRE | 38 | 4.72 |
| RE | DocRED | 32 | 2.46 |
| RE | REDFM | 32 | 2.77 |
| RE | SciERC | 8 | 1.88 |

表 1:部分零样本 IE 基准数据集统计信息。

为应对上述挑战,我们提出 SMADE-IE——一个面向零样本 IE 的稀疏证据驱动多智能体框架。如图2 (https://arxiv.org/html/2606.04691#S1.F2)所示,SMADE-IE 通过两个组件在抽取可靠性和计算成本之间取得平衡。首先,自适应模式选择器估计样本复杂度,并仅选择相关类型:简单输入进入轻量级全局抽取模式,复杂输入进入类型中心抽取模式,从而减少不必要的 token 开销和无关推理噪声。其次,针对类型中心抽取模式中的类型冲突,SMADE-IE 引入结构化辩论机制。与自由形式辩论不同,该机制将候选预测分解为 Toulmin 式论证组件\(Gupta et al\.,2024 (https://arxiv.org/html/2606.04691#bib.bib8)\),使智能体能够对每个主张背后的证据和推理发起攻击。外部证据评分器和贝叶斯 Beta 更新随后将支持和反驳信号聚合为以证据为中心的置信度估计,用于最终裁决。

主要贡献如下:

- •我们提出 SMADE-IE,一个面向零样本信息抽取的稀疏多智能体框架。借助自适应模式选择器,该框架根据样本复杂度自动将其调度至全局抽取模式或类型中心抽取模式,在效率与性能之间取得平衡。
- •我们引入证据驱动辩论机制,将每个冲突结构化为 Toulmin 式组件,并结合外部证据评分与贝叶斯 Beta 更新,实现更可靠的多智能体冲突裁决。
- •我们在 9 个零样本 IE 数据集上对 SMADE-IE 进行评估,展示了其在抽取性能和 token 效率两方面的优势。

参见图注图 2:SMADE-IE 总体架构。路由智能体负责选择抽取模式。对于冲突预测,证据驱动辩论执行基于 Toulmin 的排序、贝叶斯辩论和冲突消解。

## 2 方法

本节首先介绍零样本 IE 任务的定义,然后详细描述 SMADE-IE。如图2 (https://arxiv.org/html/2606.04691#S1.F2)所示,自适应模式选择器将每个输入调度至轻量级全局抽取模式或更精细的类型中心抽取模式。对于类型中心抽取模式中的跨类型冲突,我们引入证据驱动辩论模块进行结构化冲突裁决。对于 JERE,迭代实体-关系对齐步骤进一步强制实体与关系预测之间的本体一致性。

### 2\.1 问题形式化

给定句子 $s$ 以及预定义的实体类型集合 $\mathcal{T}_{e}$ 和关系类型集合 $\mathcal{T}_{r}$,NER 旨在识别 $s$ 中的所有实体提及 $\{e_{1},\dots,e_{n}\}$,并为每个提及分配类型 $t_{e}^{i}\in\mathcal{T}_{e}$,生成有类型实体集合 $E=\{(e_{i},t_{e}^{i})\}$。RE 需要先识别实体提及 $\{e_{1},\dots,e_{n}\}$,然后对每对有序实体 $(e_{i},e_{j})$ 预测其间成立的关系 $r_{ij}\in\mathcal{T}_{r}$,生成关系集合 $R=\{(e_{i},r_{ij},e_{j})\mid r_{ij}\in\mathcal{T}_{r}\}$。最后,JERE 同时识别所有实体和关系,生成完整类型化的五元组集合 $R^{*}=\{(e_{i},t_{e}^{i},r_{ij},e_{j},t_{e}^{j})\}$,其中每个五元组包含头实体、尾实体、它们的类型以及连接它们的关系。

由于零样本 NER 和 RE 在 SMADE-IE 中使用相同的 LLM 框架处理,仅在任务定义提示上有所不同,我们以零样本 NER 视角来介绍 SMADE-IE。

### 2\.2 自适应模式选择器

SMADE-IE 为每个输入动态选择推理抽取模式,在保留对歧义情况进行类型级别审查的同时减少冗余调用。受 LLM 推理中快慢思维范式的启发\(Zhang et al\.,2025a (https://arxiv.org/html/2606.04691#bib.bib48)\),我们引入路由智能体来估计相关类型子集和样本复杂度。

给定句子 $s$ 和实体类型集合 $\mathcal{T}_{e}$,路由智能体产生:

$$(\mathcal{A},c)=\mathrm{LLM}(s,P^{sel}_{\mathcal{T}_{e}}),\tag{1}$$

其中 $\mathrm{LLM}(\cdot)$ 表示大语言模型,$P^{sel}_{\mathcal{T}_{e}}$ 为选择器提示,$\mathcal{A}\subseteq\mathcal{T}_{e}$ 为候选类型子集,$c\in\{\mathrm{low},\mathrm{med},\mathrm{high}\}$ 表示估计的样本复杂度。我们采用三个复杂度级别而非二元标签,以更好地捕捉边界不确定性\(Mahajan et al\.,2026 (https://arxiv.org/html/2606.04691#bib.bib28)\)。估计结果随后被映射为两种执行模式:低复杂度输入使用轻量级全局抽取模式,中等和高复杂度输入使用类型中心抽取模式。

### 2\.3 全局抽取模式

为有效平衡抽取性能与计算成本(尤其是 token 用量),SMADE-IE 对低复杂度输入($c=\mathrm{low}$)采用全局抽取模式。该模式使用两个顺序执行的 LLM 智能体:通用智能体首先生成单次候选集,随后验证智能体执行有针对性的验证和精化。

#### 2\.3\.1 通用智能体

对于简单样本,我们首先应用整体提示方法Xie et al\. \(2023 (https://arxiv.org/html/2606.04691#bib.bib42)\)来抽取类型属于 $\mathcal{T}_{e}$ 的所有候选实体。形式上,给定全局抽取提示 $P_{\mathcal{T}_{e}}^{\mathrm{global}}$,通用智能体的输出定义为:

$$E_{U}=\mathrm{LLM}(s,P_{\mathcal{T}_{e}}^{\mathrm{global}}),\tag{2}$$

其中每个元素 $(e_{i},t^{i}_{e})\in E_{U}$ 将候选实体与其类型配对。

#### 2\.3\.2 验证智能体

尽管通用智能体在单次遍历中抽取所有元素,其粗粒度生成策略仍可能遗漏有效实体或引入冗余候选。为提高抽取可靠性,验证智能体受 G&O\(Li et al\.,2024 (https://arxiv.org/html/2606.04691#bib.bib18)\)中清理模块的启发,对候选集 $E_{U}$ 执行双向精化。

给定验证提示 $P_{\mathcal{T}_{e}}^{\mathrm{ver}}$ 和 $E_{U}$,验证智能体插入遗漏实体并删除不支持的候选:

$$(E^{+},E^{-})=\mathrm{LLM}(s,E_{U},P_{\mathcal{T}_{e}}^{\mathrm{ver}}),\tag{3}$$

其中 $E^{+}$ 和 $E^{-}$ 分别表示待插入和待删除的实体集合。相应地,全局抽取模式的最终输出为:

$$E=(E_{U}\setminus E^{-})\cup E^{+}.\tag{4}$$

### 2\.4 类型中心抽取模式

对于中等和高复杂度的输入,SMADE-IE 为自适应模式选择器在式(1)中选出的候选类型 $\mathcal{A}$ 实例化类型特定智能体,并添加一个审查智能体以恢复残余类型候选。为解决智能体之间的冲突,我们引入证据驱动辩论模块,限制无约束讨论和弱候选干扰,将冲突消解框架化为基于证据的置信度比较。

#### 2\.4\.1 类型特定智能体

对于每个候选类型 $t_{\mathcal{A}}^{i}\in\mathcal{A}$,我们设计一个专用的类型特定智能体,其提示为 $P_{\mathcal{A}}^{i}$。给定输入句子 $s$,该智能体抽取与类型 $t_{\mathcal{A}}^{i}$ 相关的候选实体 $e^{i}_{\mathcal{A}}$:

$$e^{i}_{\mathcal{A}}=\mathrm{LLM}(s,P_{\mathcal{A}}^{i}),\tag{5}$$

其中每个元素 $e_{\mathcal{A}}^{i,j}\in e_{\mathcal{A}}^{i}$ 表示为类型 $t_{\mathcal{A}}^{i}$ 抽取的候选实体。如图2 (https://arxiv.org/html/2606.04691#S1.F2)所示,Person 智能体同时抽取了 Amazon 和 Jordan Lee。随后我们将每个抽取的实体 $e_{\mathcal{A}}^{i,j}$ 分配给其对应类型 $t_{\mathcal{A}}^{i}$,并聚合所有预测以获得类型特定智能体的最终输出,记为 $E_{\mathcal{A}}$。

#### 2\.4\.2 审查智能体

自适应模式选择器在单次以召回为导向的遍历中估计 $\mathcal{A}$,但对于较长或上下文丰富的句子可能遗漏边缘类型。为解决此问题,我们在残余类型集合 $\mathcal{A}^{*}=\mathcal{T}_{e}\setminus\mathcal{A}$ 上引入审查智能体

相似文章

L-MAD:法律推理中多智能体辩论结构的系统性评估

arXiv cs.AI

本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。

EVE-Agent: 可验证证据的自我进化智能体

arXiv cs.AI

EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。