MASTE:一种面向零样本文本情感三元组抽取的多智能体流水线

arXiv cs.CL 论文

摘要

MASTE是一个四阶段多智能体流水线,用于零样本文本情感三元组抽取,在不使用标注数据的情况下,显著优于零样本和思维链基线方法。

arXiv:2607.08080v1 公告类型:新 摘要:文本情感三元组抽取(ASTE)需要从给定的评论文本中联合识别(方面词,观点词,情感极性)三元组。尽管大语言模型(LLMs)在许多NLP基准上取得了强大的零样本性能,但其在ASTE上的效果仍然有限,因为单次生成迫使模型在单个解码步骤中确定跨度边界、观点分组和情感极性。常见的补救措施,如少样本上下文学习和思维链提示,只能带来边际改进,并且严重依赖于从标注训练数据中采样的领域内示例或精心设计的推理提示,而在零样本部署中这些并不广泛可用。受经典智能体范式的启发,我们提出了MASTE——一种用于零样本文本情感三元组抽取的多智能体流水线。MASTE将ASTE分解为四个连续阶段,每个阶段由专门的智能体处理不同的组合子任务,并显式地依赖于先前输出。这种设计实现了完全无需训练的零样本ASTE,并且能够跨不同主干网络和数据集进行泛化。在四个ASTE基准上的大量实验表明,MASTE在使用相同主干网络的情况下,大幅优于零样本和思维链LLM基线,并且在不使用任何标注三元组的情况下缩小了与全监督方法的差距。代码地址:https://github.com/Hankerlove/MASTE。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:12

# 面向零样本方面情感三元组提取的多智能体流水线
来源:https://arxiv.org/html/2607.08080
洪傲¹,王乐航²,岳志润¹,王明鑫¹,王子涵¹,刘厚德¹

¹清华大学,²武汉大学

###### 摘要

方面情感三元组提取(ASTE)需要从给定的评论句子中联合识别*(方面、观点、情感)*三元组。尽管大语言模型(LLM)在许多自然语言处理基准上取得了强大的零样本性能,但它们在 ASTE 上的有效性仍然有限,因为单次生成迫使模型在单个解码步骤中同时确定跨度边界、观点分组和情感极性。常见的补救措施——少样本上下文学习和思维链提示——仅带来边际改进,并且严重依赖于从标注训练数据中采样的领域内示例或精心设计的推理提示,而这在零样本部署中通常不可用。受经典智能体范式的启发,我们提出了 **MASTE**(面向零样本方面情感三元组提取的多智能体流水线),这是一个四阶段框架,其中专门的智能体依次处理每个组成子任务,并显式地以先前的输出为条件。这种设计实现了完全无需训练的零样本 ASTE,并且能够泛化到不同的骨干网络和数据集。在四个 ASTE 基准上的大量实验表明,在相同骨干网络下,MASTE 显著优于零样本和思维链 LLM 基线,缩小了与全监督方法之间的差距,且未使用任何标注的三元组。我们的代码可在 https://github.com/Hankerlove/MASTE 获取。

**MASTE: 面向零样本方面情感三元组提取的多智能体流水线**

洪傲¹,王乐航²,岳志润¹,王明鑫¹,王子涵¹,刘厚德¹††感谢通讯作者。¹清华大学,²武汉大学,

## 1 引言

基于方面的情感分析(ABSA)是一项细粒度的情感分析任务,用于识别给定文本中每个特定方面所表达的情感极性(Pontiki 等,2014 (https://arxiv.org/html/2607.08080#bib.bib3))。在其子任务中,**方面情感三元组提取(ASTE)**(Peng 等,2020 (https://arxiv.org/html/2607.08080#bib.bib1))是最集成的形式。如图 1 (https://arxiv.org/html/2607.08080#S1.F1)(上图)所示,给定一个评论句子,ASTE 返回完整的(Aspect, Opinion, Polarity)三元组集合,其中 Aspect 是被评价的术语,Opinion 是描述该方面的表达,Polarity 表示相应的情感极性,包括正面、负面和中性。例如,对于评论句子 *“The food was great but the service was dreadful!”*,一个 ASTE 系统应输出 (food, great, POS)((\\textit{food},\\,\\textit{great},\\,\\texttt{POS}))和 (service, dreadful, NEG)((\\textit{service},\\,\\textit{dreadful},\\,\\texttt{NEG}))。

该食物很好吃但服务很糟糕!
POS NEG
黄金三元组:(food, great, POS), (service, dreadful, NEG)
常见 LLM 零样本失败模式(精确匹配):
(a) 跨度膨胀。
LLM → (food, wasgreat, POS) P & R ↓
(b) 三元组合并。
LLM → (food, great but service dreadful, POS) P & R ↓
(c) 幻觉。
LLM → (taste, great, POS) P ↓

图 1:(上图) ASTE 任务的说明:给定一个输入句子,模型需要提取完整的(Aspect, Opinion, Polarity)三元组集合。Aspect(蓝色)和 Opinion(橙色)通过弧线配对,弧线上的标签表示情感极性。(下图) 在同一示例上,零样本 LLM 提示可能表现出的三种系统性失败模式;每种模式都会损害精确率(P)、召回率(R)或两者。

先前针对 ASTE 及相关 ABSA 子任务的方法可分为几类,包括基于流水线的方法(Peng 等,2020 (https://arxiv.org/html/2607.08080#bib.bib1))、序列标注(Xu 等,2020 (https://arxiv.org/html/2607.08080#bib.bib2);Yan 等,2021 (https://arxiv.org/html/2607.08080#bib.bib7))、序列到序列生成(Zhang 等,2021 (https://arxiv.org/html/2607.08080#bib.bib6);Naglik 和 Lango,2024 (https://arxiv.org/html/2607.08080#bib.bib26))、网格和表格填充标注方案(Wu 等,2020 (https://arxiv.org/html/2607.08080#bib.bib4);Chen 等,2022 (https://arxiv.org/html/2607.08080#bib.bib5);Sun 等,2024 (https://arxiv.org/html/2607.08080#bib.bib8))以及多领域联合训练(Hou 等,2024 (https://arxiv.org/html/2607.08080#bib.bib24))。尽管这些方法在领域内表现强劲,但它们共享两个局限性:(i) 它们依赖于特定数据集的三元组标注,限制了跨领域迁移;(ii) 它们绑定到固定的标注约定(例如,跨度边界风格),并在迁移到新领域或提取粒度时需要重新训练。

最近,大语言模型(LLM)在广泛的 NLP 任务中展现出了显著性能和强大的零/少样本泛化能力(Brown 等,2020 (https://arxiv.org/html/2607.08080#bib.bib31);DeepSeek-AI,2024 (https://arxiv.org/html/2607.08080#bib.bib25)),包括 ABSA(Zhang 等,2024 (https://arxiv.org/html/2607.08080#bib.bib28);Scaria 等,2024 (https://arxiv.org/html/2607.08080#bib.bib27);Yang 等,2024 (https://arxiv.org/html/2607.08080#bib.bib30);Fan 等,2025 (https://arxiv.org/html/2607.08080#bib.bib29))。然而,当直接应用于 ASTE 时,LLM 在这项细粒度的结构化任务上表现挣扎:它们常常无法捕捉方面词和观点词之间的复杂潜在依赖关系,混淆方面提及与观点提及,并产生系统性的跨度边界错误和幻觉跨度。具体而言,即使是 GPT-4o(零样本)在 14res 上的 F1 分数也仅为 35.4%,与最先进的监督方法(Sun 等,2024 (https://arxiv.org/html/2607.08080#bib.bib8))存在约 40 个百分点的差距。为了缩小这一差距,后续工作探索了少样本上下文学习(Yang 等,2024 (https://arxiv.org/html/2607.08080#bib.bib30))、思维链提示(Wei 等,2022 (https://arxiv.org/html/2607.08080#bib.bib21))、指令微调(Scaria 等,2024 (https://arxiv.org/html/2607.08080#bib.bib27))以及将微调提取器与 LLM 作为评判者相结合的分解流水线(Bodke 等,2025 (https://arxiv.org/html/2607.08080#bib.bib9));同时,另一条并行的工作线研究了用于相关信息提取任务的多智能体辩论(Du 等,2024 (https://arxiv.org/html/2607.08080#bib.bib10);Lu 等,2025 (https://arxiv.org/html/2607.08080#bib.bib11))。然而,这些方法都没有明确减轻图 1 中所示的系统性单次生成失败模式。

为了解决先前方法的挑战,我们提出了 **MASTE**,一种无需训练的面向零样本方面情感三元组提取的**多智能体流水线**。MASTE 将 ASTE 分解为四个**顺序条件化的**智能体——方面、观点、情感和一致性——它们共享一个骨干 LLM,每个下游智能体接收输入句子以及所有上游智能体的结构化输出。

我们在四个常用的 ASTE 基准上进行了实验,并将 MASTE 与一组全面的先前方法进行了比较。我们的结果表明,MASTE 在所有四个数据集上均达到了基于 LLM 的方法中的最先进性能。我们进一步进行了跨骨干网络和消融研究,以验证 MASTE 的通用性并评估每个组件的贡献。总体而言,我们的贡献总结如下:

- • **一种无需训练的 ASTE 多智能体流水线。** 据我们所知,MASTE 是第一个无需训练的多智能体流水线,不需要任务特定的微调,并暴露了可由下游智能体验证和复用的中间结构。
- • **面向精确匹配 ASTE 的跨度感知智能体设计。** 受观察到的零样本 LLM 提取系统性失败模式的启发,我们设计了两种机制:带有**一对多方面-观点映射**的最小跨度观点提取,以及一个**一致性检查智能体**,负责对完整的三元组集合进行跨度接地、极性校准和重复合并。
- • **对 ASTE 基准的全面评估。** 我们在多个基准数据集上进行了广泛实验,以验证 MASTE 的有效性。结果表明,所提出的流水线持续改进了基于 LLM 的 ASTE,而消融和跨骨干网络分析则证实了其分阶段设计的重要性和通用性。

参见标题

图 2:在 ASTE-Data-V2 的一个示例上展示的 MASTE 流水线。实线箭头携带结构化数据在阶段之间传递;虚线箭头将原始句子作为上下文传递给每个智能体。阶段 2 强制使用*最小*观点跨度并支持一对多方面-观点映射。阶段 4 验证完整的三元组集合:幻觉移除、极性校准、重复合并以及输出规范化。

## 2 相关工作

### 2.1 方面情感三元组提取

方面情感三元组提取(ASTE)由 Peng 等人(2020 (https://arxiv.org/html/2607.08080#bib.bib1))提出,用于联合识别方面词、观点表达和情感极性。大多数先前工作依赖于监督学习,包括位置感知标注(Xu 等,2020 (https://arxiv.org/html/2607.08080#bib.bib2))、序列到序列生成(Zhang 等,2021 (https://arxiv.org/html/2607.08080#bib.bib6);Yan 等,2021 (https://arxiv.org/html/2607.08080#bib.bib7))、网格标注方案(Wu 等,2020 (https://arxiv.org/html/2607.08080#bib.bib4);Chen 等,2022 (https://arxiv.org/html/2607.08080#bib.bib5);Sun 等,2024 (https://arxiv.org/html/2607.08080#bib.bib8))、基于 Transformer 的跨度建模(Naglik 和 Lango,2024 (https://arxiv.org/html/2607.08080#bib.bib26))以及多领域联合训练(Hou 等,2024 (https://arxiv.org/html/2607.08080#bib.bib24))。尽管在领域内有效,这些方法需要任务特定的三元组标注,并且通常学习特定数据集的跨度约定。而 MASTE 则研究无需训练的场景,即系统必须识别精确的 ASTE 三元组,而不更新模型参数。

近期工作已开始探索 LLM 用于 ABSA 和 ASTE。MiniConGTS(Sun 等,2024 (https://arxiv.org/html/2607.08080#bib.bib8))评估了 GPT-3.5-turbo 和 GPT-4 在 ASTE 上的表现,并表明即使在 LLM 时代,预训练-微调仍然具有竞争力。其他基于 LLM 的 ABSA 方法使用指令微调(Scaria 等,2024 (https://arxiv.org/html/2607.08080#bib.bib27))、特征感知的上下文学习(Yang 等,2024 (https://arxiv.org/html/2607.08080#bib.bib30))或句法-观点-情感推理链(Fan 等,2025 (https://arxiv.org/html/2607.08080#bib.bib29))。与我们的设置最接近的是 PASTEL(Bodke 等,2025 (https://arxiv.org/html/2607.08080#bib.bib9)),它将 ASTE 分解为子任务并应用 LLM 作为评判者,但在验证之前仍依赖于微调提取器。相比之下,MASTE 完全使用无需训练的 LLM 智能体进行分解和跨度感知验证。

### 2.2 用于信息提取的多智能体 LLM

多智能体 LLM 系统因辩论式方法而流行,其中多个模型实例相互批评并修改彼此的输出(Du 等,2024 (https://arxiv.org/html/2607.08080#bib.bib10))。这一思想最近已被调整用于结构化信息提取:CROSSAGENTIE(Lu 等,2025 (https://arxiv.org/html/2607.08080#bib.bib11))在命名实体识别(NER)和关系抽取(RE)智能体之间执行跨类型和跨任务辩论;AgentRE(Shi 等,2024 (https://arxiv.org/html/2607.08080#bib.bib12))为低资源关系抽取配备了记忆、检索和反思模块;Agent-Event-Coder(Wang 等,2025 (https://arxiv.org/html/2607.08080#bib.bib13))将零样本事件抽取视为一个多智能体代码生成和验证过程。MASTE 与这些系统的不同之处在于,它使用在类型化 ASTE 中间结果上顺序条件化的智能体,并针对方面-观点-情感三元组的跨度边界控制。

### 2.3 分解与验证

分解和验证是提高 LLM 可靠性的常见策略。思维链提示(Wei 等,2022 (https://arxiv.org/html/2607.08080#bib.bib21))在单次生成中引出中间推理,而由简到繁提示(Zhou 等,2023 (https://arxiv.org/html/2607.08080#bib.bib22))将复杂问题分解为有序的子问题。验证方法进一步使用学习的验证器或智能体验证程序检查生成的解决方案(Cobbe 等,2021 (https://arxiv.org/html/2607.08080#bib.bib23);匿名,2025 (https://arxiv.org/html/2607.08080#bib.bib19))。MASTE 将这些思想调整到细粒度的结构化提取中:一致性检查智能体不是验证自由形式的最终答案,而是对整个预测的三元组集合进行操作,移除幻觉跨度、校准情感标签并规范化观点边界,以满足 ASTE 的精确匹配评估。

## 3 方法

### 3.1 任务定义

给定一个输入句子 s = (w₁, w₂, ..., wₙ),包含 n 个词元,ASTE 的目标是提取完整的三元组集合:

T(s) = { (aᵢ, oᵢ, pᵢ) }ᵢ₌₁ᵐ   (1)

其中 aᵢ 是出现在 s 中的方面词,oᵢ 是对应的观点词,pᵢ ∈ {POS, NEG, NEU} 表示情感极性。m 是句子 s 中包含的情感三元组数量。遵循标准 ASTE 评估(Xu 等,2020 (https://arxiv.org/html/2607.08080#bib.bib2)),仅当方面词、观点词和情感极性完全匹配一个黄金三元组时,预测才算正确。

### 3.2 总体框架

图 2 (https://arxiv.org/html/2607.08080#S1.F2) 展示了 MASTE 的总体框架。MASTE 将 ASTE 分解为四个顺序条件化的智能体,它们共享相同的冻结 LLM 骨干网络 M,并操作于类型化的中间输出。每个下游智能体接收原始句子以及所有上游智能体的结构化输出。以下段落详细描述每个智能体。

##### 方面提取智能体。

方面提取智能体 f_asp 识别输入句子中提到的方面。给定 s,它返回一组方面词:

f_asp(s; M) → A = {a₁, ..., aₖ}   (2)

我们约束该智能体仅提取在 s 中显式提及的方面跨度,从句子中逐字复制,避免释义、词形还原或边界扩展。由于所有下游阶段都以 A 为条件,此阶段的错误可能传播到整个流水线。因此,我们在生成后应用确定性跨度验证:任何返回的方面如果未作为不区分大小写的子字符串出现在 s 中,则在观点提取之前被丢弃。

##### 观点提取智能体。

以句子 s 和已验证的方面集 A 为条件,观点提取智能体 f_opn 识别与每个提取的方面相关联的观点跨度:

f_opn(s, A; M) → P = { (aᵢ, oᵢ⁽ʲ⁾) }

相似文章

ACAT:一个用于高效基于方面情感数据集标注的协作平台

arXiv cs.CL

ACAT 是一个基于 Web 的协作标注平台,支持四种基于方面的情感分析(ABSA)工作流,其核心特性是在导出时自动运行 ETL 流水线以计算标注者间一致性(IAA)指标,从而直接生成可用于训练的数据集。该平台在 1,002 条餐厅评论上完成了验证,标注中位耗时为 31.58 秒,原始 IAA 最高达 0.86。