ACAT:一个用于高效基于方面情感数据集标注的协作平台
摘要
ACAT 是一个基于 Web 的协作标注平台,支持四种基于方面的情感分析(ABSA)工作流,其核心特性是在导出时自动运行 ETL 流水线以计算标注者间一致性(IAA)指标,从而直接生成可用于训练的数据集。该平台在 1,002 条餐厅评论上完成了验证,标注中位耗时为 31.58 秒,原始 IAA 最高达 0.86。
arXiv:2606.04189v1 公告类型:新论文
**摘要:** 基于方面的情感分析(ABSA)需要高质量的数据集来训练可靠的模型。然而,现有标注工具通常以平面文件形式输出结果,研究人员需要手动合并多标注者数据、重建关系结构,并通过自定义脚本计算可靠性指标。本文介绍 ACAT(基于方面情感分析协作标注工具),这是一个原生支持四种 ABSA 工作流的 Web 平台:(1)方面类别情感分析,(2)子句级分割,(3)具有字符级位置追踪的方面词情感分析,以及(4)具有双跨度偏移量保留的方面情感三元组抽取。其核心贡献在于一套自动化的提取、转换、加载(ETL)流水线,能够在导出时直接对协作标注结果进行对齐并计算标注者间一致性(IAA)指标,从而生成可直接用于训练的数据集。在针对 1,002 条餐厅评论、由两名专业水平不同的标注者参与的初步验证中,ACAT 的标注中位耗时为 31.58 秒,各任务的原始 IAA 介于 0.78 至 0.86 之间。
查看缓存全文
缓存时间: 2026/06/05 02:13
# ACAT:一个用于高效方面级情感数据集标注的协作平台
来源:https://arxiv.org/html/2606.04189
11单位信息:¹罗马尼亚布加勒斯特国家理工大学 POLITEHNICA
²罗马尼亚科学院,布加勒斯特 Ilfov 3,050044,罗马尼亚
11邮箱:\{ana\_maria\.mogoase, ciprian\.truica, elena\.apostol\}@upb\.ro
###### 摘要
方面级情感分析(ABSA)需要高质量的数据集来训练可靠的模型。然而,现有的标注工具将输出视为平面文件,导致研究人员需要手动整合多标注者数据、重建关系结构,并通过自定义脚本计算可靠性指标。本文介绍了 ACAT(方面级情感分析协作标注工具),这是一个原生支持四种 ABSA 工作流的 Web 平台:(1)方面类别情感分析,(2)子句级分割,(3)具有字符级位置追踪的方面词情感分析,(4)保留双跨度偏移量的方面情感三元组抽取。其核心贡献是一个自动化的抽取、转换、加载(ETL)流水线,可在导出时直接对协作标注进行对齐并计算标注者间一致性(IAA)指标,从而生成可直接用于训练的数据集。在对 1,002 条餐厅评论进行的初步验证中,两名具有不同专业背景的标注者使用 ACAT,标注时间中位数为 31.58 秒,所有任务的原始 IAA 在 0.78 至 0.86 之间。
## 1 引言
情感分析已从文档级别的极性分类演进为方面级情感分析(ABSA)[14, 2],涵盖多项高级任务。尽管大语言模型(LLMs)不断进步,人工标注的*黄金标准*数据集对于可靠评估仍不可或缺[1]。然而,ABSA 数据集的数据管理生态系统依然分散:通用工具将标注视为平面文件,数据集成、多标注者合并和 IAA 计算的负担仍落在研究人员身上。
本文介绍 ACAT,旨在解答以下研究问题:(RQ1)平台如何在无需复杂预配置的情况下支持 ABSA 知识抽取?(RQ2)哪些架构方案能消除协作环境中的数据整合瓶颈?(RQ3)标注模式如何捕捉标准工具通常丢失的隐式或潜在语义?(RQ4)如何在无需外部后处理脚本的情况下自动验证 IAA?(RQ5)为何现有方案之间的直接一对一指标比较不可靠?
ACAT 以 Docker 容器形式部署(PostgreSQL、Python Flask、Vanilla JavaScript)。我们在 1,002 条餐厅评论上对其进行验证,标注时间中位数为 31.58 秒,原始 IAA 最高达 0.86。主要贡献包括:(C1)**统一多任务知识抽取**。原生支持四种 ABSA 架构,无需预标注配置:ACSA[14]、子句级[8]、ATSA[14] 和 ASTE[11]。(C2)**自动化 ETL 与数据整合**。多用户数据的行级对齐,并原生计算 IAA 指标(Cohen's Kappa[3]、Fleiss' Kappa[5]、Macro F1[19])。(C3)**隐式语义建模**。当显式目标词缺失时,通过隐式切换开关捕捉潜在语义[17]。(C4)**数据治理**。高速双击交互模型,内置时间追踪与层级监督机制。
## 2 相关工作
尽管 ABSA 算法发展迅速,标注基础设施仍相对滞后[4]。Doccano[9]、LightTag[12] 和 Label Studio[18] 等通用工具支持平面序列标注,但其导出的嵌套 JSON 需要自定义脚本来重建 ABSA 任务结构并整合多标注者数据。BRAT[16] 等重型环境支持关系任务并提供内置策展模块,但其繁琐的图形绘制操作引入了较高的认知负担。YEDDA[20] 和 ASQE-DPT[6] 等离线工具优化了本地速度,但缺乏集中式协作架构,导致许多 ABSA 数据集依赖定制的一次性流水线[15]。此外,捕捉隐式方面仍具挑战性[7, 17]:尽管神经模型能编码隐式含义[7],传统工具仍将标注限制在可见文本跨度内。ACAT 通过原生 ABSA 支持、自动化 ETL、隐式切换开关和流畅的双击交互解决了上述所有问题。
## 3 标注结构与导出
ACAT 支持四种标注粒度级别,每种级别以基于坐标的字符串存储,并在导出时转换为 CSV、JSON 和 XML 格式。我们采用离散的三类极性系统 $P = \{\text{Positive}, \text{Negative}, \text{Neutral}\}$ [10, 13]。图1 以贯穿全文的示例展示了所有任务。¹
导出逻辑将四个语言变量——方面类别($a$)、情感极性($s$)、方面词($t$)和观点词($o$)——组合成特定任务的输出:**ACSA 与子句级**($a{+}s$)将潜在类别映射到极性标签;**ATSA**($t{+}s$)将显式词语与字符级偏移量结合;**ASTE**($t{+}o{+}s$)链接方面与观点跨度,保留双偏移量对。
**ACSA** 将标注序列化为 `category:polarity:implicit`。**隐式切换开关**(C3)将类别-极性对扩展为正式三元组 $(c, p, i)$,$i \in \{0, 1\}$,用于标记某个类别在无显式表层词的情况下被讨论的情形[14]。ACAT 支持开放世界范式:标注者可在活跃会话中动态扩展方面分类体系。
**子句级情感分析**通过交互式分割器将复杂句子分割为基本话语单元(EDU),即表达单一情感的最小子句级文本跨度,从而解决混合情感问题。子句在 CSV 中以 `||` 分隔;JSON 使用 `clause` 数组,将每个片段与 `tags` 数组配对。
**ATSA** 从标注者的文本选择中捕获字符级偏移量,例如 `burgers[4,11]:positive;fries[32,37]:neutral` [2]。
**ASTE** 抽取完整的关系三元组 $(t, o, s)$ [11],序列化双偏移量对,例如 `burgers[4,11]:top-notch[21,30]:positive;fries[32,37]:ok[43,45]:neutral`。重复条目会被自动检测并拒绝。
参见图注
**图 1**:ACAT 导出架构。语言变量 $(a, s, t, o)$ 被组合为粒度递增的四个任务(上方),下方展示其 CSV、JSON 和 XML 序列化形式,包括字符级偏移量和隐式标志。
**协作 ETL 流水线**。在导出过程中,ACAT 执行自动行级对齐,动态将数据集记录与用户特定标注层连接,并解析标注者被分配到不相交子集时产生的稀疏矩阵。设 $R = \{r_1, \ldots, r_n\}$ 为评论实例集合,$U = \{u_1, \ldots, u_m\}$ 为标注者集合。流水线生成统一特征矩阵 $M$,其中 $M_{i,j}$ 包含 $u_j$ 对 $r_i$ 的标注。三种 IAA 指标通过 scikit-learn 和 statsmodels 计算并嵌入所有导出格式(回答 RQ4)。Cohen's Kappa[3] 用于两标注者数据集;Fleiss' Kappa[5] 在三位或更多标注者时自动选用;Macro F1[19] 用于处理所有子任务中的类别不平衡问题。
## 4 分析与讨论
两名标注者各自对每项任务处理了 $N{=}100$ 条评论,样本来自包含 1,002 条餐厅评论的语料库。ACAT 的数据集共享机制确保每项任务使用相同的评论集。其中一名标注者具有 ABSA 先验经验(A1),另一名为新手(A2),这一刻意设计旨在评估平台在不同专业水平下的易用性。
表1 汇总了时间性能和一致性结果。整体标注时间中位数为 31.58 秒(均值 37.77 秒)。A1 在 30 秒内完成了 58-67% 的评论;A2 完成了 32-37%。总体而言,49% 的标注在 30 秒内完成,表明双击交互模型降低了典型输入的操作阻力。长尾分布(最大值 164 秒,标准差最高达 30.35 秒)反映了密集评论需要开放世界方面扩展的复杂性。
**表 1**:时间性能(秒)与标注者间一致性指标。**Agr.** 为原始一致率(标注者间相同标签的百分比)。**Eff.** 为效率(在 $\leq 30$ 秒内完成标注的评论百分比)。
原始一致率从 0.78(ASTE)到 0.86(ACSA)不等,反映了任务复杂度的差异。Cohen's Kappa 显示中等至较强的一致性,在子句级任务中峰值达 $\kappa{=}0.65$,这是因为 A2 在先完成 ACSA 后已有所适应。ASTE 的一致性最低($\kappa{=}0.52$,$F1{=}0.50$),反映了抽取完整三元组的内在难度。
**讨论**。ACAT 与通用平台之间的直接性能比较因隐性数据工程成本而变得复杂(回答 RQ5)。仅以通用工具的原始标注速度为基准,忽略了编写自定义 ETL 流水线、从平面导出中重建 ASTE 三元组以及外部计算 IAA 所需的额外工作量。ACAT 开箱即可实现上述功能,而在通用平台上获得等效结果则需要额外的后处理工程。
**局限性**。本次评估仅使用两名标注者在单一领域(餐厅评论)上进行,限制了其在标注者数量、文本类型和领域方面的泛化能力。为三位及以上标注者实现的 Fleiss' Kappa 未得到实际测试。可扩展性与并发负载基准测试,以及正式的可用性研究,留作未来工作。平台目前不支持所有 ABSA 任务,交互模型针对桌面端进行了优化。
## 5 结论
我们介绍了 ACAT,一个面向 ABSA 的端到端数据策展平台。在 1,002 条餐厅评论上的初步实验表明,该平台标注效率较高(中位数 31.58 秒),标注者间一致性达到中等至较强水平。回顾我们的研究问题:(RQ1)ACAT 原生集成四种 ABSA 工作流,无需预标注配置。(RQ2)自动化 ETL 流水线在导出时执行行级对齐。(RQ3)隐式切换开关捕捉未明确表达的方面和情感。(RQ4)IAA 指标在导出时原生计算。(RQ5)与通用工具的直接比较不可靠,因为它们忽略了隐性 ETL 成本;ACAT 原生处理端到端流水线。
**未来工作**包括平台的正式发布、基于 LLM 的预标注以降低时间和成本、支持更多 ABSA 子任务、使用更多标注者进行跨领域验证、可扩展性基准测试,以及实时分析仪表板。
**致谢**:本文的研究部分得到以下资助支持:(1)罗马尼亚科学院资助项目"NetGuardAI:社交网络有害内容检测与免疫智能系统"(AOȘR-TEAMS-IV);(2)罗马尼亚布加勒斯特国家理工大学 POLITEHNICA 通过 PubArt 计划提供的支持。
## 参考文献
- [1] Aldeen, M., Luo, J., Lian, A., Zheng, V., Hong, A., Yetukuri, P., Cheng, L.:ChatGPT 与人工标注者:ChatGPT 用于文本标注的综合分析。载于:国际机器学习与应用会议,第 602–609 页,IEEE(2023)。https://doi.org/10.1109/ICMLA58977.2023.00089
- [2] Apostol, E.S., Pisică, A.G., Truică, C.O.:ATESA-BÆRT:一种用于方面级情感分析的异构集成学习模型。Knowledge-Based Systems 326, 113987(2025)。https://doi.org/10.1016/j.knosys.2025.113987
- [3] Cohen, J.:名义量表的一致性系数。Educational and Psychological Measurement 20(1), 37–46(1960)。https://doi.org/10.1177/001316446002000104
- [4] Colucci Cante, L., D'Angelo, S., Di Martino, B., Graziano, M.:文本标注工具:综合综述与比较分析。载于:国际复杂、智能与软件密集型系统会议,第 353–362 页,Springer(2024)。https://doi.org/10.1007/978-3-031-70011-8_33
- [5] Fleiss, J.L.:衡量多评分者间的名义量表一致性。Psychological Bulletin 76(5), 378(1971)。https://doi.org/10.1037/h0031619
- [6] Hua, Y.C., Denny, P., Wicker, J., Taskova, K.:EduRABSA:一个用于方面级情感分析任务的教育评论数据集。arXiv preprint arXiv:2508.17008(2025)。https://doi.org/10.48550/arXiv.2508.17008
- [7] Li, B.Z., Nye, M., Andreas, J.:神经语言模型中意义的隐式表示。载于:ACL 与 IJCNLP 年会,第 1813–1827 页(2021)。https://doi.org/10.18653/v1/2021.acl-long.143
- [8] Na, J.C., Kyaing, W.:药品评论网站上用户生成内容的情感分析。Journal of Information Science Theory and Practice 3, 6–23(2015)。https://doi.org/10.1633/JISTaP.2015.3.1.1
- [9] Nakayama, H., Kubo, T., Kamura, J., Taniguchi, Y., Liang, X.:doccano:面向人工的文本标注工具(2018)。https://github.com/doccano/doccano
- [10] Pang, B., Lee, L.:观点挖掘与情感分析。Comput. Linguist 35(2), 311–312(2009)。https://doi.org/10.1561/1500000011
- [11] Peng, H., 等:知其然、知其所以然:方面级情感分析的近乎完整解决方案。载于:AAAI 人工智能会议,第 8600–8607 页(2020)。https://doi.org/10.1609/aaai.v34i05.6383
- [12] Perry, T.:LightTag:文本标注平台。载于:自然语言处理经验方法会议,第 20–27 页(2021)。https://doi.org/10.18653/v1/2021.emnlp-demo.3
- [13] Petrescu, A., Truică, C.O., Apostol, E.S., Paschke, A.:EDSA-Ensemble:一种事件检测情感分析集成架构。IEEE Transactions on Affective Computing 16(2), 555–572(2025)。https://doi.org/10.1109/taffc.2024.3434355
- [14] Pontiki, M., 等:SemEval-2014 任务 4:方面级情感分析。载于:国际研讨会相似文章
基于SSP构建用于细粒度方面级情感分析的评价标注数据
本文介绍了利用半自动符号传播(SSP)方法,构建用于电子商务评论细粒度方面级情感分析的韩语评价标注语料库(EVAD)。并在该数据集上评估了KoBERT和KcBERT模型,在方面-值对识别任务上取得了较高的F1分数。
MASTE:一种面向零样本文本情感三元组抽取的多智能体流水线
MASTE是一个四阶段多智能体流水线,用于零样本文本情感三元组抽取,在不使用标注数据的情况下,显著优于零样本和思维链基线方法。
AAbAAC:自身免疫信息提取的标注语料库
AAbAAC是一个手动标注的语料库,包含115篇PubMed摘要,用于自身免疫信息提取,重点关注自身免疫疾病和自身抗体等实体。研究表明,在该语料库上进行微调后,命名实体识别(NER)性能有所提升。
使用语法与语义上下文评估汇总(SSAS)的情感预测一致性分析
本论文提出了SSAS(语法与语义上下文评估汇总)框架,旨在通过分层分类和迭代汇总来减少噪声和方差,提高基于大语言模型的情感预测的一致性。在三个行业标准数据集上的实证评估显示,数据质量和企业决策可靠性可提升30%。
基于方面的情感演化及其与多轮同行评审中评审轮次的相关性:一种深度学习方法
本文利用深度学习方法(LCF-BERT-CDM)研究了《自然·通讯》多轮同行评审中方面级情感的分布与演化,实现了82.65%的宏F1值,并发现随着评审轮次增加,正面情感上升而负面情感下降。