Chiaro情感:基于评价理论的对比情感基准

arXiv cs.CL 论文

摘要

本文介绍了Chiaro,一个基于评价理论的新基准数据集,用于对比情感识别,其中两个个体从共享事件中体验到对立的情感。它评估了七个LLMs和四个情感分类器,揭示当前模型的表现不及人类。

arXiv:2609.03394v1 公告类型:新 摘要:情感识别基准通常预测每个文本一种情感,忽略了现实世界中两人从单一共享事件中产生对立情感的许多场景。例如,一个孩子兴奋地踢前面的座位,而前面的乘客则变得愤怒。我们引入CHIARO,一个基于评价理论的、包含1000个人工标注句子的对比情感推理基准。每个场景描述一个因果触发点,在一个人身上引发积极情感,在另一个人身上引发消极情感,基于十类分类法。我们评估了七个前沿LLMs和四个现成的情感分类器。最强的LLM达到67.3的宏观F1分数,远低于人类一致性,而现有情感分类器得分接近随机。除了评估,CHIARO还作为训练信号。当与现有情感语料库结合时,由此产生的下游分类器在CHIARO本身和十个外部情感基准中的六个上有所改进,这定位我们的数据集为情感识别的补充信号。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:58

# 《明暗法用于情绪:基于评价理论的对比性情绪基准数据集》来源:https://arxiv.org/html/2609.03394 作者:Mohammad Saim、Tianyu Jiang  
机构:辛辛那提大学  
邮箱:bommandh@mail\.uc\.edu, saimmd@mail\.uc\.edu, tianyu\.jiang@uc\.edu  

###### 摘要  
情绪识别基准通常每篇文本仅预测一种情绪,忽略了现实中许多情况——面对同一共享事件,两个参与者可能产生截然相反的情绪。例如,一个孩子因兴奋而踢前座座椅,而前排乘客却因此感到愤怒。我们推出了Chiaro:一个包含1,000个经过人工标注的句子的基准数据集,专注于基于评价理论的对比性情绪推断。每个场景描述一个因果触发事件,该事件使一方产生正面情绪,另一方产生负面情绪,所有情绪均来自十类分类体系。我们对七个前沿大语言模型和四个现成情绪分类器进行了基准测试。表现最优的大语言模型达到67.3宏F1值,远低于人类标注的一致性水平,而现有情绪分类器的表现接近随机水平。除评估用途外,Chiaro还可作为训练信号:将其与现有情绪语料库结合后,所训练的下游分类器在Chiaro本身及十个外部情绪基准中的六个上均取得提升,这证明我们的数据集可作为情绪识别的互补信号。

## 1 引言  
当两人共享同一事件时,他们往往会产生相反的情绪。每个人对同一情境的不同方面作出反应,而文本很少直接点明任何一种感受。例如,当众宣布的意外晋升可能让一位工程师因获得认可而自豪,而一直暗中竞争该职位的同事却可能在听到消息时感到胃部紧缩。两种情绪均未明言,却都能仅从情境中推断出来。理解双方情绪正是许多任务所需的分析单元:调解人际冲突的对话系统、需呈现角色对场景反应的故事生成,以及情绪在共享事件中常出现分歧的多人对话分析,甚至要考虑情感如何影响对情境的伦理判断。参见图1:共享场景中的对比情绪。一个坐在后方的孩子玩耍平板时开心地踢前座,而前方男子转身显露出明显的不满。  

从GoEmotions到其近期的多语言和文化适应版本,细粒度标注语料库在规模和覆盖面上已显著增长。然而,预测目标仍是孤立个体的情绪,且强基线往往仅依赖单个情感关键词。隐式情绪共享任务通过移除显式情感词部分解决了这一局限,但仍限于单个个体的情绪体验。我们提出一个针对图1所示的联合对立效价解读的数据集——两人在同一场景中对共享原因产生对比情绪。这个包含1,000个句子的基准数据集包含来自平衡十类分类体系的正面与负面情绪,并基于评价理论。此外,我们的基准显示最强的前沿大语言模型与人类标注一致性之间存在显著差距。  

我们强调理论依据:评价理论指出,情绪并非由事件直接产生,而是由主体基于目标一致性、能动性和确定性等维度对事件进行评估后产生的。两个见证同一事件但目标或能动性不同的个体可能产生对立情绪。例如,未预告的雪假既让孩子们欣喜,也让需紧急安排临时托儿的工作父母沮丧。这种框架对于构建对比性句子至关重要。我们介绍Chiaro(源自“明暗法”这一绘画技法,指在同一画布上渲染强烈明暗对比的技巧,如卡拉瓦乔、伦勃朗、维米尔的风格;隐喻同一事件中产生的对立情绪):一个包含1,000个句子的基准数据集,每个句子描述一个因果触发事件,使一方产生正面情绪,另一方产生负面情绪,所有情绪均来自平衡的十类分类体系。我们避免显式使用情感词,情绪必须仅从情境上下文中推断,且每个场景都有两人的人工标注。  

总体而言,我们的贡献有三方面:  
1. 我们推出Chiaro:一个基于评价理论、针对共享事件中双人对比情绪推断的1,000句基准数据集。  
2. 我们在Chiaro上对七个前沿大语言模型和四个现成情绪分类器进行了基准测试,表明即使最强的前沿模型也远低于人类一致性,且现成的单主体情绪分类器在此任务上仅达到随机水平。  
3. 我们确立Chiaro作为现有情绪分类器的互补训练资源。在Chiaro与匹配规模的现有情绪数据集(如GoEmotions)联合微调的RoBERTa-large模型,在Chiaro本身及十个外部情绪基准中的六个上均优于单独使用任一数据源的表现。

## 2 相关工作  
自然语言处理中的情绪研究始于早期情感文本分类和情感极性基准,已发展成涵盖词汇资源、维度标注框架、大规模多标签语料库和具身推理的广泛研究项目。组合式方法表明情感在篇章内并非单一,且冲突的极性可附着于不同目标;而隐式情绪任务证实表面情感词既非推断的必要条件也非充分条件。对话中的情绪识别将此框架扩展到多说话人场景,模型需跨轮次追踪情感状态并从社交语境推断情绪。对情绪的因果推理进一步延伸至情绪-因果对抽取及对话级因果分析的共享任务,要求模型联合识别情绪及其触发事件,这促成了我们采用的因果跨度目标。相关研究将情感极性附着于事件而非说话人。近期基准测试探讨大语言模型是真正推理情绪还是仅匹配表面模式。然而,情绪识别领域的大多数评估仍局限于单主体框架,考察的核心是哪个标签适用于单一说话人,而非对立效价如何分布在共享因果触发的两位主体之间。  

评价理论解释了同一外部事件在不同主体中引发不同情绪的机制——每个主体根据自身目标和关切评估该事件。这为对比情绪设定提供了形式化解释:为何单一行为使一方愉悦而另一方烦躁。共存情绪与混合情绪的研究证实,对立效价状态并非互斥,且难以从表面形式可靠恢复。这验证了我们的数据集所提出的非平凡推断挑战。人际情绪调节研究形式化了从一方表达行为到另一方情感反应的定向影响,我们在设计每个场景主体间的共享空间时采用了类似框架。  

对比情感的研究较少,主要出现在基于方面的情感分析中,其中冲突极性附着于单个文档意义内的不同意见目标。目前尚无数据集联合要求模型检测两位主体持有对立效价并按角色分配正确极性。CHIARO直接针对这一结合点,提供物理与非物理场景的成对变体以用于因果基础和角色感知极性分配,尤其针对当前模型最常失败的设置。

## 3 任务与数据集构建  
#### 任务定义。我们将对比情绪推断形式化如下:给定描述涉及两人(主体A和B)的共享事件的句子及各自角色,从包含五个正面和五个负面类的十类分类体系中预测每人的一种情绪。每个场景构造为恰好一人情绪正面、另一人负面,因此场景预测是对两人进行成对分配。输入不含显式情感词,情绪必须仅从情境推断。  

#### 动机。对比情绪推断是情绪建模的新评估目标,是对共享触发事件中反应相异的协作者双方持对立情绪的联合预测。单主体语料库如GoEmotions、ISEAR和共情对话将每个文本片段视为一人持有的一种情绪;多方对话语料库如MELD和DailyDialog对每条发言标注说话人的一种情绪。两者均未捕捉我们任务要求的联合对立效价解读。评价理论直接预测此情况:见证同一事件但目标或能动性不同的两位主体可能产生相反情绪。Chiaro既作为基准数据集也作为评估任务呈现此预测。  

Chiaro通过将简短的Reddit版块叙述转化为受控的双主体场景构建,要求:(i)主体间展现对立情绪效价;(ii)情绪需从情境而非显式情感词汇推断。构建流程包含三个阶段:源叙事选择、两阶段场景生成、自动化验证与修正。  

### 3.1 情绪分类体系  
我们为每个主体标注十种情绪之一,分为五个正面(快乐、自豪、宽慰、感激、兴奋)和五个负面(愤怒、悲伤、恐惧、厌恶、尴尬)类别。该体系源自GoEmotions数据集。我们通过应用以下标准筛选出每种极性中最鲜明的五种情绪:首先,层次聚类分析显示几种情绪形成强度对或近义簇(如愤怒/恼怒、恐惧/紧张、悲伤/悲痛),我们基于唤醒度保留每簇更可靠的代表;同时舍弃重叠的评价结构(如“爱”“关怀”“钦佩”均共享“感激”的他向正面单元)。其次,每种保留的情绪在评价理论模型的能动性、确定性和控制维度上占据独特单元。  

我们也考虑了其他分类体系。流行替代方案是埃克曼的六种基本情绪,但其同极性类别太少(仅一种正面情绪),无法构建平衡的对比场景。普鲁奇克的八种情绪包含效价模糊类别(“惊讶”“期待”),与对立效价设计不兼容。此外,如上所述,完整的GoEmotions分类体系(27种情绪类别,含“中立”为28种)包含近义簇,使我们在规模上无法进行平衡的双主体生成和可靠标注。  

表1:三个跨越不同情绪对的Chiaro场景示例。每个句子描述一个共享事件,双方从中产生对立情绪;句子文本中不包含显式情感词。  

每种保留的情绪随后与强制性事件或触发器配对。生成的句子必须实例化情境特征,使情绪可从源文本恢复(如“感激”需要可识别的帮助者;“宽慰”需要先前被避免的威胁)。从GoEmotions分类体系到Chiaro的完整映射及每种情绪的强制触发器详见附录G。  

### 3.2 源叙事  
我们从简短的Reddit版块叙述中汲取叙事灵感...

相似文章

揭示对话情感识别中的弱点

arXiv cs.AI

本文通过分析大型语言模型(LLMs)在零样本设置中的表现,研究对话情感识别(ERC)的弱点,揭示了由于标注模糊性导致的系统性失败,并提出了一个LLM-as-Judge框架以实现更鲁棒的评估。