EmoStance: 通过表情符号弱监督实现响应侧情感取向控制的共情响应生成

arXiv cs.AI 论文

摘要

EmoStance是一种用于共情响应生成的方法,它使用表情符号弱监督来建模响应侧的情感取向,从而提高对话中的上下文特异性和感知响应性。

arXiv:2609.02133v1 Announce Type: new Abstract: 共情响应生成要求模型不仅要决定说什么,还要决定如何回应前一说话者的情感情境。我们将其表述为响应侧情感取向控制,并使用多标注者表情符号分布作为弱情感态度证据,而非输出符号或黄金标签,以诱导一个潜在控制空间,该空间在操作上近似于听者立场。我们构建了EmojiDialogue,这是EmpatheticDialogues的句子级扩展,包含表情符号投票和置信度分数,并提出了EmoStance,该方法建模源侧情感表达,从对话语境和说话者角色预测软响应侧取向,并通过连续前缀嵌入引导冻结的指令调优大语言模型。在20名标注者和800个判断的盲配对评估中,EmoStance达到了62.2%的决定性胜率,在上下文特异性和感知响应性方面收益最明显,同时与外部知识方法互补。代码、注释元数据和重建脚本可在我们的GitHub仓库获取:https://github.com/18277390221/EmoStance。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:01

# EmoStance:基于表情符号弱监督的情感响应倾向控制框架

来源:https://arxiv.org/html/2609.02133

###### 摘要
共情对话生成要求模型不仅要决定"说什么",还要决定"如何回应"前一位发言者的情感情境。我们将此问题形式化为**响应侧情感倾向控制**,并利用多标注者的表情符号分布作为弱情感-态度证据(而非输出符号或黄金标签),来构建一个操作上近似于听者立场的潜在控制空间。我们构建了**EmojiDialogue**——一个在**EmpatheticDialogues**基础上扩展的、包含表情符号投票与置信度分数的对话级数据集,并提出了**EmoStance**框架。该框架建模源侧情感表达,从对话上下文与发言者角色中预测软性的响应侧倾向,并通过连续前缀嵌入引导一个冻结的指令微调大语言模型。在包含20位标注者、800次判断的盲测配对评估中,**EmoStance**取得了62.2%的决定性胜率,在上下文特异性和感知响应度方面提升最为显著,同时能与外部知识方法形成互补。代码、标注元数据及重构脚本已开源于我们的GitHub仓库:https://github.com/18277390221/EmoStance。

## 1 引言
共情对话生成要求模型不仅要决定说什么,还要决定下一个发言者应如何接续上一轮对话。一个回复可能话题相关,但依然显得疏离、过于欢快、侵入性强、说教味重,或对发言者的情感情境回应不足。我们将这个操作性变量称为**响应侧情感倾向**:即下一个回复在语言表达之前,应如何在情感与人际层面上定位的软性表征。这一概念与**听者立场**相关,但我们不假设能直接获取或拥有听者立场的黄金标签;相反,我们将听者立场视为对弱监督的响应侧控制表征的高层解读。

现有监督仅能部分捕捉这种倾向。先前工作通过情境级情绪标签(Rashkin et al., 2019)、维度情感表征(Mohammad, 2018; Colombo et al., 2019)以及支持策略分类法(如提问、反映、建议和信息提供)来表征情感上下文(Liu et al., 2021)。后续系统建模了轮次级状态转换、混合主动权、策略-响应解耦或话语动态(Zhao et al., 2023; Deng et al., 2023; Zhang et al., 2025a; Wan et al., 2025)。这些变量刻画了对话状态,但本身并不决定下一个回复应体现出安慰、共鸣兴奋、温和关切、谨慎试探还是另一种人际取向。

基于提示的接口也已被研究用于平滑控制预定义属性的强度(Zhou et al., 2024)。而我们目标则是一种**响应特定、类似混合**的潜在倾向,它可能难以被表述为一个简短稳定的指令。这些局限性促使我们引入一个软性中间变量来建模下一个回复在情感与人际层面应如何定位。

图1(https://arxiv.org/html/2609.02133#S1.F1)说明了这一区别。具有相同粗糙情绪标签的情境可能需要不同的情感吸收方式、人际距离或回应强度。此外,响应侧情感倾向常常是模糊的:同一个情境下可能存在多个合理的回复,标注者可能合理地偏好不同的倾向。这使得硬性的单标签监督不适合用于细粒度的响应倾向控制。

**图1**:相同的情绪标签可能隐藏着不同的响应侧情感倾向线索。表情符号仅作为弱情感-态度上下文信号使用,而非黄金情绪或听者立场标签。

我们使用表情符号作为弱监督来诱导这种控制表征。关键点在于,共情系统并非应生成表情符号。先前研究表明,大规模的表情符号预测可产生可迁移的情感、情绪和讽刺表征(Felbo et al., 2017);文本描述可以支持语义化的表情符号表征(Eisner et al., 2016);表情符号序列可以表达组合语义(Yang et al., 2024)。在我们的标注设置中,这些信号在操作上可能对应于鼓励、同情、庆祝、犹豫、戏谑、惊讶或关切等响应倾向。

由于表情符号的含义依赖于上下文且标注者可能意见不一,我们遵循差异感知软标签学习和情绪分布估计的做法(Fornaciari et al., 2021; Wu et al., 2024),将多标注者的表情符号投票和置信度分数聚合成软分布。我们不将表情符号视为输出符号、黄金情绪标签或黄金听者立场标签。这些分布提供了用于建模源侧情感表达和响应侧情感倾向的弱情感-态度证据。

基于此想法,我们构建了**EmojiDialogue**,这是**EmpatheticDialogues**的一个对话级弱监督扩展(Rashkin et al., 2019),其中多个LLM标注者为每个话语提供表情符号投票和置信度分数。我们进一步提出**EmoStance**,一个可控生成框架。它诱导一个无名称的潜在情感倾向空间,从对话上下文和发言者角色转换中预测响应侧倾向,将其重构为连续控制向量,并通过学习的前缀嵌入注入冻结的指令微调LLM(Li and Liang, 2021)。

实验表明,基于原型的重构比直接向量回归稳定得多。盲测人工评估进一步表明,**EmoStance**主要提升了上下文特异性和感知响应度,同时能与增强常识的系统形成互补。

我们的贡献有三方面。首先,我们将共情对话生成表述为响应侧情感倾向控制,使用学习到的倾向表征作为听者立场的操作近似,而非直接标注的立场标签。其次,我们引入了**EmojiDialogue**,一个可通过多标注者表情符号分布保留模糊性的可扩展弱监督资源。第三,我们提出**EmoStance**,一个潜在情感倾向控制框架,它建模源侧情感表达,预测受上下文和角色约束的响应侧情感倾向,并通过连续前缀控制冻结的LLM来实现所预测的倾向。

## 2 相关工作
##### 共情与支持性对话生成
共情对话生成通常被定义为识别对话者的情感状态并产生适当回应的任务,其中**EmpatheticDialogues**被广泛用作基于情感的开放域对话基准(Rashkin et al., 2019)。早期工作通过整合情感信号来改进共情回复生成,例如显式情绪条件、连续情感表征和情绪分布(Zhou et al., 2018; Lin et al., 2019; Majumder et al., 2020; Li et al., 2020)。另一类工作通过常识认知扩展共情对话生成,或通过支持策略和用户状态来建模情感支持对话(Liu et al., 2021; Sabour et al., 2022; Zhao et al., 2023; Zhou et al., 2023; Li et al., 2024)。最近的研究进一步引入了话语级规划或面向意图的中间变量用于支持性回复生成(Wan et al., 2025; Zhang et al., 2025b)。这些研究显示了显式中间规划的价值,但其规划变量通常是发言者情绪、支持策略、意图或外部常识。相比之下,我们聚焦于**听者立场**:即下一个发言者在表达之前应采用的响应侧情感和人际倾向。

##### 听者立场与表情符号弱监督
我们的表述与关于**人际立场取向**的工作相关,该工作将对话意义视为发言者对对话者、话题和持续互动的一种定位方式(Kiesling et al., 2018)。我们研究的是这个问题的**响应侧变体**:听者立场描述的是下一个发言者应如何承接上一轮,而非上一个发言者有什么私人情绪。由于立场解读是主观的、依赖于上下文的且常常是欠定的,我们的工作也遵循了近期研究的主张,即标注者分歧应被保留,而非压缩成单一的硬标签(Fornaciari et al., 2021; Mostafazadeh Davani et al., 2022; Uma et al., 2021; Wu et al., 2024)。预测不确定性也已被用于识别主观标注任务中的模糊实例(Alies et al., 2025)。

表情符号为此目的提供了有用的弱监督接口,因为它们是紧凑的情感和语义信号,能够表达细微且有时模糊的人际含义(Eisner et al., 2016; Felbo et al., 2017; Yang et al., 2024)。与先前基于表情符号监督的回复生成(如MojiTalk(Zhou and Wang, 2018))不同,我们不预测或输出表情符号,也不使用单一表情符号作为离散控制码。相反,我们将多标注者的表情符号投票和置信度分数聚合成软分布,并用它们来诱导一个用于听者立场规划的无名称潜在立场空间。

##### 冻结语言模型的连续控制
可控生成方法通过离散标签、属性分类器、解码时判别器、自然语言指令或连续提示来引导语言模型(Pascual et al., 2021; Yang and Klein, 2021; Krause et al., 2021; Li and Liang, 2021; Zhou et al., 2024)。**EmoStance**遵循连续控制的方向,但其控制信号不是手动指定的属性、二元判别器目标或语言指令。它是一个从表情符号弱监督诱导出来的、从对话上下文和角色转换预测出来的、并通过学习的前缀嵌入注入冻结指令微调LLM的连续听者立场向量。

更详细的相关工作讨论见附录A(https://arxiv.org/html/2609.02133#A1)。

## 3 弱情感倾向监督
我们在**EmpatheticDialogues**(Rashkin et al., 2019)之上构建了**EmojiDialogue**,作为一个对话级的弱监督层。由于原始的情境级情绪标签未指定目标回复应如何在情感与人际层面定位,我们收集了每个话语的多标注者表情符号投票,并将其聚合成软表情符号分布。我们将相邻的对话轮次转换为源-响应示例,其中输入包含情境、对话历史和下一个发言者标记,目标是下一个话语。生成的**EmojiDialogue**数据集包含76,489个源-响应示例,划分为58,829/9,263/8,397个训练/验证/测试实例。一个人类合理性审计显示弱标签的合理性很高,99.69%的标注有效,99.77%的标注有效或模糊但可接受。完整的构建、审计、许可、隐私和发布细节见附录B(https://arxiv.org/html/2609.02133#A2)和E(https://arxiv.org/html/2609.02133#A5)。

## 4 方法:基于表情符号监督的情感倾向控制
**EmoStance**使用第3节(https://arxiv.org/html/2609.02133#S3)中描述的弱监督来学习一个用于共情回复生成的内部控制变量。其核心思想是将通常纠缠在直接生成中的两个决策分离开来:下一个回复应如何在情感与人际层面上面向前一个发言者定位,以及这种定位应如何用自然语言实现。我们将这个中间信号称为**响应侧情感倾向表征**。

表情符号标注仅在训练期间用作弱情感-态度观测值;它们不被视为输出符号、黄金情绪标签或黄金听者立场标签。在推理时,**EmoStance**仅接收对话上下文和下一个发言者标记,不包含表情符号标注、源自响应的倾向向量、黄金听者立场标签或黄金回复。

**图2**:**EmoStance**概述。表情符号弱监督诱导一个无名称的潜在情感倾向空间,用于源侧表达建模、角色感知响应倾向预测、基于前缀的生成控制以及可选的倾向一致性重排序。表情符号不被视为黄金情绪或听者立场标签。

### 4.1 概述与问题设定
设对话 D 是一系列标记了角色的话语 D = {(r₁, u₁), ..., (rₜ, uₜ)},其中 uₜ 是第 t 轮的话语,rₜ 表示发言者角色。在双人对话中,rₜ ∈ {A, B},尽管该表述也允许更大的有限角色集合。每个对话可能还包含一个情境描述 s。

对于每一对相邻话语 (uₜ, uₜ₊₁),我们构造序列化输入 xₜ = ser(s, D≤ₜ, rₜ₊₁),其中 D≤ₜ = {(r₁, u₁), ..., (rₜ, uₜ)},ser(·) 是一个序列化函数。

相似文章

通过潜在向量引导的可控情感生成

arXiv cs.CL

本文提出EmoVec,一个轻量级框架,通过潜在向量引导在大型语言模型中实现可控情感生成,无需更新模型权重即可实现对情感强度的连续控制。

用于共情回应的动态常识协调

arXiv cs.CL

提出了DCC,一个用于共情回应生成的动态常识协调框架,集成了基于残差的交互、关联引导的过滤和迭代解码,相比于基线模型提高了情感分类准确率和回应多样性。