情感原型引导融合用于开放词汇不完整多模态情感识别

arXiv cs.AI 论文

摘要

本文提出了一种情感原型条件融合(APCF)框架,用于处理不完整模态的开放词汇多模态情感识别,使用情感原型库来指导特征融合,并利用LLM解码器生成自然语言情感标签。

arXiv:2609.16962v1 宣告类型:新 摘要:开放词汇多模态情感识别(OV-MER)旨在从多模态情感线索中生成开放的自然语言情感标签。然而,在现实场景中,由于采集设备和用户隐私限制,完整且同步的模态数据难以获取。现有的OV-MER方法大多针对完整模态输入设计,在模态缺失条件下无法进行有效的特征融合。同时,当前针对不完整模态的融合方法主要关注固定标签识别上下文,无法满足OV-MER上下文中任意情感语义引导的情感线索融合需求。为应对这些挑战,本文提出了一种用于不完整开放词汇情感识别的情感原型条件融合(APCF)框架。作为无候选生成框架,APCF将模态贡献学习扩展到由任意情感语义引导的场景。具体而言,我们构建了一个情感原型库,以显式建模与多种情感对应的多模态贡献特征,为不同情感语义视角下的模态融合提供动态约束。基于可用模态特征进行条件检索和特征聚合。精炼后的融合情感表征随后被送入LLM解码器以生成开放词汇情感标签。在OV-MERD+和MER-FG数据集上的实验表明,APCF显著优于最先进的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:05

# 面向开放词汇不完整多模态情感识别的情感原型引导融合  
来源:https://arxiv.org/html/2609.16962  
王诗悦、罗静、于春阳\\corresponding 杨新宇\\corresponding  

###### 摘要

开放词汇多模态情感识别(OV-MER)旨在基于多模态情感线索生成开放的自然语言情感标签。然而在实际场景中,由于采集设备限制与用户隐私约束,完整且同步的模态数据往往难以获取。现有OV-MER方法大多针对全模态输入设计,在模态缺失条件下无法实现有效的特征融合。同时,当前针对不完整模态的融合方法主要集中于固定标签识别场景,无法满足OV-MER中基于任意情感语义引导情感线索融合的需求。为解决这些挑战,本文提出一种面向不完整开放词汇情感识别的情感原型条件融合(APCF)框架。作为无候选生成的框架,APCF将模态贡献学习扩展至任意情感语义引导的场景。具体而言,我们构建情感原型库以显式建模对应不同情感的多模态贡献特征,为不同情感语义视角下的模态融合提供动态约束。基于可用模态特征进行条件检索与特征聚合,精炼后的融合情感表征随后输入LLM解码器生成开放词汇情感标签。在OV-MERD+与MER-FG数据集上的实验表明,APCF显著超越了现有最优基线方法。

1西安交通大学计算机科学与技术学院,西安,中国  
2OPPO研究院,上海,中国  

[email protected], [email protected], [email protected], [email protected], [email protected]  

如图1所示:所提APCF框架概览。## 引言

多模态情感识别(MER)结合互补的音频、视觉与文本线索来推断用户的情感状态。传统方法大多将MER建模为基于固定情感词表的分类任务(Zhang等,2022)。尽管该建模范式支持直接的监督与评估,但有限的标签集会压缩情感的细微状态,且无法表达预定义类别之外的概念。连续情感识别则预测维度情感标签中的值以表达任意情感状态(Praveen等,2022),然而维度标签本身在人类可理解的描述与维度描述间存在巨大的语义鸿沟,限制了数据集标注及面向终端用户系统的进一步应用。OV-MER提出预测自然语言形式的情感短语,以平衡语义覆盖与人类可读性(Lian等,2025c)。此类短语能够描述强度、混合状态与细微区别,但也扩大了必须与感知证据相连接的语义空间。AffectGPT证明了多模态大语言模型(MLLMs)能够基于多模态情感证据生成细粒度的情感描述(Lian等,2025a)。近期工作通过面向感知的策略优化(Han等,2026)与强化学习(Lian等,2026b)进一步推动了该接口的发展。面向挑战的生成评估(Lian等,2026a)与混合证据推理(Liu等,2026)同样支持开放词汇情感理解。

然而,当前大多数开放词汇MER流程仍假设所有模态均可用。该假设在实践中较为脆弱:由于传感器故障、数据采集限制与用户隐私顾虑等问题,获取完整且同步的模态数据十分困难。用户可能不看向摄像头,甚至拒绝授权采集视觉数据。转录文本可能因口音过重或以感叹词为主而无法收集足够有意义的语义信息。不完整模态数据将阻碍语言模态学习情感短语语义与多模态情感证据间关系的能力。缺乏关键训练的情感特征(如微表情)或转录中的语义信息,会影响多模态情感线索融合时的情感推理,并降低情感识别性能。

不完整MER研究已通过重建(Zhao等,2021)、学习提示(Guo等,2024)与灵活专家路由(Han等,2024)等方式处理缺失输入。其他方法采用跨模态查询(Miyoshi等,2026)、平衡提示(He等,2026)或不确定性感知扩散(Qiu等,2026)。这些方法提升了部分数据在情感理解与推理中的使用效率。然而,当前算法设计聚焦于固定标签语境下的语义理解,无法使其学习情感模态线索与融合矩阵的能力适应开放词汇语境中的任意情感空间。假设一个系统主要基于“恐惧”进行训练,却在“忧虑”上进行评估。语言模型可能知道这些短语相关,但感知通路可能不知道它们应借鉴相似的混合线索——如迟疑的语音、紧张的面部表情与不确定的措辞。以及如何在不完整多模态情况下充分利用情感线索混合来更好地指导语言模型。

我们提出情感原型条件融合(APCF)来解决这一问题。APCF维护一组情感-语言空间中重叠的地标称为情感原型,它们在分类情感词语义特征与维度情感空间中的标签坐标间对齐。原型是可复用的查询,用于调节共享计算,它学习一系列相似情感的证据使用方式,以及原型内情感的证据融合算法。对于每个观测到的音频、视频与文本流,APCF提取原型特定的证据,并通过观测集融合模块结合可用的模态流。生成的原型记忆暴露给预训练的语言解码器。其因果前缀决定哪些语义区域与哪些样本特定证据槽位相关,指导解码器在不完整模态线索下充分推理并生成开放词汇情感描述。

我们的主要贡献如下:

1. 1\.我们将开放词汇MER扩展至不完整多模态场景。本文将不完整开放词汇MER建模为从任意非空模态子集进行的无候选生成,连接了开放词汇识别与不完整模态融合。
2. 2\.我们构建了语义与模态感知的情感原型。可迁移的原型从配对的分类与维度源监督中学习,然后通过有界正则化残差适配至目标情感短语。它们组织了情感语义与模态特定的证据使用模式。
3. 3\.我们设计了一种新颖的模态融合算法。我们使用原型来调节带时间戳的证据检索、仅观测集融合以及进入语言编码器的因果路由,以进行推理并生成开放词汇情感短语。该算法在不完整开放词汇MER任务上达到了最先进的(SOTA)性能。

## 相关工作

### 开放词汇情感识别

OV-MER用自然语言术语替代封闭的情感类别,并通过语义归一化与情感轮表示来评估预测(Lian等,2025c)。AffectGPT通过面向情感的多模态指令数据与视听语言模型框架扩展了该表述(Lian等,2025a)。Emotion-LLaMA使用多模态指令微调将情感识别与解释和推理相结合(Cheng等,2024)。Agent-MER应用分层智能体审议(Lai等,2025),Clue2Emo在预测前组织多模态线索(Zhang等,2026),Nano-EmoX开发了紧凑的多任务情感模型(Huang等,2026),OPPO则通过面向感知的策略目标优化多模态情感推理(Han等,2026)。AffectGPT-RL研究了开放词汇识别的强化学习(Lian等,2026b),HyDRA执行基于结构的线索推理(Liu等,2026),AffectAgent协调检索增强智能体(Wang等,2026),AffectVerse预测潜在视听未来以进行情感推理(Zhao等,2026)。这些方法共同加强了开放感知与推理能力。部分方法包含了处理缺失输入的机制,但缺失性并未在受控模态子集中得到系统研究。

### 基于不完整模态的情感识别

缺失模态想象网络(MMIN)通过跨模态想象与循环一致性重建不可用表征(Zhao等,2021)。Guo等人的多模态提示学习方法将学习到的提示与缺失输入模式相关联(Guo等,2024),而Miyoshi等人的基于查询的方法则结合单模态与跨模态证据(Miyoshi等,2026)。BALM在不等缺失率下平衡训练(Nguyen等,2026),SimMLM在嵌套模态子集上训练以使额外观测不会降低预测性能(Li等,2025)。FuseMoE与Flex-MoE通过专家混合路由支持任意模态组合(Han等,2024; Yun等,2024)。ComP在模态分支间传播跨模态提示与共识信息以平衡固定标签预测(He等,2026)。HyperEF使用超图条件扩散恢复潜在缺失特征,并在固定标签对话情感识别中建模源级与决策级不确定性(Qiu等,2026)。这些方法为处理部分输入建立了强大机制,但其融合模块主要通过固定类别决策进行优化。将其应用于生成器本身并不能提供能将证据使用模式迁移至未见过短语的情感语义查询。

### 语义原型与情感表征

语义信息长期用于组织跨标签与模态的表征。UniBind使用语言增强原型构建共享多模态空间(Lyu等,2024)。Pipoli等人的语义提示方法将视觉识别条件化于可用模态场景(Pipoli等,2025),而Gaonkar等人的标签语义模型使用标签描述来引导情感反应间的注意力与关系(Gaonkar等,2020)。Buechel等人的与标签无关的嵌入桥接了异构的分类体系(Buechel等,2021)。Park等人将分类情感映射至维度坐标(Park等,2021),而Li等人的情感流形方法将离散术语锚定在连续情感结构中(Li等,2026)。

## 方法

### 问题表述

设M=\{A,V,T\}表示音频、视频与文本。样本i包含一个非空观测子集Si⊆M与一个记录哪些流存在的可用性向量ai。冻结的模态编码器Em将每个观测流映射为

Him=\{(hi,m,t,τi,m,t)\}t=1Tim,m∈Si,即H_{i}^{m}=\{(h_{i,m,t},\tau_{i,m,t})\}_{t=1}^{T_{i}^{m}},\qquad m\in S_{i},(1)其中hi,m,t是编码的标记,τi,m,t是其在片段中的归一化位置。每个有效标记都遵循此时间戳感知的表示。自然池化的流由单个有效标记表示,而非展开为人工时间序列。如果某模态不可用,则不创建其编码器输出,也不向证据集插入零值或学习到的缺失模态标记。

目标Yi=(yi,1,...,yi,Ni)是包含一个或多个自由形式情感短语的普通分词器序列。因此APCF不依赖情感特定的输出词表或测试时的候选列表。给定任务提示Qi与仅基于观测流构建的证据记忆ZiSi,预测被因果分解为

p(Yi∣XiSi)=∏np(yi,n∣yi,<n,Qi,ZiSi).即p(Y_{i}\mid X_{i}^{S_{i}})=\prod_{n}p(y_{i,n}\mid y_{i,<n},Q_{i},Z_{i}^{S_{i}}).(2)此表述分离了两项要求:感知通路必须在Si下重组剩余的任何证据,而语言通路必须使用不受限的情感语言表达该证据。APCF的结构如图1所示。APCF通过情感原型连接两者:这些重叠的语义查询在不成为输出类别的前提下组织证据。模型包含K个原型与L个参考时间槽。本节中,W*表示学习的投影矩阵,所有不可用的流均从相应操作中排除。

### 情感原型库

APCF使用重叠的地标而非互斥的输出类别来表征情感。源库仅从具有配对分类与维度标注的样本构建。原型槽位从源情感类别初始化,但一个样本可能分配质量至多个槽位。原型PkS包含一个语言

相似文章