面向多模态情感分析的语义对齐结构抽象
摘要
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
arXiv:2607.27790v1 公告类型:新
摘要:多模态情感分析(MSA)旨在通过将自然语言与非语言模态相结合来解释复杂的人类情感。非语言模态与自然语言具有结构同构性,因为两者都可以被视为随时间演变的特征序列。这种同构性使得非语言模态能够转换为类文本标记,以进行统一的语义推理。大语言模型(LLMs)被设计用于理解和生成序列数据,因此可用于解释复杂的情感序列。然而,现有的基于LLM的方法主要捕获低层表面特征,未能建模由结构变化和上下文交互产生的情感语义。为了解决这一局限,我们提出了\textbf{SentiLLM},一个利用\textit{语义对齐结构抽象}将连续原始信号提炼为紧凑、语义丰富的标记的统一框架。具体而言,我们引入了一种\textit{双流显著性-上下文校准机制},该机制将非语言特征序列分解为焦点流和环境流。焦点流在文本先验的引导下捕获显著的情感转变(例如面部表情),而环境流则表征稳定的背景状态。通过将这些动态情感转变与背景状态进行校准,SentiLLM有效地将非语言模态投影到一个统一的语义空间中,使其对LLMs自然可理解。作为一个即插即用模块,SentiLLM仅用少量可训练参数就显著提升了判别性能。我们的方法在四个数据集MOSI、MOSEI、CH-SIMS和CH-SIMS v2上取得了优越的性能,证明了结构抽象范式在MSA中的有效性。我们的代码可在以下网址获取:\href{https://github.com/especiallyW/SentiLLM}{SentiLLM}。
查看缓存全文
缓存时间: 2026/07/31 10:02
# 语义对齐的结构抽象用于多模态情感分析
来源:https://arxiv.org/html/2607.27790
\(2026\)
###### 摘要\.
多模态情感分析 \(MSA\) 旨在通过整合自然语言与非语言模态来解读复杂的人类情感。非语言模态与自然语言具有结构同构性,因为两者都可被视为随时间演化的特征序列。这种同构性使得非语言模态能够被转化为类似文本的标记,以进行统一的语义推理。设计用于理解和生成序列数据的大语言模型 \(LLMs\) 因此可以被用来解读复杂的情感序列。然而,现有的基于LLM的方法主要捕获低层表面特征,无法建模由结构变化和上下文交互产生的情感语义。为解决这一局限,我们提出了 **SentiLLM**,一个利用**语义对齐的结构抽象**将连续的原始信号提炼为紧凑、语义丰富的标记的统一框架。具体而言,我们引入了一种**双流显著性-上下文校准机制**,该机制将非语言特征序列解耦为焦点流和环境流。焦点流在文本先验的引导下捕获显著的 sentiment 情感偏移(例如面部表情),而环境流表征稳定的背景状态。通过将这些动态情感偏移与背景状态进行校准,SentiLLM 有效地将非语言模态投影到一个统一的语义空间中,使其被 LLM 自然理解。作为一个即插即用模块,SentiLLM 仅需少量可训练参数即可显著提升判别性能。我们的方法在四个数据集——MOSI、MOSEI、CH-SIMS 和 CH-SIMS v2 上取得了优越的性能,证明了结构抽象范式在 MSA 中的有效性。我们的代码可在以下网址获取:https://github.com/especiallyW/SentiLLM\.
社交媒体;多模态情感分析;大语言模型;多模态学习;多模态融合
††journalyear:2026††copyright:cc††conference:Proceedings of the 34th ACM International Conference on Multimedia; November 10–14, 2026; Rio de Janeiro, Brazil††booktitle:Proceedings of the 34th ACM International Conference on Multimedia \(MM ’26\), November 10–14, 2026, Rio de Janeiro, Brazil††isbn:979\-8\-4007\-2213\-4/2026/11††doi:10\.1145/3767308\.3835866††ccs:Computing methodologies Computer vision††ccs:Computing methodologies Natural language processing## 1\.引言
多模态情感分析 \(MSA\)\(Zhang2024ACS\) 利用异构数据源——视频、音频和文本——来实现对人类情感状态的精确推理。得益于其在商业决策和人机交互中的关键价值,该领域已获得广泛关注。现有方法\(Hazarika2020MISAMA;li2023decoupled;tsai2019multimodal;wang2025dlf;luo2025towards;wang2025rclmufn\)通常采用模态解耦与融合范式。这些方法侧重于设计复杂的网络架构来捕获共享和特定的模态信息。然而,对专用架构的过度依赖限制了可扩展性和泛化能力,阻碍了对大规模预训练知识的有效利用。
多模态大语言模型 \(MLLMs\)\(li2023blip;liu2024improved\) 的出现促使我们重新审视不同模态的内在本质。非语言模态(如视频和音频)与自然语言具有结构同构性,两者都可被视为随时间演化的特征序列\(sun2019videobert;hsu2021hubert;tsai2019multimodal\)。例如,视频帧类似于句子中的词语,其语义由前后帧定义。因此,作为内嵌海量世界知识的序列建模专家,大语言模型 \(LLMs\)\(dubey2024llama;Yang2024Qwen25TR\) 具有处理非语言序列并执行统一推理的天然潜力。
然而,将LLM直接应用于MSA面临巨大的**语义鸿沟**。原始音视频信号表现为连续且冗长的序列。简单的线性映射往往只能捕获表面层特征(例如面部纹理或声学频率),无法提取微妙的情感线索,如愤怒的颤抖或讽刺的语气。这种表象与语义的错位使得变换后的特征无法与LLM语义空间对齐。因此,需要一种语义翻译机制,将非语言模态转换为LLM可理解的情感标记。
我们认为情感并非静态的时间步映射。相反,它体现了跨时间的显著语义偏移与上下情境态的结构统一。我们提出情感判断遵循**焦点-环境校准机制**:人类首先关注显著的情感偏移(即焦点),例如突然的尖叫或扬眉,随后通过上下情境线索(即环境)验证其可靠性。基于此,理想的情感标记必须满足两个标准:\(1\)**结构性**,代表一个显著的动态过程而非静态快照;以及 \(2\)**校准性**,通过上下文验证以确保语义稳定性而非随机噪声。
在这些认知洞见的指导下,我们引入了 SentiLLM,一个基于**语义对齐的结构抽象**的参数高效框架——该过程将连续的、未对齐的原始信号提炼为紧凑的、语义丰富的标记。超越传统的特征提取范式,SentiLLM 作为一个时空语义翻译器,将非语言信号转换为情感标记。具体而言,为实例化这一理论校准,我们设计了一种双流显著性-上下文校准机制。该机制将音视频信号解耦为携带情感偏移的**焦点流**和描绘上下情境态的**环境流**。焦点流利用文本语义锚定来检索显著的动态情感偏移,而环境流捕获全局背景状态以校准焦点信息的稳定性。通过这种交互,原始信号被抽象为紧凑且语义丰富的情感标记。得益于这种结构抽象,生成的情感标记与文本语义空间无缝对齐,使其无需复杂的架构修改即可兼容LLM推理。
为验证我们的方法,我们在四个基准数据集上进行了大量实验:MOSI、MOSEI、CH-SIMS 和 CH-SIMS v2。实验结果表明,我们的方法无需复杂架构设计即可取得有竞争力的性能,且仅需少量可训练参数。我们的主要贡献总结如下:
- ∙\\bullet利用非语言模态与自然语言之间的结构同构性,我们提出了 SentiLLM,展示了在LLM语义空间内统一多模态情感推理的可行性。
- ∙\\bullet根植于**焦点-环境校准**,我们引入了双流显著性-上下文校准机制。该机制实现了从原始信号到适合LLM的紧凑情感标记的结构抽象。
- ∙\\bullet在四个数据集上的大量实验证明了我们提出方法的有效性。我们还发布了代码以促进社区的进一步研究。
## 2\.相关工作
### 2\.1\.多模态情感分析
传统方法侧重于设计精细的融合机制以捕获模态间交互。早期工作\(Zadeh2017TensorFN;liu2018efficient;zadeh2018memory\)通过数学外积显式建模交互。随着 Transformer\(vaswani2017attention\) 和图神经网络\(scarselli2008graph\) 的兴起,一些方法\(zadeh2018multimodal;williams2018recognizing;tsai2019multimodal\)引入了动态融合图和架构创新来处理未对齐序列中的长程依赖问题。类似地,\(yu2021learning;han2021improving;rahman2020integrating\) 通过学习范式和理论来优化融合特性。具体而言,Self\-MM\(yu2021learning\) 采用自监督学习进行多任务训练,而 MMIM\(han2021improving\) 最大化互信息以保留关键数据。MAG\-BERT\(rahman2020integrating\) 将 BERT\(devlin2019bert\) 与多模态输入集成。
近年来,以文本为主导的任务凸显了模态解耦的重要性\(liu2022make;Hazarika2020MISAMA;li2023decoupled;sun2022cubemlp;sun2024mfm;zhang2025modal\)。这些方法区分特定模态和共享模态以增强鲁棒性。例如,DMD\(li2023decoupled\) 通过蒸馏提升表征纯度。DLF\(wang2025dlf\) 分离共享和特定信息以进行分层预测。KAN\-MCP\(luo2025towards\) 使用 KANs\(liu2024kan\) 解决由密度差异引起的模态不平衡问题。
然而,这些方法依赖于复杂的、任务特定的架构。在本文中,我们将视频和音频模态视为"时间句子",利用预训练LLM中嵌入的广泛序列知识来捕获鲁棒的情感偏移。
### 2\.2\.大语言模型
LLM的最新进展彻底改变了序列建模和推理,如 GPT\(brown2020language\)、LLaMA\(dubey2024llama\) 和 Qwen\(Yang2024Qwen25TR\)。通过视觉指令微调,一些研究将LLM扩展到视觉-语言任务。像 LLaVA\(liu2024improved\)、Flamingo\(alayrac2022flamingo\) 和 BLIP\-2\(li2023blip\) 这样的模型采用 MLP 或 Q\-Former 作为连接器,有效弥合了视觉编码器与LLM之间的差距。
在MSA领域,一些方法\(hu2022unimse;li2023unisa\)将情感分析重构为序列生成任务,将多模态输入转换为离散标记以进行统一生成。MSE\-Adapter\(yang2025mse\) 设计了一个轻量级适配器,使用文本引导混合器过滤非文本特征以实现高效适配。
然而,这些方法通常采用粗略的线性映射或指令微调,从而无法捕获情感的内在本质。它们将音视频信号视为静态上下文补充,未能显式捕获跨时间的结构变化(例如突发的情绪转换)。缺乏去噪-校准机制使模型容易受到环境噪声的影响,限制了细粒度推理能力。在本文中,我们提出了一种双流显著性-上下文校准机制。它主动提取并校准显著的情感偏移,实现向LLM语义空间的特征转换。
参见图1的说明。图1:SentiLLM的总体架构。该模型由两个核心模块组成:一个上下文时间编码模块和一个双流显著性-上下文校准机制。
## 3\.方法
在本节中,我们将详细介绍 SentiLLM 框架。首先,我们在第3.1节 (https://arxiv.org/html/2607.27790#S3.SS1) 中概述整体架构。然后,我们在第3.2节 (https://arxiv.org/html/2607.27790#S3.SS2) 中描述上下文时间编码模块。接下来,我们在第3.3节 (https://arxiv.org/html/2607.27790#S3.SS3) 中详细阐述双流显著性-上下文校准机制。最后,我们在第3.4节 (https://arxiv.org/html/2607.27790#S3.SS4) 中定义联合优化目标。
### 3\.1\.总体架构
问题定义。给定一个包含 NN 个样本的多模态数据集 D\\mathcal\{D\},每个样本包含文本 Xt\\mathbf\{X\}\_\{t\}、视觉 Xv\\mathbf\{X\}\_\{v\} 和音频 Xa\\mathbf\{X\}\_\{a\} 输入以及一个情感标签 yy。
图1 (https://arxiv.org/html/2607.27790#S2.F1)\(a\) 展示了 SentiLLM 的架构。具体而言,对于文本输入 Xt\\mathbf\{X\}\_\{t\},我们使用预训练的 tokenizer 获取 Ft\\mathbf\{F\}\_\{t\},并使用嵌入层将其转换为向量 Zt∈RT×D\\mathbf\{Z\}\_\{t\}\\in\\mathbb\{R\}^\{T\\times D\}。对于视觉 Xv\\mathbf\{X\}\_\{v\} 和音频 Xa\\mathbf\{X\}\_\{a\} 输入,我们分别采用特定的编码器提取原始特征序列 Fv\\mathbf\{F\}\_\{v\} 和 Fa\\mathbf\{F\}\_\{a\}。随后,**语义对齐的结构抽象模块**处理这些非语言模态。该模块包括两个阶段:\(1\) **上下文时间编码模块**,将原始特征转换为上下文感知的序列;以及 \(2\) **双流显著性-上下文校准机制**,通过软显著性解耦和双查询抽象将连续序列抽象为紧凑、校准的情感标记 Zv\\mathbf\{Z\}\_\{v\} 和 Za\\mathbf\{Z\}\_\{a\}。最后,我们将这些标记与文本特征拼接,形成统一序列供LLM推理。
### 3\.2\.上下文时间编码
原始特征 Fm\\mathbf\{F\}\_\{m\}\(m∈\{v,a\}m\\in\\\{v,a\\\}\) 包含丰富的低层信息,但缺乏时间因果关系和上下文依赖性。为了使模型具备时间上下文感知能力,我们执行时间建模和位置增强。
为实现这一点,我们不是使用简单的池化操作,而是采用标准 Transformer 块 \(TFBlock\\text\{TF\}\_\{\\text\{Block\}\}\) 来捕获长程时间依赖。此外,由于后续的解耦可能破坏局部结构,我们引入了绝对位置嵌入 \(PE\) 以保留序列先验。形式上:
\(1\)Hm=TFBlock\(Linear\(LN\(Fm\)\)\+PE\)\\mathbf\{H\}\_\{m\}=\\text\{TF\}\_\{\\text\{Block\}\}\(\\text\{Linear\}\(\\text\{LN\}\(\\mathbf\{F\}\_\{m\}\)\)\+\\text\{PE\}\)
这里,Linear\(⋅\)\\text\{Linear\}\(\\cdot\)表示线性映射层,LN\(⋅\)\\text\{LN\}\(\\cdot\)表示层归一化\(ba2016layer\)。该变换产生上下文感知的特征 Hm∈RT×D\\mathbf\{H\}\_\{m\}\\in\\mathbb\{R\}^\{T\\times D\},为双流机制奠定了语义基础。
### 3\.3\.双流显著性-上下文校准
在获得上下文感知特征后,我们面临一个核心挑战:序列冗余。某些片段携带显著的情感偏移(例如转瞬即逝的表情),而其他片段则提供必要的背景状态。为过滤冗余,我们提出了双流显著性-上下文校准机制,以同时对显著的语义偏移和上下情境态进行建模。
#### 3\.3\.1\.软显著性解耦
为了区分情感偏移与背景状态,我们需要时间步级别的解耦。我们设计了一种软显著性解耦机制,而不是使用硬截断策略。它学习逐步的显著性概率,动态地将特征 Hm\\mathbf\{H\}\_\{m\} 分配到携带显著动作的焦点流或携带背景状态的环境流中。
具体而言,我们使用一个轻量级的显著性评分网络来计算第 tt 个时间步代表显著时刻的概率分数 StS\_\{t\}:
\(2\)S=σ\(W2⋅GELU\(W1Hm\+b1\)\+b2\)\\mathbf\{S\}=\\sigma\(\\mathbf\{W\}\_\{2\}\\cdot\\text\{GELU\}\(\\mathbf\{W\}\_\{1\}\\mathbf\{H\}\_\{m\}\+\\mathbf\{b\}\_\{1\}\)\+\\mathbf\{b\}\_\{2\}\)这里,S∈RT×1\\mathbf\{S\}\\in\\mathbb\{R\}^\{T\\times 1\}表示显著性分数,St∈\[0,1\]S\_\{t\}\\in\[0,1\],σ\\sigma是 sigmoid 函数。然后我们使用 S\\mathbf\{S\} 作为软掩码进行加权解耦:
\(3\)Hmfoc\\displaystyle\\mathbf\{H\}\_\{m\}^\{\\text\{foc\}\}=Hm⊙S\\displaystyle=\\mathbf\{H\}\_\{m\}\\odot\\mathbf\{S\}Hmamb\\displaystyle\\mathbf\{H\}\_\{m\}^\{\\text\{amb\}\}=Hm⊙\(1−S\)\\displaystyle=\\mathbf\{H\}\_\{m\}\\odot\(1\-\\mathbf相似文章
用于令牌高效且语义保持的观点摘要的大语言模型
本文提出一个利用大语言模型进行观点摘要的框架,该框架结合多维分类和分层采样,在降低令牌使用量的同时保持语义多样性和观点间的平衡。
超越情感:比较传统NLP与基于LLM的多维分析在政治新闻评估中的应用
本文比较了基于RoBERTa的情感分析与基于LLM的多维框架分析在政治新闻文章中的应用,发现传统情感分析存在“中性崩溃”问题,而基于LLM的方法能更好地捕捉偏见、耸人听闻和框架效应,适用于社会科学研究。
评估LLM在高效可解释的产品需求度数值与分类隐式情感分析中的应用
本文提出一个可扩展的框架,利用LLM对定性反馈中的产品需求度进行隐式情感分析,实现了高达0.97的皮尔逊相关系数和94%的准确率,并提供解释,其中GPT-4o-mini在成本降低94%的情况下实现了相似的性能。
分离、细化、整合:为情感分析分解多模态融合
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。
SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解
介绍了一种结构化聚合框架SFL-MTSC,该框架利用LLM在语义框架级别的自一致性实现鲁棒的多意图口语理解,在MAC-SLU基准测试上显示出改进的槽位F1得分和整体准确性。