我们真的需要超过10亿参数的多模态情感语言模型吗?

arXiv cs.AI 论文

摘要

本文提出Light-MER,一个轻量级多模态情感识别框架,通过知识蒸馏将80亿参数的教师模型知识迁移至低于10亿参数的学生模型,在显著提升推理效率的同时取得了最先进的性能,挑战了参数超过10亿模型的必要性。

arXiv:2607.12787v1 公告类型:新文 摘要:多模态大语言模型(MLLMs)的最新进展显著提升了多模态情感识别(MER)的性能,并通过联合建模视频、音频和语言等实现了可解释的描述生成。然而,这些性能提升往往伴随着模型参数量的增加(例如,至少70亿),这不仅带来了高昂的计算成本,还降低了推理效率,从而阻碍了在机器人、移动设备等资源受限平台上的实时部署。这引出了一个根本性问题:对于高质量的多模态情感识别,我们是否真的需要参数超过10亿的模型? 在本文中,我们挑战了“越大越好”的假设,提出了一种轻量级的多模态情感识别框架(称为Light-MER),该框架通过知识蒸馏实现了更快、更好的多模态情感理解与识别。它能将强大、大规模教师模型的知识迁移至轻量的亚十亿参数学生模型,旨在在保留丰富的多模态情感推理与识别能力的同时,大幅提升部署效率。具体而言,我们引入了两种新的优化策略来增强知识迁移:(1)一种结合切片沃瑟斯坦距离(Sliced Wasserstein Distance)与隐藏状态对齐的最优传输损失函数;(2)一种基于GRPO的新型多奖励优化策略,平衡MER性能与效率,旨在进一步增强学生模型的学习能力。在九个基准数据集上的大量实验表明,Light-MER在显著提升推理效率的同时,取得了最先进的性能。这突显了小型多模态情感语言模型在未来研究中的巨大潜力。代码开源于 https://github.com/GAIR-Lab/Light-MER。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:20

# 我们真的需要超过10亿参数的多模态情感语言模型吗?
来源:https://arxiv.org/html/2607.12787
\(2018\)

###### 摘要.

近年来,多模态大语言模型(MLLMs)的进展通过联合建模视频、音频和语言等,显著提升了多模态情感识别(MER)的性能,并实现了可解释的描述生成。然而,这些性能提升往往伴随着模型参数量(例如,至少7B)的增加,同时导致高计算成本和推理效率降低,从而阻碍了在机器人、移动设备等资源受限平台上进行实时部署。这引出了一个根本性问题:对于高质量的多模态情感识别,我们是否真的需要参数量超过10亿的多模态情感模型?

在本文中,我们挑战了“更大模型必然更好”的假设,并提出了一种轻量级 MER 框架(称为 Light-MER),通过知识蒸馏实现更好、更快地多模态情感理解与识别。该框架能够将强大、大规模的教师模型的知识转移给轻量级的十亿参数以下学生模型,旨在保留丰富的多模态情感推理与识别能力,同时大幅提升部署效率。具体而言,我们引入了两种新的优化策略来增强知识转移:(1)一种结合了切片Wasserstein距离与隐藏状态对齐的新最优传输损失函数;(2)一种基于GRPO的新型多奖励优化策略,用于平衡MER性能与效率,旨在进一步增强学生模型的学习能力。在九个基准数据集上的大量实验表明,Light-MER 在显著提升推理效率的同时,达到了最先进的性能。这凸显了小型多模态情感语言模型在未来研究中的巨大潜力。代码可在 https://github.com/GAIR-LAB/Light-MER 获取。

多模态情感识别, 多模态大语言模型, 知识蒸馏, 切片Wasserstein距离

††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX.XXXXXXX††conference:Make sure to enter the correct conference title from your rights confirmation email; June 03–05, 2018; Woodstock, NY††isbn:978-1-4503-XXXX-X/2018/06††ccs:Information systems Language models参见图1标题图 1. 大型多模态情感模型性能强劲但难以在边缘部署。我们的目标是在保留8B教师模型大部分性能的同时,将部署模型参数量降至10亿以下。## 1. 引言

多模态情感识别(MER)是开发感知智能系统的基石,在社交机器人 (Kang 等人, 2024)、医疗辅助 (Islam 等人, 2024) 和智慧教育 (Gan 等人, 2022) 等领域展现出巨大潜力。由于情感表达固有的复杂性,仅凭语言线索往往难以得出稳健的推断。相比之下,面部表情、声学信号、场景动态和文本语境提供了关键且互补的证据。因此,一个实用的 MER 框架必须在促进视觉、音频和文本模态协同建模的同时,保持计算效率以适应现实世界的资源限制。

现有的 MER 方法大致可分为判别式范式和生成式范式。传统的 MER (Ge 等人, 2024) 多为判别式,即通过任务特定的分类器将多模态特征映射到预定义的情感类别。尽管有效,但这些方法仅限于封闭集预测,可解释性较差。最近,多模态大语言模型(MLLMs) (Yin 等人, 2024) 的快速发展推动 MER 转向更具生成性的范式。与仅预测标签不同,生成式 MER 模型 (Zhao 等人, 2026) 能用自然语言描述情感状态,并为其预测提供更丰富的证据。例如,AffectGPT (Lian 等人, 2025a) 表明,多模态生成器能捕捉到比传统分类器更细微、更复合的情感状态。这一转变尤为重要,因为人类情感常常是微妙、模糊且并存的。

然而,如图 1 所示,当前基于预训练 MLLMs 的生成式 MER 系统仍严重依赖于日益庞大的模型规模——通常至少需要 7B 参数 (Bhattacharyya 和 Wang, 2025; Cheng 等人, 2024)——才能实现强大的识别和生成性能。虽然这种缩放提升了基准测试成绩,但也引入了大量的计算开销、内存消耗和推理延迟,严重限制了在机器人、智能手机及其他边缘设备上的部署。更根本的是,生成式 MER 要求模型既能整合异构多模态证据,又能生成连贯的情感感知描述,这使得高效部署比基于分类的 MER 更具挑战性。这自然引出一个关键问题:对于高质量的 MER,我们是否真的需要超过 10 亿参数的多模态情感语言模型?

我们认为这并非必要——只要能够有效地将大型生成模型的多模态推理能力蒸馏到紧凑的部署模型中。这促使我们从高效多模态知识转移的角度重新审视 MER。如图 1 所示,实际的 MER 系统需要比当前大型模型解决方案更好地平衡模型大小、准确性、可解释性和推理效率。实现这一目标的自然方式是,首先利用一个强大的大规模 MER 模型作为丰富的多模态知识源,然后将这些知识转移给适合部署的轻量级模型。这样,如图 1 所示,大模型扮演教师角色,而紧凑模型则充当学生角色。

主要的挑战在于如何在压缩过程中保留教师模型内部的多模态推理过程。现有的基于 KL 散度 (Shlens, 2014) 的输出级蒸馏 (Gu 等人, 2026) 主要约束最终令牌分布,并未保留支撑情感理解的潜在推理结构。同样,简单的隐藏状态回归损失(例如 MSE) (Sun 等人, 2019) 忽略了教师表示空间的分布几何结构。对于 MER 而言,来自声音、面部、动作和文本的细微线索需要整合成连贯的潜在情感语义,保留这种内部几何结构对于有效转移至关重要。因此,一个高质量的紧凑型 MER 模型不仅需要模型压缩,还需要一个能更好保留多模态表示结构和生成能力的蒸馏框架。

为此,我们提出了 Light-MER,一个基于多奖励 GRPO 优化的知识蒸馏框架,用于更好、更快地实现多模态情感理解与识别。Light-MER 将知识从强大的大规模 MLLM 转移到轻量级的十亿参数以下学生模型,旨在保留丰富的多模态情感推理能力,同时大幅提升部署效率。具体而言,我们的框架引入了两种关键的优化策略。首先,我们定义了 SWD-H,一种隐藏状态对齐目标,利用切片 Wasserstein 距离最小化教师和学生潜在分布之间的距离。与逐点对齐不同,SWD-H 将隐藏表示视为经验分布,促进了基于最优传输的映射,对高维流形偏移更具鲁棒性。其次,我们通过一种新的基于 GRPO 的优化策略(称为 M-GRPO)进一步优化蒸馏后的学生模型,该策略同时对生成式 MER 的多奖励性能和效率施加约束。我们假设,虽然隐藏状态对齐(SWD-H)捕捉了教师的潜在几何结构,但它本身并未优化生成的输出质量。因此,我们引入 M-GRPO 作为一个关键的优化阶段,使模型生成的叙述与多层面奖励对齐,特别关注 MER 的细微差别。

我们的贡献有三方面:

- • 我们从效率角度重新审视多模态情感识别,并质疑高质量的生成式 MER 是否真的需要超过 10 亿参数的部署模型。
- • 我们提出了 Light-MER,一个紧凑的教师-学生框架,将多模态情感理解和识别能力从大型生成式 MLLM 转移到轻量级学生模型进行部署。
- • 我们引入了 SWD-H,一种基于切片 Wasserstein 距离的隐藏状态对齐目标,明确保留了多模态潜在结构的几何形状,从而提高知识蒸馏的有效性。
- • 我们提出了 M-GRPO,一种新的基于 GRPO 的优化策略,同时对多奖励性能和效率施加约束,以进一步提高生成质量和学生模型在生成式 MER 中的学习能力。

在九个基准数据集上的大量实验表明,Light-MER 不仅显著提高了推理效率,还达到了最先进的性能,表明高质量的生成式 MER 并不一定需要超过 10 亿参数的部署模型。

## 2. 相关工作

*生成式多模态情感识别。* 早期 MER 主要被表述为判别式分类问题,通过任务特定的分类器将多模态特征融合并映射到预定义的标签空间。代表性方法包括基于模态特定编码器的多任务学习 (Zheng 等人, 2023; Fu 等人, 2024a)、基于图的跨模态推理 (Li 等人, 2023a) 以及基于注意力的融合 (Shi 和 Huang, 2023)。虽然在封闭标签设置下有效,但这些方法在建模模糊性、共现性和细粒度情感强度方面存在局限。最近的综述总结了数据集、融合策略和模型架构方面的进展 (Wu 等人, 2025; A.V. 等人, 2024)。

随着多模态大语言模型(MLLMs)的兴起 (OpenAI, 2024; An Yang, 2025; Gemini Team, 2025; Fu 等人, 2025, 2026a, 2024b; He 等人, 2025; Fu 等人, 2026b),MER 已转向生成式范式,模型用自然语言描述情感,并支持开放词汇的情感推理。Emotion-LLaMA (Cheng 等人, 2024) 在统一的大语言模型中联合进行视频、音频和文本的情感理解。AffectGPT (Lian 等人, 2025a) 进一步将多模态编码器与 7B 语言解码器结合,并引入了 MER-Caption+ 数据集。最近的一项综述 (Shou 等人, 2025) 同样强调了 MLLMs 在情感识别和推理中日益增长的作用。然而,现有的生成式 MER 系统通常依赖至少 7B 参数的部署模型来实现强性能 (Lian 等人, 2025a; Cheng 等人, 2024; Su 等人, 2023),导致巨大的内存和延迟成本,阻碍了在资源受限设备上的实际部署。我们的工作遵循生成式 MER 范式,但挑战了“高质量多模态情感理解必须依赖大部署模型”的假设。

*知识蒸馏与最优传输对齐。* 知识蒸馏 (Hinton 等人, 2015) 是将大模型能力转移到紧凑学生模型的标准方法。大多数先前方法 (Gu 等人, 2026; Agarwal 等人, 2024) 依赖于输出分布上的软化交叉熵或 KL 散度,例如 DistilBERT (Sanh 等人, 2020)。然而,对于生成式 MER,目标不仅仅是保留下一个令牌的概率,而是保留多模态推理行为,因此 logit 级蒸馏不太适用。在我们的设置中,教师输出通常高度集中,这削弱了超出最高令牌之外的监督信号。

因此,近期工作探索了隐藏状态蒸馏,包括 TinyBERT (Jiao 等人, 2020) 中的逐层对齐、MiniLLM (Gu 等人, 2026) 中的反向 KL 蒸馏,以及最近的分析强调隐藏状态对齐是一个有前景的方向 (Dasgupta 和 Cohn, 2025)。然而,像 MSE 或余弦距离这样的逐点目标并未明确保留表示几何结构,而基于 CKA 的对齐 (Zhou 等人, 2024) 仅部分解决了这个问题。这一限制在多模态生成中尤为重要,因为在解码之前,隐藏状态跨模态组织证据。

最优传输(OT)提供了一种基于几何结构的对齐原理 (Cui 等人, 2024; Lv 等人, 2024; Zhuang 等人, 2025)。与基于 KL 的目标相比,Wasserstein 距离在部分分布不匹配的情况下更具鲁棒性。然而,现有的 OT 变体,如 Sinkhorn OT (Cuturi, 2013)、位置感知 OT (Zeng 等人, 2023) 和不平衡 OT (Séjourné 等人, 2023),要么需要迭代优化,要么引入额外的耦合和平衡项,增加了重复隐藏状态匹配中的计算成本。因此,我们采用切片 Wasserstein 距离 (SWD) (Kolouri 等人, 2019),它通过随机一维投影和排序实现高效的 OT 近似。SWD 保留了 OT 的几何优势,同时计算开销低得多。

相似文章

MER-R1: 通过慢速-快速思维协同的多模态情感推理

arXiv cs.AI

本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

语音强调模型能否跨语言和情感泛化?

arXiv cs.CL

介绍了MMEE,一个包含7种语言、34种情感类别、共10,000条话语的多语言多情感强调语料库,并在多种迁移设置下对强调检测模型进行了基准测试,发现多语言训练能显著提升鲁棒性,而单语言模型的零样本迁移能力有限。