OneEmo:用于情绪感知、理解和交互的统一多模态推理模型

Hugging Face Daily Papers 论文

摘要

介绍了一款名为OneEmo的统一多模态推理模型,用于情绪感知、理解与交互,并同时介绍了EmoWorld-130K数据集和Emo-Chord强化学习策略。

多模态大语言模型(MLLMs)在情绪智能方面展现出了卓越的能力。然而,现有研究主要侧重于特定任务的专门化,常常忽视任务间的协同作用,使得潜在推理能力未被充分挖掘。为了弥补这一差距,我们提出了OneEmo,一个统一的情感通用模型,能够掌握情绪感知、理解和交互。为此,我们首先构建了EmoWorld-130K,这是一个全面的数据集,通过人在回路的工作流程将专门的情感知识提炼为显式的推理轨迹。在该语料库上进行的有监督微调显示出多任务学习带来的显著互惠效益。其次,为了充分释放潜在推理能力,我们提出了Emo-Chord,一种新颖的强化学习策略,通过统一的多任务奖励分配来稳定优化过程。大量实验表明,OneEmo在大多数基准测试中均取得了与同等规模基线模型相比最先进的性能。值得注意的是,尽管OneEmo的参数数量远少于商业模型,它仍能提供极具竞争力的结果。本文为更可靠、更可解释的情感计算铺平了道路。代码可在 https://github.com/waHAHJIAHAO/OneEmo 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/10 10:14

论文页面 - OneEmo:用于情绪感知、理解与交互的统一多模态推理模型

来源:https://huggingface.co/papers/2608.06013

摘要

多模态大语言模型(MLLMs)在情绪智能方面展现出了卓越的能力。然而,现有研究主要侧重于任务特定领域的专门化,往往忽视了任务间的协同效应,并且未充分探索潜在的推理能力。为了弥补这一差距,我们引入了 OneEmo,一个统一的情绪通用模型,能够掌握情绪感知、理解与交互。为此,我们首先构建了 EmoWorld-130K,这是一个全面的数据集,通过人在回路的工作流程将专门的情绪知识提炼为显式的推理轨迹。在此语料上进行监督微调揭示了多任务学习带来的显著互惠收益。其次,为了充分释放潜在的推理能力,我们提出了 Emo-Chord,一种新颖的强化学习策略,通过统一的多任务奖励分配来稳定优化过程。大量实验表明,在大多数基准测试中,OneEmo 在同等规模的基线上取得了最先进的性能。值得注意的是,尽管参数量远少于商业模型,OneEmo 仍取得了极具竞争力的结果。本文为更可靠、可解释的情感计算开辟了道路。代码可在 https://github.com/waHAHJIAHAO/OneEmo 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06013) 查看 PDF (https://arxiv.org/pdf/2608.06013) GitHub5 (https://github.com/waHAHJIAHAO/OneEmo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06013)

在您的代理中获取此论文:

hf papers read 2608\.06013

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

Jiaha0Hu4ng/OneEmo Video-Text-to-Text• 5B• 更新于2天前 • 122 • 2 (https://huggingface.co/Jiaha0Hu4ng/OneEmo)

Jiaha0Hu4ng/OneEmo-Base Video-Text-to-Text• 更新于3天前 (https://huggingface.co/Jiaha0Hu4ng/OneEmo-Base)

引用此论文的数据集1

Jiaha0Hu4ng/EmoWorld-130K (https://huggingface.co/datasets/Jiaha0Hu4ng/EmoWorld-130K)

引用此论文的 Space1

收录此论文的集合1

相似文章

MER-R1: 通过慢速-快速思维协同的多模态情感推理

arXiv cs.AI

本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。

Rationale-Guided Learning for Multimodal Emotion Recognition

arXiv cs.AI

Introduces Rationale-Guided Learning (RGL), a framework that reframes multimodal emotion recognition in conversation as a cognitively-inspired reasoning task using dual-process theory and MLLM-generated rationales, achieving state-of-the-art results on IEMOCAP and MELD.

tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face

Reddit r/LocalLLaMA

腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。