OneEmo:用于情绪感知、理解和交互的统一多模态推理模型
摘要
介绍了一款名为OneEmo的统一多模态推理模型,用于情绪感知、理解与交互,并同时介绍了EmoWorld-130K数据集和Emo-Chord强化学习策略。
查看缓存全文
缓存时间: 2026/08/10 10:14
论文页面 - OneEmo:用于情绪感知、理解与交互的统一多模态推理模型
来源:https://huggingface.co/papers/2608.06013
摘要
多模态大语言模型(MLLMs)在情绪智能方面展现出了卓越的能力。然而,现有研究主要侧重于任务特定领域的专门化,往往忽视了任务间的协同效应,并且未充分探索潜在的推理能力。为了弥补这一差距,我们引入了 OneEmo,一个统一的情绪通用模型,能够掌握情绪感知、理解与交互。为此,我们首先构建了 EmoWorld-130K,这是一个全面的数据集,通过人在回路的工作流程将专门的情绪知识提炼为显式的推理轨迹。在此语料上进行监督微调揭示了多任务学习带来的显著互惠收益。其次,为了充分释放潜在的推理能力,我们提出了 Emo-Chord,一种新颖的强化学习策略,通过统一的多任务奖励分配来稳定优化过程。大量实验表明,在大多数基准测试中,OneEmo 在同等规模的基线上取得了最先进的性能。值得注意的是,尽管参数量远少于商业模型,OneEmo 仍取得了极具竞争力的结果。本文为更可靠、可解释的情感计算开辟了道路。代码可在 https://github.com/waHAHJIAHAO/OneEmo 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06013) 查看 PDF (https://arxiv.org/pdf/2608.06013) GitHub5 (https://github.com/waHAHJIAHAO/OneEmo) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06013)
在您的代理中获取此论文:
hf papers read 2608\.06013
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型2
Jiaha0Hu4ng/OneEmo Video-Text-to-Text• 5B• 更新于2天前 • 122 • 2 (https://huggingface.co/Jiaha0Hu4ng/OneEmo)
Jiaha0Hu4ng/OneEmo-Base Video-Text-to-Text• 更新于3天前 (https://huggingface.co/Jiaha0Hu4ng/OneEmo-Base)
引用此论文的数据集1
Jiaha0Hu4ng/EmoWorld-130K (https://huggingface.co/datasets/Jiaha0Hu4ng/EmoWorld-130K)
引用此论文的 Space1
收录此论文的集合1
相似文章
EmoS:面向细粒度流式情感理解的高保真多模态基准
本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。
MER-R1: 通过慢速-快速思维协同的多模态情感推理
本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。
Rationale-Guided Learning for Multimodal Emotion Recognition
Introduces Rationale-Guided Learning (RGL), a framework that reframes multimodal emotion recognition in conversation as a cognitively-inspired reasoning task using dual-process theory and MLLM-generated rationales, achieving state-of-the-art results on IEMOCAP and MELD.
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习
论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。