标签
本文研究基于同步EEG-fNIRS数据的零样本跨被试连续效价-唤醒度回归问题,将情感分解为刺激共享成分与个体成分,其中个体成分通过无标签的α频带跨通道同步性进行校准;该方法在性能上超越EEGNet和ASAC-Net等基线模型,并对多种替代架构与特征进行了系统的负面结果搜索。
本文揭示,在全模态大语言模型中,用于线性探测读取概念的最佳层与用于激活操控的最佳层并不相同,这挑战了表征工程领域的普遍经验法则。
本文介绍了YNU-HPCC团队在SemEval-2025 Task 11中针对基于文本的情感识别任务的方法,使用了一个带有增强输出头的RoBERTa模型,并通过英文翻译数据集获得了0.44的排名分数。
本文介绍了 Modality Discrepancy Transformer (MDT),一种新型多模态融合框架,它增强了跨模态差异建模,用于在临床视频中识别矛盾与犹豫,在 BAH 数据集上优于基线方法。
本文提出了一种基于置信度门控的混合系统,用于对话式AI中的情感识别。该系统将大多数流量路由通过低成本集成模型,并将不确定案例升级到LLM,从而在提高准确性的同时,降低CCaaS平台的成本和延迟。
本文介绍了MultiHuSE,这是一个多模态数据集,包含演员视频,标注了幽默风格和情感。基线实验表明,多模态融合比单模态方法提高了幽默风格分类的准确性。
本文通过分析大型语言模型(LLMs)在零样本设置中的表现,研究对话情感识别(ERC)的弱点,揭示了由于标注模糊性导致的系统性失败,并提出了一个LLM-as-Judge框架以实现更鲁棒的评估。
本文介绍了Chiaro,一个基于评价理论的新基准数据集,用于对比情感识别,其中两个个体从共享事件中体验到对立的情感。它评估了七个LLMs和四个情感分类器,揭示当前模型的表现不及人类。
本文介绍了VoiceLongMemEval (VLME)基准,它评估AI助手在长期对话中记忆和推理语音副语言元数据(如情感和韵律)的能力,揭示了当前模型中存在的'情感差距'。
VocalAffectBench 被引入作为一个公共基准,用于评估AI音频模型中的声音情感识别,展示了当前基线模型的准确性有限,尤其是对于非中性情感。
AffectOmni是一个基于GRPO训练的框架,用于多模态大型语言模型中的可验证情感推理,引入了People Focus和Temporal Order奖励,以增强以人为中心的证据选择和时间结构化推理,实验显示在7B规模基线上有所改进。
研究发现,在语音模型中,情感表示在七种语言中大多是通用的,有一个可衡量的‘口音’,这与人类跨文化研究相似,并影响跨语言迁移。
本研究论文探讨了多模态基础模型中的情感敏感神经元,通过因果干预和跨模态分析,揭示了语音与面部情绪识别之间的共享情感机制。
Introduces Rationale-Guided Learning (RGL), a framework that reframes multimodal emotion recognition in conversation as a cognitively-inspired reasoning task using dual-process theory and MLLM-generated rationales, achieving state-of-the-art results on IEMOCAP and MELD.
本文提出CONFER,一种基于图的冲突感知证据协商框架,用于弱监督多模态情绪识别,解决自我报告不可靠和跨模态冲突问题。在AMIGOS、MAHNOB-HCI和DEAP基准上取得了具有竞争力的准确率。
This preprint introduces a generation-aligned diagnostic ladder that separates decision-rule misalignment from readout-coverage limitations in speech language models, showing that state decoding far exceeds generated accuracy in emotion recognition tasks.
论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。
本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。
本文介绍了AtmosERC,一个模拟对话级情感氛围以增强对话中情绪识别的模型。
提出了DCC,一个用于共情回应生成的动态常识协调框架,集成了基于残差的交互、关联引导的过滤和迭代解码,相比于基线模型提高了情感分类准确率和回应多样性。