AffectOmni:用于社交与艺术场景的强化学习可验证以人为中心情境情感推理

arXiv cs.AI 论文

摘要

AffectOmni是一个基于GRPO训练的框架,用于多模态大型语言模型中的可验证情感推理,引入了People Focus和Temporal Order奖励,以增强以人为中心的证据选择和时间结构化推理,实验显示在7B规模基线上有所改进。

arXiv:2608.26193v1 公告类型:新 摘要:多模态大型语言模型(MLLMs)在视觉问答(VQA)和场景理解方面表现出色,但情感推理仍然容易受到捷径行为的影响。模型可能在预测正确答案时忽略了以人为中心的线索,如微表情和肢体语言,这削弱了可追溯性和外部验证能力。先前的强化学习方法主要奖励上下文或逻辑连贯性,而没有明确强制关注人类证据。此外,LLM作为评判者的评分常因分数聚类问题而降低奖励的可区分性。我们提出了AffectOmni,一个基于GRPO训练的可验证情感推理框架。AffectOmni引入了People Focus和Temporal Order奖励,以鼓励以人为中心的证据选择和时间结构化推理,并采用组内比较评分来产生更稳定和更具区分性的奖励信号。为了验证,Thinking Summarizer将自由形式的理由转化为可执行的证据指令,这些指令通过SAM3嵌入到像素级证据区域,以在训练循环之外提供一个可外部审计的接口。在IntentBench、Daily Omni和WorldSense上的实验显示,相较于开源的7B规模基线模型有一致改进,包括在情绪识别上提升4.66%和在时间敏感任务上提升14.29%。代码可在 https://github.com/eliot127825-rgb/AffectOmni_nobody 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:32

# AffectOmni:基于强化学习可验证的、以人为核心的多模态情感推理框架,适用于社交与艺术场景  
来源:https://arxiv.org/html/2608.26193  
作者:Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua  

**致谢:** Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Pengfei Cao, Hong Peng, Bin Hu 就职于兰州大学,兰州,中国。  
Yitao Wu 就职于海南大学,海口,中国。  
Wencan Zhang 和 Tat-Seng Chua 就职于新加坡国立大学计算学院,新加坡。  
通讯作者:Bin Hu, Pengfei Cao, 和 Wencan Zhang。  

---

**摘要**  
多模态大语言模型在视觉问答与场景理解方面表现卓越,但情感推理仍易受“捷径行为”影响。模型可能给出正确答案,却忽略了微表情、肢体语言等以人为中心的线索,从而削弱了推理过程的可追溯性与外部可验证性。现有的强化学习方法主要奖励上下文或逻辑一致性,而未显式地引导模型关注人类证据。此外,基于大语言模型的评分机制常出现分数聚类问题,导致奖励信号区分度不足。  

我们提出 **AffectOmni**,一个基于群组相对策略优化训练的可验证情感推理框架。该框架引入了“**人物聚焦**”与“**时序顺序**”奖励,以鼓励模型选择以人为中心的证据并进行时序结构化推理;同时采用组内对比评分机制,生成更稳定、更具区分度的奖励信号。为实现验证,我们设计了一个“**思维总结器**”,将自由形式的推理链转化为可执行的证据指令,并通过 SAM3 将其锚定到像素级的证据区域,从而在训练循环之外提供可外部审计的接口。  

在 IntentBench、Daily Omni 和 WorldSense 上的实验表明,与开源 7B 规模基线模型相比,AffectOmni 在情感识别任务上提升了 **4.66%**,在时序敏感任务上提升了 **14.29%**。  

代码已开源:https://github.com/eliot127825-rgb/AffectOmni_nobody  

**索引关键词:** 情感计算、多模态大语言模型、强化学习、视觉定位、情感识别、社交场景理解  

---

## I 引言  

(参见图1)图1:捷径推理与以人为中心的推理对比。左图:缺乏“人物聚焦”奖励时,证据归因漂移至背景线索,导致错误答案。右图:有“人物聚焦”奖励时,证据锚定于手部位置、姿态变化等人类线索,实现了基于证据的情感推理。所示帧为完整视频的代表性快照,先前事件提供上下文,而人类线索提供判别性证据。  

多模态大语言模型已取得显著进展,而强化学习,特别是群组相对策略优化,进一步增强了其深度推理能力。这一能力被广泛期待用于支持涉及人类情感与意图的高级社交认知任务。然而,Visionary-R1 和 HumanOmniV2 等研究指出,多模态推理存在显著的“捷径问题”。模型常从全局线索猜测答案,未能分析细粒度证据。HumanOmniV2 引入了显式的上下文建模和基于大语言模型的评分奖励,部分缓解了全局上下文理解的局限。  

但在情感计算领域,我们发现了一个更根本的挑战:即使模型预测出正确的情感,其推理过程常忽略微表情、肢体语言等以人为中心的线索,且无法通过外部证据进行验证。如图1所示,当前模型可能依赖背景线索而非以人为中心的证据,导致推理过程不可信,有时甚至得出错误答案。这仍然是情感人工智能在真实场景中部署的关键障碍。  

我们将情感推理中的可信度挑战提炼为三个相互关联的问题:  
1. 如何设计细粒度奖励信号,引导模型学习以人为中心的推理模式,而非依赖粗糙的全局线索?  
2. 如何在强化学习中获得具有足够区分度的奖励信号,以可靠地区分基于证据的推理与捷径推理?  
3. 如何将长链推理转化为可执行的结构化表示,并建立将推理主张与视觉证据相链接的验证机制?  

现有方法仅部分解决了这些需求。对于问题1,HumanOmniV2等先前奖励(如全局上下文完整性)主要针对整体上下文理解,但未显式建模或鼓励关键情感线索,包括皱眉、含泪眼角等微表情,手势、姿态变化等肢体语言,以及反映情感随时间演变的时序动态。对于问题2,大多数基于大语言模型的评分机制采用独立评分策略,对每个候选响应单独评分。然而,大语言模型在绝对评分设置下可能出现校准漂移和分数聚类,导致不同质量的推理路径获得相似分数,从而产生区分度弱的奖励信号,影响策略优化。对于问题3,当前模型常生成约800至1400个字符的冗长思维链,内容虽丰富但结构松散、信息密度低,难以直接支持心理咨询辅助、关键帧提取等下游应用。此外,仅基于标签的评估无法检验模型是否真正关注了与情感判断相关的视觉区域。  

我们的核心论点是:可信的情感推理不仅取决于答案的正确性,更重要的是推理过程可追溯、奖励信号具有区分度、结果可外部验证。基于此观点,我们提出了AffectOmni框架。  

**主要贡献如下:**  
- 提出首个面向情感推理任务的“从推理到证据锚定”范式。我们将模型生成的情感推理压缩为可执行的结构化证据指令,并通过SAM3将其锚定至视频帧的像素级证据区域,为推理中提及的人物、动作和时序线索提供外部可追溯、可验证的证据锚点。  
- 提出细粒度奖励机制,通过在强化学习中引入多维约束(包括“人物聚焦”和“时序顺序”),引导以人为中心的推理。这些约束鼓励模型关注微表情、肢体语言和人际互动,并按时间顺序组织推理。  
- 在群组相对策略优化训练中,引入组内对比评分策略,缓解基于大语言模型的评分中的校准漂移和分数聚类问题,从而提供更稳定、区分度更高的优化信号。  
- 在IntentBench、Daily-Omni和WorldSense等多模态基准测试中达到最优性能,相比开源7B规模基线模型实现持续提升,情感识别任务提升4.66%,时序敏感任务提升14.29%。  

---

## II 相关工作  

**多模态情感理解**  
情感计算旨在使机器理解人类情感,该领域已从基于规则的分类发展到深度推理。早期研究集中于单模态特征提取与端到端识别,随后探索了多模态融合策略。Hazarika等人提出模态不变表示学习,Hu等人构建了情感与情绪识别的统一框架。随着多模态大语言模型的兴起,情感计算进入新阶段。Lian等人提出可解释多模态情感推理基准;Zhou等人研究音视频时序对齐机制;Lian等人提出AffectGPT用于开放词表情感理解。思维链提示也被探索用于隐式情感推理。  

然而,现有方法常表现出捷径学习行为。模型可能绕过微表情、肢体语言等细粒度线索,直接预测标签。我们引入以人为中心线索的细粒度奖励设计,以显式鼓励模型关注关键情感证据。  

(参见图2)图2:AffectOmni框架。流程包含三个阶段:(1)**定位**:采用基于以人为中心奖励的人物聚焦奖励、时序顺序奖励和对比评分的群组相对策略优化训练,引导基于证据的推理。(2)**推理**:生成结构化输出,并通过思维总结器将推理链压缩为“最小证据包”。(3)**验证**:通过SAM3将最小证据包锚定至像素级掩模,实现事后审计,检验证据主张是否能在视觉输入中定位。星号表示我们的关键贡献。验证模块将在第V节进一步评估。  

**强化学习与奖励设计**  
强化学习已成为激发多模态大语言模型推理能力的关键方法。Huang等人和Yuan等人首次将群组相对策略优化应用于视觉推理,后续工作将其扩展至视频理解、全模态推理以及音视频领域。为缓解捷径学习,近期研究设计了多样化的奖励函数:HumanOmniV2提出上下文与逻辑一致性奖励;Chen等人引入步级奖励;Chen等人设计一致性奖励。其他变体包括格式奖励、感知奖励和混合奖励策略。  

这些方法大多遵循“大语言模型作为评分器”范式,即语言模型对每个生成的输出单独进行绝对评分。然而,绝对评分可能出现校准漂移和分数聚类,导致不同质量的推理路径获得相似分数,降低奖励区分度。我们提出组内对比评分策略,联合评估多个候选响应并强制进行相对排序,以获得更具区分度的奖励信号。  

**视觉定位与推理验证**  
视觉定位旨在将语言描述与图像或视频中的区域对齐。Reich等人提出定位的真实性与合理性指标;Das等人分析人类与深度网络之间的注意力差异。在医学视觉问答中,研究验证了“先定位后回答”范式的有效性。对于可信的多模态大语言模型,定位可缓解幻觉问题,并支持多模态事实核查。Yu等人和Sun等人使用基于人类反馈的强化学习进行行为对齐;Zhang等人采用强化学习提升多图像定位。SAM系列模型实现了像素级视频分割,为推理验证提供了技术基础。  

先前工作探索了视觉定位与事后定位,但通常将定位与情感推理视为独立组件。我们将推理总结器与基于SAM3的像素级定位相结合,为情感推理的事后验证提供可外部审计的证据接口。  

---

## III 方法  

### III-A 问题建模与框架概述  

给定包含视频帧序列、音频信号和文本问题的多模态输入,我们的目标是训练策略模型,生成结构化推理输出。上下文段描述多模态上下文,推理段提供逐步推理,答案段给出最终决策。我们在群组相对策略优化框架下训练策略。对于每个输入,模型采样一组候选响应,并使用组内相对优势更新策略。训练目标如公式(1)和公式(2)所示。

相似文章

CogniRoute:在全模态模型中学习路由社交证据

Hugging Face Daily Papers

CogniRoute 是一个基于模式引导的专家混合框架,用于社交视频问答,通过认知模式分解和路由感知的强化学习提升了多模态推理能力。在新的 OmniSocialBench 基准上,它相较于基线取得了显著提升。

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。

GRASP:在多人物非语言交互中建立社交推理的根基

Hugging Face Daily Papers

GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。