标签
AffectOmni是一个基于GRPO训练的框架,用于多模态大型语言模型中的可验证情感推理,引入了People Focus和Temporal Order奖励,以增强以人为中心的证据选择和时间结构化推理,实验显示在7B规模基线上有所改进。