rl-verification

标签

Cards List
#rl-verification

AffectOmni:用于社交与艺术场景的强化学习可验证以人为中心情境情感推理

arXiv cs.AI · 2026-08-28 缓存

AffectOmni是一个基于GRPO训练的框架,用于多模态大型语言模型中的可验证情感推理,引入了People Focus和Temporal Order奖励,以增强以人为中心的证据选择和时间结构化推理,实验显示在7B规模基线上有所改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈