social-reasoning

标签

Cards List
#social-reasoning

从被动代理人到战略谈判者:使用 SocialRL 强化小型语言模型中的社会推理能力

arXiv cs.AI · 2026-08-17 缓存

本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。

0 人收藏 0 人点赞
#social-reasoning

MeetingToM:在多参与者会议中评估多模态大语言模型的心智理论推理

arXiv cs.CL · 2026-07-22 缓存

介绍MeetingToM,这是一个用于评估多模态大语言模型在多参与者会议中进行心智理论推理的基准,包含个体、二元和群体层面的任务,包括伪共识检测。

0 人收藏 0 人点赞
#social-reasoning

超越对话的心智理论与说服:评估LLMs通过规划与行动诱导信念状态的能力

arXiv cs.CL · 2026-07-01 缓存

本文介绍了非对话规划心智理论(NCP-ToM)及新型评估框架NCP-ExploreToM,旨在评估LLMs能否通过行动而非对话诱导其他智能体产生特定信念状态。在600个任务中对前沿模型与人类进行测试,GPT-5成功率达到约80%,优于人类,但所有模型在错误信念状态任务上表现更差。

0 人收藏 0 人点赞
#social-reasoning

OmniToM: 通过显式信念建模对大语言模型的心智理论进行基准测试

arXiv cs.AI · 2026-05-27 缓存

OmniToM 引入了一个基准测试,通过要求显式提取和标注信念结构来评估大语言模型的心智理论,揭示了尽管模型在端点问答任务上表现强劲,但在跟踪角色特定信念方面存在瓶颈。

0 人收藏 0 人点赞
#social-reasoning

GRASP:在多人物非语言交互中建立社交推理的根基

Hugging Face Daily Papers · 2026-05-15 缓存

GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。

0 人收藏 0 人点赞
#social-reasoning

RoleConflictBench:用于评估大语言模型情境敏感性的角色冲突场景基准

arXiv cs.CL · 2026-04-20 缓存

RoleConflictBench 是一个新颖的基准,包含 13,000+ 个场景和 65 个角色,旨在评估大语言模型在多个社会期望相互冲突的角色冲突情境中的情境敏感性。对 10 个大语言模型的分析表明,这些模型主要依赖于学习到的角色偏好,而非动态的情境线索来做决策。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈