标签
介绍MeetingToM,这是一个用于评估多模态大语言模型在多参与者会议中进行心智理论推理的基准,包含个体、二元和群体层面的任务,包括伪共识检测。
本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。
MafiaScope是一个开放测试平台,利用社交推理游戏Mafia非侵入式地实时探测LLM智能体的信念,通过结构化探测问题、交互式可视化和反事实回放,实现对机器心智理论的细粒度分析。
本文介绍了非对话规划心智理论(NCP-ToM)及新型评估框架NCP-ExploreToM,旨在评估LLMs能否通过行动而非对话诱导其他智能体产生特定信念状态。在600个任务中对前沿模型与人类进行测试,GPT-5成功率达到约80%,优于人类,但所有模型在错误信念状态任务上表现更差。
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
介绍了一种包含小丑角色的三方狼人杀社交推理游戏变体,用于评估大语言模型的多跳心智理论。实验表明,当前模型难以应对反向激励机制,暴露了其在对手效用推理方面的局限性。
本文介绍了Theory of Mind Utility (ToM-U),一种通过构建Local Epistemic World Models (LEWMs)来推断他人认知状态的形式化计算层级规范。它不同于Bayesian ToM和模拟理论,提供了一种领域无关的信念推断机制,而不依赖于算法实现。
介绍RecToM,一种推理时框架,通过递归视角构建来建模嵌套信念,用于大语言模型的心理理论推理,在多个基准上取得了最先进的性能。
MindZero 提出了一种自监督强化学习框架,用于训练多模态大语言模型,使其能够高效且鲁棒地进行在线心智推理,而无需心智状态标注,在准确性和效率上均优于基于模型的方法。
本文介绍了一种可微分的基于信念的对手塑造(D-BOS)方法,这是一种一阶方法,将观察者的信念视为被塑造的状态,并通过信念更新动态进行微分,从而允许在隐藏角色多智能体环境中,最优策略自然地源于环境的奖励结构。
OmniToM 引入了一个基准测试,通过要求显式提取和标注信念结构来评估大语言模型的心智理论,揭示了尽管模型在端点问答任务上表现强劲,但在跟踪角色特定信念方面存在瓶颈。
提出 Agent-ToM,一种基于心智理论推理的学习监控框架,通过推断信念和意图来检测自主LLM智能体中的隐蔽恶意行为,性能优于基线监控器。
本文提出OSCToM,一种RL引导的方法,用于生成对抗数据以测试LLM中的嵌套信念冲突,在FANToM等基准上改进了心智理论推理。
本文针对大语言模型的心智理论能力提出了一种新的交互评估范式,发现静态基准测试上的提升并不能转化为动态人机交互中的更好表现,凸显了基于交互评估的必要性。
本文引入指令推理任务,用于评估LLM智能体在处理不完整或模糊指令的人-智能体协作中的心智理论能力。作者呈现了Tomcat(一个LLM智能体),在GPT-4o、DeepSeek-R1和Gemma-3-27B上进行测试,展现出与人类参与者相当的推理未言明意图的性能。
OpenAI 和牛津大学研究人员提出了 LOLA(Learning with Opponent-Learning Awareness),这是一种强化学习方法,使智能体能够建模并考虑其他智能体的学习,在迭代囚徒困境和硬币游戏等多智能体博弈中发现合作策略。