评估推理模型中的心智理论:稳健性优于推理
摘要
这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。
arXiv:2608.04646v1 公告类型:新
摘要:大型语言模型(LLM)最近在心智理论(ToM)测试中表现出色,引发了关于其底层能力的性质与有效性的争论。与此同时,通过基于可验证奖励的强化学习训练出的推理型LLM在一系列基准测试中展现出显著改进。在本研究中,我们使用新颖改编的机器心理学实验以及已有基准测试的结果,考察此类推理模型在ToM任务中的行为。我们观察到,推理模型始终表现出对提示变化和任务扰动更强的稳健性。我们的分析表明,这些增益至少部分来自模型在提示和任务变化下更稳健地得出正确答案。我们将此解读为支持基于稳健性的解释,而非新的ToM特定能力。
查看缓存全文
缓存时间: 2026/08/06 07:50
# 评估推理模型中的心智理论:鲁棒性优先于推理 来源:https://arxiv.org/html/2608.04646 11institutetext:LIACS,荷兰莱顿大学,荷兰11email:i\.b\.de\.haan\.2@umail\.leidenuniv\.nl,11email:p\.w\.h\.van\.der\.putten@liacs\.leidenuniv\.nl, m\.j\.van\.duijn@liacs\.leidenuniv\.nl###### 摘要 大型语言模型 \(LLMs\) 最近在心智理论 \(ToM\) 测试中表现出色,引发了关于其底层能力性质与有效性的争论。与此同时,通过可验证奖励强化学习训练出的推理导向 LLMs 在多个基准上展现出了显著提升。在本工作中,我们结合既有基准的结果,采用新颖改编的机器心理实验,考察了这类推理模型在 ToM 任务中的行为。我们观察到,推理模型在提示词变化和任务扰动下始终表现出更高的鲁棒性。我们的分析表明,这些收益至少部分来源于模型在提示与任务变化下更稳健地得出正确答案。我们将此解读为支持一种基于鲁棒性的解释,而非出现了新的 ToM 特异能力。 ## 1 引言 近年来,大型语言模型 \(LLMs\) 已变得足够强大,能够融入我们的日常生活,并越来越多地被用于社交和智能体场景中\[13 (https://arxiv.org/html/2608.04646#bib.bib67)\]。用户倾向于将这些模型视为具有类人的意向性和推理能力,尽管这些模型在多大程度上能够进行复杂推理在很大程度上仍然是一个开放的研究问题\[29 (https://arxiv.org/html/2608.04646#bib.bib10),16 (https://arxiv.org/html/2608.04646#bib.bib9),23 (https://arxiv.org/html/2608.04646#bib.bib69),14 (https://arxiv.org/html/2608.04646#bib.bib68)\]。 由于这些系统极为复杂,即使知晓其架构的全部信息,仍难以确定和预测它们的实际行为。鉴于这一点,多个领域的研究人员开始通过与其交互和理解其行为来研究这些系统及其智能,而非分析其架构。\[16 (https://arxiv.org/html/2608.04646#bib.bib9)\] 在此背景下,已有研究争论 LLMs 在多大程度上展现出心智理论 \(ToM\) 行为,即对心理状态、信念、意图和欲望进行推理的能力。早期一些说法对这种技能在某种程度上涌现持乐观态度\[9 (https://arxiv.org/html/2608.04646#bib.bib61)\]。然而,后续的批评\[21 (https://arxiv.org/html/2608.04646#bib.bib29)\]促成了更全面测试这些能力的基准的出现\[22 (https://arxiv.org/html/2608.04646#bib.bib2),24 (https://arxiv.org/html/2608.04646#bib.bib12),8 (https://arxiv.org/html/2608.04646#bib.bib30),4 (https://arxiv.org/html/2608.04646#bib.bib5),6 (https://arxiv.org/html/2608.04646#bib.bib1)\]。 此后,所谓的推理模型家族相继发布,如 OpenAI 的 GPT-5、Anthropic 的 Claude 以及 DeepSeek R 系列。这些模型的创新之处在于,它们通过强化学习被训练为“先思考再回答”,即在回答查询之前生成复杂的思维链,这是一种推理时扩展的形式\[11 (https://arxiv.org/html/2608.04646#bib.bib14),12 (https://arxiv.org/html/2608.04646#bib.bib62),5 (https://arxiv.org/html/2608.04646#bib.bib65),14 (https://arxiv.org/html/2608.04646#bib.bib68)\]。这种新型模型不仅可能在 ToM 任务上表现显著更好,而且其思维链在理论上可能为这些模型究竟如何回答查询提供重要洞见。 然而,尚不清楚这些提升是否反映了根本性更强的 ToM 推理能力,还是仅仅反映了在提示词和任务变化下找到正确答案的鲁棒性提升。理解这一区别对于解释 LLMs 社会认知能力表面的进步以及设计可靠的评估协议非常重要。 本文研究推理在大型语言模型执行 ToM 任务时的作用,可视为人文学科和社会科学对 AI 的贡献,反之亦然,不过我们仅探索 LLM 行为,并明确不对 LLMs 是否真正拥有 ToM 做出任何强 AI 声明。首先,我们使用\[24 (https://arxiv.org/html/2608.04646#bib.bib12)\]中的既有心理学 ToM 测试来评估近期推理导向模型。其次,我们引入受\[21 (https://arxiv.org/html/2608.04646#bib.bib29)\]启发的提示变体,用于探测在保持任务不变的提示扰动下的鲁棒性。第三,我们比较推理启用模型和非推理模型在这些测试中的行为,以考察推理如何影响性能稳定性。最后,我们用\[7 (https://arxiv.org/html/2608.04646#bib.bib35)\]中报告的基准结果补充我们的实验。所有提示、数据和代码均公开于此GitHub 仓库 (https://github.com/ianbdehaan/Evaluating_ToM_in_Reasoning_Models),包括一份补充材料文档。 本文其余部分结构如下:第2节 (https://arxiv.org/html/2608.04646#S2)概述相关研究;第3节 (https://arxiv.org/html/2608.04646#S3)介绍实验所用的材料与方法;第4节 (https://arxiv.org/html/2608.04646#S4)呈现实验结果;第5节 (https://arxiv.org/html/2608.04646#S5)解释所得结果,指出当前工作的一些局限,并提出可扩展研究的新方向;第6节 (https://arxiv.org/html/2608.04646#S6)总结研究发现。 ## 2 背景 本节呈现与本研究相关的文献综述。内容包括第2.1节 (https://arxiv.org/html/2608.04646#S2.SS1),回顾思维链以及近期采用可验证奖励强化学习 \(RLVR\) 训练的推理模型;第2.2节 (https://arxiv.org/html/2608.04646#S2.SS2),介绍 ToM 主题,以及它为何会成为 LLMs 必备的一项有用技能;第2.3节 (https://arxiv.org/html/2608.04646#S2.SS3),介绍调查研究它们在多大程度上具备 ToM 的第三方基准。 ### 2.1 思维链与推理模型 RLVR 已被证明能有效诱导 LLMs 进行复杂推理,利用这一技术,一批经过优化以生成思维链及答案的新模型开始涌现,并被命名为*推理模型*\[27 (https://arxiv.org/html/2608.04646#bib.bib43),14 (https://arxiv.org/html/2608.04646#bib.bib68),13 (https://arxiv.org/html/2608.04646#bib.bib67)\]。这些模型的实现细节是一个重要话题,但超出了本文的范围。 然而,尽管在多个领域(尤其是数学和编程)取得了有希望的结果,并点燃了 RLVR 训练的 LLMs 可能实现更普遍形式智能的希望,\[28 (https://arxiv.org/html/2608.04646#bib.bib23)\]证明,实际上,这些模型获得的性能提升来自对基础模型已可解问题更高效的答案采样,而非引入了根本性的新推理能力。因此,推理模型的推理能力仍然受限于其基础模型。推理最初也被视为追踪 LLMs 中奖励黑客行为的一条有希望的途径,但已有研究表明,至少在思维链对该类行为并非必需的情景中,其言语化程度非常低\[3 (https://arxiv.org/html/2608.04646#bib.bib31)\]。这一发现也让人更普遍地认识到,推理模型并不总是在其思考令牌中包含真实的推理过程,尽管同一篇文章也表明,至少在某些时候它们确实如此。 ### 2.2 心智理论与 LLMs ToM 通常被定义为个体将心理状态归因于他人(包括自己)并持续跟踪这些状态的能力,同时它也与自我和他者的概念紧密相关\[2 (https://arxiv.org/html/2608.04646#bib.bib55),24 (https://arxiv.org/html/2608.04646#bib.bib12)\],仓库中的补充材料还提供了更多定义。根据\[1 (https://arxiv.org/html/2608.04646#bib.bib59)\],“在特定情境中推断他人相信什么的能力,使人能够预测他们将要做什么”,这一概念不仅显示了 ToM 在人类社交互动中的重要性,也为设计实验以检验某个智能体是否表现出 ToM 行为提供了途径。Quesque 和 Rossetti\[15 (https://arxiv.org/html/2608.04646#bib.bib44)\]提出,一个特定任务要成为有效的 ToM 评估,应满足两个标准:任务不仅应涉及将心理状态归于他人,而且这些心理状态应不同于任务执行者自己的心理状态(*“非融合”属性*);此外,比 ToM 更简单的过程不应能够解释在特定任务中的成功(*“心智化”属性*)。 这两个原则体现在许多不同的任务中,例如理解假装游戏、虚张声势、善意的谎言等,但其中一种任务类型成为了该领域的试金石:错误信念测试。这种测试需要理解:一个在信息不正确条件下运作的智能体,会依据其错误信息行动,而非依据世界的真实状态\[17 (https://arxiv.org/html/2608.04646#bib.bib24)\]。 随着 LLMs 的普及,这些系统具备参与社交互动所需技能变得至关重要。在此背景下,研究者开始讨论它们在多大程度上拥有 ToM。\[24 (https://arxiv.org/html/2608.04646#bib.bib12)\]表明,截至 2023 年,大多数 LLMs 在若干 LLM 任务上的表现低于 7-10 岁儿童的水平。\[19 (https://arxiv.org/html/2608.04646#bib.bib27)\]证明,GPT-4 和 Flan-PaLM 在更高阶 ToM 任务上达到了成人或接近成人的水平。 然而,关于 LLMs 在这些 ToM 任务中的成功是否真正意味着它们发展出了 ToM 技能,学界仍有争论\[18 (https://arxiv.org/html/2608.04646#bib.bib60)\]。\[21 (https://arxiv.org/html/2608.04646#bib.bib29)\]证明,尽管 GPT-3 能通过 ToM 任务,但对那些在我们看来微不足道的提示进行改动,就会导致其失败。作者声称这意味着 GPT3 对 ToM 背后基本原则的理解并不是真实的。 在本文语境下,AI 拥有真实技能的概念仅指它通过我们与它的交互所展现出的行为,因此*表现得好像*拥有某项技能与*真正拥有*该项技能被视为等价。这是因为关于 AI 现象学真正本质的断言,以及它是否可能是哲学上的“僵尸”,虽然是有效且有趣的讨论,但远远超出本文的范围,因此我们采用图灵更具工具主义的方法\[20 (https://arxiv.org/html/2608.04646#bib.bib66)\]。然而,需要指出的是,像\[21 (https://arxiv.org/html/2608.04646#bib.bib29)\]那样的断言仍然是有意义的,因为 AI 理解缺乏“真实性”这一点会通过模型响应的属性表现出来。 尽管围绕着使用 ToM 任务成功频率作为模型是否具有 ToM 技能的真实评估这一有效性存在各种讨论,多个基准还是开始出现,每个基准在任务构成上都有其特定方法。\[8 (https://arxiv.org/html/2608.04646#bib.bib30)\]有了基准之后,测试任何特定技术能否提高模型在 ToM 任务上的表现就变得容易了。首先被测试的是 CoT 提示对模型的影响。研究发现,至少在若干情况下它能提升模型的表现\[8 (https://arxiv.org/html/2608.04646#bib.bib30)\]。此外,其他作者也提出了其他方法,包括但不限于: - •*视角采择*:提示模型在回答 ToM 任务前先将语境过滤为仅包含角色所知的信息\[25 (https://arxiv.org/html/2608.04646#bib.bib47)\] - •*DEL-ToM*:一种通过基于动态认知逻辑的方法来扩展模型推理时间的方法\[26 (https://arxiv.org/html/2608.04646#bib.bib6)\] - •*Thought Tracing*:一种推理时推理算法,在 ToM 任务中跟踪并加权围绕角色心理状态的不同假设\[7 (https://arxiv.org/html/2608.04646#bib.bib35)\] 一个有助于进一步阐明 ToM 任务的概念是“推理阶数”。为了说明这个概念的含义,想象三个角色:Adu、Lin 和 Lily。如果 Adu 想“Lin 很酷”,这被认为是一个 0 阶推理,因为他只是在想 Lin,并未涉及 Lin 的心理状态。另一方面,如果他想“Lily 认为 Lin 很酷”,那就是 1 阶推理。为了进一步说明更高阶的推理,考虑 Adu 想:“4) Lily 认为 3) 我认为 2) 她认为 1) Lin 认为 0) 她很酷”。简而言之,ToM 任务的推理阶数是递归定义的,即它需要多少个心理表征。\[10 (https://arxiv.org/html/2608.04646#bib.bib33) ### 2.3 第三方基准结果 已有研究尝试直接测试推理和非推理模型在既定 ToM 基准上的表现。与我们最相关的是,\[7 (https://arxiv.org/html/2608.04646#bib.bib35)\]报告了一系列模型(包括几个推理模型及其对应的非推理同类模型)在 FANToM、BigToM、MMToM-QA 和 ParaphrasedToMi 基准上的结果。我们在表1 (https://arxiv.org/html/2608.04646#S2.T1)中复现了他们的数据,以供参考。请注意,这些模型比我们自己实验中使用的模型略旧。 有两个模式值得强调,我们将在第5节 (https://arxiv.org/html/2608.04646#S5)中再回到这一点:推理模型在大多数基准上的得分往往高于可比的非推理模型;且差距在 FANToM 上最大,该基准中模型只有在某个类型的所有问题上都回答正确才能得分,因此不一致性会受到严重惩罚。这两种观察都与我们在全文中所发展的基于鲁棒性的解读一致,我们将其视为支持性的外部证据。 表 1:第三方 ToM 基准结果,数据来自\[7 (https://arxiv.org/html/2608.04646#bib.bib35) ## 3 方法 为使结果有上下文、可复现、可重复,本节概述研究中涉及的模型(第3.1节 (https://arxiv.org/html/2608.04646#S3.SS1))、对模型进行的心理测试(包括高层实现细节、评估指标以及实验所用代码和数据引用)(第3.2节 (https://arxiv.org/html/2608.04646#S3.SS2)),并讨论评分方式(第3.3节 (https://arxiv.org/html/2608.04646#S3.SS3))。 我们要强调,本文并未对 RLVR 训练的效果进行受控因果识别。被评估的系统在供应商接口、提示能力以及中间推理轨迹访问权限等方面存在差异,这使得完全受控的比较变得困难。因此,我们的贡献应被理解为一项实证行为分析:在一系列 ToM 测试和提示扰动中,推理导向模型在变化下显得更稳定,这一发现与既有基准的外部证据相吻合。
相似文章
OmniToM: 通过显式信念建模对大语言模型的心智理论进行基准测试
OmniToM 引入了一个基准测试,通过要求显式提取和标注信念结构来评估大语言模型的心智理论,揭示了尽管模型在端点问答任务上表现强劲,但在跟踪角色特定信念方面存在瓶颈。
心智理论提升是否真的有益于人机交互?来自交互评估的实证发现
本文针对大语言模型的心智理论能力提出了一种新的交互评估范式,发现静态基准测试上的提升并不能转化为动态人机交互中的更好表现,凸显了基于交互评估的必要性。
大语言模型数学问题求解中可执行推理约束下的表示鲁棒性
本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。
Agent-ToM: 通过心智理论推理学习监控自主LLM智能体
提出 Agent-ToM,一种基于心智理论推理的学习监控框架,通过推断信念和意图来检测自主LLM智能体中的隐蔽恶意行为,性能优于基线监控器。
The Theory of Mind Utility:心智化机制的形式化规范
本文介绍了Theory of Mind Utility (ToM-U),一种通过构建Local Epistemic World Models (LEWMs)来推断他人认知状态的形式化计算层级规范。它不同于Bayesian ToM和模拟理论,提供了一种领域无关的信念推断机制,而不依赖于算法实现。