FALSIFYBENCH:利用规则发现游戏评估大语言模型的归纳推理能力
摘要
FalsifyBench 是一个用于评估大语言模型归纳推理能力的新型评测框架,灵感来源于 Wason 2-4-6 任务。在该框架中,智能体通过提出示例并接收反馈来发现隐藏的语义规则。对 12 个大语言模型的评估结果表明,推理模型的表现优于指令微调模型,而负面测试(即假设证伪)是决定成败的关键因素。
查看缓存全文
缓存时间: 2026/06/05 02:08
# 使用规则发现游戏评估大语言模型的归纳推理能力
来源:https://arxiv.org/html/2606.04751
Leonardo Bertolazzi1,Katya Tentori1,Raffaella Bernardi2
1特伦托大学,2博尔扎诺自由大学,联系方式:leonardo\.bertolazzi@unitn\.it (https://arxiv.org/html/2606.04751v1/mailto:email@domain)
###### 摘要
大语言模型(LLMs)正日益被部署为科学任务中的自主智能体。然而,这些系统能否有效地参与与科学发现相关的归纳推理,仍是一个悬而未决的问题。在本研究中,我们提出了 FalsifyBench——一个受经典 Wason 2-4-6 任务启发的假设驱动推理评估框架。在该框架中,智能体必须通过反复提出示例并接收反馈来发现隐藏的语义属性。这一任务涵盖了科学推理的关键要素:假设生成、证据收集,以及在面对确认性与否定性证据时的信念修正。我们对 12 个 LLMs 进行了跨模型系列和规模的评估,结果表明推理模型通常比指令微调模型表现出更强的科学推理能力,但没有任何模型接近最优表现。影响成功的主要因素是负向测试能力:积极尝试证伪自身假设的模型,始终优于以寻求确认为主的模型。此外,此前研究所忽视的细粒度轮次级分析揭示,失败与模型在假设空间中导航方式的可识别模式密切相关。
FalsifyBench:使用规则发现游戏评估大语言模型的归纳推理能力
Leonardo Bertolazzi1,Katya Tentori1,Raffaella Bernardi2
1特伦托大学,2博尔扎诺自由大学,联系方式:leonardo\.bertolazzi@unitn\.it (https://arxiv.org/html/2606.04751v1/mailto:email@domain)
## 1 引言
大语言模型(LLMs)在与科学工作相关的各个领域中表现越来越出色,包括文献综述\(Mialon等,2024 (https://arxiv.org/html/2606.04751#bib.bib12);Wei等,2025 (https://arxiv.org/html/2606.04751#bib.bib13)\)、软件工程与编程\(Jimenez等,2024 (https://arxiv.org/html/2606.04751#bib.bib7);Jain等,2025 (https://arxiv.org/html/2606.04751#bib.bib8)\)、数学\(Mirzadeh等,2025 (https://arxiv.org/html/2606.04751#bib.bib15);Glazer等,2025 (https://arxiv.org/html/2606.04751#bib.bib14)\)以及专家级知识\(Wang等,2024 (https://arxiv.org/html/2606.04751#bib.bib9);Rein等,2024 (https://arxiv.org/html/2606.04751#bib.bib10);Center for AI Safety等,2026 (https://arxiv.org/html/2606.04751#bib.bib11)\)。这些进展推动了一系列关于能够端到端执行科学研究的自主智能体的研究\(Lu等,2024 (https://arxiv.org/html/2606.04751#bib.bib17);Gottweiss等,2025 (https://arxiv.org/html/2606.04751#bib.bib16)\)。随着这些系统日益融入科学工作流程,一个根本性的问题随之而来:它们能否执行科学研究所需的关键归纳推理形式?其中最核心的是:根据新证据生成、评估和修正假设的能力。这一过程中的关键环节是*证伪*(falsification)——当假设被证据所反驳时,将其替换为新假设。
表1:可能的假设 $H$ 与真实规则 $R$ 之间的集合关系,其中 $x$ 表示一个测试三元组。每种关系都有特定的*证伪*情形,迫使对 $H$ 进行否定并转向新假设。高亮显示的情形($H \subset R$)对应 Wason 2-4-6 任务及 FalsifyBench 中的游戏:在此情形下,只有 $H$ 之外的三元组(负向测试,$-$)才能揭示 $R$ 比 $H$ 更宽泛;而在其他关系中,$H$ 内部的三元组(正向测试,$+$)也可能证伪 $H$。
研究这一过程中最为知名且广泛使用的人类实验范式之一,是 Wason 2-4-6 任务\(Wason,1960 (https://arxiv.org/html/2606.04751#bib.bib1)\)。实验参与者会看到一组三元数字(例如"2, 4, 6"),并被要求发现其背后的隐藏规则(此处记为 $R$)。他们通过提出新的三元组并从实验者处获得每个三元组是否符合规则的反馈来推断规则。当参与者足够自信地认为已发现 $R$ 时,便陈述自己的假设(此处记为 $H$)。当待发现的规则比初始示例所暗示的规则更为宽泛时(如 Wason 原始任务中,$R$ 为"任意递增的三个数字序列"),成功率很低。这是因为参与者往往形成过于具体的假设(例如"以二为公差递增的偶数")。在这种情况下,生成与具体假设一致的三元组(例如"8, 10, 12")无法揭示这些假设过于狭窄,也无法证伪它们。这种行为被称为*确认偏误*,传统上被解释为一种与科学推理相悖的非理性倾向。
后来,Klayman 和 Ha(1987 (https://arxiv.org/html/2606.04751#bib.bib2))的研究对此作出了更为细致的区分:*正向测试*是指寻求预期能确认当前假设的证据;*负向测试*是指寻求预期能否定当前假设的证据。关键在于,他们指出正向测试同样可以导致对假设的证伪,而这两种策略的有效性取决于 $H$ 与 $R$ 之间的关系。具体而言,当假设 $H$ 比隐藏规则 $R$ 更宽泛($H \supset R$)时,正向测试策略可以证伪 $H$;而当 $H$ 是 $R$ 的严格子集($H \subset R$)时,正向测试则无法证伪 $H$。在后一种情况下,*负向测试*是能够决定性地证伪 $H$ 的唯一策略。表1 (https://arxiv.org/html/2606.04751#S1.T1) 汇总了 $H$ 与 $R$ 之间所有可能的关系,以及在每种情形下能够决定性地证伪 $H$ 的测试类型。[^1]
[^1]: 我们在附录A (https://arxiv.org/html/2606.04751#A1) 中对可决定性证伪 $H$ 的情形进行了详细讨论,并提供了可视化示例。
在本研究中,我们引入了 Wason 任务的一个泛化版本,其中 LLMs 必须发现隐藏的语义属性,而非数字规则。在这一语义版本中,我们利用分类关系构建着重体现 $H \subset R$ 配置的游戏——在该配置下,负向测试是最优策略,这也对应于 Wason 的原始情形。这一配置尤为值得关注,因为它映射了科学史上一个反复出现的模式:被接受的理论后来被证明只是更宽泛理论的特例(例如,牛顿力学是相对论的一个极限情形)。这一类比促使我们将通过负向测试证伪和修正过于狭窄的假设,作为科学推理的核心组成部分加以关注,并在 LLMs 等系统中加以检验。与此同时,遵循 Klayman 和 Ha(1987 (https://arxiv.org/html/2606.04751#bib.bib2))的研究,我们并不假设负向测试在所有情况下都更优,而是考察 LLMs 如何在 $H$ 与 $R$ 的不同关系下处理假设检验,并对每种情形应用最合适的规范性分析框架。
我们的主要贡献如下:(1)我们提出了 FalsifyBench[^2],这是一个基于语义分类体系的假设驱动推理基准,它将科学推理的关键组成部分操作化:主动生成并潜在证伪当前假设以对其加以检验的能力;(2)我们评估了 12 个来自多个模型系列和不同规模的 LLMs,结果表明推理模型在我们的框架中通常表现出比指令微调模型更强的科学思维,但没有任何模型接近最优表现;(3)我们进行了细粒度的轮次级分析——这得益于我们的评估设置——结果表明,失败反映了模型在假设空间中导航方式的可识别模式。
[^2]: 本文所用代码和数据已公开发布于 https://github.com/leobertolazzi/FalsifyBench.git。
参见图1说明:FalsifyBench 游戏结构。玩家被给定三个物品(例如,pocketed bat、skimmer 和 tarsius glis),必须通过提出额外的测试三元组并从裁判处接收反馈("符合"vs."不符合")来识别它们共同隐藏的目标规则(例如,"它们都是动物")。在提出测试三元组之前,玩家需明确说明当前所测试的关于隐藏规则的假设。在*正向测试*中,提出的三元组预期满足该假设;在*负向测试*中,提出的三元组预期证伪该假设。该过程持续进行,直到玩家足够自信地识别出隐藏规则并将其作为*猜测*表达出来。若所陈述的假设正确,游戏结束;否则,玩家继续提出新的测试三元组。
## 2 相关工作
归纳推理是人类众多活动的核心,包括实证科学研究,因此已成为 LLMs 推理能力评估的重要焦点。早期研究使用合成基准在序列到序列模型上测试这一能力。Chollet(2019 (https://arxiv.org/html/2606.04751#bib.bib25))提出了抽象与推理语料库(ARC),该基准通过网格变换任务测试模型——模型必须从少量输入输出示例对中推断抽象变换,并学会将正确规则应用于未见过的网格。Lake 和 Baroni(2018 (https://arxiv.org/html/2606.04751#bib.bib27))采用了类似方法,测试从命令到动作字符串的映射学习能力,以及将其应用于新颖的、未见过的序列组合的能力。
近期研究越来越关注理解 LLMs 在任务表现之外如何进行归纳推理。Jin 等(2026 (https://arxiv.org/html/2606.04751#bib.bib23))表明,思维链推理\(Wei等,2022 (https://arxiv.org/html/2606.04751#bib.bib28)\)并不能普遍提升归纳能力,甚至可能降低性能。Li 等(2025 (https://arxiv.org/html/2606.04751#bib.bib22))通过解耦归纳步骤与演绎步骤,提出了一个评估和解释 LLMs 归纳推理的框架。Louapre(2026 (https://arxiv.org/html/2606.04751#bib.bib24))考察了 LLMs 在归纳游戏中的行为,将模型策略显式映射到影响表现的类人特征,并将其设置与科学发现相联系。
在这一研究方向中,我们的工作与同样从 Wason 2-4-6 任务获取灵感的研究密切相关。Banatt 等(2024 (https://arxiv.org/html/2606.04751#bib.bib3))提出了 WILT,一个多轮归纳逻辑基准,其中隐藏规则为涉及三个变量的布尔函数;Jhaveri 等(2026 (https://arxiv.org/html/2606.04751#bib.bib4))使用关于数字属性的规则,明确研究 LLMs 中的确认偏误,并将针对人类设计的干预措施应用于 LLMs,以鼓励证伪行为。这两项研究均未明确采用 Klayman 和 Ha(1987 (https://arxiv.org/html/2606.04751#bib.bib2))提出的规范性框架:它们既没有从作为一般目标规则严格子集的规则中采样三元组,也没有追踪模型在每个轮次形成的假设与目标规则之间的关系。在我们的实验中,我们通过从 $R$ 的严格分类后代节点中采样术语三元组来弥补这一不足,从而使负向测试成为识别目标规则的更优策略。
玩家 裁判
参见图2说明:12 个 LLMs 在 FalsifyBench 上的实验结果。垂直黑线左侧的模型为*指令微调*变体,右侧为*推理*变体。**左上**:成功率表示正确识别目标规则的百分比。**左下**:确认偏误衡量确认而非证伪当前假设的查询比例(越低越好)。**右上**:裁判在 Test 和 Guess 轮次上与人工标注的准确率对比。**右下**:裁判与人工标注在 Test 和 Guess 轮次上的 Cohen's $\kappa$ 一致性系数。
## 3 方法
### 3.1 实验概述
在我们的实验中,每个 LLM 分别扮演两个角色:作为裁判(oracle)回答查询,以及作为玩家(player)尝试发现隐藏规则。与 Wason 原始实验直接类比,裁判向玩家提供一个从下位语义类别(例如"脊椎动物")中采样的初始三元组,而该类别本身包含于一个更为宽泛的目标类别(例如"动物")中。这个更宽泛的目标类别作为目标规则 $R$。通过迭代地提出新示例并接收反馈,玩家不断积累证据,以正向或负向方式测试其当前假设,直至能够识别出 $R$。图1 (https://arxiv.org/html/2606.04751#S1.F1) 展示了一个真实游戏的示例。
更具体地说,在每个轮次中,玩家提出三个物品,同时给出一个假设以及选择这些物品的理由。裁判根据这组物品是否满足目标规则 $R$,回应"符合"或"不符合"。当玩家足够自信时,提交最终答案,裁判回应"正确"或"错误"。因此,系统提示玩家使用 Test 动作收集信息并细化假设,在收集到足够信息后使用 Guess 动作。当玩家提交错误猜测时,它会得知当前假设有误,并被提示执行新的动作以收集更多证据,直至足够自信后再次猜测。当玩家提交正确猜测或达到最大轮次限制时,游戏结束(我们将最大轮次设为 20)。
我们选择语义类别而非数字序列作为实验领域,原因有二:LLMs 极有可能在预训练期间接触过经典的 2-4-6 任务;语义分类体系允许我们定义一组具有越来越具体子概念的丰富候选概念。这些类别从 WordNet\(Miller,1995 (https://arxiv.org/html/2606.04751#bib.bib5)\) 中提取,通过选取宽泛概念并从其后代节点中采样,可以构建大量此类游戏。从这一庞大空间中,我们精心策划了一组 100 个具有代表性的游戏,涵盖不同的分类深度和语义领域。每个游戏由两个语义类别定义:第一个是作为目标隐藏规则 $R$ 的宽泛类别;第二个是采样类别 $S$,即 $R$ 的一个后代节点,初始示例从中抽取。例如,若 $R = \text{"animal"}$,$S = \text{"vertebrate"}$,则一组可能的物品为 $E = \{\text{"pocketed bat"}, \text{"skimmer"}, \text{"tarsius glis"}\}$。玩家观察这些物品并形成初始假设 $H_1$。由于物品来自分类体系中较深位置的节点 $S$,该区域附近的语义类别往往比像 $R$ 这样非常宽泛的类别显得更为合理,因此玩家通常会从比真实规则更具体的假设开始。[^3]
当 $H$ 比 $R$ 更具体时,*正向测试*总会……
[^3]: 这一模式与 Wason 的发现相吻合:接触到序列"2-4-6"的参与者倾向于选择过于具体的规则,例如"递增的偶数",而非真实规则"任意递增序列"。相似文章
智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗
本文介绍了ParliamentBench,一个基于社交推理游戏《秘密希特勒》的开源基准,用于评估LLM在信息不对称条件下的欺骗、说服和推理能力。对约1600场比赛中16个LLM的实验显示,前沿模型形成了一个强大的顶尖集群,而大多数模型难以维持一致的欺骗性人格。
# 结合语义等价自博弈与形式化验证提升 LLM 代码推理能力
爱丁堡大学研究人员提出了一种利用 Liquid Haskell 进行形式化验证的自博弈框架,用于训练 LLMs 的语义等价推理能力,同步发布了 OpInstruct-HSx 数据集(28k 个程序),并在 EquiBench 上实现了 13.3 个百分点的准确率提升。
A2RBench:一种自动化的可形式化验证抽象推理基准生成范式
本文介绍了A2RBench,一个用于为LLM生成可形式化验证的抽象推理基准的自动化流水线,它利用循环一致性来确保唯一解,并揭示当前LLM在3D推理任务上显著落后于人类。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
LLM助手可验证的社会推理
本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。