没有系统性的思考?在规则归纳任务上评估推理模型

arXiv cs.CL 论文

摘要

本文通过扩展认知科学中的规则归纳任务,评估推理模型是否表现出系统性,发现模型在解决单个任务后,常在结构等价变体上失败,这表明其推理能力缺乏系统性。

arXiv:2609.13948v1 公告类型:新 摘要:人类认知的一个核心原则是系统性,即理解一个概念必然与理解该概念的紧密变体相关联。推理模型是否能稳健地表现出这种系统性?如果是这样,我们预期在同一任务的结构等价变体上会有持续的表现。在此,我们扩展了认知科学中已建立的规则归纳任务,以评估当前推理模型的思维系统性。每个任务族具有组合结构,我们通过任务同构(如重组和替换)来创建结构等价的任务变体。我们发现,尽管模型能够正确解决一个任务,但它们常在相同任务的结构等价变体上失败。这些发现表明,许多模型行为缺乏系统性,使得难以在超越其被评估的特定上下文之外稳健地确立推理模型的认知能力。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:47

# 缺乏系统性的思维?评估推理模型在规则归纳任务中的表现 来源:https://arxiv.org/html/2609.13948

#### 摘要
人类认知的一个核心原则是系统性,即理解一个概念必然与理解其密切相关的变体相关联。推理模型是否能稳健地表现出这种系统性?如果是,我们期望模型在结构等价的同一任务变体上能表现出一致的性能。在此,我们扩展了认知科学中已建立的规则归纳任务,以评估当前推理模型中思维的系统性。每个任务族都具有组合结构,我们利用这些结构通过任务同构(如重组和替换)来创建结构等价的任务变体。我们发现,即使模型能够正确解决某个任务,它也常常在该任务的结构等价变体上失败。这些发现表明,许多模型行为缺乏系统性,这使得难以在超出其被评估的特定上下文之外,稳健地建立推理模型的认知能力。

**图1:** 推理模型在规则归纳任务中的系统性。我们在规则归纳任务的组合族上评估推理模型。对于族内的每个特定任务,我们针对每种任务不变性类型生成 $K=5$ 个结构等价的任务变体。对于每组任务变体,我们报告是否有任何变体被正确解决、正确解决的变体比例以及所有变体是否都被正确解决,并报告任务族内任务变体集的平均值。我们发现,几乎所有模型在布尔类别学习任务族上都是完全系统性的,但在解决任意变体与解决所有变体的能力之间,在剩余的任务族上存在显著的系统性差距。

## 1 引言
**图2:** 在具有组合结构的规则归纳任务中评估系统性。(A) 组合任务族允许构建大量具有相关结构的任务。所示任务是第4.1节(https://arxiv.org/html/2609.13948#S4.SS1)中基于语法的指令学习任务的简化版本。(B) 每个规则归纳任务需要在一组输入 $\rightarrow$ 输出支持样例的基础上推断隐藏规则,以解决新的查询样例。(C) 组合任务结构允许创建结构等价任务的系统性变体。(D) 可以在结构等价的任务变体上独立评估推理模型,以评估其系统性。

系统性是人类语言和思维的一个定义性特征:当我们能理解一个概念时,就意味着我们也能理解许多密切相关的概念(Fodor 和 Pylyshyn,1988;McLaughlin,1993)。例如,当我们学会如何“blicket”时,我们也能“blicket”两次;如果我们能学会所有红色正方形都是“wudsy”,我们同样能学会所有蓝色圆形都是“wudsy”。这种系统性反映了人类能够毫不费力地生成和理解熟悉元素未见过变体的灵活性(Chomsky,1985;Lake 等,2017),并且它是认知测试的一个关键假设,因为它使得在特定上下文中测量某种能力,并对该能力做出超出其被测量的特定上下文之外的推断成为可能。人类认知的系统性有许多方面,反映了根据任务的潜在组合结构对其进行改变的各种方式(Hupkes 等,2020)。这包括替换,例如使用不同的符号表示相同的基本概念;以及表达式中服务于相似作用的部分的重组。这些不变性反映了组合任务结构,通过共同的句法将任务相互关联,该句法规定了如何将一组基元组合成不同的配置。从这个角度来看,系统性可以被理解为成功捕捉一系列任务潜在组合结构的行为结果。组合任务族本质上是指数级的,即使在大规模情况下,也几乎不可能在训练数据中详尽地包含所有可能的任务变体(Schug,2025)。这就提出了一个问题:推理模型是否表现出思维的系统性,并在给定任务的众多可能、结构等价的变体上表现一致?

在这里,我们通过借鉴认知科学中成熟的实验范式来研究这个问题。特别是,我们考虑需要学习者推断潜在结构的规则归纳任务,并在结构等价的任务变体上对其进行评估,以探究其思维的系统性,如图2所示(https://arxiv.org/html/2609.13948#S1.F2)。认知科学中研究了多种此类任务,从简单的布尔概念学习、符号序列的抽象推理,到发现人工语言的语法和语义(Raven,1962;Feldman,2000;Piantadosi 等,2016;Lake 和 Baroni,2023;Rule 等,2024)。这些任务具有组合结构,使我们能够生成大量可能的任务,并探究超出任何特定经验细节的理解。重要的是,对于每个特定任务,我们可以通过使用任务同构——基于底层组合结构的等变任务变换——来创建结构等价的任务变体,以评估系统性。与经验会不可避免地改变心智状态的人类不同,模型提供了通过观察在多个互不影响的反事实世界中的行为结果来评估最严格形式系统性的机会。我们在此总结我们的主要贡献:

- 在第3节(https://arxiv.org/html/2609.13948#S3),我们形式化了系统性,以及如何在通过任务同构的结构等价规则归纳任务上测量它。
- 在第4节(https://arxiv.org/html/2609.13948#S4),我们调整了四个规则归纳任务族以生成系统性任务变体。
  - 第4.1节(https://arxiv.org/html/2609.13948#S4.SS1):基于语法的指令学习(Lake 和 Baroni,2023)
  - 第4.2节(https://arxiv.org/html/2609.13948#S4.SS2):Raven 渐进矩阵的符号版本(Schug 等,2025)
  - 第4.3节(https://arxiv.org/html/2609.13948#S4.SS3):整数序列上的程序归纳(Rule 等,2024)
  - 第4.4节(https://arxiv.org/html/2609.13948#S4.SS4):布尔类别学习(Piantadosi 等,2016)
- 在第5节(https://arxiv.org/html/2609.13948#S5),我们在四个任务族的任务变体上评估推理模型的系统性,并研究推理努力和采样噪声的影响。

## 2 相关工作
观察到人类认知具有系统性,长期以来一直是探究的焦点,这可以追溯到早期对思维定律的尝试(Boole,1854;Griffiths,2026)。系统性是思维语言假说的核心原则——这是一个关于人类认知的突出理论,它假设心理表征具有组合的语法和语义(Fodor,1975;Fodor 和 Pylyshyn,1988;Penn 等,2008;Goodman 等,2015)。因此,认知科学有着悠久的历史,开发具有不同潜在句法和语义结构的规则学习测试,以研究思维语言假说。Feldman(2000)的经典工作使用布尔概念学习任务表明,主观难度与底层规则的复杂性直接相关,而具有更复杂逻辑规则的学习任务已被用于探究可能构成思维语言的具体基元(Piantadosi 等,2016;Rule 等,2024)。需要推断组合字符串重写规则的任务已被进一步用于比较人类和神经网络之间的组合学习,这是神经网络历史上一直难以应对的挑战,但最近取得了显著进展(Lake 和 Baroni,2023)。尽管取得了这些进展,早期的大型语言模型仍然很脆弱,容易被其输入的细微变化所干扰,包括拼写错误、无关句子、措辞变化和示例重排(Jia 和 Liang,2017;Jiang 等,2020;Zhao 等,2021;Lu 等,2022)。虽然通过人类反馈的指令微调(Ouyang 等,2022)、渐进式缩放(Kaplan 等,2020;Bubeck 等,2023)和推理时推理(Wei 等,2022;Wang 等,2022;Lightman 等,2024;OpenAI 等,2024)已使所得模型对表面变化的敏感度显著降低,但对抗性脆弱性仍然是一个核心关注点(Wang 等,2023;Zou 等,2023;Berglund 等,2024;Romanou 等,2026;Mondorf 等,2026;Burnell 等,2026),特别是在安全性和对齐的背景下(Wei 等,2023;Chen 等,2025)。因此,近年来人们更加强调通过变形测试来评估模型一致性,其中评估相关输入输出之间的已知关系(Segura 等,2016)。这包括跨语言的一致性(Cho 等,2025)或基于类别的替换(Ribeiro 等,2020)。逻辑一致性测试尤其评估模型知识的内在一致性(Jang 等,2022),例如通过验证对释义的不变性(Elazar 等,2021)或预测的关系是否在传递性下封闭(Jang 和 Lukasiewicz,2023)。我们的系统性评估可以被解释为一种特定类型的变形测试,它验证了在组合数据生成过程下的任务解决能力的不变性。

## 3 什么是系统性以及如何测量它?
在下文中,我们将形式化系统性、如何在规则归纳任务设置中测量它,并开发度量标准来量化学习者在这些任务上的系统性。

### 3.1 什么是系统性?
我们将系统性定义为能力相对于具有组合结构的任务的某些变换的不变性。例如,我们可能期望理解像“Alice loves John”这样的表达式的能力对于其成分的置换(如“John loves Alice”)是不变的。这意味着我们将系统性视为行为的一个潜在属性,它对数据生成过程的底层组合结构做出假设。为了量化系统性,我们将测量解决任务的能力如何根据任务的组合结构修改其成分的任务变体而变化。由于某些任务变体可能会改变任务的难度并混淆系统性度量,我们将任务变体限制为通过同构(任务变体之间的一对一映射)彼此结构等价。

### 3.2 系统性任务变体的类型
任务成分可以修改的具体方式取决于数据生成过程的组合结构。在我们的任务族中,我们将考虑以下任务变换:
- •**符号替换:** 替换那些不携带与任务相关的内在语义意义的符号。例如,将一个伪词“dax”替换为另一个伪词“lug”。
- •**特征重绑定:** 将潜在变量重新绑定到不同的特征。例如,通过大小、方向或数量来表示相同的数字。
- •**成分置换:** 在表达式内打乱相同类型的成分。例如,“Alice loves John” ↔ “John loves Alice”。
- •**示例重排序:** 改变呈现多个独立示例的顺序。

### 3.3 结构等价的规则归纳任务
我们将在如图2所示(https://arxiv.org/html/2609.13948#S1.F2)的规则归纳任务设置中评估系统性。在每个任务中,我们向学习者呈现一组输入-输出示例,基于此,学习者必须推断隐藏的底层规则。然后,我们通过要求学习者预测一组新的输入上的输出来验证其是否正确推断了规则。例如,在布尔类别学习任务中,学习者可能会看到三个支持样例,如 $\rightarrow$ wudsy(红色正方形),$\rightarrow$ 不是 wudsy(蓝色圆形)。

相似文章

立场:推理是一种可学习的基于规则的过程

arXiv cs.AI

这篇立场论文认为,AI推理缺乏清晰的操作性定义,削弱了评估的有效性,并提出将推理定义为一种可学习的基于规则的过程,同时提供研究最佳实践的检查清单。

推理一致性扫描:用于审计AI安全评估中思维链有效性的框架

arXiv cs.AI

本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。

推理模型难以控制其思维链,但这其实是好事

OpenAI Blog

OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。