立场:推理是一种可学习的基于规则的过程

arXiv cs.AI 论文

摘要

这篇立场论文认为,AI推理缺乏清晰的操作性定义,削弱了评估的有效性,并提出将推理定义为一种可学习的基于规则的过程,同时提供研究最佳实践的检查清单。

arXiv:2608.12325v1 公告类型:新 摘要:自主推理是当今人工智能领域最具科学和经济激励的话题之一。历史上,它是符号AI的范畴,而最近的进展主要来自深度概率生成模型。尽管兴趣巨大、进展迅速,生成式AI社区尚未明确就推理的操作性定义达成共识,并且常常隐含地拒绝逻辑和可验证的自动推理中对这一主题的历史处理方式。本文立场认为,定义上的模糊性使得推理评估的构念效度无法验证,削弱了向可信自主推理方向的可量化进展。我们还认为这种模糊性是可以解决的。为此,我们提供:(1) 基于文献综合的操作性定义,将有效且可靠的推理定位为一种可学习的基于规则的过程;(2) 一份关于AI推理研究交流最佳实践的检查清单。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

# 立场:推理是一个可学习的基于规则的过程  
来源:https://arxiv.org/html/2608.12325  

###### 摘要  

自主推理是当今人工智能领域最具科学和经济激励性的主题之一。历史上,这是符号人工智能的专属领域,而最近的进展主要来自深度概率生成模型。尽管人们对此抱有极大兴趣并取得了快速进展,生成式人工智能社区尚未在推理的操作性定义上达成明确共识,并且常常隐式地拒绝对这一主题在逻辑和可验证自动推理中的历史性处理。本立场认为,定义上的模糊性使得推理评估的构念效度无法验证,从而削弱了朝着可信赖自主推理方向可量化的进展。我们还认为,这种模糊性是可以解决的。为此,我们提供:(1) 基于文献综合的操作性定义,将有效且可靠的推理定位为一个可学习的基于规则的过程;(2) 一份关于人工智能推理研究交流最佳实践的检查清单。  
机器学习、ICML、推理、可信赖  

### 1 引言  

推理——非正式定义  
选择并应用一系列规则的過程,这些规则作用于先前的信念和当前证据,以在不断演变的状态中获得有原则的信念更新。  

核心立场  
命题 1 先定义,再测量。  
应为所研究的推理现象陈述操作性定义,并且推理评估的构念效度应相对于这些定义加以论证。  

命题 2 推理是一个可学习的基于规则的过程。  
推理是精确规则应用的过程,而非输出。可学习的规则将推理输入映射到输出,可以涵盖定理、函数、策略等,包括与随机性、不确定性和近似相关的规则。  

命题 3 基于规则的推理是有效的。  
推理过程的有效性源于精确的规则应用,与规则选择无关。  

图 1:本立场的核心命题。  

人工智能推理的前景是当今最具科学和经济激励意义的进展之一。最近的进展由大型推理模型(LRMs)显著的经验表现所推动:即为推理任务微调的大型语言模型(LLMs)(词汇表 E.1 (https://arxiv.org/html/2608.12325#A5.Thmdefinition1);Huang and Chang 2023 (https://arxiv.org/html/2608.12325#bib.bib37))。一波基准测试的成功引出了许多问题:自主推理是一种随规模扩展而出现的新兴行为吗(Wei et al., 2022 (https://arxiv.org/html/2608.12325#bib.bib62);González and Nori, 2024 (https://arxiv.org/html/2608.12325#bib.bib121))?LRMs 是否能正式地被表征为自主推理者,这是一个已成定局的问题吗?答案取决于推理是如何定义的。那么,什么是推理?尽管可能不存在一个普遍的定义,但我们认为实用的操作性定义(词汇表 E.2 (https://arxiv.org/html/2608.12325#A5.Thmdefinition2))是可以实现的,但在生成式人工智能中尚未被广泛使用。  

本工作倡导在推理中使用正式的操作性定义,并将有效且可靠的推理定位为一个植根于精确规则应用的可学习过程(图 1 (https://arxiv.org/html/2608.12325#S1.F1))。  

缺乏共识  
尽管推理在人类思想史上被广泛研究(附录 D.3 (https://arxiv.org/html/2608.12325#A4.SS3)),它在人工智能中仍然是一个难以捉摸的目标。尽管关于生成式人工智能中涌现推理的论断现在司空见惯,但“关于它包含什么并没有一个明确的定义”(Huang and Chang, 2023 (https://arxiv.org/html/2608.12325#bib.bib37))。在生成式人工智能中,对于推理的正式构成缺乏共识的情况下,我们观察到一种研究产出的常态化:这些研究声称要研究、改进、测量或促进人工智能推理,却并未严格定义所研究的推理形式。这种定义上的空白导致了目标不断移动,并使得推理评估的构念效度无法验证,从而模糊了朝着人类水平推理清晰进步的路径。回避正式定义可能源于一种隐含的假设,即推理是一个不需要明确定义的直观概念;也可能源于回避制定操作性定义这一艰苦工作;对符号人工智能历史定义的默默拒绝;或者(有意或无意的)将基准测试准确率与推理本身混为一谈。我们旨在使这种回避的风险变得显而易见,并提出替代路径。也就是说,我们认为没有理由在生成式人工智能的背景下“重新发明”推理:我们预计,与具体方法无关的操作性定义——同时兼容符号、神经和混合方法——从长远来看将提供更大的概念统一性和研究价值。  

推理僵尸与其他难题  
LRMs 的黑箱设计和自然语言界面带来了一个不小的挑战:区分真正的推理与看似推理的言语。后者代表着一种肤浅的模拟:像推理者一样说话,但无法保证结论来自任何超出记忆、猜测、聪明汉斯效应(Lapuschkin et al., 2019 (https://arxiv.org/html/2608.12325#bib.bib119);Kauffmann et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib89))或某种“幕后操纵”(Mitchell, 2025a (https://arxiv.org/html/2608.12325#bib.bib84))的机制。这一挑战并非人工智能推理所独有:可以将其与人类认知测试以及区分智能、理解和意向性与复杂模拟相类比,正如图灵测试(Turing, 1950 (https://arxiv.org/html/2608.12325#bib.bib88);Pinar Saygin et al., 2000 (https://arxiv.org/html/2608.12325#bib.bib34))和中文房间论证(Searle, 1980 (https://arxiv.org/html/2608.12325#bib.bib115), 1990 (https://arxiv.org/html/2608.12325#bib.bib114);Dennett, 1980 (https://arxiv.org/html/2608.12325#bib.bib111);Hauser, 1997 (https://arxiv.org/html/2608.12325#bib.bib113))所经典化的那样。这引出了一个粗略的类比:哲学僵尸(p-zombie)思想实验,我们称之为推理僵尸(r-zombie)。在经典的思想实验中,p-zombie 是在表面上表现得像有意识存在物、但缺乏任何有意识内在体验的系统(Chalmers, 1997 (https://arxiv.org/html/2608.12325#bib.bib77), 2020 (https://arxiv.org/html/2608.12325#bib.bib76))。类似地,r-zombie 是在表面上表现得像自主推理者、但缺乏有效内部推理机制的系统。完美的 r-zombie,即在所有情况下都与真正推理者行为相同的系统,仍然是纯理论性的。然而,我们认为 (1) 不完美的人工智能 r-zombie 已经存在;(2) 在理论上且通常在经验上区分人工智能 r-zombie 与人工智能推理者是可能的;(3) 我们必须仔细确定现实应用何时需要推理者,以及何时 r-zombie 就已足够。  

本立场是什么  
我们的核心命题(图 1 (https://arxiv.org/html/2608.12325#S1.F1))源于两个主要问题。  
1. 问题1:生成式人工智能中的推理经历了不必要的、可以解决的定义模糊性,其中不精确和过度负载的定义往往与人工智能和哲学中对此主题的历史性处理不一致(在提供定义的情况下)。  
2. 问题2:这导致了错误测量,促进了研究者之间共享理解的幻觉,并破坏了朝着可信赖人工智能推理可衡量进展的进程。  

本立场不是什么  
我们并不声称人工智能社区必须在一个普遍的推理定义上达成一致。我们不试图正式表征 LRMs 能够执行的推理的种类或程度,也不提出用于改进 LRM 推理的实际实现。本立场并不是对符号人工智能、纯数据驱动方法或神经符号人工智能的支持或反对。我们不声称关于自然智能中的推理,也不认为推理意味着理解或意识。  

贡献与产物  
1. 1. 一个将推理作为可学习、受规则支配过程的操作性定义。
根据文献综合,我们引入了一个供通用使用和社区讨论的人工智能推理操作性定义(§2 (https://arxiv.org/html/2608.12325#S2))。根据命题 1 (https://arxiv.org/html/2608.12325#S1.I1.i1),我们以 (1) 自然语言表达该定义以提供直觉;(2) 数学符号以具体化;以及 (3) 伪代码(算法 1 (https://arxiv.org/html/2608.12325#alg1))。操作化通过简单的 Python 实现加以说明。¹¹¹ https://github.com/jmaasch/valid_reasoning 我们将定义应用于特例,包括逻辑演绎、贝叶斯推理、强化学习(RL)和概率性下一词预测。在 §3 (https://arxiv.org/html/2608.12325#S3) 中,我们回应了对我们定义和命题的反驳。  
2. 2. 关于科学交流的建议。
我们提出了一份符合命题 1 (https://arxiv.org/html/2608.12325#S1.I1.i1)–命题 3 (https://arxiv.org/html/2608.12325#S1.I1.i3) 的社区指南检查清单(附录 A (https://arxiv.org/html/2608.12325#A1))。  

#### 1.1 问题的重要性:我们为什么关心?  

问题1 (https://arxiv.org/html/2608.12325#S1.I2.i1) 和问题2 (https://arxiv.org/html/2608.12325#S1.I2.i2) 的重要性主要在于以下几点:(1) 推理是通用人工智能(AGI)的必要(但非充分)前提;(2) 人工智能评估面临构念效度危机,这一危机已蔓延到推理评估;以及 (3) LRMs 的用户采纳速度已超过可信赖推理的证据积累速度。  

推理是 AGI 的前提  
尽管存在争议,AGI 被广泛视为当代人工智能研究的北极星(Morris et al., 2024 (https://arxiv.org/html/2608.12325#bib.bib87);Blili-Hamelin et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib71))。然而,社区对 AGI 的定义和测量缺乏共识阻碍了进展。最近一项将 AGI 操作化的努力提出了一个子组件分类法以及基于基准的测量方法(Hendrycks et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib70))。基于人类认知测试,该分类法强调即时推理是可测量 AGI 的基本组成部分。我们同意 Hendrycks et al. (2025 (https://arxiv.org/html/2608.12325#bib.bib70)) 的观点,即推理能力是 AGI 的必要(但非充分)前提。除了大量有价值的用例之外,仅此一点就足以证明人工智能推理是一个关键的研究领域。然而,与 AGI 一样,一层模糊、混淆和争论的阴影笼罩着人工智能推理的定义和测量。如果推理是 AGI 的必要前提,那么朝着明确定义推理的可衡量进展将是朝着 AGI 可衡量进展所必需的。  

构念效度未得到足够重视  
近几波生成式人工智能倾向于强调探索性研究和经验评估,而较少关注假设驱动的验证性研究、理论保证的证明或形式验证(词汇表 E.3 (https://arxiv.org/html/2608.12325#A5.Thmdefinition3);Herrmann et al. 2024 (https://arxiv.org/html/2608.12325#bib.bib132))。历史上,经验领域通过构念效度验证来防范错误测量(词汇表 E.4 (https://arxiv.org/html/2608.12325#A5.Thmdefinition4);Cronbach and Meehl 1955 (https://arxiv.org/html/2608.12325#bib.bib133)):通过制定将潜在抽象构念(如智力、偏见、意识形态)与可测量代理相关联的操作性定义,来论证实验测量捕捉了所研究的现象。然而,“到目前为止,效度和其他实证研究的质量标准在机器学习中几乎没有得到关注”(Herrmann et al., 2024 (https://arxiv.org/html/2608.12325#bib.bib132)),这引发了这样的评论:自然语言理解中的评估在很大程度上是“破碎的”(Bowman and Dahl, 2021 (https://arxiv.org/html/2608.12325#bib.bib141)),并且人工智能评估必须“成熟为一门真正的‘科学’”(Weidinger et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib140))。使用静态数据集进行基准测试是生成式人工智能评估的标准框架,但它面临多重危机,例如:构念效度差(Wallach et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib36);Alaa et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib35))、数据污染(White et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib11))、过拟合、最低限度的质量控制、博弈、SOTA 攻击和选择性报告(Cheng et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib79))。我们观察到当前推理评估策略中构念效度的几个风险点,包括:  

1. 1. 不应将过程与其产物混为一谈。
推理基准测试通常将问答(QA)准确率视为推理的代理(Clark et al. 2018 (https://arxiv.org/html/2608.12325#bib.bib57) 等)。然而,最终答案的准确率并不能保证答案生成的机制(Zhang et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib174)),我们赞同 Chollet (2019 (https://arxiv.org/html/2608.12325#bib.bib64)) 和 Simon (2000 (https://arxiv.org/html/2608.12325#bib.bib167)) 关于将过程与其产物混为一谈的风险的观点。²²²我们赞同 Chollet (2019 (https://arxiv.org/html/2608.12325#bib.bib64)) 关于“将智能过程”(我们的例子中是推理)与“该过程产生的产物”(例如,QA 回答)混淆、而忽略生成机制的风险的观点:“在人工智能的案例中,专注于实现特定任务表现而不对该表现如何实现施加任何条件,导致了这样的系统:尽管很好地执行了目标任务,但在很大程度上并不具备人工智能领域最初想构建的那种人类智能”(原文强调)。Simon (2000 (https://arxiv.org/html/2608.12325#bib.bib167)) 也类似地论证,有限理性理论“将同样关注决策过程的质量和结果的质量”。我们认为 (i) 推理是一个过程而非输出(图 1 (https://arxiv.org/html/2608.12325#S1.F1)),(ii) 准确的 QA 最终答案可以通过 r-zombie 的非推理行为获得,因此 (iii) 准确的 QA 不足以证明推理已经发生。  
2. 2. 思维链(CoT)轨迹不是可信赖的解释。
如果评估中间推理步骤,CoT“推理轨迹”往往充当 LRM 内部推理过程的替代物。然而,CoT 既不是获得可信赖解释的必要条件,也不是充分条件(Barez et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib139))。尽管具有吸引人的拟人化特征,但 CoT 并不能保证忠实于模型的内部决策(Turpin et al., 2023 (https://arxiv.org/html/2608.12325#bib.bib138);Lyu et al., 2023 (https://arxiv.org/html/2608.12325#bib.bib60);Lanham et al., 2023 (https://arxiv.org/html/2608.12325#bib.bib146);Kambhampati et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib137);Zhang et al., 2025 (https://arxiv.org/html/2608.12325#bib.bib174))。CoT 中段的转变(例如,“啊哈!”时刻)可能比以前认为的更少见且影响更小,反映的是不稳定的推断而非真正的自我纠正推理(d’Aliberti and Ribeiro, 2026 (https://arxiv.org/html/2608.12325#bib.bib14))。我们认为 t

相似文章

AI推理是否因错误的原因而正确?

Hacker News Top

《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。