悲观元归纳及其限制:来自频率统计和机器学习理论的教训
摘要
本文批判了反对科学实在论的悲观元归纳论证,通过利用频率统计和机器学习中的收敛概念,表明普通归纳能实现收敛,而元归纳则失败。
arXiv:2608.17213v1 公告类型:新
摘要:本文挑战了反对科学实在论的悲观元归纳论证,通过削弱其归纳步骤而非其历史前提。尽管相关挑战已经存在,但我提出了一个新的。基于在频率统计、机器学习和形式认识论中发展起来的一般科学推断认识论,我从收敛到真相的角度评估归纳。我认为普通枚举归纳能实现处处收敛,而元归纳甚至无法实现几乎处处收敛。实际上,在元归纳出现的问题背景下,失败更为深刻:没有任何推断方法能实现几乎处处收敛。
查看缓存全文
缓存时间: 2026/08/19 10:24
# 频率统计与机器学习理论的启示 来源:https://arxiv.org/html/2608.17213 ## 悲观的元归纳及其局限:来自频率统计与机器学习理论的启示 Hanti Lin 致谢:AI使用声明:本文准备过程中仅使用AI工具进行英文编辑,未用于生成任何内容或图像。单位:加州大学戴维斯分校 邮箱:[ika@ucdavis\.edu](mailto:[email protected]) ###### 摘要 本文挑战了反对科学实在论的悲观元归纳论证——不是通过质疑其历史前提,而是通过瓦解其归纳步骤。虽然相关质疑已存在,但本文提出了一种新视角。借鉴频率统计、机器学习和形式知识论中发展出的科学推理一般认识论,本文以"收敛至真相"的标准评估归纳。作者论证普通枚举归纳可实现处处收敛,而元归纳甚至无法实现几乎处处收敛。实际上,在元归纳出现的问题情境中,其失败更为深刻:没有任何推理方法能实现几乎处处收敛。 ## 1 引言 反对科学实在论的悲观元归纳论证旨在大致表明:既然所有或大多数过往科学理论最终甚至都不近似为真,我们当前的科学理论也不例外(Laudan 1981, Putnam 1978)¹。另见Wray(2015)对不同类型元归纳论证的重构。²许多回应质疑了"大多数过往理论已被证明甚至不近似为真"这一历史前提;例如,参见Devitt(1984)、Kitcher(1993)、Psillos(1994)、Worrall(1994)和Leplin(1997)。然而,本文采取互补策略:直接瓦解归纳步骤本身。相关研究相对较少。值得注意的例子包括Lewis(2001)以及Magnus和Callender(2004),他们借助与基准率谬误相关的考量,解释为何元归纳步骤不能等同于合理的归纳。 在不批评这些盟友的前提下,本文提出挑战归纳步骤的新路径——基于频率统计(尤其是非参数统计)多个分支以及机器学习理论基础中蓬勃发展的科学推理认识论通用方法。这些学科本质上致力于系统研究科学家进行及服务于科学的推理。核心思想是通过推理方法的"收敛至真相"特性来评估其性能——无论在普通科学推理、统计程序还是机器学习算法中,无论数据是否随机生成。尽管这一思想源远流长(可追溯至C.S. Peirce(1902)),但其核心命题直到近期才被哲学家清晰而普适地阐明(参见Lin(2025))。本文旨在运用此框架解释:尽管普通归纳与元归纳在句法上相似,二者实则存在本质差异: - • 在普通归纳情境中(例如追问未来观察到的乌鸦是否全为黑色),枚举归纳因其达到较严格的"处处收敛"标准而具有合理性——即在"当前考虑的所有可能世界状态"下均收敛至真相。 - • 在元归纳情境中(例如追问未来检验的所有科学理论是否都会被数据证伪),枚举归纳连较弱的"几乎处处收敛"标准都未达到——即仅在"当前考虑的所有可能世界状态中的几乎所有"下收敛至真相。 "几乎所有"的严格定义将在下文给出,该概念已用于评估因果结构学习算法(Lin and Zhang 2020)。实际上,反对元归纳的论据更为有力:若问题情境由一组竞争性假说定义为潜在答案,则在元归纳应用的特定情境中,没有任何推理方法能实现几乎处处收敛——这是本文的主要数学结论。 本文首先建立普通归纳与元归纳的简明数学模型(第2节),该模型虽经简化,但捕捉了元归纳的典型形态,值得在自身逻辑框架内予以解构。模型的简洁性有助于揭示问题本质结构,并暗示结论的推广方向。过程中将阐释所用认识论思想,特别是"收敛至真相"概念,同时避免其传统表述中的误导性(第3节)。结论部分将强调:这种认识论是极具普适性的科学推理框架——主要由科学家在少数哲学家协助下发展而成,其包容性足以涵盖频率统计与机器学习理论的大部分内容(第4节)。 ## 2 问题设定 考虑数据序列: 001 000001 000000000,即`\mathtt{001}\;\mathtt{000001}\;\mathtt{000000000}`,其中每个`\mathtt{0}`表示无不利情况——当前科学理论通过新检验;每个`\mathtt{1}`表示出现不利情况——当前理论检验失败需被取代。首个序列块`\mathtt{001}`显示第一个理论在仅三次检验后迅速失败。此后转向第二个理论,虽也失败但存续更久(由较长的序列块`\mathtt{000001}`表示)。相比之下,第三个理论表现良好:第三序列块尚未以`\mathtt{1}`结尾。 更一般地,令`T_n`表示若我们足够勤勉(且寿命足够长)将发展成熟的第`n`个理论。数据序列中第`n`次出现的`\mathtt{1}`标志着`T_n`的崩溃及其被`T_{n+1}`取代。 现假设以下数据序列代表当前证据状态: 000001 00000001⋯⋯000000000100000000000000000000000000000000000⏞T_{n+1}已通过多次检验。`\mathtt{000001}\;\mathtt{00000001}\cdots\cdots\mathtt{0000000001}\;\overbrace{\mathtt{00000000000000000000000000000000000}}^{\text{T_{n+1}已通过多次检验。}}`,其中`T_1`失败,`T_2`失败,…,`T_n`失败(`n`值较大)。 面对此数据序列,我们可能倾向于两种归纳推理之一。其一为: 普通归纳。考虑数据序列上方的注释:当前理论`T_{n+1}`经历多次检验且全部通过。我们通过归纳推断`T_{n+1}`无论面临多少进一步检验都不会失败。 其二由Putnam(1978)和Laudan(1981)提出: 悲观元归纳。考虑数据序列下方的注释:前`n`个理论`T_1,...,T_n`均失败,且`n`值极大。我们悲观地归纳推断:当前理论`T_{n+1}`及其所有后续理论若经受足够检验也将失败。 那么,我们应采纳何种归纳?这并非易事,因为二者符合相同句法模板: 归纳的句法模板 前提1. 已观察到许多F。 前提2. 所有F都是G。 ——————————————— 结论. 因此,所有F都是G。 为打破普通归纳与悲观元归纳之间的表面对称,我们必须超越其句法形式。若本文观点成立,则存在重要不对称性: 差异论题(待下文完善与论证)• 在"当前理论经足够检验是否会失败"的问题情境中,普通归纳方法使证据成为真值的指示器。• 但在"流程中每个科学理论经足够检验是否会失败"的情境中,包括悲观元归纳在内的所有非演绎方法——均无法使证据成为真值的指示器。 在将此差异论题完善为定理前,需严格定义若干概念。将借助收敛概念及"几乎所有"的拓扑解释。 即使暂略技术细节,此差异在直觉层面应不令人惊讶。令无限二进制序列表示可能世界状态,这些状态大致对应于单位区间内以二进制展开表示的实数。暂不考虑二进制表示的微小冗余(例如`\mathtt{1\bar{0}}`与`\mathtt{0\bar{1}}`表示相同实数0.5)。在第一种问题情境中,问题是当前理论是否会失败。等价地,我们追问实际世界状态是否为单位区间内的特定实数`r`,其中`r`由可用数据序列与无限个`\mathtt{0}`拼接而成。在另一种情境中,问题是流程中每个科学理论经足够检验是否会失败。当且仅当实际世界状态含无限个`\mathtt{1}`(即实际状态为单位区间内的无理数)时,真答案为"是"。 因此这两种问题情境截然不同。一个询问实际实数是否为特定值;另一个询问其是否为无理数。随着更多数据位到来,我们获得关于实际状态在单位区间连续统中位置的更精确信息——即不断缩小的非空实数区间`[a_n,b_n]`。故在第一种情况下,更多数据仍可证伪至少一个候选答案。但在第二种情况下,任何可能数据均无法证伪任一候选答案——因为"有理数"与"无理数"在实数线上交织过密,任何非空区间都同时包含两者。故后一问题在直觉上更困难。下文的形式化发展将证实这一直觉。 ## 3 形式化发展 是时候将上述差异论题转化为定理。 ### 3.1 认识情境与收敛性 推理方法是以有限数据序列作为证据输入、输出命题作为结论的数学函数,且随着更多数据到来允许修正。非演绎方法只有在某种意义上能充当真值的良好指示器时才具有合理性——挑战在于如何精确表述此概念。初步想法是,真值的良好指示器应在一定范围的认识情境中指向真值。但指向何种真值?何种情境?何种范围?将依次阐明。 首先讨论真值。在任何问题情境中,都会提出一个问题,其潜在答案构成竞争性假说。所追求的真值是情境中该问题的(未知)真实答案。 其次讨论情境。认识情境可建模为有序对`(s,n)`。第一分量`s`是世界状态——粗粒化的可能性,决定情境中每个竞争假说的真值。第二分量`n`是正整数,表示证据量。因此`(s,n)`表示实际世界状态为`s`且可用证据量为`n`时所处的认识情境。 现设想特定情境`(s,n)`为二维空间中的点,其中`s`是X轴坐标,`n`是Y轴坐标。X轴由可能世界状态构成——特别是与问题背景假设兼容的状态。Y轴由正整数构成。 不同问题情境可能需要对世界状态进行不同数学建模。对于当前归纳问题,简单定义即足。令世界状态`s`为无限二进制序列。例如: `s^* = 010101\cdots`(重复`01`模式)`\cdots` 状态形式化为无限序列,但并非表示我们永生且无限积累数据的状态。无限序列是编码反事实情况的便利工具:若证据量为`n`,则证据为该序列长度为`n`的初始段。本文中,"当前考虑的所有可能世界状态"指所有无限二进制序列——我们未作排除任何序列的背景假设。(在其他探究情境中,可能有强背景假设,使"当前考虑的世界状态"数量有限。) 例如考虑认识情境`(s^*,4)`,其中`s^* = 010101\cdots`;此时可用证据为`\mathtt{0101}`(四个数据点)。此时`T_2`刚通过第二次检验失败,更糟的是,若经足够检验(具体而言至少两次检验),每个理论都会失败。若所提问题是"每个理论经足够检验是否会失败",则状态`s^*`中的真答案为`\mathtt{Yes}`。因此推理方法`M`在此情境`(s^*,4)`输出真值当且仅当`M(\mathtt{0101})=\mathtt{Yes}`。 那么,什么可被视为真值的良好指示器?精确表述并不容易。但指导性直觉是:非演绎方法在问题情境中被视为真值的良好指示器,仅当其在"广泛范围"的认识情境中输出真值。至少,该范围须包含证据量`n`极大(即证据极丰富)的认识情境`(s,n)`。核心思想是:真值的良好指示器必须至少在证据有利的情境`(s,n)`(即`n`极大)中输出真值;理想情况下,若非所有,则在许多"当前考虑的世界状态"`s`下均如此。 在形式化前,暂以图示方式描述此概念:仅当能绘制横贯认识情境二维平面的横线,穿过每条垂线并将平面分为上下区域,使非演绎方法`M`在上部区域所有情境中输出真值时,该方法才被视为良好。可形式化定义如下: 定义(处处收敛至真值)。推理方法`M`在问题情境`c`中达到处处收敛至真值标准,当且仅当在情境`c`中,对每个"当前考虑的世界状态"`s`(即X轴上的状态),存在有限证据量`N`(Y轴上),使得对每个`n \geq N`,方法`M`在认识情境`(s,n)`中输出真答案。 双下划线提示情境依赖性:何为"当前考虑的世界状态"取决于当前问题情境`c`的背景假设;何为潜在答案取决于当前问题情境`c`中所提问题。 附注:上述评价标准并非特别高,常被称为逐点收敛。更高标准可通过交换前两个量词获得——"对每个`s`
相似文章
亨佩尔统计模糊问题的解决方案与因果AI
本文通过引入最大特异性因果关系(MSCRs)并证明其预测具有一致性,解决了卡尔·亨佩尔在归纳-统计推理中的统计模糊问题,并探讨了对因果AI和机器学习的影响。
连接法律解释与形式逻辑:忠实性、假设与人工智能法律推理的未来
本文指出了人工智能法律推理中法律解释与形式逻辑之间的系统性鸿沟,提出了一种神经符号方法来弥合这一鸿沟,并展示了在严格形式蕴含条件下重新标注法律自然语言推理数据时出现的显著标签偏移。
打破概率的枷锁:Neutrosophic Logic作为大语言模型中认知不确定性的新框架
本文研究了Neutrosophic Logic作为大语言模型中认知状态建模的框架,证明了它能够捕捉超越传统概率约束的'hyper-truth'状态,从而带来更透明、更具伦理意识的AI系统。
对数学、金融和人工智能中近似问题的哲学反思,讨论了模型的不完美但有用性,以及对AI安全和机器意识的影响
对数学、金融和人工智能中近似问题的哲学反思,讨论了模型的不完美但有用性,以及对AI安全和机器意识的影响
最佳AI“科学评论员”也是最有自信的——一个关于校准度与技能的基准测试
文章介绍了Refute基准测试,该测试评估LLM在评论科学论文摘要方面的能力及其校准度。结果显示,最好的批评模型在犯错时往往也最有自信。