当规范补全不正确时:形式化与测量大型语言模型中的跃迁
摘要
本文形式化并测量了大型语言模型中的'跃迁',即它们放弃默认补全转而采用正确补全的情况,并发现LLMs在实验中成功进行了跃迁。
arXiv:2608.26187v1 Announce Type: new
摘要:大型语言模型(LLMs)能否从证据执行溯因跳跃到一个新的公理系统,通常被称为'跃迁',最近引起了广泛争论。一个突出的观点认为LLMs在结构上无法进行这种跃迁,而最近的研究对其机制和证据都提出了挑战。然而,这场争论仍然难以解决,因为该领域仍然缺乏对跃迁的形式化定义和测试双方的度量方法。在本文中,我们通过四个步骤开发了对跃迁的形式化描述,并测量了第二步。这些步骤探讨了部分数据的默认补全是什么,何时被迫放弃它,放弃是否正确,以及连续跃迁如何叠加。具体来说,我们将跃迁实例定义为一个有限扩展问题,具有机器检查的证书,证明存在正确的补全,该补全在重命名下是唯一的,并且与数据的规范补全不同。规范补全由左和右 Kan 扩展给出,也是模型在没有约束时产生的内容,因此作为默认值。我们证明跃迁实例是适定的,并建立了一个族定理,无需枚举即可认证无界难度的实例。我们进一步形式化了跃迁何时正确以及连续跃迁如何叠加。最后,我们在九个认证实例和四个前沿模型上运行了测量。在全部248次受约束试验中,Kan默认率为零,因此模型在这一步确实进行了跃迁,并每次都放弃了被排除的默认值。在更高难度上的失败源于推理预算耗尽或约束错误,从未因恢复默认值而发生。这些结果表明第二步不是瓶颈。如果争议的无能为力是真实的,它存在于生成约束或发明框架中。代码可在以下位置找到:https://github.com/EEthanShi/kan-jump-test。
查看缓存全文
缓存时间: 2026/08/28 09:24
# 当规范性补全出错时:形式化与度量大语言模型中的跳跃 来源:https://arxiv.org/html/2608.26187 肖宇(Xiaoyu Affiliation:剑桥大学,英国;新南威尔士大学,澳大利亚) 何塞·米格尔·埃尔南德斯-洛巴托(José Miguel Hernández-Lobato) ###### 摘要 大语言模型(LLM)能否从证据进行溯因跳跃至新的公理体系——这一过程通常被称为“跳跃”——近年来引发了广泛讨论。一种主流观点认为,LLM在结构上无法完成此类跳跃,但近期研究同时质疑了该观点的机制基础与实证依据。然而,由于该领域仍缺乏“跳跃”的形式化定义及可检验的度量方法,这场辩论难以定论。本文分四步构建了“跳跃”的形式化框架,并重点度量第二步。这四步分别回答:部分数据的默认补全是何种形式?何时被迫放弃该默认补全?放弃是否正确?以及连续跳跃如何复合?具体而言,我们将“跳跃实例”定义为有限的扩展问题,并附有机器可验证的证书,证明存在一个正确的补全(该补全在重命名意义下唯一),且与数据的规范补全不同。规范补全由左右Kan延拓给出,也是模型在无约束条件下生成的结果,因此可作为默认补全。我们证明跳跃实例具有良定性,并建立了一族定理,无需枚举即可认证任意难度的实例。我们进一步形式化了跳跃正确性的判定标准以及连续跳跃的复合规则。最终,我们在九个经认证的实例和四个前沿模型上进行度量。在所有248次受约束试验中,Kan默认率均为零,表明模型在此步骤中确实发生了跳跃,且每次都放弃了被排除的默认补全。更高难度下的失败源于推理预算耗尽或约束错误,而非回归默认补全。这些结果表明第二步并非瓶颈。若争议中的“无能”真实存在,则它应存在于约束生成或框架发明阶段。 论文代码见https://github.com/EEthanShi/kan-jump-test。 简言之,本文试图部分回应文献[34](https://arxiv.org/html/2608.26187#bib.bib1)提出的LLM能否实现从证据到新公理体系的“跳跃”问题。我们通过四步框架形式化“跳跃”,并基于范畴论评估第二步。在九个认证问题与四个前沿模型的评估中,LLM至少在第二步确实发生了跳跃。我们通过Kan默认率(公式3)度量此现象,该指标统计模型保留被给定事实排除的答案的频率。在所有248次试验中该比率为零,其中226次模型收敛到经认证的正确答案,其余失败均源于推理耗尽或约束错误,而非保留旧答案。其余步骤已在本文中形式化,我们期望未来研究在更丰富的实验设置中评估它们。模型能否生成新事实或发明新框架仍超出这四步范畴,留待后续探索。 ## 1 引言 大语言模型(LLM)能否像爱因斯坦那样,从牛顿引力跨越到广义相对论的弯曲时空?对此问题的近期回答往往持否定态度[34](https://arxiv.org/html/2608.26187#bib.bib1)。这些观点承认LLM已掌握归纳推理,且归纳能力日益精进,但仍认为LLM缺乏皮尔斯式溯因能力——即从经验跳跃至新公理体系的能力[25](https://arxiv.org/html/2608.26187#bib.bib19)。然而,这一结论近来受到双重挑战:有研究论证溯因无需具身化基础[8](https://arxiv.org/html/2608.26187#bib.bib26),且数学领域的机器发现早于该辩论本身[24](https://arxiv.org/html/2608.26187#bib.bib27)。但由于该领域仍缺乏对“跳跃”的形式化定义及可检验的度量标准,辩论难以定论。这一缺口引出了我们的核心问题:当给定约束排除了模型的默认补全时,模型能否放弃该默认补全? 本文通过四步形式化框架回答此问题。这四步依次探讨:默认补全是什么?何时被迫放弃默认补全?放弃是否正确?以及连续跳跃如何复合?我们将第二步称为“覆写”,这也是本实验测量的步骤。辩论本身的来源区分了“选择假设”与“生成假设”[17](https://arxiv.org/html/2608.26187#bib.bib20)。覆写属于“选择”范畴,因为约束已给定且答案空间已被界定。图1预览了该设计,将历史跳跃与其实验室呈现对齐。 图1:历史跳跃与实验室呈现。上行追溯历史进程:所有观测记录均符合牛顿理论,因此延续牛顿理论是默认补全。随后关于光的实验排除了该默认补全。爱因斯坦选择弯曲时空——尽管当时无任何观测数据支持此结构,但它保留了所有历史记录。下行以命题4的认证种子实例重建相同情境:数据表F0留下隐藏对象b。Kan延拓提供可计算的默认补全,即平凡补全。经认证的约束排除了该默认补全,因此唯一可接受的补全强制模型发明两个新元素(t的交换对)。实验室行最终与历史行殊途同归,得到数据从未直接显示的结构。Kan默认率记录模型停留在被排除默认补全的频率,该值在248次受约束试验中均为零。 我们的形式化源于外推的基本事实:当部分数据必须扩展到更大定义域时,范畴论挑选出两个可从数据单独计算的典范补全,即左右Kan延拓[16](https://arxiv.org/html/2608.26187#bib.bib17)。这些补全也可通过误差最小化获得[30](https://arxiv.org/html/2608.26187#bib.bib2);[28](https://arxiv.org/html/2608.26187#bib.bib3),因此代表通过损失最小化训练的模型预期生成的默认答案。为此,本方案首先度量各模型的默认补全而非假设其存在。 广义相对论的历史阐明了默认补全的重要性:1912年,已知物理的规范延拓是Nordström标量理论——这是已知数据的直接延伸,但最终被证明错误。爱因斯坦的答案则需要几何结构,而当时任何数据都未强制该结构[23](https://arxiv.org/html/2608.26187#bib.bib25)。跳跃发生在默认补全无法满足累积约束之处。因此,我们形式化以下情境:存在可计算的默认补全,但给定约束排除了它,从而正确补全是剔除默认补全后剩余的那个。 为使该情境可检验,我们引入“跳跃实例”概念。每个实例呈现一个系统,其观测部分完全指定,隐藏部分需由模型补充,且需满足一组机器可验证约束。每个实例附带证书,证明存在唯一正确补全(在发明元素重命名意义下),且该补全与数据的两种Kan延拓均不同。因此,规范补全与记忆结构匹配均失效,偶然成功的概率可忽略。模型必须假定数据无法直接显现的结构。 我们进一步构造匹配的“控制实例”,其约束选择规范补全本身。这些控制实例区分了“完全无法扩展”的模型与“仅能规范扩展”的模型。基于这些实例,我们定义“Kan默认率”,统计模型输出被给定约束排除的规范补全的频率(第4.5节,公式3)。该指标将争议性命题转化为可度量的量。最后,校准阶段在提出任何跳跃主张前记录各模型的无约束默认补全。 除单次覆写外,我们还从两个方向扩展框架:首先,证明一个族定理(定理1),无需枚举即可认证无限难度实例,使难度增长而认证保持免费;其次,形式化跳跃正确性的判定标准及连续跳跃的复合规则(第6节)。我们区分内部正确性与预测正确性:内部正确性指满足所有给定约束的可容许性;预测正确性指与留出真值的一致性。一个显式构造展示了两个同样可容许的补全,但仅一个能适应未来数据,这与Nordström标量引力的命运形成对照。在复合方面,我们定义链式结构:前一阶段的经认证答案成为下一阶段的数据。我们证明知识积累永远不会扩大可容许集。一个“固着实例”则展示了在第一阶段可容许、但在第二阶段被排除的补全——该实例是“以太”的形式化类比。 形式化就位后,度量给出了直接答案:在九个认证实例和四个前沿模型的测试中,248次受约束答案无一采用被约束排除的规范补全。在经认证的范围内,模型在被迫时总会放弃默认补全。在覆写步骤中,它们确实发生了跳跃,并以高达8×10⁻⁷的随机水平收敛到经认证的可容许类。更高难度下的失败源于推理预算耗尽或约束错误,而非回归默认补全。若争议中的“无能”真实存在,则它应位于覆写步骤上游,处于本测试刻意保留的阶段。 这些结果应在我们的主张范围内解读:我们并未形式化文献[34]提出的完整跳跃(其假设机制为具身化且前符号化的)。跳跃实例向模型同时提供约束与答案空间,因此本测试覆盖了爱因斯坦在1912-1915年间选择弯曲时空而非规范替代方案的阶段。约束生成与真正新数学语言的涌现则留待未来工作(第8节)。 #### 贡献。 - • **带规模认证的良定形式化**:定义跳跃实例并证明形式化的良定性:规范参考答案始终存在(命题1);可容许性在发明元素重命名下不变(命题2);可识别性产生有限答案空间(命题3),从而可计算随机水平。族定理(定理1)则无需枚举即可认证任意难度实例。 - • **正确性理论与链式跳跃**:通过双组件实例区分内部正确性与预测正确性(仅一个组件能适应留出数据,命题7),形式化跳跃链,证明纳入是良定义的、积累的知识永不扩大可容许集,且固着(即一个阶段可容许的补全在下一阶段被排除)会发生(定理3)。 - • **可归因失败的评估方案**:典范性相对于预先注册的约束无关扩展算子库定义;跳跃主张仅相对于各模型的度量无约束默认补全授权;匹配的Kan控制与求解器、匹配器基线将默认锁定、有限搜索与结构匹配分离。总是典范的学习者在针对自身算子的控制任务中满分,在跳跃实例中得零分(命题5),表明所测维度与系统性正交。 - • **认证实例与测量**:发布九个认证实例(六个通过枚举,三个通过族定理,随机水平达8×10⁻⁷)及其生成器、认证器、评估工具,并评估四个前沿模型。Kan默认率在所有248次受约束试验中均为零,更高难度下的失败源于推理预算耗尽或约束错误,而非回归默认补全(第7节)。 - • **范围限定**:形式化四步但仅度量第二步,并阐明阳性或阴性结果能证实与不能证实的范围(第8节)。 ## 2 相关工作 #### 跳跃辩论。 文献[34]主张LLM缺乏从证据(E)到公理体系(A)的溯因能力。该工作将差距归因于缺乏具身化模拟,因此提出交互式世界模型作为解决方案。该论证仍属纲领性而非形式化的。同时,文献[8]主张溯因无需具身化基础。与此观点一致,AlphaEvolve等系统在固定形式语言内产生了新颖的数学构造[24](https://arxiv.org/html/2608.26187#bib.bib27)。直接回应也以不同方式分解跳跃:文献[10]认为该能力并非单一类型,要求基准测试按机制细分;文献[29]将发现分解为分层图上的算子,推测不可约残余为公理回溯;文献[22]则绕过限制,让贝叶斯循环向模型请求新假设。我们的框架可与这些分解共存,因为Kan默认率仅预设可计算默认补全与经认证的排除,而非完整跳跃理论。在我们的形式化下,争议命题对应于高Kan默认率——即使上下文内约束被认证为伪证默认补全时该率仍持续偏高。此陈述可直接证伪。 #### 范畴论与学习。 文献[30]将从部分数据的泛化刻画为Kan延拓,文献[28]则将误差最小化算法呈现为富化情境中的Kan延拓。沿此脉络,我们将该刻画倒置……
相似文章
立场:LLMs 无法跳跃
一篇立场论文,认为大语言模型存在根本性局限,用“无法跳跃”这一隐喻来突出推理或泛化方面的不足。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
@pallavishekhar_: https://x.com/pallavishekhar_/status/2058460434035060758
解释大型语言模型实际所做的工作(下一个Token预测),以及为什么即使出错时它们听起来也很有信心。提供了一种心智模型和验证检查清单,用于安全使用LLM。
大型语言模型中的稳定校准错误:高置信度错误的实用视角
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
JumpLoRA:大语言模型持续学习的稀疏适配器
JumpLoRA 引入了一个新颖的稀疏适配器框架,用于大语言模型的持续学习。该方法使用 JumpReLU 门控来动态隔离任务参数并防止灾难性遗忘。它增强了基于 LoRA 的方法,并超越了 ELLA 等最先进的持续学习方法。