从依存到组合性:通过组合范畴语法对LLM输出的神经符号提升

arXiv cs.AI 论文

摘要

本文提出了一种神经符号框架,利用组合范畴语法将LLM输出提升为类型化组合推导,从而实现结构检查和早期幻觉检测。

arXiv:2607.18961v1 公告类型:新 摘要:大语言模型(LLM)通过从前缀逐步预测下一个词元来生成流畅文本。生成传统的批评者认为这类系统缺乏真正的语法;来自依存语法视角的有影响力的回应则认为,LLM的行为可以很好地由逐词构建的局部核心-依存结构来描述。我们认为一个更尖锐的观察被忽视了:自回归生成的前缀驱动、类型补全动态,与组合范畴语法(CCG)最初设计支持的增量处理模型高度一致。在此基础上,我们提出了一种神经符号框架,将LLM输出提升为类型化组合推导——我们不声称LLM内部实现了CCG,而是说它们的输出允许一种有原则、增量且可审计的CCG重构。由此产生两个结果。首先,通过Curry-Howard对应,这种提升从自然语言扩展到LLM也生成的形式语言——如Solidity等编程语言、描述逻辑和查询语言(如OWL和SQL),其中类型系统变化而架构保持不变。其次,这种提升支持两层检查:一个组合层直接捕捉结构失败,一个内容层将提升后的结构与外部知识源进行核对,从而尽早标记出幻觉内容。因此,该叙述要求生产者不是认知能力,而是一个前缀驱动的生成轮廓。最后,我们概述了同步LLM-CCG耦合作为该框架开辟的一个方向。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# 从依存关系到组合性:通过组合范畴语法对 LLM 输出进行神经符号提升

来源:https://arxiv.org/html/2607.18961

## 从依存关系到组合性:通过组合范畴语法对 LLM 输出进行神经符号提升

Remo Pareschi  
STAKE Lab, 莫利塞大学, 坎波巴索, 意大利  
通讯作者:[email protected]  
ORCID: 0000-0002-4912-582X  

###### 摘要

大型语言模型(LLM)通过从前缀逐步预测下一个 token 来生成流畅文本。生成传统中的批评者认为,此类系统缺乏真正的语法;来自依存语法视角的有影响力的回应则认为,LLM 的行为可以通过逐词构建的局部核心-依存结构得到很好的描述。我们认为,一个更敏锐的观察被忽视了:自回归生成的、由前缀驱动、类型补全的动态过程,与组合范畴语法(CCG)最初设计所支持的那种增量式处理模型高度吻合。基于此,我们提出了一个神经符号框架,在该框架中,LLM 输出被*提升*为带类型的组合推导——这并不是声称 LLM 内部实现了 CCG,而是说它们的输出允许一种有原则的、增量式的、可审计的 CCG 重构。由此产生两个后果。首先,通过 Curry-Howard 对应,这种提升从自然语言扩展到 LLM 也会产生的形式语言——例如 Solidity 等编程语言、OWL 和 SQL 等描述逻辑和查询语言——其中类型系统会变化,而架构保持固定。其次,这种提升支持两层检查:一个组合层,直接捕捉结构失效;以及一个内容层,将提升后的结构对照外部知识源进行检查,从而能够尽早标记出幻觉内容。因此,该描述对生产者要求的不再是认知能力,而是一个由前缀驱动的生成模式。最后,我们简要描绘了同步的 LLM-CCG 耦合作为该框架开启的一个方向。

**关键词:** 大型语言模型;组合范畴语法;神经符号 AI;组合语义;幻觉检测;智能合约

## 1 引言

大型语言模型(LLM)的成功以一种意想不到的方式重新开启了理论语言学中的许多经典争论。这些系统的流畅性和广泛的句法能力使许多观察者认为,语法规律可以从大规模统计学习中涌现出来。生成传统中的批评者则回应说,这类系统从根本上讲是没有语法的:它们操纵词序列,却不具备支撑真正语言知识的那种结构化原则。对这类批评的一个近期的、有影响力的回应,来自依存语法传统的心理语言学工作,其中最具代表性的是 Edward Gibson 的工作。按照这种观点,LLM 的表面行为可以通过在处理单词时逐步形成的局部核心-依存关系得到很好的描述,并且人类理解与 LLM 行为中观察到的许多经验规律都遵循单一的依存局域性原则(Gibson, 1998 (https://arxiv.org/html/2607.18961#bib.bib8);Futrell 等, 2020 (https://arxiv.org/html/2607.18961#bib.bib7);Gibson, 2025 (https://arxiv.org/html/2607.18961#bib.bib9))。这便将争论从“LLM 是否‘有语法’”这个二元问题,转向了一个更精确的问题:它们的可观察行为是否允许一种可恢复的语法组织。在这方面,依存语法提供了一个令人信服的*第一层*解释。

本文从一个观察入手:尽管这种基于依存关系的回应是有道理的,但它忽略了一个更有趣的趋同现象。自回归 LLM 逐个前缀地操作:每一步它们都维护一个关于已生成内容的表示,并预测接下来可能出现什么。由 Mark Steedman 及其合作者开发的组合范畴语法(CCG),正是被设计用来支持这种从左到右、由前缀驱动、类型补全的处理过程的(Ades 和 Steedman, 1982 (https://arxiv.org/html/2607.18961#bib.bib1);Steedman, 2000 (https://arxiv.org/html/2607.18961#bib.bib32), 2011 (https://arxiv.org/html/2607.18961#bib.bib33))。在 CCG 中,部分表达式具有有原则的语法和语义类型——例如,“John loves”并非一个不完整的片段,而是类别 S/NP,并附有相应的 lambda 项——定义明确的组合规则决定了当新材料到来时这些类型如何扩展。LLM 在统计上实现的那种增量式的、预测性的、前缀补全的动态过程,正是 CCG 旨在形式上描述的东西。我们相信,这种趋同是一个更具生产力的焦点,用于理解 LLM 在做什么以及我们能利用它们的输出做什么。

依存语法描述哪些词与哪些词相连;CCG 则额外描述了*还缺少什么*、缺少什么类型,以及当缺少部分到来时*意义将如何组合*。当依存分析恢复局部结构时,CCG 恢复了组合性解释的预测性脚手架。对于一个其整个操作特征都是预测性的自回归系统来说,这不是一个微小的差异。

我们以一种特定的方式来利用这种趋同。我们并不声称 LLM 内部实现了 CCG——这是一个我们不打算辩护的强经验主张——而是将 CCG 视为一个应用于 LLM 输出的*提升*机制。这个想法是事后进行的,但是有原则的。由 LLM 生成的一个句子,通过一个现有的 CCG 语义解析器(例如 `ccg2lambda`(Martínez-Gómez 等, 2016 (https://arxiv.org/html/2607.18961#bib.bib16);Mineshima 等, 2015 (https://arxiv.org/html/2607.18961#bib.bib18)))被解析成一个 CCG 推导;该推导产生一个 lambda 风格的逻辑形式。结果是一个管道,将流畅生成的文本映射成带类型的、组合性的符号对象,其内部结构是透明且可审计的。

这种框架带来了三个值得事先说明的承诺。第一,该框架是*分层且谦逊的*:依存语法提供了对可观察结构的轻量级描述,而 CCG 提供了一个支持组合性解释的重构层。我们不主张任何单一层就足够,也不主张 LLM“包含”其中任何一个。第二,该框架是*保守的*:其中没有任何东西要求修改 LLM、重新训练它或访问其内部。提升操作作用于可观察的输出。第三,该框架是*在替代推导下保持一致的*:我们将在第 2.2 节 (https://arxiv.org/html/2607.18961#S2.SS2) 回到这个性质,因为正是它使得在面对 CCG 众所周知的语义等价表面分析激增时,提升操作仍然定义良好。

尽管本文是从关于自然语言语法的争论切入的,但其提出的框架并不止步于此。一旦提升就位,两件事情随之而来。它执行的的操作——为增量生成的表达式分配一个带类型的组合结构——通过 Curry-Howard 对应,与编程语言中的类型检查是同一操作;因此,该框架扩展到 LLM 也会产生的形式语言,其中类型系统变化而架构保持固定。而一旦提升了的结构可用,它就能支持两个层次的检查:一个是组合层,在结构内部进行;另一个是内容层,将结构引向外部知识源。这两个发展——跨领域范围以及两个检查层——是本文中间部分的主干,它们共同将该描述从依赖语法回应所继承的认知假设中解脱出来。我们将在首先以自然语言形式阐述该框架之后再探讨它们。

本文其余部分组织如下。第 2 节 (https://arxiv.org/html/2607.18961#S2) 回顾了关于依存语法、CCG、基于 CCG 的语义解析以及神经符号 AI 的相关背景。第 3 节 (https://arxiv.org/html/2607.18961#S3) 以其自然语言形式呈现了两层提升框架。第 4 节 (https://arxiv.org/html/2607.18961#S4) 阐述了该框架的基础承诺:立场的架构性而非认知性特征、组合性检查与内容检查的区别,以及外部知识源的角色。第 5 节 (https://arxiv.org/html/2607.18961#S5) 将跨领域扩展发展到形式语言,以 Curry-Howard 对应为其依据,并以智能合约代码作为主要的应用案例。第 6 节 (https://arxiv.org/html/2607.18961#S6) 简要描绘了一种更紧密的同步 LLM-CCG 耦合,作为该框架开启的一个方向。第 7 节 (https://arxiv.org/html/2607.18961#S7) 讨论了该框架的主张与非主张、与现有工作的关系及其局限性,第 8 节 (https://arxiv.org/html/2607.18961#S8) 进行总结。

## 2 背景

### 2.1 依存语法作为描述 LLM 行为的一个层

依存语法通过词项之间的不对称核心-依存关系来表示句法组织,而无需中间的短语节点层。在其现代形式中,它与 Tesnière 以及后续的计算与认知语言学工作相关联,并已通过通用依存关系 (Universal Dependencies) 成为跨语言语料标注中的主导表示方案(de Marneffe 等, 2021 (https://arxiv.org/html/2607.18961#bib.bib4))。该传统的认知分支由 Gibson 及其合作者发展,强调依存关系会带来一个随其长度增加的记忆成本,从而产生经验的*依存局域性*原则:跨语言和跨结构,倾向于最小化依存长度的词序(Gibson, 1998 (https://arxiv.org/html/2607.18961#bib.bib8);Futrell 等, 2020 (https://arxiv.org/html/2607.18961#bib.bib7))。

该框架作为描述 LLM 行为的透镜已被证明具有吸引力。从左到右实现依存关系自然与自回归生成吻合;LLM 表现出的许多局部句法规律可以被表征为逐词构建核心-依存链接;并且依存局域性效应似乎在语言模型的 surprisal 曲线中也被再现。我们认为,这一系列工作是对*LLM 明显地做什么*的一个动机良好的初阶描述。我们不对此提出异议。然而,我们将论证,它并非可用的最深层描述,因为它只捕捉了在表面文本中*已经实现*的关系,而没有显式机制来处理驱动生成的预测性补全。

### 2.2 组合范畴语法

组合范畴语法(Steedman, 2000 (https://arxiv.org/html/2607.18961#bib.bib32), 2011 (https://arxiv.org/html/2607.18961#bib.bib33))在词汇化语法形式体系中占据了一个独特的位置。其核心直觉是:句法范畴*就是*语义类型:每个词项既携带一个句法范畴,也携带一个关联的 lambda 项,一组数量很少的组合规则——前向和后向应用、前向和后向组合以及类型提升——决定了范畴如何组合以及意义如何组合。句法推导和语义组合同步进行。这种同步的经典依据是蒙塔古的代数语法概念,即意义赋值是从句法代数到语义代数的一个同态(Montague, 1970a (https://arxiv.org/html/2607.18961#bib.bib19));CCG 可以被视为以一种增量式的、表面组合的形式实现了那个同态。

就当前目的而言,CCG 的关键特征在于它对部分表达式的处理。像 “John loves” 这样的序列并非一个没有语法状态的片段;它具有范畴 S/NP(缺少一个在右边的名词短语的句子),以及一个等待自变量的部分 lambda 项 $\lambda x.\,\textit{love}(\textit{john},x)$。这并非该形式体系的脚注:它是该形式体系最独特的承诺。Steedman 及其合作者正是利用类型提升和组合来对增量式的、从左到右的解释给出一个有原则的说明,其中句子的每个前缀都携带一个定义良好的类型和一个定义良好的部分意义(Ades 和 Steedman, 1982 (https://arxiv.org/html/2607.18961#bib.bib1);Steedman, 2000 (https://arxiv.org/html/2607.18961#bib.bib32))。¹¹¹ 类型提升本身有一个值得记录的双重渊源。作为一条句法规则,它可以作为 Lambek 演算的一个定理推导出来(Lambek, 1958 (https://arxiv.org/html/2607.18961#bib.bib14));作为一种语义操作,它随着 Montague 将个体提升为广义量词而进入该领域,这使得专名和量化名词短语在组合上统一起来(Montague, 1973 (https://arxiv.org/html/2607.18961#bib.bib21))。CCG 的独特贡献在于将这个操作与组合一起,服务于增量推导——这正是逻辑和语义谱系汇聚之点。

在这个方面,CCG 与自回归语言模型的操作特征异常地吻合,后者的全部计算都是预测性的:在每个位置上,它们都隐式地携带一个关于迄今为止的前缀可能如何完成的表示。形式体系的一个特性值得强调,因为它会反复出现。CCG 的组合规则对于同一个字符串允许多个推导顺序:像 “John loves Mary” 这样的句子既可以按规范方式推导——先将动词与其宾语组合,再与其主语组合——也可以通过非规范方式——将主语类型提升,并在应用到宾语之前先与动词组合。由此产生的表层推导是不同的,但它们生成的 lambda 项是一致的:组合是结合的,两个推导在底层的组合逻辑中产生等价的项。这个性质有时被称为*模组合的推导等价*,在早期关于 CCG 高效解析的工作中得到了详细研究,它支撑了基于图表的解析器的设计,这些解析器能够交付所有语义上不同的分析,而无需枚举虚假的分析(Pareschi 和 Steedman, 1987 (https://arxiv.org/html/2607.18961#bib.bib24))。同样的思路在最近的工作中也得到了延续,即使用树旋转操作设计完全增量的 CCG 解析器(Stanojević 和 Steedman, 2019 (https://arxiv.org/html/2607.18961#bib.bib29), 2020 (https://arxiv.org/html/2607.18961#bib.bib30)),这些解析器在每个词处维护一个完全连接、语义可解释的结构,并且在当前的实现中,使用一个神经超标签器作为前端。超标签器的角色需要准确的陈述,因为很容易被低估:除了消歧已知词的已知范畴之外,现代超标签器能够可靠地预测*未见过*词的范畴,然后可以通过规则提供相应的语义范畴。这种对未见词汇的泛化是一个强大的效果——在广覆盖 CCG 解析被移植到生物医学文本时得到了证明(Rimell 和 Clark, 2009 (https://arxiv.org/html/2607.18961#bib.bib26))——并且它是使当前 CCG 解析器能够在输入远离其训练分布的情况下仍可用于实际语义任务(例如构建蕴含图)的重要组成部分。我们在此注明这些性质,因为正是这些形式事实使得 LLM 前缀的 CCG 提升成为可能。

相似文章

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

arXiv cs.AI

本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。

形式化潜在思维:大语言模型中思维表征的四条公理

Hugging Face Daily Papers

提出了一种用于大语言模型中潜在思维表征的公理化评估框架,揭示当前表征在23个推理任务中无法满足四个基本功能公理(Causality, Minimality, Separability, Stability),表明表征质量存在结构性差距。

LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考

Reddit r/LocalLLaMA

研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。