人工神经网络的涌现符号结构

Hacker News Top 论文

摘要

本研究提出,神经网络隐式地实现了符号结构,通过使用符号方程近似向量表示来证明,这些方程在算术、逻辑、代码和语言等多个领域中保持行为一致。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:19

# 人工智能神经网络中涌现的符号结构  
来源:https://arxiv.org/html/2608.29530  
Paul Soulos 约翰斯·霍普金斯大学  
Tal Linzen 纽约大学  
Paul Smolensky 微软研究院  

###### 摘要  
现代人工智能系统在某些看似不适用的领域表现出色。传统上,智能被建模为操作符号的结构化组合(如逻辑公式)。然而,当前最强大的人工智能系统基于神经网络,其信息表示采用连续向量。向量似乎不足以捕捉语言、逻辑及其他认知领域的结构,但神经网络在这些领域取得了令人瞩目的性能。它们是如何实现的?本文提出一个可能的答案:尽管表面不同,神经网络的内部表示可能隐式实现了符号结构。为支持这一假设,我们展示了多种神经网络的向量表示可以用符号结构高度近似:我们可以用一个实例化符号结构的闭式方程替代网络整个表征生成过程,而网络的行为基本保持不变。这一发现适用于处理列表操作的小型神经网络以及在算术、逻辑、计算机代码和语言这四个符号学核心领域中运作的大型语言模型。此外,我们的符号近似方法允许通过精确干预LLM的内部表示来针对性修改其行为,表明LLM的行为依赖于我们所识别的符号结构。这项工作为调和长期以来智能的符号概念与现代人工智能基于向量的本质提供了潜在途径。  

††脚注:1项目初期,所有作者均隶属于约翰斯·霍普金斯大学,Smolensky同时隶属于微软研究院。项目部分阶段,McCoy隶属于普林斯顿大学或耶鲁大学与微软。Soulos现隶属于微软。  

## 1 引言  
图1.1:神经网络表征与符号表征的表观不相容性。左:符号句法表示,具体为(简化版)句法树。右:神经网络句法表示,具体为连续向量。这两种表示编码相同句子,但彼此差异显著。然而,神经网络在许多传统上被视为符号学的领域达到了最先进水平。本文研究向量表示如何在看似需要符号结构的领域中支撑如此强大的性能。  

在人工智能和认知科学中,许多智能领域传统上采用符号系统建模,其中离散单元(符号)以结构化方式组合。例如在语言学中,句子通常用离散词构成的树状结构表示。符号分析有悠久历史:波尼尼约于公元前500年发展出语言符号理论,亚里士多德在公元前350年形式化符号逻辑,艾达·洛芙莱斯在1843年将符号操作作为首个计算机程序的基础。但近年来,人工智能的重大突破主要由神经网络驱动——这类计算系统以截然不同的方式编码信息:使用连续向量。这些向量与符号结构在质上不同,但神经网络在语言、数学和编码等传统符号学领域表现卓越。  

使用向量表示的系统如何在符号学领域表现如此出色?解答这一问题是机械可解释性研究的重要目标——该领域旨在理解大型语言模型等人工智能系统的内部运作机制。我们研究的假设是:尽管神经网络的表观结构与符号系统差异显著,但其向量表示可能隐式实现了符号结构。为检验此假设,我们采用一种名为DISCOVER的分析方法,旨在用显式编码符号结构的向量来近似神经网络的向量表示。  

这需要一种理论框架解释向量如何捕获此类结构——考虑到向量与符号的表观不相容性,这绝非易事。为此,我们采用认知科学中的数学形式主义:张量积表示(TPR)。在TPR中,符号结构被构建为填充词集合(结构元素),每个填充词与指示其位置的角色配对。例如,编码句子"cats chase dogs"时,可将填充词"cats""chase""dogs"分别与角色"主语""动词""宾语"配对。角色-填充词对可通过第2.3节描述的方法转换为向量。TPR最初是神经网络如何捕获符号结构的理论构想。我们的假设是:即使未被显式设计为此结构,标准神经网络也会自然收敛至TPR结构的表征。  

我们将DISCOVER应用于多种神经网络,发现其表征可通过假设的符号结构高度近似。具体而言:我们可以用单个基于TPR的可解释方程替代每个神经网络的整个表征生成过程,且网络行为几乎不变。核心发现如下:  

1. 在合成序列操作任务训练的模型分析中,我们在三类神经网络(多层感知机、循环神经网络和Transformer)中均发现了涌现的符号结构,表明此类结构具有跨神经网络体系的普适性。  
2. 我们分析了七个LLM(Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b),在所有模型中均发现涌现符号结构,证明此类结构存在于基于自然数据训练的大规模系统中。  
3. 我们对GPT-OSS执行算术、逻辑、编码和语言四个符号学领域任务进行了详尽分析,其表征可通过TPR高度近似,证明LLM在执行符号任务时依赖隐式符号结构。  
4. 我们能够通过定向干预神经网络表征引导其行为按预期变化,表明所识别的表征结构与模型行为密切相关。例如:若网络输入为"the clever doctor helped the lawyer",可通过将"clever"的表征从"主语形容词"改为"宾语形容词"进行编辑,网络行为便表现为输入"the doctor helped the clever lawyer"。  
5. 我们的分析可泛化至新的填充词与角色组合。例如:若DISCOVER方法在包含"scientist"一词但从未担任"句子主语"角色的句子上训练,则能成功泛化至"scientist"作为主语的新句子,表明网络以系统性方式组合填充词与角色。  

这些发现支持以下假设:至少在许多情况下,标准神经网络的向量表示具有隐式符号结构。尽管神经网络的发展易使人认为符号结构非必需,但本研究结果表明该结构对智能行为至关重要,因为即使非符号学系统也能自主学习使用符号结构。  
2 部分代码库可在https://github.com/tommccoy1/discover/获取,完整代码将待雇主批准后发布。  

## 2 背景  
### 2.1 理解神经网络表征  
尽管神经网络被广泛使用,其驱动行为的内部机制仍知之甚少。可解释性或机械可解释性研究领域旨在通过解析神经网络内部运作方式解决这一问题。我们的工作聚焦于分析作为网络表征的向量。先前研究通过识别向量中可解释特征的编码方式已取得重要进展。例如,某项分析发现了编码"金门大桥"概念的向量成分,强化该特征会使网络聚焦于金门大桥。  

大多数先前表征分析可统一于线性表征假设框架下。在该框架的一种表述中,神经网络中的每个向量被假定捕获某些概念集;每个可能概念拥有编码该概念的向量,整体表征为这些概念向量的加权和。例如:"dogs jump"的表征可能编码"dogs"和"jump"两个概念;若"dogs"的概念向量为[2.0, –0.3],"jump"的概念向量为[0.6, 1.8],则编码结果为[2.6, 1.5]。该假设已被证明可统一多种流行的表征可解释性方法,包括加法类比、线性探针和稀疏自编码器。  

### 2.2 结构与绑定问题  
线性表征假设在理解人工智能系统方面取得了重要进展,但在解释涉及结构的重要情况时面临挑战——即系统不仅需考虑哪些概念存在,还需考虑它们的排列方式。考虑句子"cats chase dogs",按前文表述应编码为三个概念向量之和。问题在于加法对顺序不敏感,"dogs chase cats"会获得与"cats chase dogs"相同的编码,尽管二者含义不同。  

结构在传统符号学分析的各个领域都至关重要:数学中"4−7"与"7−4"含义不同;逻辑中"如果P则Q"与"如果Q则P"含义不同;编程中"concatenate(x, y)"与"concatenate(y, x)"含义不同;语言中如刘易斯·卡罗尔所指出,"I breathe when I sleep"与"I sleep when I breathe"含义不同。因此,未能捕获此类结构的方法缺失了人工智能系统在这些领域取得成功的关键部分。  

解决此问题需要某种方式指示每个元素的位置(例如指出"cats"处于主语位置而"dogs"处于宾语位置)。这一目标是认知科学长期研究的核心,即绑定问题:神经网络如何绑定不同位置的表征成分?

相似文章

从近似到涌现:深度学习理论

arXiv cs.LG

本文提出了一个理论框架,将近似理论与深度学习中的涌现现象桥接起来,为神经网络如何学习提供了新的见解。