全息神经PCFG用于无监督句法分析

arXiv cs.CL 论文

摘要

本文提出了全息神经PCFG(Hol-PCFG),该方法利用全息嵌入对概率上下文无关文法规则评分进行重构,在六种语言上实现了最先进的无监督句法分析性能,同时减少了99.94%的参数。

arXiv:2607.08063v1 Announce Type: new 摘要:无监督成分句法分析旨在仅从原始文本中准确推导出潜在的树结构。最近的PCFG神经参数化在监督和无监督句法分析中均取得了强劲性能,但其规则评分依赖于高容量黑盒网络——正如神经PCFG系列所示范的那样——导致规则概率缺乏可解释的数学形式。在本文中,我们提出了全息神经PCFG(Hol-PCFG),它将PCFG规则评分重新表述为语法符号嵌入之间的代数关系建模。Hol-PCFG将全息嵌入(Nickel等人,2016年)——通过循环相关对知识图谱三元组进行评分的方法——适配到环面约束嵌入上的左子、右子和词汇发射关系,使得每个规则概率都具有闭式形式,该形式天然承载了语法规则的内在结构。Hol-PCFG在六种语言上实现了最先进的句法分析性能,同时相对于基线模型减少了99.94%的规则评分参数,并且训练更加稳定。此外,我们证明Hol-PCFG可以直接从字符解析日语,无需任何形态分割,同时保持几乎相同的语素级性能。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:12

# 全息神经PCFG用于无监督句法分析
来源:https://arxiv.org/html/2607.08063
Ryosuke Yamaki¹,Daichi Mochihashi²,Nobutaka Shimada¹,Tadahiro Taniguchi³,¹
¹日本立命馆大学,²日本统计数理研究所,³日本京都大学
[email protected], [email protected]
[email protected], [email protected]

###### 摘要

无监督成分句法分析旨在仅从原始文本中准确诱导出潜在树结构。近期的PCFG神经参数化方法在监督和无监督句法分析中均取得了强劲性能,但依赖高容量黑盒网络进行规则评分——例如神经PCFG系列——使得规则概率缺乏可解释的数学形式。在本文中,我们提出全息神经PCFG(Hol-PCFG),将PCFG规则评分重新定义为语法符号嵌入之间的代数关系建模。Hol-PCFG 改编了全息嵌入(Nickel 等,2016),该方法通过循环相关性对知识图谱三元组进行评分,并将其应用于在环面约束嵌入上的左孩子、右孩子和词法发射关系,使得每个规则概率都具有一个闭合形式,该形式通过构造携带了语法规则的内在结构。Hol-PCFG 在六种语言上取得了最先进的句法分析性能,同时与基线模型相比将规则评分参数减少了99.94%,并且训练更加稳定。此外,我们证明 Hol-PCFG 可以直接从字符序列解析日语,无需任何形态分割,同时保留几乎相同的词素级性能。

## 1 引言

参见标题图1:Hol-PCFG 概览。二元规则采用 SN-PCFG 分解,假设在给定父节点A的情况下,左孩子和右孩子的选择条件独立。规则概率通过规范化基于 HolE 的分数(即基于循环相关算子 ⋆ 构建的双线性分数)来计算,这些分数作用于环面约束的语法符号和词嵌入,并使用单独的关系统量 r^(L)、r^(R) 和 r^(T) 分别对应左孩子、右孩子和词法发射角色。

无监督成分句法分析是从原始文本中仅根据词分布信息诱导出自然语言的句法树结构,而无需任何标注。这个任务不仅是对句法分析准确性的基准测试,更体现了关于语言习得的一个基本问题:是否仅从词层面的分布信息就能诱导出紧凑、可解释的离散语法。即使在大型语言模型(LLM)时代,这个问题依然相关:基于LLM的无监督句法分析方法(Cao 等,2020;Li 和 Lu,2023;Chen 等,2024)可以通过利用丰富的预训练知识来诱导解析树,但它们不一定学习到一个具有可重用非终结符号和规则概率的显式生成语法。因此,基于PCFG的无监督句法分析对于低资源语言和语言习得的计算模型仍然重要(Bannard 等,2009;Jin 等,2021a,b)。

本文关注的神经PCFG(N-PCFG;Kim 等,2019a)家族,保留了显式的离散语法,同时使用神经嵌入参数化规则概率。然而,N-PCFG 将二元规则的每个孩子对视为一个具有自身嵌入的原子单元,因此规则评分器的参数数量随着非终结符和词前终结符数量的增加而呈二次增长,限制了早期模型只能使用几十个这样的符号。后续工作表明,使用更多符号能大幅提升诱导质量,并将语法扩展到数千个非终结符——TN-PCFG(Yang 等,2021b)通过规则张量的低秩分解实现,SN-PCFG(Liu 等,2023)则通过左孩子和右孩子之间的条件独立假设以及高效的GPU计算实现。另一个最近的互补方向是 SemInfo(Chen 等,2025),它通过提出一种新的目标函数来解决似然改进与解析准确性之间的不匹配问题,该目标函数直接利用诱导成分的语义信息内容。

然而,规则评分函数本身的结构受到的关注相对较少:上述进展主要针对语法规模和训练目标。在这些模型中,父-子关系和词前终结符-词法关系都是通过高容量MLP评分,这本质上将规则评分视为通用函数逼近。但PCFG规则评分有其自身的内在结构:从父节点到子节点的方向性、左孩子和右孩子之间的不对称性,以及语法符号之间的相似性。当这种结构在MLP权重中被隐式保留时,它必须从原始文本似然的弱信号中重新被发现,而这在实践中经常失败:不同的非终结符会收敛到几乎相同的规则分布(Park 和 Kim,2025)。此外,基于MLP的评分使得规则概率没有作为符号嵌入函数的可解释数学形式。本研究工作的核心问题是:N-PCFG中的规则评分能否被重新设计,使其不再是黑盒神经映射,而是基于语法符号嵌入之间的代数关系评分,并通过构造携带这种结构。

在这项工作中,我们提出全息神经PCFG(Hol-PCFG;图1),它将PCFG规则评分视为高维环面上符号嵌入之间的代数关系。¹ 代码见 https://github.com/ryosuke-yamaki/hol-pcfg.git。Hol-PCFG 改编了全息嵌入(HolE;Nickel 等,2016)——该方法通过循环相关操作对知识图谱三元组进行评分——用于PCFG的左孩子、右孩子和词法发射关系。因此,规则评分的内在结构被构建到代数中,而不是被学习得到。在Hol-PCFG中,与基于MLP的评分器不同,每个规则概率都是符号嵌入上的显式闭式表达式,使得学习的语法具有数学上透明的表述。Hol-PCFG表明,无监督成分句法分析不仅可以通过扩大非终结符库存或改进训练目标来提高,还可以通过向规则评分添加结构性归纳偏置来提高。

本工作有三项贡献。

1. 我们提出Hol-PCFG,它使用基于HolE的操作在环面约束嵌入上对神经PCFG的产生式规则进行评分,从而得到数学上透明的语法表述。
2. Hol-PCFG在六种语言(使用SemInfo目标的英语、汉语、法语、韩语、瑞典语和日语)上取得了最先进的句法分析性能,参数数量大幅减少且训练稳定性更高。
3. 我们证明了Hol-PCFG甚至可以直接从字符序列进行解析而无需形态分割,同时保留几乎相同的词素级性能,并提供了一个定性案例研究,表明它可以对非语言类文本状数据诱导出合理的层次分析。

## 2 背景与相关工作

### 2.1 无监督成分句法分析

无监督成分句法分析的方法在学习内容上有所不同,即模型是诱导一个显式的符号语法——一组可重用的非终结符及其规则概率——还是仅生成树结构(括号标注)而不包含这样的语法。我们根据这一区分来组织先前的工作。

大多数先前的方法属于后一类,生成括号标注而不包含显式语法,主要区别在于它们利用的信号不同。经典方法诱导不带非终结符类别的无标签括号标注,包括Klein和Manning(2002)的成分-上下文分布模型以及Seginer(2007)的增量基于链接的解析器。第二组方法从神经语言模型的内部结构中推导出树:PRPN(Shen等,2018)的句法距离、ON-LSTM(Shen等,2019)的有序神经元、或者URNNG(Kim等,2019b)推断的潜在树。另一种自监督信号支撑着DIORA和S-DIORA(Drozdov等,2019,2020),它们通过一个内外递归自编码器恢复括号标注,该自编码器从其上下文中重构每个词。最近的工作转而利用预训练模型:通过学习的成分测试(Cao等,2020)或者冻结的掩码语言模型的上下文扭曲(Li和Lu,2023)从其表示中读取结构,或者利用LLM生成释义,其中重复的词序列提供了无监督成分信号(Chen等,2024)。在这些多样化的信号中——包括最近的基于LLM的方法——这些方法都有一个共同特征:它们直接输出括号标注或树,而不学习一个具有可重用非终结符和规则概率的显式语法。

相比之下,神经PCFG(Kim等,2019a)系列的方法,包括本文的工作,是诱导一个显式语法而不是直接生成树。一个概率上下文无关语法G为每个产生式规则附加一个概率π。由于解析树是未观察到的,语法归纳通过最大化句子x = w₁…wℓ的对数边缘似然来将G和π拟合到数据,该边缘似然对产生x的所有解析树t∈T_G(x)进行边缘化:

log p_π(x) = log ∑_{t∈T_G(x)} p_π(t). (1)

这个边际量由内部算法(Baker, 1979)高效计算。

### 2.2 神经PCFG

神经PCFG(N-PCFG)使用神经嵌入对规则概率π进行参数化。² 此外,复合PCFG(C-PCFG)进一步增加了每句子的全局潜在向量z(Kim等,2019a)。N-PCFG为每个二元规则A→BC使用一个对嵌入u_{BC},并通过softmax获得规则概率。由于二元规则的数量以O(|N|(|N|+|P|)²)的规模增长,其中|N|和|P|分别是非终结符和词前终结符的数量,因此只有小规模语法如|N|≈30,|P|≈60才是实用的。

为了扩大非终结符的数量,TN-PCFG(Yang等,2021b)通过低秩分解对规则张量进行分解,并将|N|扩展到数千。基于这一系列工作,简单神经PCFG(SN-PCFG;Liu等,2023)引入了左孩子和右孩子的选择在给定父节点A的条件下条件独立的假设,并将二元规则概率分解为两个类别分布的乘积。每个因子由多个MLP参数化,这些MLP处理父节点、孩子节点和嵌入的词法变换。SN-PCFG进一步提出了FlashInside实现,将核融合与log-einsum-exp相结合,并将|N|扩展到8192。SC-PCFG是其变体,将相同的独立假设与C-PCFG风格的复合潜在变量相结合。

另一个问题是这个扩大的符号库存是否被有效使用:Park和Kim(2025)发现了*概率分布坍塌*,即不同的非终结符被映射到几乎相同的规则分布,并缓解了这个问题,使得更小的语法仍能保持竞争力。他们的方法修复了标准内积评分器以压缩符号库存,而我们的Hol-PCFG重新设计了评分操作以压缩其参数化——这是通向紧凑语法的正交途径。

N-PCFG还在其他几个方向上得到了扩展,包括视觉基础(Zhao和Titov, 2020)、词汇化(Zhu等,2020;Yang等,2021a)以及非连续成分句法分析(Yang等,2023)。

### 2.3 SemInfo 目标

对数似然是PCFG归纳的标准目标,如公式(1)所述,但据报道随着训练的进行,它与句子级F1(SF1)的相关性变得很弱。为此,Chen等(2025)提出了SemInfo训练,将解析树t视为一组成分子字符串t = {s₁, s₂, ...},并最大化t与句子x的语义表示m(x)之间的语义信息I(t, m(x)) = ∑_{s∈t} I(s, m(x))。子字符串与句子级语义表示之间的信息是通过将概率加权信息(PWI;tf-idf的概率解释;Aizawa, 2003)扩展到子字符串集合来定义的:

I(s, m(x)) = p(s | m(x)) log [p(m(x) | s) / p(m(x))],

其中两个因子通过由LLM生成的释义集合X_p中最大子字符串的频率和逆文档频率进行经验估计。

训练使用基于跨度TreeCRF的强化学习进行(Stern等,2017;Kim等,2019b)。当§2.2中介绍的几个N-PCFG系列模型使用SemInfo训练时,报告了在多种语言上解析性能的显著提升。

在§4中,我们将在最大似然训练和SemInfo目标下评估Hol-PCFG。

### 2.4 全息嵌入

全息嵌入(HolE;Nickel等,2016)是一种知识图谱嵌入方法。给定由主体实体s、关系p和客体实体o组成的三元组(s, p, o),它通过循环相关算子⋆分配一个双线性分数,并将该分数传递通过...

相似文章

ContextRAG:面向检索增强生成的无抽取层次图构建

arXiv cs.CL

ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。

基于角色感知聚类的异构图压缩

arXiv cs.LG

本文提出了一种基于角色感知的异构图压缩框架HGC-RC,该框架利用轻量级传播和混合聚类策略生成紧凑的异构图,从而在不牺牲性能的情况下实现大规模图上的高效HGNN训练。