语言再生:信息局部性对重建影响的探究

arXiv cs.CL 论文

摘要

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。

arXiv:2607.10268v1 公告类型:新 摘要:信息局部性(相关句法词汇倾向于靠近出现)影响着人类语言处理和语言模型学习。虽然先前的工作研究了语言模型是否能学习不可能语言,但尚不清楚它们是否能从这类输入中恢复自然语言,以及这揭示了它们什么样的归纳偏差。我们通过用基于可学习性的方法补充一个重建框架来解决这个问题:对在不可能语言上预训练的GPT-2模型进行微调,以从三种扰动类型重建自然英语。我们的发现表明,恢复的结构比原始文本具有更短的依赖长度,反映了在无约束语言模型生成中观察到的局部性偏好,并提供了可学习性实验单独无法揭示的架构偏好的量化特征。恢复难度随局部性破坏程度的增加而增加。结构恢复(依赖三元组F1)与表层恢复(精确匹配)分离,而流畅性与忠实重建在全局洗牌下分离。句子长度进一步调节性能:当局部结构保留时,较长的句子有利于恢复,但在全局洗牌下会导致完全崩溃。最后,恢复难度在不同扰动类型中追踪可学习性难度,表明信息局部性是支配两者的共享约束。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:21

# 信息局部性对重构效果影响的调查研究  
来源:https://arxiv.org/html/2607.10268  
Amirhossein Mohammadi, Laurence E. Frank, Albert Gatt, Robert A. Bagheri  
乌得勒支大学,[email protected] (https://arxiv.org/html/2607.10268v1/mailto:[email protected])  

###### 摘要  
信息局部性——句法相关词语倾向于彼此靠近——塑造了人类语言处理与语言模型学习。虽然已有研究探讨语言模型能否习得不可能是语言,但尚不清楚它们能否从这类输入中恢复自然语言,以及这揭示了其怎样的归纳偏置。本文通过以重构框架补充基于可学习性的方法——对在不可能语言上预训练的GPT-2模型进行微调,使其从三种扰动类型中重构自然英语。我们的发现表明,恢复后的结构展现出比原文更短的依存距离,这与无约束语言模型生成中观察到的局部性偏好一致,并提供了可学习性实验单独无法揭示的架构偏置的量化特征。恢复难度随局部性破坏程度增加而增加。结构恢复(依存三元组F1)与表层恢复(精确匹配)分离,而流畅度与全局打乱下的忠实重构分离。句子长度进一步调节性能:当局部结构保留时,长句有利于恢复,但在全局打乱下导致完全崩溃。最后,恢复难度在不同扰动类型间追踪可学习性难度,表明信息局部性是两者共享的约束条件。  
仓库 (https://github.com/amirhoseinMhmd/impossible_translation)  

语言再生成:信息局部性对重构效果影响的调查研究  
Amirhossein Mohammadi, Laurence E. Frank, Albert Gatt, Robert A. Bagheri  
乌得勒支大学,[email protected] (https://arxiv.org/html/2607.10268v1/mailto:[email protected])  

## 1 引言  
存在许多可想象的语言系统,但并非所有语言在人类认知约束下都同样可习得 (Chomsky 1957 (https://arxiv.org/html/2607.10268#bib.bib29), 1986 (https://arxiv.org/html/2607.10268#bib.bib2); Jackendoff 2002 (https://arxiv.org/html/2607.10268#bib.bib5); Pinker 1994 (https://arxiv.org/html/2607.10268#bib.bib6))。自然语言共享结构属性,恰恰因为这些属性使其保持在认知可达范围内 (Hawkins 1994 (https://arxiv.org/html/2607.10268#bib.bib17); Futrell et al. 2020 (https://arxiv.org/html/2607.10268#bib.bib51))。其中一个属性是**信息局部性**:语义和句法相关的元素在线性顺序中倾向于彼此靠近。这植根于人脑的记忆限制 (Gibson and others, 2000 (https://arxiv.org/html/2607.10268#bib.bib50); Musso et al., 2003 (https://arxiv.org/html/2607.10268#bib.bib32))。**依存局部性理论 (DLT)** 形式化了这一原则,预测加工难度随依存元素间线性距离增加而增加,反映增量理解过程中工作记忆的限制 (Gibson, 1998 (https://arxiv.org/html/2607.10268#bib.bib52))。跨语言研究通过**依存长度最小化 (DLM)** 证实了信息局部性原则,表明自然语言倾向于趋同于将语法相关元素保持相邻或靠近的词序策略 (Hawkins, 1994 (https://arxiv.org/html/2607.10268#bib.bib17); Liu, 2008 (https://arxiv.org/html/2607.10268#bib.bib68); Futrell et al., 2020 (https://arxiv.org/html/2607.10268#bib.bib51); Temperley, 2018 (https://arxiv.org/html/2607.10268#bib.bib54))。  

扰动句 | 原句  
--- | ---  
The cat Rmat the on sat | The cat sat on the mat  
The loudly barked dog | The dog barked loudly  
Shire. Bag live Frodo the End at in | Frodo lives at Bag End in the Shire.  

图1:翻译任务概览。三个独立的LLM分别在特定扰动类型(从上到下:部分反转、局部打乱、全局打乱)上进行微调。每个模型将对应的扰动语言输入(左)翻译成原始语言输出(右),恢复被破坏的自然结构。

当依存元素与其核心词被中间不相关词语分隔时,这种顺序遭到破坏,句子的依存结构更难恢复。结果,文本变得认知上难以接近,尽管其词汇内容保持不变。违反给定语言句法约束的乱序操作(如打乱或反转)会增加依存长度并破坏局部句法关系,产生人类更难处理的输入,尽管词汇完整。虽然一些研究认为语言模型处理此类违规的方式与自然语言类似 (Ziv et al., 2025 (https://arxiv.org/html/2607.10268#bib.bib28)),但 Kallini et al. (2024 (https://arxiv.org/html/2607.10268#bib.bib43)) 证明了经此类扰动后的语言在可学习性上存在系统差异,显示出对自然语言结构的清晰归纳偏置。Someya et al. (2025 (https://arxiv.org/html/2607.10268#bib.bib74)) 进一步确定信息局部性是这种偏置的主要驱动因素。这种偏置扩展到文本生成:语言模型表现出强烈的倾向,将语义和句法相关元素紧密放置 (Khandelwal et al., 2018 (https://arxiv.org/html/2607.10268#bib.bib45); Futrell et al., 2020 (https://arxiv.org/html/2607.10268#bib.bib51))。尽管有这些证据表明语言模型在可学习性上表现出与人类相当的趋势,我们仍然缺乏对“信息局部性被违反时信息更难恢复”这一假设的直接检验。本文通过将其构造成翻译任务来解决这个问题。将扰动输入翻译回原始文本直接检验了语言模型能否识别散落的依存关系并恢复其特征性的邻近性。为此,我们以 Kallini et al. (2024 (https://arxiv.org/html/2607.10268#bib.bib43)) 中**预训练**的 GPT-2 模型为起点,微调它们将经过不同程度局部性破坏的输入重构为有效英语形式。每种扰动类型微调一个模型。这些模型已经暴露于不可能语言分布中,因此微调直接测试了恢复能力,而不会将获取困难与重构困难混为一谈。研究语言模型能否从结构退化的输入中恢复信息局部性,为语言模型架构偏置提供理论洞见 (Kallini et al., 2024 (https://arxiv.org/html/2607.10268#bib.bib43); Xu et al., 2025 (https://arxiv.org/html/2607.10268#bib.bib44); Tran et al., 2018 (https://arxiv.org/html/2607.10268#bib.bib46); Khandelwal et al., 2018 (https://arxiv.org/html/2607.10268#bib.bib45)),同时在实践上揭示系统如何处理受损或噪声文本。我们研究两个核心问题:  
第一,跨扰动类型和依存度量上的恢复成功与失败模式揭示了语言模型对信息局部性的哪些归纳偏置?  
第二,恢复难度是否随局部性违反严重程度而缩放?  
这些实验揭示了三个关键发现。  
第一,恢复性能按扰动类型系统变化,直接反映了局部性违反的程度。  
第二,基于依存的评估表明,即使重构字符串与原始不完全匹配,语言模型也能恢复大量句法结构,表明结构恢复与表层重构可分离而非绑定;此外,恢复的结构系统性地低于自然依存长度,揭示了一种偏向于短于自然依存弧的架构偏置,与DLM偏置一致。  
第三,句子长度与局部性违反严重程度交互:对于保留部分局部结构的扰动,长句通过提供更丰富的上下文线索改善恢复,但对于全局打乱,依存距离随句子长度成比例增长,导致完全崩溃。  
综合这些结果,表明语言模型对信息局部性约束敏感但未完全受其限制,展现出部分与人类语言可行性对齐的架构偏置。111 本文所有数据和源代码均可从 GitHub (https://github.com/amirhoseinMhmd/impossible_translation) 获取。  

表1:每种扰动函数的示例数据。为便于比较,我们采用与 Kallini et al. (2024 (https://arxiv.org/html/2607.10268#bib.bib43)) 相似的视觉效果。  

## 2 背景  
#### 语言学习的认知约束  
语言学的一个目标是区分自然语言与广阔的可想象语法空间——识别哪些结构属性定义了人类语言 (de Saussure, 1983 (https://arxiv.org/html/2607.10268#bib.bib8); Hockett, 1958 (https://arxiv.org/html/2607.10268#bib.bib9); Lyons, 1968 (https://arxiv.org/html/2607.10268#bib.bib10))。乔姆斯基的**普遍语法 (UG)** 框架形式化了这一区分,提出所有人类语言共享源自先天认知机制的受限结构原则 (Chomsky, 1965 (https://arxiv.org/html/2607.10268#bib.bib1))。至关重要的是,一种语言可以在形式上可描述,却不一定认知上可习得。换句话说,一个语法形式化能否表示某个语言系统,与人类能否习得该系统是不同的问题 (Moro, 2016 (https://arxiv.org/html/2607.10268#bib.bib23); Musso et al., 2003 (https://arxiv.org/html/2607.10268#bib.bib32))。在这种观点下,“不可能语言”是指人类尽管接触却无法习得其语法,原因不是它们无法被形式化表征,而是因为它们违反了认知约束 (Moro, 2016 (https://arxiv.org/html/2607.10268#bib.bib23))。  
这一边界经验证据来自习得研究和神经语言学。Smith and Tsimpli (1993 (https://arxiv.org/html/2607.10268#bib.bib31)) 表明,人类能够成功习得符合自然语言已知原则的人工语言,但无法学习违反这些原则的语言,表明某些语法无论如何接触都不可习得。神经语言学研究佐证了这一点:句法加工的大脑区域选择性响应与自然语言兼容的结构 (Moro, 2016 (https://arxiv.org/html/2607.10268#bib.bib23); Musso et al., 2003 (https://arxiv.org/html/2607.10268#bib.bib32))。Nefdt (2024 (https://arxiv.org/html/2607.10268#bib.bib30)) 进一步认为,识别可能的语法边界需要基于理论语言学能力,而不仅仅是分布规律性。然而,这些证据仍然有限——Smith and Tsimpli (1993 (https://arxiv.org/html/2607.10268#bib.bib31)) 仅关注单个个体,多数理论主张缺乏系统性经验检验——使得可能语言与不可能语言之间的边界仍未被充分界定。  
在定义这一边界的认知约束中,信息局部性是记录最充分的。跨语言研究表明,自然语言系统性地最小化依存长度,以保持语法相关元素相邻 (Gibson and others, 2000 (https://arxiv.org/html/2607.10268#bib.bib50); Gibson, 1998 (https://arxiv.org/html/2607.10268#bib.bib52); Hawkins, 1994 (https://arxiv.org/html/2607.10268#bib.bib17); Liu, 2008 (https://arxiv.org/html/2607.10268#bib.bib68); Futrell et al., 2020 (https://arxiv.org/html/2607.10268#bib.bib51); Temperley, 2018 (https://arxiv.org/html/2607.10268#bib.bib54))。Someya et al. (2025 (https://arxiv.org/html/2607.10268#bib.bib74)) 确立了信息局部性是可能语言与不可能语言之间可学习性差异的主要驱动因素。这使得信息局部性不仅仅是自然语言的描述性属性,更是可能/不可能边界本身的诊断标准。Mollica et al. (2020 (https://arxiv.org/html/2607.10268#bib.bib75)) 发现证据表明,即使自然语言字符串违反词序约束,只要依存成分位于附近,人脑也能从中恢复有意义的依存关系。  

#### 语言模型作为语言能力模型  
标准神经架构不会自动遵循定义可能语言的约束。Hahn (2020 (https://arxiv.org/html/2607.10268#bib.bib69)) 表明,当句法依存跨越任意距离时,自注意力架构具有理论局限性;Mitchell and Bowers (2020 (https://arxiv.org/html/2607.10268#bib.bib33)) 证明循环神经网络能学会人类不会习得的高度不自然模式——突显了人类与神经归纳偏置之间的潜在错位。然而,这种错位程度在所有语言现象上并不统一。Abdou et al. (2022 (https://arxiv.org/html/2607.10268#bib.bib36)) 表明,在打乱文本上训练的模型保留了非平凡的词序信息;Huang et al. (2023 (https://arxiv.org/html/2607.10268#bib.bib35)) 证明,词元不变的Transformer变体在长上下文下与标准模型匹配;Ebrahimi et al. (2020 (https://arxiv.org/html/2607.10268#bib.bib39)) 表明,自注意力网络能在适当线索下学习某些层级语言。然而,Delétang et al. (2023 (https://arxiv.org/html/2607.10268#bib.bib40)) 认为,没有显式结构化记忆时,标准架构在表示复杂层级依存关系方面面临相当大的挑战。  
Kallini et al. (2024 (https://arxiv.org/html/2607.10268#bib.bib43)) 证明了LLM在可能语言与不可能语言之间表现出系统的可学习性差异,显示出对自然模式的偏置,同时难以处理高度不自然的系统。Xu et al. (2025 (https://arxiv.org/html/2607.10268#bib.bib44)) 发现,GPT-2在获取不合理反事实语言时表现出与类型学普遍性对齐的学习放缓,尽管它最终能学会它们。总之,这些发现表明LLM偏置仅部分与人类认知约束重叠——留下了开放性问题:LLM能否通过逆转定义边界的局部性违反,从不可能输入中主动恢复可能语言。  

## 3 方法  
本研究的主要目标是训练一个LLM从扰动输入中恢复有意义的字符串,其中后者可以粗略视为“不可能语言”的字符串。形式上,我们定义扰动函数 f:A→A′,其中 A 代表标准英语文本,A′ 是扰动版本。我们的目标是训练模型 M 使得 M(A′):=A,有效逆转扰动并恢复原始语言信息。一个关键约束是 M 不能预先在 A 上训练过。如果 M 先前暴露于 A(例如标准英语),它可以利用该知识,而不是真正学习从扰动输入中恢复语言结构,从而混淆我们对信息恢复的评估。为满足这一要求,我们采用 Kallini et al. (2024 (https://arxiv.org/html/2607.10268#bib.bib43)) 预训练的模型。

相似文章

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

大语言模型顺序后训练中的表征坍塌

arXiv cs.LG

本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。