人类语言中上下文持久性的标度律

arXiv cs.CL 论文

摘要

本文提出一个标度律,表明人类语言中词序的上下文影响随距离近似以1/d的速率衰减,该衰减通过大型语言模型测得的困惑度降低来衡量,且在不同语言和语料库中均成立。

arXiv:2607.25184v1 Announce Type: new Abstract: 人类语言在单词层面(频率、词汇增长)和单词对层面(跨距离共现)都表现出有规律的结构。在此,我们表明词的序列排列——意义的一个核心决定因素——遵循着类似的规律。我们使用大型语言模型作为概率探针,测量了相较于打乱后的相同词汇,先前上下文在距离d处对目标困惑度的降低;这一差值,即上下文持久性函数P(d),隔离了排列的影响。在涵盖六个语系以及书面和口语模态的十个语料库中,P(d)近似以1/d衰减($P(d) \propto d^{-\alpha}$,均值$\alpha = 1.04$;中位数$r^2 = 0.96$)。在打乱和合成对照中该效应消失,在独立探针中重复,并且在领域原生模型下的基因组或蛋白质序列中未出现。指数接近1使得上下文影响在对数时间尺度上近似均匀分布。这些结果确立了人类语言中上下文持久性的标度律。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# 人类语言中语境持久性的标度律 来源:https://arxiv.org/html/2607.25184 Elan BarenholtzMachine Perception and Cognitive Robotics Laboratory, Department of Psychology and Center for Complex Systems, Florida Atlantic University ###### 摘要 人类语言在词汇层面(词频、词汇增长)和词对层面(跨距离共现)展现出有律可循的结构。本文表明,词汇的序列排列——意义的核心决定因素——遵循类似的规律。利用大型语言模型作为探针,我们测量了超出相同词汇随机打乱顺序后的距离上,语境对目标困惑度的降低量;这一差值,即语境持续性函数 \(P(d)\),隔离了排列顺序的影响。在跨越六个语系的十个书面和口语语料库中,\(P(d)\) 近似按 \(1/d\) 衰减(\(P(d) \propto d^{-\alpha}\),平均 \(\alpha = 1.04\);中位数 \(r^2 = 0.96\))。该效应在打乱顺序和合成的对照实验中消失,在独立的探针模型上可复现,并且在领域内原生模型下,其无标度形式在基因组和蛋白质序列中不成立。指数接近 1 将语境影响在对数时间尺度上近似均匀分布。这些结果确立了人类语言中语境持久性的一条标度律——一种交际行为的定量规律性。 ## 1 引言 人类语言具有丰富的统计结构,其某些方面已被定量定律所捕捉(Altmann and Gerlach,2016 (https://arxiv.org/html/2607.25184#bib.bib1); Tanaka-Ishii,2021 (https://arxiv.org/html/2607.25184#bib.bib36))。词频遵循齐普夫定律(Zipf,1949 (https://arxiv.org/html/2607.25184#bib.bib42)),词汇增长遵循希普斯定律(Heaps,1978 (https://arxiv.org/html/2607.25184#bib.bib16));两者都是无标度的,并且在不同的语言和语料库中惊人地一致重复出现。使这种规律成为定律的是其指数的可重复性,而不仅仅是幂律形式本身:在广泛的语言和语料库中,齐普夫指数接近 1,希普斯指数在特定的亚线性带内重复出现。这两条定律描述的都是单元的总体特征,因此处于统计结构层级中最基本的层面。第二个层面涉及的不是单个单元,而是成对单元:它们的出现如何在距离上共变。这里也发现了高度的统计结构:符号之间的互信息随它们的分离距离近似呈幂律衰减,其衰减速度远慢于传统有限阶马尔可夫模型下的预期(Ebeling and Pöschel,1994 (https://arxiv.org/html/2607.25184#bib.bib9); Lin and Tegmark,2017 (https://arxiv.org/html/2607.25184#bib.bib23); Montemurro and Pury,2002 (https://arxiv.org/html/2607.25184#bib.bib26))。然而,这两种度量都没有隔离出单元出现的顺序。单元频率天生不依赖顺序,而长程互信息即使在局部内容顺序被破坏时,也能反映重复出现的词汇和主题内容。然而,相同的词汇、相同的间距,由于其排列方式的不同,可以构成截然不同的含义:语法关系和组合意义存在于排列本身,而不是词汇的库存或其间隔。关于语境依赖性的表征性解释,例如话语和情境模型(van Dijk and Kintsch,1983 (https://arxiv.org/html/2607.25184#bib.bib39))以及阅读过程中基于共鸣的记忆访问模型(Myers and O'Brien,1998 (https://arxiv.org/html/2607.25184#bib.bib27)),对其进行了定性描述;但尚未发现定量的规律性结构。与共现类似,特定于顺序的依赖性可以作为一个距离问题提出:一个给定词汇的概率如何在多大程度上依赖于序列中其他词汇的排列方式,并且这种依赖关系如何随距离变化?要达到这第三个层面,就需要估计在给定其他词汇的有序组合条件下特定词汇的概率。这是长程互信息背后成对计算的排列层面类比:互信息询问的是两个词汇在给定间距下的出现如何共变,而这个量询问的是词汇的概率如何依赖于其他词汇的有序配置——无论是紧邻的,如同在给定结构之后出现的词汇,还是序列中更远的词汇。经典的语料库统计只能粗略地近似这一点。自回归 Transformer 模型(Vaswani et al.,2017 (https://arxiv.org/html/2607.25184#bib.bib40); Radford et al.,2019 (https://arxiv.org/html/2607.25184#bib.bib32))为直接捕捉这种结构提供了工具:这些模型只训练用于预测下一个词元,它们在远超传统语料库估计器可行范围的语境长度上分配词元级别的条件概率,并且对原始共现统计无法隔离的、恰恰是依赖于顺序的结构非常敏感。将它们作为测量仪器(或探针)而非研究对象使用时,为理解语言结构的这一层面提供了新的视角。本文直接测量了这种依赖性。与互信息类似,这个量是一种统计依赖性,但它是在单个词汇与其前面词汇的有序配置之间,而不是在词汇对之间。探针的下一个词元概率提供了影响力的度量:当先前的语境被揭示时,分配给某个固定后续片段的概率增加了多少。沿序列的距离提供了测量的轴:逐步、越来越远地揭示真实语境,使得这种影响力成为距离 \(d\) 的函数。测量作为上下文长度函数的下一个词元预测的方法有着悠久的历史。香农的猜测实验(Shannon,1951 (https://arxiv.org/html/2607.25184#bib.bib34))探讨了当读者获得越来越长的前文时,关于后续内容的不确定性还剩下多少。希尔伯格的猜想(Hilberg,1990 (https://arxiv.org/html/2607.25184#bib.bib17); Debowski,2015 (https://arxiv.org/html/2607.25184#bib.bib8))是对香农数据的重新解释,认为答案遵循幂律:预测随着上下文长度的增加而持续改善,在测量范围内未达到下限。我们的完整语境条件扩展了这一测量,使用一个能够达到更远语境的探针。关键是,与这些早期研究不同,我们的度量专门针对序列中顺序的作用。在那些传统中,语境总是完整呈现的,只改变其长度,因此得到的曲线是总的,混合了从揭示的词汇中获得的信息和从其排列中获得的信息,无法区分两者。因此,在每一步,我们询问揭示的语境将探针的惊奇度降低了多少,并减去在相同词汇以打乱顺序提供时(整个揭示的跨度被排列,因此基线保留了词汇和主题内容但没有排列)所获得的降低量。剩下的就是完整序列排列带来的额外益处:特定于顺序的语境影响。其在上下文延伸超过距离 \(d\) 时每个词元的增益定义了语境持续性函数(CPF) \(P(d)\);其函数形式我们称之为语境持续性定律。注意:我们使用“持续性”是统计学意义上的——有序的先前语境作为距离函数的持续预测影响力——而不是任何内部表征或认知过程的持续性:该函数是操作性度量,定律是它揭示的规律性。我们将其应用于跨越六个语系、多种体裁以及书面和口语模态的十个语料库。在整个过程中,我们将 CPF 视为支配自然语言序列的定律,是语言产品的一种属性——人类交际行为的统计痕迹;它是否以及如何映射到人类产生和理解过程中的实时机制,是一个独立的、经验上悬而未决的问题,我们将在讨论部分回到这个问题。我们发现 \(P(d)\) 近似按 \(1/d\) 衰减(\(P(d) \propto d^{-\alpha}\)),平均衰减指数 \(\alpha = 1.04\)(\(SD = 0.15\)),在近两个数量级的距离范围内没有特征截断。这种衰减在不同的语系、体裁和模态中是一致的,在随机词元对照中消失,随序列结构的完整性而变化,并且广泛分布在前面的句子中,而不是集中在少数锚点中。CPF 描述了人类语言中一种连续的、无标度的时间结构,可直接从语言序列中测量,并在独立训练的探针模型(Llama-3.1-8B, Mistral-7B)上可复现。\(P(d)\) 的形状将语言置于其他表现出无标度时间结构的人类行为和神经过程之列(Gilden,2001 (https://arxiv.org/html/2607.25184#bib.bib12); Barabási,2005 (https://arxiv.org/html/2607.25184#bib.bib3); Linkenkaer-Hansen et al.,2001 (https://arxiv.org/html/2607.25184#bib.bib24); Beggs and Plenz,2003 (https://arxiv.org/html/2607.25184#bib.bib4); Kello et al.,2010 (https://arxiv.org/html/2607.25184#bib.bib20)),并限制了能够产生这种结构的机制类别。特别是,在测量范围内没有任何特征尺度,加上广泛分布在序列中的先前内容的梯度贡献,很难与那些假定维护材料和检索材料之间存在明确划分、并具有可区分时间动态的记忆架构性解释相协调。相反,这种模式与以下机制一致:先前内容通过序列本身不断演化的概率结构继续塑造当前的生成过程。 ## 2 结果 ### 2.1 语境持续性函数 我们将语境持续性函数(CPF)\(P(d)\) 定义为在距离当前生成点 \(d\) 处,先前语境的*特定于顺序*的预测性影响力:即,将揭示的语境延伸超过距离 \(d\) 段所带来的目标困惑度的每个词元减少量,减去整个揭示跨度以打乱顺序计算时相应的边际减少量(方法部分)。减去打乱的词元基线,可以控制从相同词元组合(但顺序打乱)中可获得的预测益处,因此 \(P(d)\) 隔离了完整序列排列的额外贡献,并作为距离的函数解析。图 1 (https://arxiv.org/html/2607.25184#S2.F1) 显示了十个语料库各自的 \(P(d)\),在对数-对数坐标轴上绘制。在所有语料库中,\(P(d)\) 在整个测量范围内都是正的:在接近 1000 个词元的距离(我们测量范围的远端)上,先前的语境相对于打乱的对照组仍然使目标困惑度降低了一个可测量的量。长程语境影响并不局限于一个近期窗口,而是作为梯度函数延伸到我们检查的完整序列。接下来的分析将表征这个函数:其形式,指数接近 1 的幂律,在不同语言、体裁和模态中重复出现;其来源,语言本身的结构顺序,而非探针的属性,通过合成对照、跨探针和跨领域对照确定;以及其构成,即句子内部顺序、话语序列和句子内容的可分离贡献,这些贡献广泛分布在先前的语境中,而不是集中在特定的句子中。 ### 2.2 跨语言、体裁和模态的重尾衰减 \(P(d)\) 的函数形式可以很好地近似为重尾衰减。在语言、体裁和模态中,\(P(d)\) 在近两个数量级上平滑衰减,平均衰减指数 \(\alpha = 1.04\)(\(SD = 0.15\);\(P(d) \propto d^{-\alpha}\))——接近于 \(1/d\) 幂律——中位数拟合优度 \(r^2 = 0.96\)。一个缩减样本的复制实验,每个目标平均使用 20 次打乱排列,产生了相同的跨语料库平均指数(\(\alpha = 1.04\))和改进的拟合稳定性(补充说明 3),表明主要结果不依赖于选定的排列。拟合计算基于 \(d \geq 10\) 个词元的范围,在这个范围内有序和打乱语境的基础都是稳定的;非常短距离的区间在方法部分报告,并且拟合的指数对稳定范围内的确切截断点不敏感(补充说明 4)。通过小样本校正信息准则对五种候选函数形式进行比较(补充说明 1),幂律在十个语料库中的八个更受青睐,并且在所有十个语料库中都优于纯指数形式;固定尺度的指数形式从未被偏好。剩下的两个语料库,日语文学散文和 Buckeye 英语口语,显示出轻微的下弯曲率,分别略好地拟合对数正态和拉伸指数形式;但在这两种情况下,衰减仍然是重尾的,并且远远超出固定时间缓冲单独作用所预期的范围。衰减机制的跨语料库一致性值得注意。样本涵盖日耳曼语系、罗曼语系、突厥语系、日本语系、乌拉尔语系和斯拉夫语系,以及小说和文学散文、新闻和说明性散文、准备好的演讲稿和自发口语。在这个范围内出现的窄重尾衰减机制表明,CPF 反映的是自然语言的通用属性,而不是任何单一语言、语域或模态的属性。定义 \(P(d)\) 的定性模式——有序语境在长程上的正贡献与打乱语境几乎为零的贡献并存——超出了长程运行所涵盖的六个语系。在一个补充性的跨语言分析中,在两个探针模型上评估了较短的语境长度,这种长程标志模式在另外三个语系中得以保留:亚非语系、朝鲜语系和汉藏语系(补充信息)。因此,\(P(d)\) 的主要指数是在六个语系集合上获得的,该集合位于一个更广泛的九个语系跨语言复制(定义了持续性函数的定性模式)之内。 参见图注 图 1:跨语料库的语境持续性函数。每个词元特定于顺序的语境影响力 \(P(d)\) 作为距离 \(d\) 的函数,对数-对数坐标轴。每个面板是十个语料库之一,涵盖六个语系(日耳曼语系、罗曼语系、突厥语系、斯拉夫语系、日本语系、乌拉尔语系)和四种产生模式。所有单元在近两个数量级的距离范围内表现出重尾衰减,平均衰减指数 \(\alpha = 1.04\)(\(SD = 0.15\);\(P(d) \propto d^{-\alpha}\),因此对数-对数斜率为 \(-\alpha\))——接近 \(1/d\) 定律。点显示为 \(d \geq 10\) 个词元;虚线是幂律拟合。排除 \(d=10\) 以下的区间,因为在如此短的语境下,打乱的词元基线不稳定:只有一两个词元时没有有意义的排列,因此特定于顺序的差异在那里定义不清,不能反映持续性衰减(方法部分)。标记为 † 的两个单元(日语文学散文;Buckeye 自发英语口语)显示出轻微的下弯曲率,分别略好地拟合对数正态和拉伸指数形式,但仍然是重尾的,幂律紧随其后。

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

大语言模型中的模型合并扩展定律

Hugging Face Daily Papers

本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。

时间上下文重建驱动长上下文语言模型中的类情节顺序记忆

arXiv cs.AI

本文基于一部小说的时序记忆任务,研究长上下文语言模型是否表现出与人类相似的类情节顺序记忆。作者发现模型显示出相同的距离效应,并揭示了一个单独的关注头(attention head)重建时间上下文,支持时间上下文重建作为大语言模型中类情节记忆的机制。

论词汇性在大语言模型中的持续影响

arXiv cs.CL

本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。