我如何知道接下来该说什么?巴伦霍茨的自生语言理论对哈里斯式整合主义的丰富

arXiv cs.CL 论文

摘要

本文认为,埃兰·巴伦霍茨(Elan Barenholtz)基于大语言模型行为提出的自生语言理论,通过为前瞻开放性以及语言与非语言符号的连续性提供结构机制,丰富了罗伊·哈里斯(Roy Harris)的整合语言学,为计算方法提供了解释性内容。

arXiv:2607.07891v1 公告类型:新 摘要:罗伊·哈里斯(Roy Harris)的整合语言学对深深植根于语言计算方法核心的指称主义传统提出了有力批判,认为语言并非映射到预先给定世界的代码,而是一种情境化、双边的活动,旨在实现前瞻性联合行动。然而,整合主义留下了一些解释空白:它未能充分说明符号维持前瞻开放性的结构机制,对语言与非语言符号活动之间的连续性理论化不足,且未详细阐明过去整合积累档案的结构属性。本文认为,埃兰·巴伦霍茨(Elan Barenholtz)针对大语言模型行为提出的自生语言理论,恰好能够填补这些空白,在不削弱整合主义任何核心主张的前提下丰富其理论。具体而言,自生解释提供了:哈里斯视为双边沟通核心的前瞻开放性的结构机制;哈里斯关于语言与其他符号创造活动之间符号连续性论点的计算对应物;以及一种档案理论:过去整合的积累残余如何呈现,新参与者如何利用它。这一综合保留了哈里斯对情境化整合行为的本体论优先性,同时增加了整合主义本身未能提供的解释性内容。对于自然语言处理和大语言模型设计的实践者和研究者而言,这一论证提供了一种有原则的说明,阐明了大语言模型如此有效利用的统计结构究竟是什么,以及其本质上无法提供什么。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:11

你如何知道接下来该说什么?巴伦霍尔茨的自主生成理论对哈里斯整合论的丰富与补充
来源:https://arxiv.org/html/2607.07891
斯蒂芬·J·考利教授 南丹麦大学荣休教授

(2026年6月)

###### 摘要

罗伊·哈里斯的整合论语言学对深深植根于语言计算方法的指称论传统进行了有力批判,主张语言并非映射预先给定世界的代码,而是一种情境性的、双向的活动,其目的在于促成未来的联合行动。然而,整合论在某些解释上存在空白:它未能充分解释符号维持未来开放性的结构机制,对语言与非语言符号活动之间的连续性理论化不足,并且对过去整合活动积累档案的结构性特征缺乏详细解释。本文认为,埃兰·巴伦霍尔茨针对大型语言模型(LLM)行为提出的语言自主生成理论,恰恰能够填补这些空白,在不损害整合论核心主张的前提下丰富其内涵。具体而言,自主生成理论提供了:一种结构性机制,用以解释哈里斯视为双向沟通核心的未来开放性;一种计算层面的对应物,支撑哈里斯关于语言与其他符号制造活动之间符号连续性的论点;以及一种档案理论,即过去整合活动积累的残余在结构上是什么,以及新参与者如何利用它。这种综合保持了哈里斯关于情境性整合行为之本体论优先性的立场,同时增添了整合论本身未能提供的解释性内容。对于自然语言处理和大型语言模型设计领域的从业者和研究者而言,本文为以下问题提供了原则性的解释:LLM如此有效利用的统计结构究竟是什么,以及因其本性,它无法提供什么。

## 1 引言

罗伊·哈里斯,生前曾任牛津大学普通语言学教授,他花费数十年时间发展整合论语言学,以此持续批判他所谓的“语言神话”,即深植于西方思想以至于鲜少被注意的假设:词语是固定的标签,透明地传达关于独立外部世界的思想。(Harris,1981 (https://arxiv.org/html/2607.07891#bib.bib3))在哈里斯攻击的“心灵传输”观点中,沟通成功当且仅当一个心灵中的思想在另一个心灵中成功复制:语言仅仅是透明的管道。与此相反,哈里斯认为语言是一种情境性的、双向的活动:符号并不在说话者之间传递固定意义,而是在特定语境中协调参与者接下来将共同做什么。意义并非被传输,而是被前瞻性地建构。

在最近的一篇论文中,认知科学家埃兰·巴伦霍尔茨认为,大型语言模型(LLM)揭示了关于语言本质同样激进的东西:语言并非通过指向或描述现实来运作,而是通过生成语境上合适的自身续接来运作。(Barenholtz,2026 (https://arxiv.org/html/2607.07891#bib.bib2))巴伦霍尔茨将此称为语言的“自主生成属性”。关键在于,LLM无需直接接触生活世界(借用The Who乐队的说法,即臭名昭著的“又聋又哑又瞎的孩子,却弹得一手好弹球”(TheWho,1969 (https://arxiv.org/html/2607.07891#bib.bib10))),却仍能生成连贯且语境合适的语言。LLM对“红色”的实际红色或“远”的实际物理距离一无所知;它只知道这些词在高维关系空间中与其他每个词的位置关系。然而,正是通过操纵他所谓的“空符号”,连贯且语境合适的语言便涌现出来。

然而,巴伦霍尔茨谨慎地未曾声称人类大脑本质上就是LLM。其论点更为微妙:LLM的成功揭示了人类语言活动积累语料库中存在的一种结构性属性,而大脑(作为情境性的、具身的、活的器官)可能利用这一属性,而无需以计算方式实现它。正如巴伦霍尔茨所言:“并非大脑本质上就是LLM。更准确地说,该提议是,大脑也可能利用我们现在已知已经存在于语言中的结构,基于前词的预测性结构生成词语。”这一区分对于后续论证至关重要。我们提出的对整合论的丰富,并非将语言还原为计算;而是关于语料库(过去语言行为积累的残余)统计结构的主张,而LLM和人类说话者都以各自截然不同的方式利用了这一结构。†††此处需作术语说明,且关乎全文。当我们使用“语言结构”或“语言属性”时,并非意在将语言具体化为一种抽象的、预先给定的实体,这是哈里斯毕生反对的错误。按照§5中发展的对巴伦霍尔茨的解读,此类短语应理解为“语料库的统计结构”的简称:即过去整合行为积累的、历史偶然的沉淀物。并不存在凌驾于这些行为之上的“语言本身”;只存在它们留下的结构痕迹。这一点在激进语言学家的Cowley (2026 (https://arxiv.org/html/2607.07891#bib.bib8))一方得到了进一步阐述,该文认为LLM使用的是数据,而非“语言”。

这两种观点主要被解读为对指称论的趋同性批判,且此种趋同是真实且实质性的。但更具建设性的问题是,巴伦霍尔茨的观点能否做到趋同性文献尚未充分利用的事情:不仅仅是同意哈里斯,而是丰富他——在整合论尽管哲学力量强大却留下解释空白之处,提供机制、连续性和档案理论。这个问题对AI和计算语言学具有直接意义:如果这种丰富成功,它将为大型语言模型实际上建模了什么、它们无法捕捉什么,以及统计能力与情境性语言活动之间的鸿沟为何不仅仅是规模或数据问题,提供一种有理论依据的解释。

本文认为这种丰富是可能的,并且沿着三个不同的轴线运作。首先,自主生成理论为哈里斯视为双向符号核心但从未充分解释的未来开放性提供了一种结构性机制(§3)。其次,巴伦霍尔茨将自主生成框架扩展至多模态,涵盖意象和感知以及语言,为哈里斯关于语言与非语言活动之间符号连续性的论点提供了计算支持(§4)。第三,自主生成理论可被解读为一种档案理论:对过去整合积累的残余在结构上是什么,以及新参与者如何利用它的刻画——这是一个哈里斯承认但未充分理论化的主题(§5)。全文始终注意确保这种丰富在整合论核心承诺的范围内运作,而非与之相悖。

值得一开始就指出的是,此处发展的论证是来自不同出发点的研究者独立得出的。巴伦霍尔茨(Barenholtz,2026 (https://arxiv.org/html/2607.07891#bib.bib2))作为认知科学家分析LLM行为而接近该问题;Cowley (2026 (https://arxiv.org/html/2607.07891#bib.bib8))作为在分布式语言传统中工作的激进生态语言学家接近它;而Pinna(Pinna,forthcoming (https://arxiv.org/html/2607.07891#bib.bib9))从科学哲学视角接近,认为LLM能力源于重建规范塑造的续接,而非操纵直接与现实联系的表征,并将语料库描述为保存了规范支配实践的“沉积痕迹”——一种与§5中发展的档案观点惊人地趋同的直觉。四条独立的研究线索汇聚于自主生成能力作为理解LLM与语言关系的核心,这一事实本身就是该观点有效性的重要证据,并将本文置于更广泛的研究计划中,而非孤立的提议。†††第四条研究线索即本文本身(Bishop and Cowley,2026 (https://arxiv.org/html/2607.07891#bib.bib1))。与哈里斯整合论的接合构成了本文的哲学核心,源于Bishop先前关于AI与语言哲学关系的研究。Cowley最初作为早期草稿的评论者加入,其贡献如此具有生产力,以至于他随后成为合著者。因此,四种观点的独立性是真实的,尽管其中两种后来在本文撰写中汇合。

## 2 整合论基础

哈里斯的核心主张,在《语言神话》(Harris,1981 (https://arxiv.org/html/2607.07891#bib.bib3))和《阅读索绪尔》(Harris,1987 (https://arxiv.org/html/2607.07891#bib.bib4))中得到发展,认为西方语言学传统通过将语言视为说话者之间共享的固定代码而系统性地误解了语言。†††值得注意,哈里斯构想的“语言神话”包含两个不同的组成部分:代码模型(语言形式映射到固定意义的观点)和心灵传输模型(沟通成功当且仅当一个心灵中的思想在另一个心灵中复制的观点)。我们的论文主要聚焦于心灵传输方面,因为这最直接地与LLM案例相关;但代码模型同样是哈里斯批判的重要目标,且两者在文献中并非总是被区分。无论索绪尔模型作为结构解释有何优点,它继承并编纂了这一误解:它设定了一种“语言”,一种悬浮于个体沟通行为之上的抽象系统,并将个体话语视为该系统的简单实例化。对哈里斯而言,这完全颠倒了过来。不存在语言;只存在个体、创造性的、情境性的整合行为,参与者通过这种行为使符号在此刻、此地、为他们自己而意指某些东西。

由此得出若干承诺。符号是“不确定的”:没有符号携带固定的、独立于语境的值。意义并非储存在词语内部并被检索;而是在每次沟通情境中由参与者根据自身历史、身体和目的重新建构。因此,语言具有典型的“双向性”:在其典型情况下,它涉及至少两方共同面向共享情境,其构成性特征在于它促成的双方之间的协调。然而,哈里斯确实允许自我沟通,其中单个个体在没有第二参与者的情况下整合符号;因此,双向协调是符号制造的原型而非必要条件。沟通是“前瞻性的”:符号的功能不是报告事态,而是协调参与者接下来将共同做什么。语言是“具身的”:符号制造者不是非具身的处理器,而是一个生物力学主体,其身体情境是符号本身的构成部分,而不仅仅是它的载体。

这些承诺并非松散捆绑的独立论题;它们形成了一个连贯的架构。不确定性解释了为什么双向协调是符号制造的原型案例:因为符号没有固定值,每次整合都在符号制造者与情境的相遇中重新、独一无二且不可转移地建构其意义。这并不是说意义在参与者之间共享或趋同;哈里斯的不确定性论题排除了任何此类趋同。每次整合仍然不可还原地独特,即使它产生了看似协调的行为。双向活动解释了为什么沟通是前瞻性的:参与者共同做的不是交换信息,而是协调行动。具身性则将整个观点锚定在情境化人类实践的特定性中。

然而,整合论并未提供的是:符号维持未来开放性的“机制”的详细解释——为什么符号在结构上“邀请”进一步的活动而非将其关闭。它也没有提供关于符号连续性的系统解释,超出语言与非语言符号制造是一体的一般性主张。并且,关于过去整合活动积累的档案在结构上是什么,以及参与者如何利用它,它说得相对较少。这些并非致命的空白;整合论是对语言是什么的哲学解释,而非对其如何运作的认知科学。但它们是真正的缺失,而巴伦霍尔茨的自主生成理论在此有可贡献之处。对于AI和计算语言学读者而言,这些缺失映射到熟悉的开放问题:为何缺乏世界基础的预言模型仍能产生语境合适的输出;LLM学习的向量空间表征与人类说话者建构的意义之间关系如何;以及LLM的成功告诉我们关于人类说话者所利用的语言资源结构的哪些信息。

在继续之前还需一次澄清。此处提出的丰富在某些点上超出了哈里斯本人明确论证的范围。哈里斯的计划主要是批判性和哲学性的:他拆解了一种误解,但留下了关于语言能变成什么——鉴于过去整合行为档案如何被结构化——的积极观点未充分阐述。以下各节利用巴伦霍尔茨的自主生成框架发展这一积极观点。这是对哈里斯的有意扩展而非误读,并以此精神提出。

相似文章

HawkesLLM:智能体文本模拟中的语义不确定性传播

arXiv cs.CL

本文介绍了HawkesLLM,一个通过结合用于时间影响和记忆选择的多变量Hawkes过程与用于文本生成的语言模型,对多步骤智能体文本模拟中的语义不确定性传播进行建模的框架。在GDELT新闻级联案例研究上的评估表明,在紧凑的提示-记忆约束下,后期语义对齐得到了改善。

LLM的最佳使用方式会是什么样?

Reddit r/singularity

探讨一种推测性想法:通过适应LLM的原生通信模式(例如使用神经语)来优化人类与LLM的交互,而不是强迫它们适应人类语言。

语言游戏:与非人类系统对话

arXiv cs.LG

本文介绍了一种名为“语言游戏”的框架,通过将通信视为一场游戏,其中系统的内部动态被冻结作为强化学习策略,仅训练线性输入输出接口,从而实现与非神经生物系统(例如基因调控网络)的对话。该方法允许不同系统在不改变其参数的情况下流畅地进行通信。

语言作为设计的潜在空间

Lobsters Hottest

本文探讨了人类语言是一种设计的潜在空间,它将推理约束为模式匹配和符号操作,并论证了LLM无法创造新语言来解决现有语言之外的问题。