语言作为设计的潜在空间
摘要
本文探讨了人类语言是一种设计的潜在空间,它将推理约束为模式匹配和符号操作,并论证了LLM无法创造新语言来解决现有语言之外的问题。
<p><a href="https://lobste.rs/s/ljg2qr/languages_as_designed_latent_spaces">评论</a></p>
查看缓存全文
缓存时间: 2026/07/25 16:05
# 语言作为设计的潜在空间
来源:https://blog.jsbarretto.com/post/languages-as-latent-spaces
关于解决问题本质的一些思考
---
*2026-07-22*
*本文是我最近在 Mastodon 帖子(https://social.coop/@jsbarretto/116960627082185187)上的编辑版本。*
我最近一直在思考语言作为一种高熵潜在空间,以及这意味着什么。
潜在空间有点神奇:它们不仅降低了高维空间的维度,还对其进行了约束,使得潜在空间中的任意移动都映射到高维空间中的某个*有意义*位置。想想看,几乎你给图像生成器的任何文本提示,都会产生一张具有可识别形状和结构的图片,然而,绝大多数可能的图像基本上只是随机噪声。
显然,语言也是如此。一旦你学会了掌握基本的结构规则,如句法、语法以及具有相似语义聚类的词语的基本模式匹配,在其中的移动几乎总能产生“有意义”(可读,而非哲学意义上的有意义)的结果。想象一下,一个善于表达的人,只需阅读某个领域的一点行话并即兴发挥,就能相当轻松地在该领域内编造出像模像样的废话,但完全无法展示该领域的实际能力。
## 语言作为技术
一种思考方式是,语言是一种让概念推理变得容易的工具:一旦你掌握了基本规则,产生一个*不*携带任何意义的输出,几乎比产生一个有意义的输出还要困难。
考虑一种强类型编程语言,如 Rust、Haskell、Lean 等:就像人类语言一样,代码的几乎所有良类型转换都对应着某种有意义的变化。就像程序员可以利用类型系统的障碍来避免 bug 一样,人类语言的使用者只需遵循语言的语法规则,就能避开那些原本会导致他们产生不可理解的胡言乱语的概念障碍。
然而:地图并非疆域。对于每一个良类型转换,都有无数无效的转换,这些转换在表达能力较弱的语言中会对应无意义的垃圾。实际上,语言通过将可能的程序集合约束到一个小的潜在空间(该空间覆盖了特别高密度的有意义程序),将*领域推理*的问题转化为*模式匹配*和*符号操作*的问题。
许多困惑源于这样一个事实:在 2016 年之前的人类历史上,符号操作一直被认为*非常困难*,因为它对我们的大脑来说不那么直觉。因此,每当我们看到某人或某物执行类似语言这样的潜在空间操作时,我们的倾向是假设他们首先在低熵、嘈杂、复杂的*现实*空间中进行了推理,然后将其转化为潜在空间作为最后一步。但机器没有理由采取这种行动路线:为什么它要这么做,当仅仅在语法和模式匹配层面建模语言更容易满足适应度函数时?
## 许多问题无法在语言空间中解决,因为解决它们的语言还不存在
我慢慢想说的是,人类语言是一个潜在空间,我们通过数千年的仔细分析、分类、分类学研究以及对现实世界的研究,才塑造出了这个空间。这是一种特定的工作,我们在充满文本和语言的生活中常常忘记,我们生活在地图上,忘记了疆域的存在。这也是大型语言模型无法做到的工作:它们是符号操作者,而非符号的创造者。
它们的推理受限于我们放在它们面前的潜在语言空间(在某种程度上,我们也都如此)。但我们独特的能力在于,我们也可以在该潜在空间之外运作,并通过利用我们头脑中的世界模型来扩展它的范围,这种世界模型能够在不依赖训练数据提供答案的情况下进行探究和检验假设。
机器可以生成数学证明或找到长期存在猜想的反例,同时却无法完成煎蛋或叠衣服这样的基本任务,这常常让人觉得奇怪且有点费解;但这或许不应该如此:前者只需要快速操作已经被人类思维映射过的语义丰富的潜在空间,而后者需要对充满死胡同的嘈杂现实进行更稳健的推理,而这正是只有世界模型才能擅长的事情。
如果你觉得这个想法难以接受,不妨想一想一个几乎没有任何训练数据可学习的人类是多么能干。只是因为我们拥有一种极其高效的训练算法吗?还是我们只是将所有推理的大部分放在了一个完全不同的抽象层次上进行?
## 在空间之间移动
我的假设是,大型语言模型只能在第一层内进行转换,而人类——或任何拥有世界模型的事物——则能够在各层之间切换。这并不是说大型语言模型无法解决也可以用世界模型解决的问题:只是说它们需要一个预先播种的语言潜在空间,覆盖问题领域,然后才能建模解决方案;而世界模型可以绕过这个问题。
## 不要把地图混淆为疆域的重要性
对已经被人类上百代劳动映射的丰富潜在空间进行插值,与在高度嘈杂且路径依赖的环境中推理,是完全不同的任务。我们应该小心,不要认为在前者上的熟练必然能证明在后者上的能力,尽管这对人类来说通常是成立的。
我强烈怀疑,在潜在空间之间的移动正是大型语言模型开始遇到瓶颈的地方。这对我们意味着什么?很可能:创新的停滞。如果语言——至少部分地——定义了我们的思维界限(https://en.wikipedia.org/wiki/Language_of_thought_hypothesis),那么在一个大型语言模型成为最普遍、最常见的语言使用者的世界里,可能会经历一种语言和认知的惯性,无法摆脱自我强化的语言潜在空间。
## 这是技术相当正常的表现
也许如果你已经喝了那杯“迷魂汤”,你可能会想声称我在移动“智能”的门槛,但正如 Opus 23(https://www.youtube.com/watch?v=1CbmC2aWhjY)令人信服地论证的那样,这正是技术所做的:它将之前被视为整体的概念分解成组成部分,并重新语境化。智能和语言这两个制度正在被分开,这不应该让我们感到惊讶。
我并非绝对主义者:我不认为人类有什么特殊或超自然之处。我们只是物质的肉袋子,没有理由认为机器不能也配备一个世界模型。可以说,昨天那种狭义的“AI”,如国际象棋机器人和寻路算法,本身就是带有求解器的世界模型。我想说的是,大型语言模型还没有破解这个通用推理的问题:它们仍然只是狭义的AI,在一个由人类预先播种的、具有表达结构(足以建模广泛领域)的潜在空间内运作。
相似文章
LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考
研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。
LLM的最佳使用方式会是什么样?
探讨一种推测性想法:通过适应LLM的原生通信模式(例如使用神经语)来优化人类与LLM的交互,而不是强迫它们适应人类语言。
通过语言表征塑造图式:拓展LLM智能的下一前沿
本文指出,设计先进的语言表征以塑造认知图式,是在不扩展参数规模的前提下拓展LLM智能的关键前沿。文章提供了形式化定义与实证证据,表明不同的语言结构会显著影响模型性能与内部特征激活。
中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
文字是意识的副产品。对于LLM来说,情况则相反
文章认为,人类语言源自已有的意识思想,而LLM无需底层概念即可生成文字,这表明存在一种根本性的颠倒,对AI的未来具有启示意义。