Semantic Lenia:大型语言模型语义空间中稳态孤子的涌现
摘要
本文提出Semantic Lenia,一个将LLM推理转化为logit空间中连续动态系统的框架,通过非线性反馈展示了自主语义孤子和稳态极限环的涌现。
arXiv:2608.11657v1 公告类型:新
摘要:我们引入了Semantic Lenia,这是一种人工生命框架,它将大型语言模型(LLM)推理从静态优化问题转化为宏观logit空间中的连续动态系统。通过建立非线性稳态反馈回路,动态平衡语义吸引与句法排斥,我们展示了"自主语义孤子"的涌现——这是一种避免重复结晶的宏观耗散结构。我们详尽的参数扫描描绘出一条关键的"宜居脊线",在该脊线上,施加的引导力完美平衡了模型内在的句法惯性。该方法成功地将生成轨迹维持在混沌边缘,在不发生结构崩溃的情况下触发深刻的溯因跳跃,并为机器认知建立了物理标度律。
查看缓存全文
缓存时间: 2026/08/13 15:27
# Semantic Lenia:大型语言模型语义空间中的稳态孤子涌现 Source: https://arxiv.org/html/2608.11657 Yoshihiko Kayama 感谢:通讯作者:[email protected] 所属:梅花女子大学 地址:日本大阪茨木市 2–19–5 邮箱:[[email protected]](mailto:) ###### 摘要 大型语言模型(LLMs)通常被视为静态推理引擎,这种范式将长期轨迹多样性限制在静态均衡上。从人工生命(Artificial Life)的视角出发,我们提出 **Semantic Lenia**——一种生态干预框架,将 LLM 推理转化为宏观 logit 空间中的连续动力系统。通过在概率单纯形上建立调制吸引与排斥的非线性反馈回路,我们证明了“自主语义孤子”作为宏观耗散结构的涌现。我们识别出一条关键的“宜居脊线”,在此处施加的引导力与模型固有的句法惯性达到平衡,从而建立稳健的极限环。穷尽式参数扫描揭示了一个物理标度律:高度受限的提示如同大质量惯性体,需要指数级更高的激活能才能跨越语义鸿沟。在严格可复现的设置下,我们成功地将系统推向混沌边缘,在不发生结构崩溃的前提下触发深刻的溯因跳跃。 *关键词*:Semantic Lenia ⋅ Large Language Models ⋅ Homeostatic Solitons ⋅ Dissipative Structures ⋅ Syntactic Inertia ## 1 引言 #### 从离散网格到高维流形 人工生命(ALife)的历史以“生命得以涌现的基底”的持续扩展为特征。早期元胞自动机(CAs),最著名的是康威生命游戏([2, https://arxiv.org/html/2608.11657#bib.bib1]),证明了复杂的自组织模式可以从空间网格上的简单离散规则中产生。然而,这些系统本质上受限于其刚性网格结构和有限状态集合。随着 Lenia 的引入(Chan,[3, https://arxiv.org/html/2608.11657#bib.bib2];[4, https://arxiv.org/html/2608.11657#bib.bib3]),一次重要的范式转移发生了;Lenia 将 CA 推广到连续空间、时间和状态。Lenia 证明了“生命形态”——自主、有弹性、可移动的模式——并非网格的偶然产物,而是由基于核的更新规则所支配的连续场的基本属性。 今天,我们面对一个新的、尚未探索的基底:由大型语言模型(LLMs)生成的宏观概率场(logit 空间)。凭借数十亿的参数,LLM 编码了一个丰富的“语义拓扑”,其中的概念彼此关联,犹如高维非线性流形中的坐标。然而,从 ALife 的角度看,当前 LLM 的文本生成过程在生态学上仍是“冻结的”,等待一个动态框架来催化自主涌现。 #### 问题:生成收敛与轨迹多样性丧失 自然语言处理(NLP)中的标准解码策略,如贪心搜索或束搜索,将文本生成纯粹视为优化问题。目标是最大化似然 P(wt|w<t),这在每一步都有效,但长期来看会将轨迹限制在某一静态吸引子的邻域内。这种“认知结晶化”表现为重复的 n-gram、语义循环以及无法维持长期主题新颖性。更根本的是,对底层概率分布的纯算术操作——无论多么复杂——都无法将概率质量推向本身不存在的区域。如果我们希望 LLM 在语义上“探索”,我们需要一种物理扰动,而不是算术重新加权;这种扰动来自我们提出的 Semantic Lenia 框架。 #### 我们的贡献:面向生态学的生成范式 我们将 Semantic Lenia 形式化为一个干预框架,将文本生成重构为“语义生态”。我们工作的核心贡献如下: 1. **连续语义场上的反馈控制**:我们在输出 logit 空间中构建了一个由目标概念簇定义的非线性势场。一个单峰生长函数根据当前的语义接近度调节吸引与排斥,从而建立一个远离平衡态的反馈回路。 2. **自主语义孤子的涌现**:通过可控的干预强度 α 和目标参数 μ, σ,我们展示了 LLM 的生成轨迹能够进入自维持的极限环——即“自主语义孤子”。这些孤子自主地探索目标概念周围的语义半影,生成连贯且语义多样化的文本。 3. **认知标度律**:我们的参数扫描揭示了一个物理标度律:高度受限的提示充当大质量惯性体,需要指数级更高的激活能才能跨越语义鸿沟。这一发现对“提示工程”具有直接启示:引导 LLM 认知轨迹所需的“能量”不是相对于基线概率,而是相对于底层生成流的惯性。 ## 2 背景与相关工作 ### 2.1 从静态优化到动态平衡:超越传统解码 传统文本生成范式(如贪心解码或束搜索)本质上是静态的:它们根据条件概率分布选择最高排名的 token 序列。这些方法虽然高效,但存在根本性缺陷。通过强制实施局部最优性,它们将语义多样性压缩成狭窄的、预定的轨迹,具体表现为重复的 n-gram 和系统性缺乏长期主题新颖性。近期工作试图通过引入随机采样方法(如 top-k、top-p 和温度缩放)来应对这些问题。然而,这些方法仅对预先存在的概率分布进行重新加权,而不会产生新的语义状态;它们仍然受制于分布内随机性,无法实现真正开放的探索。从 ALife 的视角来看,这些解码策略与“淬火无序”相似:一个被困在局部能量最小值附近、失去宏观动力学演化能力的系统。相比之下,Semantic Lenia 引入了干预性的动力学结构,主动将生成轨迹推向语义新颖性的前沿。 我们将 Semantic Lenia 的干预机制与传统方法在概念上区分如下: - **单向调整 vs. 呼吸式稳态反馈**:诸如对比解码等方法施加单向“推动”,将输出引导至特定的语义方向。Semantic Lenia 通过交替的吸引(G>0)和排斥(G<0)机制施加平衡的“呼吸”反馈,从而形成远离平衡态的开放式极限环。 - **分布重新加权 vs. 注入势能**:许多方法直接修改 token 分布(例如,通过惩罚重复)。Semantic Lenia 则通过显式的势能注入修改 logit 空间本身,使采样动力学能够探索模型概率质量所暗示的语义流形拓扑。 - **目标 token 约束 vs. 分布式原型的靶向**:现有方法通常以特定 token 或短语为目标,导致吸引子坍缩。Semantic Lenia 使用概念簇的归一化质心作为分布式“原型”(见第 3.2 节),在保持稳定反馈回路的同时实现语义探索。 非正式地说,t=0 处的系统是一个脆弱的、“尚未诞生”的实体,完全受静态先验主导。通过注入 α·G(Ut)·Sk 的势能,我们将系统转化并扩展为一个活的系统。这种动态反馈很像 Lenia 中的生长函数;它周期性地使系统剧烈摆动,防止其安静地落入平凡的终点——单一语义模式。我们使用强大的模型(例如,Llama-3.1-70B)进行实验,展示了我们的框架仅通过介入 logit 函数,即可让模型在超过 T>150 生成步的“语义波”中保持稳定,且不发生结构退化。 ### 2.2 连续元胞自动机与 Lenia Lenia 由 Chan([3, https://arxiv.org/html/2608.11657#bib.bib2])引入,代表了人工生命研究中的一次重要范式转移,它将离散元胞自动机(CA),如康威生命游戏,推广到连续时空和状态。与在刚性网格上运作的经典 CA 不同,Lenia 定义了一个连续场,其中被称为“生命形态”的自主且有弹性的模式从简单的局部规则中涌现。Lenia 的数学核心由两个主要组件组成:卷积核 K 和单峰生长函数 G。核整合周围邻域的信息以计算局部势 U,然后由生长函数将其映射为特定的更新值。该机制确保了模式能够主动维持其结构:产生正生长以对抗衰变,产生负生长(排斥)以防止坍缩。从动力系统的角度看,Lenia 通过建立稳态——一种远离平衡态的动态平衡状态——超越了静态优化的“死亡”均衡。 ## 3 Semantic Lenia 框架 ### 3.1 LLM 作为混合动态系统 我们将 LLM 形式化为一个混合动态系统。虽然可观察的输出(token)和时间步 t∈N 本质上是离散的,但生成过程发生在连续的高维潜流形中。在本研究中,我们将投影后的宏观语义空间(输出 logit 空间)——它直接反映这一底层潜流形的复杂拓扑——作为我们物理基底的功能代理。虽然真正的认知动力学深藏于内部中间层,但对输出 logit 的调制提供了一个计算上可访问且高度可解释的代理空间,以建立我们对 Semantic Lenia 的初步概念验证。在这个基底中,每个上下文向量 c_t∈R^D 表示一个移动语义实体的瞬时状态,其中 D 表示预训练语言模型的潜在嵌入维度(例如,Llama-3.1-8B 中 D=4096,70B 中 D=8192)。传统解码将这一生成过程视为静态优化任务,旨在收敛,这自然会在长时程内将轨迹推向局部点吸引子。相比之下,Semantic Lenia 在该语义空间中构建了一个连续势场,将 token 采样过程转变为由稳态反馈支配的动态轨迹。我们将这种稳态反馈定义为一个自调节的非线性控制回路:当轨迹偏离目标语义质心过远时,系统注入吸引力能量;反之,当轨迹过于接近时,系统产生排斥性语义力(形式化见第 3.3 节)。这种双力交互动态地维持系统远离平衡态,从而维持一个开放式的极限环。 令 V 为大小为 N 的词表。每个 token w_i∈V 关联一个预训练输出嵌入向量 w_i∈R^D。在每个离散生成步 t,上下文隐藏向量 c_t 动态地累积历史 token 序列的潜在状态表示,作为我们动态实体的连续坐标。 ### 3.2 目标核与语义势 在 Lenia 中,环境通过连续卷积核感知。我们通过定义目标核质心 k 将此机制映射到 LLM 上。对于一组概念相关的目标 token C={w_1,w_2,...,w_m}⊂V,核 k∈R^D 被定义为其 L2 归一化平均嵌入: k = (1 / ||Σ_{w∈C} w||_2) · Σ_{w∈C} w (1) 状态向量通过语义势 U_t∈[0,1] 响应其相对位置,该语义势通过将当前上下文向量 c_t 与目标核 k 之间的余弦相似度归一化来计算: U_t = (sim(c_t, k) + 1.0) / 2.0 (2) 其中 sim(a,b) = (a·b) / (||a||_2 ||b||_2) 表示标准余弦相似度。这个标量值作为主要感觉输入,为系统提供其语义轨迹相对于概念中心的宏观度量。 **方法论依据:去噪与语义邻域保持** 构建 k 时选择多 token 簇 C 而非单一目标词,这一数学决策服务于两个关键动力学功能。首先,从 NLP 的角度来看,该公式利用了平均词嵌入(AWE:[1, https://arxiv.org/html/2608.11657#bib.bib9])和认知原型理论([9, https://arxiv.org/html/2608.11657#bib.bib10])的原理。单个词嵌入天然带有噪声,被特定词的句法特性和高频搭配偏差所污染。对 C 的线性平均充当语义低通滤波器,消除这些非语义局部维度,从而分离出一个稳健的、泛化的“原型向量”以代表核心概念。其次,使用多 token 簇 C 可防止在稳态反馈回路期间出现奇异性导致的排斥。如果目标仅限于单个 token w(例如,“Computer”),系统将面临严重的动力学瓶颈:在吸引阶段(G>0)坍缩为重复 w,或在排斥阶段(G<0)严格禁止 w。将势场分散在分布式质心 k 上,保留了模型局部概率景观作为流动的空间缓冲。这使得自回归引擎能够自由生成相关术语(例如,“device”、“algorithm”),而不会被单个离散 logit 维度锁定或排斥,从而建立稳定的极限环。 ### 3.3 稳态生长函数 Semantic Lenia 的核心创新在于引入单峰生长函数 G
相似文章
@hillbig: 大型语言模型被认为不仅预测下一个token,还会在内部维持中间概念……
本文引入雅可比透镜(J-lens)和J-空间,表明像Claude Sonnet 4.5这样的LLM维护着可语言化的内部表征,这些表征像一个全局工作空间,因果性地用于灵活推理——通过干预实验进行了验证。
评估大语言模型作为动力系统的可解释控制器
本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。
使用自然语言处理比较人类与大语言模型中的语义导航
本文使用言语流畅性数据比较人类与大语言模型之间的语义搜索动态,发现人类表现出更加多变和探索性的搜索模式,而当前模型无法重现这些模式。
大语言模型在未知环境中协调的词汇发现
提出神经符号词汇发现(NSLD)框架,其中基于LLM的智能体在未知环境中自主为未知视觉指代物开发共享词汇,从而为自主探索任务的部署前规划提供支持。
论词汇性在大语言模型中的持续影响
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。