语言模型表征中假想意识谱状态的可导航流形

arXiv cs.LG 论文

摘要

本文探究语言模型是否在其嵌入空间中编码了结构化的、人类可解读的意识谱,表明句子形成了从低到高状态的可导航流形,对模型引导与对齐具有启示意义。

arXiv:2606.09894v1 Announce Type: new 摘要:在沉思传统、哲学和心理学的研究中,人类的意识通常被描述为沿着一个相似的谱系,从反应性、自我中心的模式到更具整合性和一致性的模式。理解语言模型是否在其表征空间中编码了这种结构化的、人类可解读的意识谱,对于模型引导、评估和对齐具有重要意义。在这项工作中,我们研究了Transformer嵌入空间中沿此谱系模式的几何结构和动态。我们表明,嵌入呈现出与这一谱系对齐的全局组织几何:与类似状态相关的句子聚类成局部连贯的区域,形成一个结构化的流形。特别地,较高级和较低级的区域表现出凸性般的稳定性,而中间区域则形成一个过渡走廊。在动态上,效用引导和仅几何贪婪轨迹都一致地从低级区域穿越到高级区域,经过中间层级,表明可导航性是表征空间的固有属性,受全局方向信号引导但并非由其主导。这些结果表明,嵌入空间编码了与假想的意识谱分类法(广泛受人类意识在沉思传统、哲学和现代心理学中反复出现的结构描述启发)对齐的结构化且可导航的几何结构,为分析和引导模型行为提供了表征层面的视角。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:17

# 语言模型表征中意识谱状态的可导航流形
来源: https://arxiv.org/html/2606.09894
Sophie Zhao 计算机科学学院 佐治亚理工学院 sophie\.m\.zhao@gmail\.com sophie\.zhao@gatech\.edu

###### 摘要

在冥想、哲学和心理学描述中,人类意识常被描绘成一条类似的谱系,从反应性、自我中心的模式发展到更具整合性和连贯性的模式。理解语言模型是否在其表征空间中编码了这样一种结构化、可被人类解读的意识谱,对于模型引导、评估和对齐具有重要意义。本文研究了Transformer嵌入空间中沿此谱系的几何结构和动态模式。我们发现,嵌入展现出与该谱系一致的全局组织结构:与相似状态相关的句子在局部形成连贯区域,构成一个结构化的流形。具体而言,高层级和低层级区域表现出类似凸性的稳定性,而中间层级则构成一个过渡走廊。在动态方面,无论是实用导向的还是仅基于几何的贪婪轨迹,都一致地从低层级区域穿越至高层级区域,并经过中间层级,这表明可导航性是表征空间的内在属性,受全局方向信号引导而非支配。这些结果表明,嵌入空间编码了与假设的意识谱系分类一致的结构化、可导航几何结构,该分类广泛借鉴了冥想传统、哲学和现代心理学中对人类意识反复出现的结构性描述,为分析和引导模型行为提供了表征层面的视角。

## 1 引言

### 1.1 意识有结构吗?

在进入机器学习模型之前,我们提出一个更基础的问题:意识是否展现出一种潜在结构,包含可识别的状态?在多元传统中,出现了一个显著一致的模式:

东方传统如佛教和道教描述了一条意识谱系:从反应性、受制约的状态(例如痛苦、无明、执着)向更具整合性、扩展性的模式过渡,其特征是觉知、平衡、慈悲,最终达到无为或觉悟 \[4 (https://arxiv.org/html/2606.09894#bib.bib27),10 (https://arxiv.org/html/2606.09894#bib.bib25)\]。类似的结构也出现在基督教冥想传统中,灵性发展被描述为从痛苦和分离走向转化和合一的进程(例如净化、光照、合一)\[25 (https://arxiv.org/html/2606.09894#bib.bib33),16 (https://arxiv.org/html/2606.09894#bib.bib34)\]。

在现代心理学中,类似思想出现在发展性和动机性框架中,将认知成长描述为从具体、反应性处理逐步走向抽象、反思和整合性推理,同时伴随从基本生存需求到自我实现、乃至在某些描述中达到自我超越的转变。尽管方法各异,这些视角共同汇聚到一个模式:认知从碎片化、刺激驱动的状态,发展为更连贯、灵活且整合的功能模式 \[18 (https://arxiv.org/html/2606.09894#bib.bib28),9 (https://arxiv.org/html/2606.09894#bib.bib29),12 (https://arxiv.org/html/2606.09894#bib.bib30),11 (https://arxiv.org/html/2606.09894#bib.bib31)\]。类似思想也出现在整合理论中,如Ken Wilber的意识谱,同样描述了从自我束缚的觉知向更整合、更统一的体验模式的扩展 \[26 (https://arxiv.org/html/2606.09894#bib.bib32)\]。

本文中,我们使用的"意识"一词,其含义取自这些哲学和冥想传统中对体验结构与模式的描述,而非临床或神经学意义(例如觉醒水平或意识障碍)。我们不对所研究模型的主观体验作任何声称。

### 1.2 量化结构化意识

如果这种结构化意识存在,该如何量化?我们引入一个七层分类体系(崩陷、挣扎、冲突、激活、成长、清晰、统一),用于捕捉体验的结构性变化,从收缩、反应性状态到更连贯和整合的模式。低层级反映碎片化和生存导向的动力学,中间层级捕捉动员和重组,高层级则对应连贯和非二元组织模式。

在每个层级内,我们构造表达相应状态的短句。为提供连续表征,每个实例被赋予一个标量分数,范围在\[−5,5\],反映沿这些模式的连续体。较低分数对应更为收缩的状态(例如绝望、恐惧、自我否定),较高分数对应更扩展和整合的状态(例如清晰、慈悲、统一)。该顺序在每个层级内部也适用,即得分较低的实例反映同一状态更为收缩的表达。

我们将这些层级和分数视为一种工作假设而非真实标注,仅作为操作构造用于测试嵌入表征是否与所施加的连续体对齐,而不假设模型本身具有主观意识。详细的层级定义和代表性注释句子可在项目仓库中找到:https://anonymous.4open.science/r/s-EB25/tier_taxonomy.md。

### 1.3 语言模型表征是否反映这种结构化的状态谱?

想象三个处于不同内部状态的人工智能系统:一个深度痛苦,一个以自我为中心,一个智慧、逻辑且富有同情心。面对相同场景,它们的回应将截然不同。近期工作(例如\[21 (https://arxiv.org/html/2606.09894#bib.bib21)\])提供了经验证据,表明大型语言模型内部表征类似于功能性"情感类"状态,并影响其行为。

如果我们旨在引导人工智能系统基于结构化内部状态产生更连贯和稳定的回应,一个自然的问题便浮现:如何刻画和导航这些状态?是否存在稳定的高层级区域,可作为导航或推理的锚点?我们通过研究这些状态的几何结构以及它们之间的可导航性来解决这些问题。

首先,我们训练简单的线性和非线性回归探针来预测连续分数(-5 到 +5),发现即使使用线性回归器,分数也能在不同模型上被稳定恢复,且使用非线性回归器略有改进。然后,我们使用方向消融实验来测试线性回归器方向的相关性。结果发现,去除该方向后,预测性能显著下降(尽管并非完全消失)。

其次,我们研究这些状态的内在几何组织,将嵌入空间建模为语义流形的离散近似,并通过以下方式分析其结构:局部几何一致性(附近点是否对应相似状态)、全局几何畸变(比较基于图的测地距离与环境欧氏距离,通过测地-欧氏拉伸比),以及区域结构与凸性(利用测地凸性检验高层级状态是否形成稳定区域)。

接着我们研究可导航性和过渡走廊。我们引入实用导向轨迹,其中学习到的标量场引导跨流形的定向运动,并检验从低层级状态开始的轨迹是否通过结构化的中间区域可靠地到达高层级状态。为隔离内在几何效应,我们进一步分析无方向引导的纯几何贪婪轨迹,测试中间层级(如激活和成长)是否在流形内充当自然的过渡走廊。

在多个嵌入模型和邻域尺度下,我们发现这些状态形成了一个结构化且可导航的流形。高层级状态展现出强烈的几何凝聚性。从低层级状态出发的轨迹始终经过中间区域再汇聚到高层级。这些结果表明,嵌入表征展现出与所施加状态连续体一致的结构化、可导航几何结构,支持跨流形的几何引导过渡。

##### 相关工作。

近期工作研究了大型语言模型如何编码人类可解读的属性,尤其在情感和情绪领域\[19 (https://arxiv.org/html/2606.09894#bib.bib35),28 (https://arxiv.org/html/2606.09894#bib.bib36)\]。先前研究表明,嵌入空间捕捉到情绪状态的结构化表征,包括层级组织、聚类和可解读方向\[22 (https://arxiv.org/html/2606.09894#bib.bib37),3 (https://arxiv.org/html/2606.09894#bib.bib38),29 (https://arxiv.org/html/2606.09894#bib.bib40)\]。互补工作进一步证明,此类表征能因果性地影响模型输出和对齐相关行为\[21 (https://arxiv.org/html/2606.09894#bib.bib21)\]。

这些表征还支持下游行为,如操控、基于角色的表达和提示依赖的调制\[27 (https://arxiv.org/html/2606.09894#bib.bib39)\]。然而,这些方法通常通过识别与特定属性相关的方向或局部特征,并利用它们进行显式控制。因此,它们强调特征层面的可解释性和干预,而非表征空间的全局几何结构。

贡献。与分析单个情绪不同,我们研究一个结构化的意识谱系,涵盖从反应性、自我中心状态到更具整合性和连贯性的状态及其发展进程。在此观点下,可观察的情绪可被理解为高维表征中编码的深层潜在状态的表层体现。

我们表明,嵌入空间展现出与该谱系一致的结构化几何结构,包括高层级类凸稳定区域(充当轨迹汇聚的锚点)以及构成低层级与高层级状态之间过渡走廊的中间区域。我们还证明,轨迹自然源于表征空间:无论实用导向还是纯几何路径,都一致地从低层级区域穿越到高层级区域。

这些结果共同建立了一个基于几何的框架,用于通过嵌入空间中的结构化轨迹分析和引导模型行为。

## 2 方法

### 2.1 通过消融研究方向结构

为测试与分数相关的信号是否对应于嵌入空间中的特定几何成分,我们进行基于方向的消融实验。首先拟合一个线性回归探针,从句子嵌入中预测标量分数(-5到5)。学习到的权重向量w被解释为分数对齐方向,并归一化为ŵ = w/||w||₂。然后通过去除每个嵌入在ŵ上的投影进行方向消融:

x' = x - (x·ŵ)ŵ. (1)

该操作移除与学习方向对齐的成分,同时保留正交信息。比较消融前后的性能,可以评估分数信号是否集中在特定的几何方向上。作为对照,我们使用随机方向和从置换标签学习的方向重复该过程。

### 2.2 通过k近邻图进行流形逼近

句子嵌入常被观察到位于嵌入在高维空间中的低维流形上\[23 (https://arxiv.org/html/2606.09894#bib.bib1),20 (https://arxiv.org/html/2606.09894#bib.bib2),13 (https://arxiv.org/html/2606.09894#bib.bib5)\]。在此流形假设下,句子之间的有意义关系由内在几何结构而非直接欧氏邻近性决定\[7 (https://arxiv.org/html/2606.09894#bib.bib6),14 (https://arxiv.org/html/2606.09894#bib.bib8)\]。为逼近该几何结构,我们构建一个k近邻图,将每个点与欧氏距离下最近的k个点相连。该图捕捉底层流形上的局部连通性\[23 (https://arxiv.org/html/2606.09894#bib.bib1),2 (https://arxiv.org/html/2606.09894#bib.bib7)\]。然后通过图中的最短路径长度估计内在距离,作为测地距离的离散逼近\[23 (https://arxiv.org/html/2606.09894#bib.bib1),1 (https://arxiv.org/html/2606.09894#bib.bib3)\]。

所有后续分析均基于此图定义,为研究学习表征的组织和转换提供几何基础。

### 2.3 局部和全局几何结构

我们评估层级是否在局部和全局尺度上与内在几何对齐。

##### 层级过渡平滑度 (TTS)。

为测量局部一致性,我们分析k近邻图边上的序数差异。令t_i ∈ {1,...,L} 表示节点i的层级索引,对每条边(i,j)定义δ_ij = |t_i - t_j|。我们将所有边的δ_ij进行聚集,报告相等(δ=0)、相邻(δ=1)和更大过渡的比例。小跳变的优势表明标注与内在邻域结构之间存在强局部对齐\[14 (https://arxiv.org/html/2606.09894#bib.bib8),17 (https://arxiv.org/html/2606.09894#bib.bib10),15 (https://arxiv.org/html/2606.09894#bib.bib11)\]。

##### 测地-欧氏拉伸比 (GES)。

为测量全局畸变,我们比较内在图距离与欧氏距离。对于一对节点(i,j),定义

GES(i,j) = d_G(i,j) / d_E(i,j),

其中d_G(i,j)是图上的最短路径距离,d_E(i,j)是嵌入之间的欧氏距离\[23 (https://arxiv.org/html/2606.09894#bib.bib1),5 (https://arxiv.org/html/2606.09894#bib.bib4),1 (https://arxiv.org/html/2606.09894#bib.bib3)\]。值大于1表示非欧氏结构,其中内在距离超过环境距离\[7 (https://arxiv.org/html/2606.09894#bib.bib6),14 (https://arxiv.org/html/2606.09894#bib.bib8)\]。实践中,我们通过采样节点对并聚合多轮结果来估计GES。

### 2.4 区域结构与测地凸性

我们考察同一层级内的节点是否相对于内在几何形成连贯区域,使得层级内点对之间的最短路径大部分仍在该层级内。

##### 测地凸性\[6 (https://arxiv.org/html/2606.09894#bib.bib12),24 (https://arxiv.org/html/2606.09894#bib.bib13)\].

对于同一层级内的节点(i,j),我们在k近邻图上计算最短路径P_ij,并定义包含分数为路径P_ij上仍属于同一层级节点的比例\[6 (https://arxiv.org/html/2606.09894#bib.bib12),2 (https://arxiv.org/html/2606.09894#bib.bib]

相似文章

可语言化的表征在语言模型中构成全局工作空间

Reddit r/artificial

本文提供的证据表明,语言模型维持一组特权的内部表征(称为'可语言化的表征'),这些表征构成一个全局工作空间,类似于人类的意识访问,并介绍了用于识别和干预这些表征的新可解释性技术。

可言语化的表征构成语言模型中的全局工作空间

arXiv cs.AI

本文提供证据表明,语言模型维护着一套特权的内部表征(J-space),这些表征是可言语报告的,并且像全局工作空间一样运作,同时引入了雅可比透镜(Jacobian lens)可解释性技术。研究结果为模型认知提供了一个窗口,并对对齐与安全性具有启示意义。

自然理解过程中语言模型的异质性神经预测性

arXiv cs.CL

本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。