多种心理空间的单一机制:语言模型中共享路由器作用于值槽
摘要
本文研究了 Transformer 语言模型如何通过值槽上的共享路由器机制实现多种心理空间(反事实、信念、虚构等),证明单个低秩子空间控制所有空间类型并驱动推理。
arXiv:2607.10248v1 公告类型:新
摘要:语言构建了除现实之外的话语语境:一幅画、一种信念、一段记忆、一个假设。每一种都是一个心理空间,同一实体在其中可以具有不同的值,例如一朵花在现实中是红色的,但在画中却是紫色的。形式语义学将这些语境分开,因为它们的逻辑不同(模态、时间、信念、描绘);Fauconnier 的心理空间理论将它们视为单一的空间构建操作。我们探究了 Transformer 语言模型实现了哪一种,并发现了 Fauconnier 统一理论的机制版本。该模型在整个清单中使用一个路由器/槽格式:一个可复用的值槽存储属性内容,一个因果可操纵的路由器(空间索引)选择读取哪个空间。使用分布式对齐搜索训练的控制一种空间类型(反事实、信念、虚构或时间)的子空间,在三个模型家族中也控制了其他类型,远高于随机基线;信念在形式语义学中被标记为特例,但并未被特别分离。路由器是低秩的,与实体身份可加性组合,并通过少数几个后期层头部起作用。另外两个结果表明该机制驱动推理并组合:一个在规则推导结论上训练的子空间会翻转模型的推理输出,同时与模型的报告分离;而组合空间构建器则会在共享槽上铸造一个新的路由器。本文确立了跨类型的普遍性。配套论文深入探讨了信念,因为它在哲学、心理学和语言学(认识论、心智理论和命题态度报告)中具有特殊地位。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 一种适用于多种心理空间的机制:语言模型中基于值槽的共享路由器 来源:https://arxiv.org/abs/2607.10248 查看PDF (https://arxiv.org/pdf/2607.10248) > 摘要:语言会构建除现实之外的各种话语语境:一幅画、一种信念、一段记忆、一个假设。每一种都是一个心理空间,同一实体在其中可以具有不同的值,例如,一朵花在现实中是红色,但在肖像中却是紫色。形式语义学将这些语境区分开来,因为它们的逻辑不同(模态、时间、信念、描述);而福康涅的心理空间理论将它们视为同一种空间构建操作。我们探究了Transformer语言模型实现的是哪一种方式,并发现了福康涅统一理论的机制版本。该模型在整个库存中使用一种路由器/槽位格式:一个可重用的值槽存储归属内容,而一个因果可操纵的路由器(空间索引)则选择读取哪个空间。使用分布式对齐搜索训练的一个子空间,用于控制一种空间类型——反事实、信念、虚构或时间——也能控制其他空间类型,且效果远高于随机水平,这在三个模型家族上均得到验证;形式语义学将信念视为一种特殊情况,但这里并未被单独区分。该路由器具有低秩特性,与实体身份以加法方式组合,并通过少数几个后期层的注意力头起作用。另外两个结果表明,该机制驱动推理并能够组合:一个基于规则推导出的结论进行训练的子空间,会翻转模型的推断结果,同时与模型报告的内容相分离;而组合空间构建者则会在共享槽位上生成一个新的路由器。本文确立了跨类型的普遍性。配套论文则深入探讨了信念,因其在哲学、心理学和语言学中具有特殊地位(认识论、心智理论以及命题态度报告)。 ## 提交历史 来自:Oliver Steele [查看邮件 (https://arxiv.org/show-email/090b3254/2607.10248)] **[v1]** 2026年7月11日星期六 10:30:36 UTC (1,220 KB)
相似文章
信念与现实分离存在于语言模型中对共享值槽的路由中
本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
可语言化的表征在语言模型中构成全局工作空间
本文提供的证据表明,语言模型维持一组特权的内部表征(称为'可语言化的表征'),这些表征构成一个全局工作空间,类似于人类的意识访问,并介绍了用于识别和干预这些表征的新可解释性技术。
Transformer线性表示高度结构化的世界模型
本文证明,在数独求解轨迹上训练的Transformer构建了由领域约束组织的结构化世界模型,并识别出一个稀疏、单语义的电路,负责裸单决策规则。该工作为Transformer在组合任务上的推理提供了完全可解释的算法描述。
可言语化的表征构成语言模型中的全局工作空间
本文提供证据表明,语言模型维护着一套特权的内部表征(J-space),这些表征是可言语报告的,并且像全局工作空间一样运作,同时引入了雅可比透镜(Jacobian lens)可解释性技术。研究结果为模型认知提供了一个窗口,并对对齐与安全性具有启示意义。