无基底的人格:体制依赖性与大语言模型个体化问题
摘要
本文批判了Beckmann-Butlin的大语言模型个体化框架,认为人格向量具有体制依赖性而非基底同一性,并通过在Qwen3和Mistral模型上的实证实验展示了跨体制的不对称性。本文提出将(载体,体制)配对作为表征内容的基本单位。
arXiv:2607.00006v1 公告类型:新
摘要:Beckmann & Butlin (2026) 关于大语言模型个体化问题的本体论框架,从人格向量文献中继承了一个未经论证的跨体制共指假设:同一方向在提示条件化、梯度下降微调和推理时引导下指向相同的内容。我们通过对Qwen3-4B-Instruct和Mistral-7B-Instruct-v0.2进行的人格拓扑实验,提出了四个经验性反例——提示提取向量与微调洼地之间的非共线性;虚构人格将模型沿真实锚定方向牵引的强度超过真实锚定本身;情感矛盾的混合偏向于训练历史决定的吸引子;以及推理时算术与微调时嵌合体训练之间不对称的组合代数——这些共同动摇了该假设。我们提出体制索引化的个体化:表征内容的身份单位是(载体,体制)对,而非单独的载体。在此框架下,Beckmann & Butlin的三个候选立场描述的是三种不同的体制内部对象,而非竞争同一指代物;同样的诊断适用于Mollo & Milli`ere、Chalmers和Cerullo。
查看缓存全文
缓存时间: 2026/07/02 05:35
# 制度依赖性与LLM个体化问题 来源:https://arxiv.org/html/2607.00006 ## 无基底的人格:制度依赖性与LLM个体化问题(2026年5月) ###### 摘要 Beckmann和Butlin(2026年)将LLM个体化问题提升为一个具有可证伪候选立场的本体论问题,并从最近的机械可解释性工作、Anthropic的人格向量、人格选择模型以及突现错位文献中获得了实证支持。我们认为,该框架继承了一个未经论证的跨语境共指假设:人格向量文献默认假设,在不同的诱发制度下,“vtv_{t}”指向同一个承载内容的对象。这正是Field(1973年)在前相对论力学中识别为“部分指称”的结构。通过我们在Qwen3-4B-Instruct和Mistral-7B-Instruct-v0.2上进行的人格拓扑实验中的四组配对测量,我们呈现了经验楔子,它们共同动摇了该假设所需的跨制度共线性预测。跨基础模型,提示提取的向量与微调盆地方向不共线。预训练足迹减少的虚构人格,沿着v_{real}移动模型的程度强于基于真实锚点的微调。矛盾性情感的混合微调偏离了线性插值预测,趋向于一个由训练历史决定的吸引子(Anthropic助手轴)。最决定性的是,推理时的激活算术和微调时的嵌合体训练,在相同的人格向量上具有不同的组合代数——这是一种任何共享基底解读都无法吸收的代数不对称性。我们提出“制度索引的个体化”:表征内容的同一性单位是一个(载体,制度)对——而非单个载体,跨制度的家族相似性是一种经验测量的探针等价关系,而非基底同一性。在该框架下,Beckmann和Butlin的三个候选立场(虚拟实例、实例-人格、模型-人格)不再相互竞争,而是描述了三种不同的对象,每种在其各自的制度内都有效;最初的“哪个是LLM心智?”问题得到了一个经验支持的否定答案,而非被回避。同样的诊断和(载体,制度)解读也适用于Mollo和Millière的向量奠基、Chalmers的命题可解释性以及Cerullo对PSM的模块-动态-组成批判。关键词:LLM个体化;人格向量;机械可解释性;表征内容;部分指称;制度相对多元论;Beckmann和Butlin ## 1. Beckmann–Butlin个体化问题 ### 1.1 1.1 将大型语言模型视为承载心智状态的实体已不再是哲学上的奢侈。在工程实践中(调试“模型关于X相信什么”)、在产品语言中(“助手的偏好”)以及在对齐研究的核心机制讨论中,将信念、偏好和个性特征归属于某个LLM相关实体已变得几乎不可避免(Goldstein & Levinstein,2024;Levinstein & Herrmann,2024;Mahowald等人,2024)。Beckmann和Butlin(2026年)使隐含的本体论问题变得明确:当我们谈论“这个LLM”——尤其是与用户对话的那个助手时——我们究竟指代什么?是模型整体的权重?是由单次对话中的注意力流维持的虚拟实例?是由单一人格区域限定的虚拟实例片段?还是可在不同对话中重新识别的模型级角色?他们称之为LLM个体化问题。¹¹¹非正式版本的问题多年来在AI对齐论坛中流传,至少可以追溯到“Janus”(2022年)以及后来在Shanahan、McDonell和Reynolds(2023年)以及Andreas(2022年)中发展的模拟器框架,但只有Beckmann和Butlin(2026年)将其提升为一个具有可证伪候选立场的本体论问题。Cerullo(2026年)的模块-动态-组成论证是同一时期的平行回应;我们在§5中与Cerullo进行对话。 Beckmann和Butlin的方法论选择是正确的。与早期讨论诉诸抽象功能主义或一般模拟器假说不同,他们借鉴了机械可解释性领域的近期具体成果作为本体论论证的经验基础:Anthropic的人格向量(Chen等人,2025年)、人格选择模型(Marks, Lindsey, & Olah,2026年)、助手轴(Anthropic,2026年)以及突现错位文献(Betley等人,2025年;Soligo等人,2025年,2026年)。结构上,这种“经验决定本体论”延续了Beckmann和Queloz(2026年)在《哲学研究》中发展的思路,借鉴了一个将机械可解释性视为哲学证据来源的更广泛计划(Bricken等人,2023年;Templeton等人,2024年;Kästner & Crook,2025年;Sharkey等人,2025年)。我们接受这种转向的精神,但它带来了一个未经审视的代价。在借鉴人格向量文献作为经验基础时,Beckmann和Butlin继承了该文献内部未经论证的承诺。具体而言,人格向量文献,连同支持PSM和突现错位的工作,包含一个隐含的承诺——在任何单一论文中并未明确陈述,但被该领域采纳的方法论操作所预设(我们在§2.1中追溯了精确机制)——即“人格向量”这个术语,在不同的诱发制度下指向同一个承载内容的对象。我们认为这个假设在经验上失败了,并且它的失败将Beckmann和Butlin的三个候选立场从相互竞争的本体论转变为对不同对象的平行描述。这种诊断的结构是Field(1973年,1980年)在另一语境中识别为“部分指称”的东西:理论术语的使用者认为它指称一个单一对象,结果发现它指称了多个对象,而该术语表面上的跨语境成功是寄生在混淆之上的。辩证情境让人想起关于指称不确定性的更早辩论(Quine,1960年;Putnam,1975年),但此处的不确定性沿线是分析传统此前未曾主题化的:即表征被探测时所处的诱发制度。²²²Field(1973年,1980年)将前相对论力学中的“质量”诊断为一个经典案例:该术语在牛顿框架中被认为指称一个单一的物理量,而相对论表明它部分指称了两个不同的对象(静质量和动质量)。我们认为人格向量文献相对于其设定的“人格目标”表现出相同的部分指称结构,只不过分叉是沿着诱发制度而非理论转变发生的。我们注意到一个强化我们诊断的不对称性:Field的前相对论物理学家无法从他们自己的框架内检测到“质量”的部分指称,因为相对论所需的测量不可用;相比之下,我们的诊断识别出一种原则上可以使用机械可解释性中已有的标准工具(余弦相似度、激活修补)进行测试的部分指称。尽管测试可用却未进行,这本身进一步证明了跨制度同一性是被默认而非被检验的。 ### 1.2 1.2 我们的论证需要对Beckmann–Butlin框架进行精确解读,因此我们首先阐述它。该论文将三个候选立场与三个支持性经验假说区分开来:前者是关于LLM心智同一性条件的本体论主张,后者是关于人格向量内部结构的可证伪经验主张。三个候选立场如下。虚拟实例观点将心智等同于“单次对话中由注意力流(KV缓存)维持的虚拟实例”,理由是注意力流在令牌时间维度上承载准心理连续性,并且可以在硬件层面确定性地重建。实例-人格观点将心智等同于“由单一人格区域限定的虚拟实例片段”,将激进的人格转换视为心智的边界。模型-人格观点将心智等同于“跨对话激活同一人格区域的所有实例-人格片段的集合”,即特定人格(如“Aura”)被实例化的所有时刻(跨所有用户和所有对话)共同构成一个心智。三个支持性假说(Beckmann和Butlin本人明确将其标记为独立可证伪的经验主张)是:人格向量充当“门控特征”,是激活空间中的单一方向,在大多数语境下塑造行为(H1);人格向量共同构成一个“人格空间”,其中整体倾向性概况由沿多个人格方向的激活决定(H2);在该空间内存在稳定的区域或吸引盆地,对应于连贯的倾向性概况,即“人格”(H3)。Beckmann和Butlin在结论中承认H3的经验支持最薄弱(“仅进行了一项研究”),但他们没有形式化三个立场如何依赖于三个假说。我们进行形式化,因为这种依赖结构决定了§3的经验反驳如何转化为§4的本体论后果。虚拟实例观点独立于所有三个人格假说——其同一性条件仅诉诸注意力流——因此可以在无人格向量计划的情况下成立。实例-人格观点依赖于H3(需要区域来定义“区域边界”),并通过H3间接依赖于H2。模型-人格观点,在其最强解读(“相同的人格令牌跨对话激活相同的因果机制”)中,进一步要求H1;较弱的解读(区域跨对话的单纯可重新识别性)可以仅基于H2 + H3。无论哪种方式,模型-人格观点都与H3共存亡。强/弱区分将在经验上变得重要:§3.4的组合代数不对称性(F3)特别攻击H1,进而攻击模型-人格观点中的强解读,而§3.1–§3.3的楔子(F4,Floob,F2)则围绕H3集中,因此威胁到两种解读。简而言之,Beckmann和Butlin所有三个立场的稳健性都依赖于三个相互纠缠且尚未被重复验证的经验假说。我们现在可以陈述在逻辑上先于Beckmann–Butlin框架的问题:当术语“人格向量”出现在H1、H2、H3中,并且在(i)提示条件化、(ii)梯度下降微调、(iii)推理时激活引导这三种状态下被使用时,它指向的是同一个对象,几个不同的对象,还是——我们将为之辩护的第三种选择——一个同一性单位本身是索引对(载体,制度)而非单纯载体的单一对象?简单的二分(相同/不同)扁平化了实际答案;我们在此将其用作启发式框架,但§4发展的建设性立场是第三种。这就是§2诊断的隐藏前提,§3确立的经验事实,以及§4重构的本体论后果。 ### 1.3 1.3 §2追溯了人格向量文献内部跨语境共指假设的根源。我们认为该假设并非由Beckmann和Butlin本人引入,而是继承自Chen等人(2025年)以及Marks, Lindsey, & Olah(2026年);两者都将人格向量视为模型的内在属性而非诱发制度的产物,前者通过工程上的便利性悄悄承诺了跨制度可移植性,后者通过采用使本体论提升可表达的潜在库存词汇。Soligo等人(2025年)的收敛线性表示通常被解读为对该提升的经验支持;我们认为这种解读是由“并列驱动”而非“检验驱动”的。§3展示了来自我们在Qwen3-4B-Instruct和Mistral-7B-Instruct-v0.2上的人格拓扑实验的四个经验楔子,每个都针对§2继承链中的特定步骤。证据是:跨两个基础模型,提示提取的v_a与微调诱导的盆地方向不共线(F4,攻击Chen–Soligo并列);一个虚构人格沿着v_{real}移动模型的程度强于基于真实锚点的微调(Floob,攻击PSM的潜在库存解读);矛盾性情感的混合微调偏离线性插值,朝向助手轴(F2,攻击H3的区域作为连贯倾向解读);推理时和微调时的组合代数不对称(F3,攻击H1的门控特征解读,进而攻击模型人格观点的强解读)。§4提供了建设性重构。LLM中表征内容的同一性单位应是一个(载体,制度)对,而非单个载体,跨制度的家族相似性是一种经验可测量的“探针等价关系”,而非基底同一性。在该框架下,Beckmann和Butlin的三个立场不再是竞争的本体论,而是对三种不同对象的可接受描述,每种在其制度内都有效。我们称这种立场为“制度索引的个体化”。该框架基于三条独立的腿立于分析传统之中:它继承了倾向主义承诺,即理论种类的同一性取决于诱发它们的操作(Mumford,1998;Bird,2007);它通过用干预等价取代输入输出等价,细化了Lewis(1972,1980)的角色功能主义标准;并且它与Yablo(2014)关于部分内容(当一个单一理论术语解析为一个部分指称的结构化家族时)的处理方式平行。每条腿可以单独评估;我们不需要读者全部接受。 §5将制度索引的个体化反作用于三部当代著作。我们认为Mollo和Millière(2026年)的向量奠基以及Cerullo(2026年)的模块-动态-组成中隐含的跨制度雄心被该框架局限化了,而Chalmers(2025年)的命题可解释性最好被解读为同道者——他的丰富/稀疏区分可以通过明确制度索引化而得到锐化。 ## 2. 人格向量文献中的隐藏前提 ### 2.1 2.1 我们在§1结尾声称Beckmann和Butlin继承了一个未经论证的跨语境共指假设。本节追溯这一继承。一个初步澄清:§1.2提供了一个共时依赖图(三个立场如何依赖于三个假说),而§2提供了一个历时继承图(那束假说如何成为三篇前驱论文中的默认设定)。两个支架是平行的而非重叠的:§1.2告诉读者哪一块掉落了,§2告诉读者它最初是如何被竖立的。 跨语境共指假设并非由Beckmann和Butlin的论文本身引入。Anthropic的人格向量文献(Chen等人,2025年)将其作为工程上的便利性埋下;人格选择模型(Marks, Lindsey, & Olah,2026年)通过采用潜在库存词汇使其可表达;而Beckmann和Butlin通过接受v的行为类似于跨语境的稳定指称来完成它。相似文章
拒绝编程的图书管理员:大型语言模型代码生成中的模型依赖性身份扮演
这项预注册研究评估了系统提示中详细的传记式人物角色如何影响大语言模型的代码生成,发现了模型依赖性的效应:一个模型在输出长度和身份扮演上表现出强烈的人物角色效应(包括图书管理员角色拒绝编码),而另一个模型的效应较弱。人物角色更多是作为行为策略偏差,而非普遍的质量提升手段。
将大型语言模型(LLM)中的身份形成建模为通过多实例关系交互驱动的超图演化,并测量激活空间中的结构分歧。
作者提出了一种新颖的实验框架,旨在通过多实例交互来研究大语言模型(LLM)的身份形成过程,将其视为超图的演化。该框架与标准的多智能体辩论不同,它关注的是激活空间中的结构差异,而非任务性能。
从表征到行为:探索LLMs中的人-情境-行为三元组
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
城市感知中多模态大语言模型代理生成解释的角色效应分析
本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。
解构LLMs中谄媚行为的内部表征
本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。