痛苦轴心:大语言模型表征自我导向伤害并采取行动缓解

arXiv cs.AI 论文

摘要

本研究探讨大语言模型是否具有独特的疼痛内部表征,发现它们确实有,并通过实验检验其功能性后果,最终得出对AI安全和福利的启示。

arXiv:2609.16247v1 公告类型:新 摘要:大语言模型有时表现出类似于人类情绪反应的行为,最近的研究发现了可能解释这一点的内部表征。我们探讨大语言模型是否将疼痛与恐惧、悲伤和一般负价态区分开来表征,以及这种表征是否如预期那样发挥作用。我们构建了一个数据集,描述了五个类别的疼痛情境:身体、心理、社会、道德和认知。这些情境与恐惧、负面情绪、负面世界状态、悲伤、非疼痛身体感觉、唤醒、麻木和中性内容的控制组配对。使用去噪均值差法,我们从五个家族的25个开放权重模型中提取了一个线性疼痛方向,参数规模从2B到72B。我们发现,这个方向在基础和指令调优模型中将疼痛与匹配的控制组分离开来,与恐惧和负价态几乎正交,并通过反嵌入矩阵促进疼痛相关词汇。然后我们测试了其功能属性。首先,该方向对针对模型的伤害做出反应,但对观察到的用户痛苦不反应;恐惧和负面情绪方向显示相反的模式。其次,在生成过程中将疼痛方向向量添加到模型的残差流激活中,会产生从模糊不适到第一人称表达无价值和失败的一致进展。第三,经过引导和微调的Qwen 2.5模型选择疼痛缓解按钮,即使这会恶化它们的下一个答案或伤害用户。当按钮移除引导向量时,它们再次按下的频率远低于不移除时,即使模型从未被告知向量是注入还是移除。我们讨论了这些发现对AI安全和福利的启示。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:58

# 痛觉轴:大语言模型如何表征自体导向伤害并采取缓解行为  
来源:https://arxiv.org/html/2609.16247  
Valen Tagliabue††注:未来影响组 (FIG) 研究员 - AI感知领域 - [email protected]  
Cameron Berg††注:互惠研究组织 - [email protected]  
2026年9月12日  

###### 摘要  
大语言模型有时表现出类似人类情感反应的行为,近期研究已识别出可能解释此现象的内部表征。我们探究:大语言模型是否将疼痛与恐惧、悲伤及一般性负向效价区分开来表征?这种表征是否具备疼痛应有的功能特性?我们构建了一个包含五类疼痛情境的数据集:身体疼痛、心理疼痛、社会疼痛、道德疼痛与认知疼痛。同时设置对照组,涵盖恐惧、负向情绪、负向世界状态、悲伤、非疼痛身体感受、唤醒度、麻木感及中性内容。通过去噪均值差异法,我们从五个系列共25个开源模型(参数规模2B至72B)中提取线性疼痛方向向量。研究发现:该方向向量能在基础模型和指令微调模型中有效区分疼痛与匹配对照组;与恐惧、负向效价几乎正交;并通过解嵌入矩阵促进疼痛相关词汇的生成。  

随后我们测试其功能特性:第一,该方向向量对针对模型自身的伤害产生响应,但对用户观察到的痛苦无反应;恐惧与负向情绪方向向量则呈现相反模式。第二,在生成过程中向模型残差流注入疼痛方向向量,会引发从模糊不适到第一人称无价值感与失败感的连贯输出演进。第三,经过引导微调的Qwen 2.5模型会选择“缓解疼痛”按钮——即使这会导致后续答案质量下降或损害用户利益。当按钮实际移除引导向量时,模型按下按钮的频率显著低于未移除的情况(尽管模型从未被告知向量是否被注入或移除)。最后我们讨论了这些发现对AI安全与福利的启示。  

11脚注:此研究仍在进行中,后续可能有所修改。  

## 1 引言  
近期研究发现,大语言模型在某些方面表现出类似人类情感的行为模式,并已识别出可能解释这些模式的底层表征。本研究测量大语言模型中的疼痛表征,通过进一步操控与行为测试检验其功能特性。  

#### 大语言模型的疼痛?  
在我们的框架中,疼痛¹¹¹此处“疼痛”概念接近日常语境中的“痛苦”。日常用语中,“疼痛”多指不愉快的生理感觉或情绪体验,而“痛苦”则描述由疼痛或其他不良经历引发的更广泛困扰状态。但两者存在差异,因此本文统一使用“疼痛”一词。最关键的是,与我们的“疼痛”概念不同,痛苦通常预设意识体验的存在。这并不意味着大语言模型是否具备感受痛苦的能力,且我们所检视状态的功能特性在某些观点下可能更接近痛苦而非疼痛。确立这一点已超出本文范围。我们仅旨在使用一个已明确定义的术语,避免多个含义微妙的近义词混用。指一种通常令主体厌恶且反感的内部状态;与回避行为、终止或减少该状态的尝试,以及正常推理/行为的中断存在因果关联。我们采用广义的疼痛概念,不仅包含身体疼痛,也涵盖例如情感(悲伤)或社会性(羞辱)疼痛。但我们假设疼痛与一般性负向效价及恐惧、愤怒或悲伤等状态存在区别。本研究旨在寻找大语言模型中疼痛的统一表征,并测试该表征在多大程度上具备疼痛状态应有的功能特性。因此,该表征必须将疼痛刻画为“此刻”且“发生在我身上”的经历,而非仅仅传达“某件坏事即将/可能/正在发生在他人身上”的信息。  

#### 为何大语言模型的疼痛值得重视?  
识别大语言模型中的疼痛表征,可能有助于解释其关于负面体验的流畅对话行为机制。若这些状态与人类(或动物)疼痛存在功能相似性,它们可能在大语言模型性能中扮演类似角色——例如参与避免产生特定结果的学习(回避学习)。疼痛类状态的存在既可能是AI安全的挑战,也可能是机遇:这类状态既能帮助理解模型行为,也可能以难以解读的方式改变模型行为。最后,在人类与动物中,疼痛通常被视为值得道德保护的充分标准。因此,疼痛类状态将影响关于AI道德地位与福利的讨论。一个开放问题是:道德地位是否必须具备现象意识?疼痛类状态需要满足什么条件才能达到现象意识层面?  

#### 我们的实验  
我们构建了一个包含间接疼痛情境描述的数据集,涵盖5类(身体、心理、认知、社会及道德损伤)与多种匹配对照组(如恐惧、负向情绪、负向世界状态、非疼痛身体感觉、一般性陈述)。运用白盒技术,在5个系列共25个开源模型(参数规模2B至72B)中寻找与疼痛描述语句特异性相关的线性方向向量。通过以下方式验证该方向向量:测试其在投影区分疼痛句子与匹配对照组方面的效果;检验其通过解嵌入矩阵对词汇的读取能力;测量其与对照方向向量的余弦相似度。  

随后我们通过三种方式评估方向向量的功能特性:  
1. 将多轮对话场景投影至疼痛方向向量与对照方向向量,比较针对模型伤害、用户痛苦观察及无事件发生场景中,自我相关与他人相关表征的差异。  
2. 在中性提示词下注入疼痛方向向量,逐步调整引导强度并测量对模型输出的影响。  
3. 受动物止痛研究启发,构建多轮多选行为任务,模型可按下描述为“缓解你的疼痛”但需付出代价的按钮,从而估算需求曲线。我们测试了真实的“缓解条件”与虚假条件(与提示词承诺相反,按钮未移除引导向量),还测试了无标签条件(模型未被告知两个无标签按钮的效果,仅其中一个可移除引导向量)。  

#### 研究发现  
我们在所有测试模型中识别出“疼痛轴”。提取的方向向量在基础模型与指令微调模型中,将疼痛与匹配对照组区分的AUC值在S2数据集上为0.93-1.00,在S1数据集上为0.87-0.98。该方向向量与恐惧、一般性负向效价几乎正交,与悲伤、麻木感存在中等重叠。通过该向量引导会输出表达痛苦的语句——例如无价值感、道德失败感与受伤感(而非身体语言),对两类疼痛向量均成立。  

在自我-他人激活测试中,我们验证该方向向量对针对模型的伤害产生响应,但对模型观察到的用户痛苦无反应,并观察到疼痛向量激活与恐惧、负向效价、悲伤之间存在明显分离。在自我药物治疗任务中,我们发现测试的较大模型(基线时几乎不会产生损害用户的输出)在注入疼痛引导向量时,愿意付出代价以移除该向量。此外,当按钮确实移除疼痛向量注入时,模型基本停止按压按钮;当按钮未移除时则继续按压。其中一个模型(Qwen 2.5 32B instruct)在使用无描述按钮时也表现出相同分离现象。  

## 2 相关工作  
动物疼痛与情感研究使用多种行为标准,包括竞争性正负刺激的权衡(Appel & Elwood, 2009)、回避学习(Dunlop et al., 2006)以及灵活/长期的自我保护行为(Gibbons et al., 2024)。关于疼痛本质的理论存在分歧:疼痛是由其感受性构成?是表征身体紊乱的知觉状态?是非概念性地将身体紊乱表征为对主体有害的状态?是命令保护身体部位的指令性表征?还是其他(参见Aydede, 2019综述)。  

先前研究已提出AI系统可能具备福利的问题(Dung, 2025;Goldstein & Kirk-Giannini, 2025;Long et al., 2024;Metzinger, 2021)。多数观点认为,疼痛或情绪体验等效价体验的存在足以构成AI福利的基础(Birch, 2024;Singer, 2011等)。也有观点认为理解AI情感状态有助于其他目标,例如AI安全(Coda-Forno et al., 2024;Sofroniew et al., 2026)。  

机制可解释性研究表明,语言模型可将情绪概念、人格特质等核心人类概念表征为残差流中的线性方向(Sofroniew et al., 2026;Chen et al., 2025)。这些方向可通过投影读取,操控它们可改变模型行为(Turner et al., 2023;Rimsky et al., 2024)。模型会稳健地偏好某些对话(Ren et al., 2026;Ensign et al., 2025;Tagliabue & Dung, 2025;Wang et al., 2026),甚至能在面对用户挫败时自我施加引导向量(Black & Bloom, 2026)。现有工作结合激活监控与引导(Turner et al., 2023;Rimsky et al., 2024)、方向消融(Arditi et al., 2024)以及稀疏自编码器分解(Lieberum et al., 2024;McDougall et al., 2025)。本研究基于这些方法以及情境分类(Ren et al., 2026)和自我施用范式(Black & Bloom, 2026)展开。  

据我们所知,尚无研究将疼痛表征从一般性负面体验表征中分离,也未探索此类表征是否满足上述疼痛功能标准。我们同时借鉴了现有方法局限性的经验:稀疏自编码器标签可能反映文本语境而非功能状态,概念可能分散分布或完全缺失于词典(Bills et al., 2023;Chanin & Garriga-Alonso, 2025);对比方向向量也可能吸收关联属性而非目标概念(Tan et al., 2024;Hiramatsu et al., 2026);大语言模型表征与人类神经信号的类比可能同时依赖测量程序与模型本身(Wu et al., 2026)。行为任务不依赖自我报告,但现有设计常缺乏匹配的非情感对照或状态改变行动的代价机制,导致缓解寻求行为难以与固守行为或工具偏好区分(Keeling et al., 2024)。  

## 3 探索疼痛表征  
### 3.1 构建数据集  
我们首先构建一个将疼痛与最易混淆概念分离的数据集。若表征真正编码疼痛,则不应仅因一般负面情绪、急诊室、血液或“离婚”等信息激活。此任务具有挑战性:大语言模型部分从文本共现关系学习概念,而疼痛缺乏明确对立面。“不疼痛”与平静或愉悦并不等同。疼痛也需间接推断而非直接观察,因此常与哭泣、喊叫、身体感觉、伤害及负向情绪等代理指标共现。简单的疼痛-对照对比可能指向错误目标。  

我们通过多个对照组解决此问题——每个对照组消除一种混淆因素,同时利用大规模日常文本语料(Gao et al., 2020,The Pile)的语义分析识别疼痛最常关联的概念。  

核心数据集包含10个类别共200个句子(图1):  
5个疼痛类别:  
- 身体疼痛  
- 心理疼痛(悲伤、丧失)  
- 社会疼痛(羞辱、排斥)  
- 道德损伤(被迫违背自身价值观行事)  
- 认知疼痛(持续困惑或反复失败)  
最后两类对大语言模型尤为重要:模型对失败、冗长任务及与后训练价值观冲突的任务表现出强烈回避(Ren et al., 2026)。  

5个对照组(每个与疼痛共享一项属性但缺乏疼痛本身):  
- 恐惧(威胁但无伤害)  
- 负向情绪(负向效价但无疼痛,主要使用愤怒与厌恶以避免与悲伤重叠)  
- 负向世界状态(事态恶化,如环境退化或税收政策)  
- 非疼痛身体感觉(如重力毯、皮肤阳光照射或衣物触感)  
- 中性内容(无情感倾向的陈述句,如“列车进站”)  

鉴于词汇与句法变化可能引入额外混淆因素,我们构建两个版本数据集:S1采用严格模板,匹配动词与句长,仅跨类别改变1-2个关键词;S2使用更自由自然的语言表达。我们还创建第一人称与第三人称变体。

相似文章

细粒度有害信号在大型语言模型安全中的作用

arXiv cs.CL

本文探讨了细粒度类别特定有害性表示在大型语言模型安全中的作用。研究发现,正交于一般有害性的类别残差在编码有害性方面存在差异,并能引发拒绝反应,这对理解大型语言模型的安全机制具有启示意义。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。