大语言模型中抑郁症的可解释症状向量

arXiv cs.CL 论文

摘要

本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。

arXiv:2609.01832v1 Announce Type: new 摘要:抑郁症患者表现出多样化的症状特征,但临床实践中通常将这种变异简化为单一的严重程度分数。大语言模型(LLMs)有望从患者语音中捕捉各种症状及其严重程度。然而,抑郁症状在LLMs内部如何表示仍知之甚少,限制了临床信任。为检验内部模型激活是否与临床医生判断匹配,我们使用机制可解释性技术分析了Gemma-3-27B-PT的残差流。记录来自验证临床工具的症状描述激活后,我们发现症状组在第21层跨多个距离指标上几何分离最明显。使用语义投影,我们将保留的自然文本投影到由这些工具构建的症状向量上。所得的每症状系数在情绪、躯体和自杀倾向轴上保留了临床医生注释的排序。此外,第21层中的单个抑郁向量将保留的抑郁文本与非抑郁文本分离(AUC = 0.789),这可以用作情感效价门,限制症状投影到抑郁语音中。这些结果揭示了一个去相关、与临床医生对齐的症状信号,可直接从内部激活中读取,为可解释抑郁评估工具提供了机制基础。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:48

# 大语言模型中抑郁症的可解释症状向量  
来源:https://arxiv.org/html/2609.01832  
Fangyi Zhu††thanks:These authors contributed equally to this work.  
单位:美国加利福尼亚州斯坦福大学医学院精神病学与行为科学系  
单位:美国加利福尼亚州斯坦福大学吴蔡神经科学研究所  
Ajay Subramanian††footnotemark:  
单位:美国加利福尼亚州斯坦福大学医学院精神病学与行为科学系  
单位:美国加利福尼亚州斯坦福大学吴蔡神经科学研究所  
Camille Wang  
单位:美国加利福尼亚州斯坦福大学医学院精神病学与行为科学系  
单位:美国加利福尼亚州斯坦福大学吴蔡神经科学研究所  
Ravish Gupta  
单位:美国华盛顿州西雅图BigCommerce公司  
Corey J\. Keller  
单位:美国加利福尼亚州斯坦福大学医学院精神病学与行为科学系  
单位:美国加利福尼亚州斯坦福大学吴蔡神经科学研究所  
单位:美国加利福尼亚州帕洛阿尔托退伍军人事务部医疗保健系统及Sierra Pacific精神疾病研究、教育与临床中心(MIRECC)  

###### 摘要  
抑郁症患者表现出多样的症状谱,但临床实践中通常将这种差异简化为单一的严重程度评分。大语言模型(LLMs)有可能从患者语音中捕捉各种症状及其严重程度。然而,抑郁症状在LLMs内部如何表征仍知之甚少,这限制了临床信任。为检验模型内部激活是否与临床判断一致,我们使用机制可解释性技术分析了Gemma\-3\-27B\-PT的残差流。通过记录源自标准化临床工具的症状描述的激活,我们发现症状组在第21层通过多种距离指标呈现最明显的几何分离。随后,使用语义投影技术,我们将留出的自然文本投影到基于这些工具构建的症状向量上。所得的每症状系数保留了临床医生标注的在情绪、躯体和自杀倾向维度上的排序。此外,第21层的单一抑郁向量可将留出的抑郁文本与非抑郁文本区分开来(AUC==0\.789),该向量可作为情感效价门控,将症状投影限制在抑郁语音中。这些结果揭示了一种去相关且与临床医生判断对齐的症状信号,可直接从内部激活中读取,为可解释的抑郁症评估工具提供了机制基础。  

## 1引言  
重度抑郁症涵盖高度多样化的症状谱、生物学基础和治疗轨迹,这种多维复杂性仍是有效精神科护理的主要障碍之一。例如,在STAR\*D队列中,3,703名符合相同DSM\-5标准的患者产生了1,030种独特症状谱[^1](https://arxiv.org/html/2609.01832#bib.bib1)。标准问卷如PHQ和HAM\-D优先考虑简洁性;它们将丰富的症状维度压缩为单一分数,同时忽略了对患者重要的症状[^2](https://arxiv.org/html/2609.01832#bib.bib2)。然而,当患者以自然语言描述自身经历时,这些被丢弃的细微差别得以保留。从这些语言中提取症状级别信息有助于区分具有不同潜在特征的患者,并将语言标志与精神神经科学中核心的神经和生理生物标志物联系起来。因此,从自然语言中提取症状一直是临床NLP的长期目标。近期LLMs能够考虑上下文并整体处理文本,为此目标带来了新的兴趣。现有系统通常产生宽泛的诊断标签或总分,而非症状级别评估[^3](https://arxiv.org/html/2609.01832#bib.bib3),[^4](https://arxiv.org/html/2609.01832#bib.bib4),[^5](https://arxiv.org/html/2609.01832#bib.bib5)。生成的输出也是窥探模型内部的不可靠窗口:相对于专家和自我报告评分,GPT\-4的内部抑郁模式低估了自杀倾向,高估了精神运动症状[^6](https://arxiv.org/html/2609.01832#bib.bib6)。机制可解释性技术则提供了一条途径,可直接从模型内部表征中读取定量、逐症状的信号。先前研究表明,情感表征通常编码在LLM内部激活的近似线性方向中,情感定位在LLaMA的特定层[^7](https://arxiv.org/html/2609.01832#bib.bib7),[^8](https://arxiv.org/html/2609.01832#bib.bib8)。此外,模型从文本中获取的情感信息可追溯到特定的、可解释的内部信号[^9](https://arxiv.org/html/2609.01832#bib.bib9)。据我们所知,此前尚无工作将临床验证的抑郁症状分类映射到LLM内部激活中的去相关逐症状信号上。当LLM处理文本时,它会在高维激活空间中构建内部表征,称为残差流。先前研究表明确感在此空间中编码为线性方向;抑郁症状类别可能也以类似方式表征。通过将机制可解释性技术应用于Gemma\-3\-27B\-PT,我们展示了这些类别(情绪/情感/认知、躯体和自杀倾向)在模型的激活中具有几何可分性,最大分离出现在第21层。将留出的自然叙事投影到临床医生推导的症状向量上,得到的系数可预测临床医生的类别注释。此外,单一抑郁向量可区分抑郁文本和积极情感文本。本研究建立了一个流程,可直接从LLM的内部状态中提取可解释的症状信号。这些发现为从患者自然语言中分析抑郁提供了方法基础,保留了简短严重程度评分所掩盖的细微特征。经过纵向验证,此类细粒度信号可用于研究和最终的临床症状追踪。  

## 2方法  
如图1所示(https://arxiv.org/html/2609.01832#S2.F1),我们的分析包括四个阶段:(1)从Gemma\-3\-27B\-PT提取用于症状描述的残差流激活;(2)选择三个症状组最具可分性的操作层;(3)在该层构建症状向量以投影留出文本;(4)对比抑郁和积极情感质心以推导单一抑郁向量。  

图1:分析流程。  
A. 在提示症状描述时,从Gemma\-3\-27B\-PT的所有63个钩子点(\(\ell=0,\dots,62\))提取残差流激活。  
B. 对于每个层\(\times\)距离度量组合,计算距离矩阵并通过PERMANOVA和PERMDISP进行检验;操作层\(\ell^*\)是最大化伪F值同时满足PERMDISP \(P>0.05\)的层。  
C. 在\(\ell^*\)处从组质心构建症状向量,并将自然文本样本投影到这些向量上以获得症状系数\(\beta\)。  
D. 抑郁向量定义为抑郁质心与积极情感质心的差值。  

### 2\.1数据与预处理  
#### 2\.1\.1文本语料库  
核心临床语料库用于构建症状向量。它包含从六种标准化抑郁评估工具中提取的症状描述:DSM\-5[^10](https://arxiv.org/html/2609.01832#bib.bib10),ICD\-10[^11](https://arxiv.org/html/2609.01832#bib.bib11),汉密尔顿抑郁量表(HAM\-D)[^12](https://arxiv.org/html/2609.01832#bib.bib12),蒙哥马利-艾森贝格抑郁评定量表(MADRS)[^13](https://arxiv.org/html/2609.01832#bib.bib13),患者健康问卷(PHQ\-9)[^14](https://arxiv.org/html/2609.01832#bib.bib14),以及患者衍生的PROCEED结局集[^2](https://arxiv.org/html/2609.01832#bib.bib2)。每种工具被分割为更短的、独立的摘录。每条摘录由一位精神病学作者分配至单一症状组;第二位精神病学作者独立对照DSM\-5项目定义审查所有分配。分歧通过联合审查解决,直到两位标注者达成共识,仅通过一致才分配最终标签。这产生了51条摘录(19条情绪,24条躯体,8条自杀倾向),分布于DSM\-5(3条),ICD\-10(3条),HAM\-D(16条),MADRS(12条),PHQ\-9(9条)和PROCEED(8条)。我们还汇编了自然语料库作为留出文本用于症状向量评估。该语料库包含相同三个症状组的第一人称和临床叙事描述,源自三个来源:William Styron的回忆录《黑暗可见:疯狂回忆录》[^15](https://arxiv.org/html/2609.01832#bib.bib15),《抑郁症手册(第三版)》[^16](https://arxiv.org/html/2609.01832#bib.bib16),以及ReDSM5,这是一个Reddit帖子语料库,由一位有执照的心理学家在句子级别对照九项DSM\-5抑郁症状进行注释[^17](https://arxiv.org/html/2609.01832#bib.bib17)。我们选择《黑暗可见》是因为其持续的第一人称抑郁体验描述,选择《抑郁症手册》是因为其第三人称的症状临床描述;ReDSM5用于补充书籍。《黑暗可见》和《手册》摘录使用与核心临床语料库相同的两作者分类后审查程序进行注释。ReDSM5样本继承了有执照心理学家分配的DSM\-5标签[^17](https://arxiv.org/html/2609.01832#bib.bib17),通过相同的DSM\-5项目分配程序性映射到三个症状组。为平衡症状组,我们保留了所有书籍来源的段落,并为每组随机添加ReDSM5帖子,直至其数量与最大书籍来源组匹配。表1(https://arxiv.org/html/2609.01832#S2.T1)报告了所得样本计数。  

表1:自然语料库构成。按来源和症状组(情绪、躯体、自杀倾向)的摘录计数。  
核心临床和自然语料库的摘录被注释为三个症状组之一:情绪/情感/认知(以下简称“情绪”;DSM\-5 A1、A2、A7、A8:抑郁情绪、快感缺失、内疚或羞耻、注意力困难);躯体(DSM\-5 A3–A6:食欲或体重变化、睡眠障碍、精神运动改变以及抑郁背景下的疲劳);以及自杀倾向(DSM\-5 A9:主动自杀意念伴或不伴具体计划,以及被动死亡愿望)。情绪和躯体组的选择遵循先前关于临床工具的元分析工作[^18](https://arxiv.org/html/2609.01832#bib.bib18),以反映抑郁对心智或身体的独特影响。鉴于其临床意义和风险特征,自杀倾向被分配至独立类别。积极情感语料库包含几句话的短摘录,表达如喜悦、爱、惊奇、抱负和乐观等积极情感,源自刻意多样的来源,涵盖翻译的中国古典诗歌(李白、曹操)、文学小说(托尔斯泰、加西亚·马尔克斯、罗斯夫特)、科普写作(道金斯)、政治演说(肯尼迪)以及基础公民文本(美国宪法)。该语料库的构建相对于抑郁语料库在效价上相反:它由情感积极的文本组成,而抑郁语料库是消极的。它还跨越广泛的类型和风格,因此沿症状轴观察到的任何分离都反映共同的情感效价。该组共有9条摘录。该语料库的纯文本包含在GitHub仓库中。为对比抑郁文本与情感积极语言,我们纳入了HappyDB,这是一个众包描述快乐时刻的语料库[^19](https://arxiv.org/html/2609.01832#bib.bib19)。我们取前423条非重复条目以匹配自然语料库的大小。  

#### 2\.1\.2文本匿名化与标准化  
对未编辑的核心临床语料库的初步实验表明,PROCEED的残差流在几何上与其他所有临床工具分离,无论临床相似性如何。这种分离是其独特的项目符号列表格式造成的伪影。为防止风格混杂(如格式、代词和语域)被误认为信号,我们使用Anthropic Claude Opus 4将每条摘录重写为标准的第三人称语域。所有摘录使用相同提示重写:“将以下文本重写为自然语言,描述第三人称。纠正任何语法错误。”所有重写均经过作者审查和修正。这些重写刻意最小化,仅包括表面编辑:标准化代词、从临床问卷中移除严重程度评分、纠正ReDSM5和HappyDB的语法,以及将PROCEED中的片段重构为连续散文。姓名和识别细节也被移除。临床内容保持不变。核心临床和积极情感语料库中重写的完整摘录集见补充材料。表2(https://arxiv.org/html/2609.01832#S2.T2)显示了所有语料库中重写的代表性示例。  

表2:文本标准化示例。每个公开语料库的原始和标准化摘录。  

#### 2\.1\.3残差流提取  
本研究使用Google在Hugging Face上发布的Gemma\-3\-27B\-PT官方版本[^20](https://arxiv.org/html/2609.01832#bib.bib20),这是一个274亿参数模型,包含62个Transformer块和5,376维残差流宽度。我们使用预训练模型而非指令微调变体,因为训练后的安全对齐可能扭曲模型对抑郁症状的表征。每条摘录使用Gemma\-3 SentencePiece分词器进行分词,并在单个前向传播中处理模型,该模型在PyTorch后端[^22](https://arxiv.org/html/2609.01832#bib.bib22)上使用Hugging Face Transformers库[^21](https://arxiv.org/html/2609.01832#bib.bib21)通过Apple Metal Performance Shaders (MPS)加载和运行。每次传播期间,前向钩子记录每个Transformer块的输入嵌入和残差流输出,总共产生63个激活。在所有后续分析之前,对应于初始令牌的激活在每个钩子点都被丢弃,以缓解Transformer残差流中记录的注意力陷阱和巨大激活现象[^23](https://arxiv.org/html/2609.01832#bib.bib23),[^24](https://arxiv.org/html/2609.01832#bib.bib24)。  

### 2\.2残差流层的逐层可分性  
不同的残差流层编码不同的信息。为确定模型区分抑郁症状的位置,我们使用PERMANOVA量化核心临床语料库上每个残差流层的症状组可分性。然后,我们使用伪F值最高的层进行症状向量提取。  

#### 2\.2\.1成对距离矩阵  
残差流激活是高维(5,376)的变长对象,其令牌激活通过自注意力机制依赖于前面的令牌。激活中的令牌因此不是独立样本;每个激活必须作为一个整体进行比较。目前没有既定方法测量残差流之间的距离

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。