基于监督嵌入的症状网络可扩展部分信息分解

arXiv cs.LG 论文

摘要

本文介绍了ePID,一种使用监督嵌入计算症状网络部分信息分解的可扩展流水线,能够分离心理健康数据中的冗余和协同信息。

arXiv:2609.13203v1 公告类型:新 摘要:心理健康症状之间的成对关系通常总结为标量边权重,无法表达两个症状是否携带关于第三个症状的重叠信息或仅在组合中出现的信息。部分信息分解(PID)解决了这一差距,但在超过几个源时计算上不可行。 我们引入了基于嵌入的PID(ePID),这是一种可扩展的流水线,将所有非焦点症状压缩为低基数离散嵌入,并计算可处理的两源PID,为每个有序源-目标对生成源唯一、余数唯一、冗余和协同分量。我们在校准到PHQ-9的合成贝叶斯网络和五个PID度量下的83个真实世界数据集上基准测试了13种候选嵌入。 在测试的13种嵌入中,监督条件信息瓶颈(ACIB)嵌入最准确地恢复了参考分解,并且对于每个产生非负原子的PID度量,在压缩四个或更多症状时均有效(协同恢复r = 0.92)。然后,这两种工具出现了明显分歧。在PHQ-9网络中(UK Biobank,N = 154,291;新乡学生样本,N = 24,292),周围的症状上下文通过冗余和余数唯一通道携带了大部分成对依赖;协同贡献占6%到9%,在任一队列中没有定向边是以协同为主导的。在28项Interpersonal Reactivity Index中,45%的源对是如此。因此,相同的流水线在不改变参数的情况下,为这两种工具返回了相反的分布,每种分布都与该工具的构建方式一致。 通过分离重叠信息与交互依赖信息,ePID提供了一种可扩展的、与模型无关的标准症状网络方法的补充,以区分观察到的相关性中的冗余和协同贡献。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:36

# 基于监督式嵌入的可扩展症状网络部分信息分解
来源:https://arxiv.org/html/2609.13203
###### 摘要
背景:心理健康症状之间的成对关系通常被总结为标量边权重,但这无法表达两个症状是携带关于第三个症状的重叠信息,还是仅在组合时才出现的信息。部分信息分解(PID)解决了这一局限,但其计算复杂度在信源超过少数几个时变得不可行。
方法:我们引入了基于嵌入的PID(ePID),这是一个可扩展的流程。它将所有非焦点症状压缩成一个低基数的离散嵌入,并计算一个可处理的双信源PID,从而为每个有序的信源-目标对生成信源独有、剩余独有、冗余和协同四个组成部分。我们在经PHQ-9校准的合成贝叶斯网络和涵盖五种PID度量的83个真实数据集上,对13种候选嵌入进行了基准测试。
结果:在13种测试的嵌入中,有监督的聚合条件信息瓶颈(ACIB)嵌入最准确地恢复了参考分解,并且在将四个或更多症状压缩后,为每种产生非负原子的PID度量都做到了这一点(协同恢复率 r=0.92)。然而,这两种工具的表现则大相径庭。在PHQ-9网络(英国生物银行,N=154,291;新乡学生样本,N=24,292)中,周围的症状上下文主要通过冗余和剩余独有通道传递成对依赖性;协同贡献了6%至9%,并且在任一队列中都没有任何有向边以协同为主。而在28项的人际反应指数量表中,45%的信源对以协同为主。因此,相同且未调整参数的流程,对这两种工具返回了截然不同的特征,且每个特征都与其构建方式一致。
结论:通过区分重叠信息与交互依赖信息,ePID为标准的症状网络方法学提供了一种可扩展、模型无关的补充手段,以区分观察到的相关性中的冗余与协同贡献。
## 公共意义声明
症状网络描绘了心理健康症状之间的相互关系。这些关系复杂,但标准方法仅报告两个症状是否相关——而非它们是否携带关于第三个症状的相同信息,或是否仅在组合时才重要。我们开发了ePID,一个将每对关系分解为重叠(冗余)信息(两个症状共有)和仅联合(协同)信息(仅当两者同时出现时才可获得)的流程。应用于PHQ-9(抑郁症状)和人际反应指数量表(共情),ePID返回的特征与每个问卷的构建方式相符。PHQ-9的设计使其项目测量单一的严重程度维度,而ePID发现其信息几乎完全重叠。人际反应指数量表则围绕共情的四个不同方面构建,ePID发现其大部分信息仅可从项目的组合中获得。该方法在无需任何先验信息的情况下恢复了每个量表的设计特征,这正是其结果可信的原因。经过进一步验证,此类特征可帮助指导应同时评估或干预哪些症状,而非孤立看待。
关键词:症状网络、部分信息分解、高阶交互、信息论、精神病理学
## 1 引言
网络模型将多元系统表示为节点及其统计关联的边,提供了一个框架,其中感兴趣的结构从观察到的关系本身涌现,而非源于假设的潜在原因。这种方法已在精神病理学中被广泛采纳,其中症状网络将心理健康症状表示为节点,将条件依赖表示为边(Borsboom and Cramer, 2013;Borsboom, 2017)。与将症状视为单一疾病实体的被动指标不同,网络视角将其视为相互强化的元素,其交互模式构成了疾病本身(Guloksuz et al., 2017; Malgaroli et al., 2021)。在最常见的表述中,边量化了在调整了其他症状后症状之间的成对条件关联,产生了一个通常被解释为“直接”依赖结构的稀疏网络。例如,在压力事件后,个体可能经历失眠,导致疲劳,疲劳可能影响注意力,进而导致抑郁情绪和无价值感(Cramer et al., 2016)。这种观点将心理障碍的概念从集中的潜在疾病模型转变为去中心化的网络模型。
然而,常用的症状网络估计器共享一个任何成对度量选择都无法克服的根本局限。每条边都将两个症状之间的关联总结为一个数字。即使该关联是在未假设特定函数形式的情况下估计的——这是一个有用的保护措施——标量边仍然无法表达多个症状如何*共同*作用以影响第三个症状。这正是我们试图解决的差距。
考虑症状在上下文中的行为方式。两个症状可能共同作用,使得它们的组合具有信息量,尽管单独来看每个都不太能说明问题;或者,它们可能充当重叠的信源,每个都携带关于第三个症状的大部分相同信息。例如,PHQ-9的睡眠和疲劳项目在调整了整体抑郁严重程度后仍然相关,因此一旦知晓其中一个,另一个提供的信息就很少(Horton and Perry, 2016; Fried et al., 2017);相比之下,其他症状对可能仅在联合考虑时才携带关于自杀意念的信息,而成对筛查很少测试这种可能性(Franklin et al., 2017)。成对数字无法区分这些情况。然而,它们可以被操作化为不同类型的信息:两个症状关于一个目标共享的重叠信息(*冗余*),以及仅当它们被联合考虑时才可获得的信息(*协同*),此外还有每个症状独有的信息。这种区别在干预主义解读下具有实际意义——我们强调,这种解读预设了因果结构,并且容易受到隐藏混杂因素的影响,因此以下的解读是强因果假设而非既定结论。如果两个源症状高度冗余,仅改变其中一个的状态对目标影响很小,因为另一个继续传递相同的信息。相反,如果它们的联合信息主要是协同的,那么破坏任一源是否足以打破联合通道则取决于潜在的因果系统:联合配置携带信息这一事实本身并不等同于允许干预。这些解读是假设生成式的,需要纵向或实验验证;我们将在讨论部分结合经验发现重新审视它们。
信息论提供了使这种操作化变得精确的工具。当观测一个源变量能减少对目标状态的不确定性时,该源变量就提供了关于目标的*信息*(Shannon, 1948)。条件互信息(CMI)利用这一思想将偏相关(在联合高斯分布下,作为条件独立性准则,两者一致)推广为一种对条件依赖性的无模型(关于函数形式)度量。部分信息分解(PID)更进一步,将两个或多个*源*提供的关于指定*目标*的信息分解为非重叠的组成部分或*原子*(Williams and Beer, 2010),即上文概述的冗余、独有和协同部分,从而条件关联可以被解读为重叠的或仅交互的,而非单一未分化的数字。
应用PID的障碍在于其规模。原子的数量随源的数量超指数增长,从2个源的4个原子到6个源的超过700万(遵循Dedekind数 M(N)(Kleitman, 1969)。估计如此多的原子需要高维联合分布,这在典型的临床样本量下严重欠采样,实践中将大多数分析限制在三元组水平(两个源和一个目标)。虽然三元组水平的分解是可处理的,但它们会遗漏仅当三个或更多源共同作用时才出现的交互。在症状网络中,给定症状的相关比较对象是其完整上下文——所有其他症状——因此三元组分解无法回答主要关注的系统级归因问题:一个症状是否提供了*超出症状谱中其他部分已存在的*关于目标的信息。
为解决此问题,我们引入了基于嵌入的PID流程,称之为*ePID*。对于给定的一对症状,ePID首先将网络的其余部分压缩成一个紧凑的摘要变量——一个学习得到的小类别数,旨在尽可能多地保留关于*目标*症状本身的信息——然后询问焦点症状(即该对中的源)与该摘要相比如何与目标关联。因为这种分解完全由关于目标的信息定义,所以为保留剩余部分的目标相关信息而优化的摘要保留了其依赖的信息,而摘要丢弃的信息,根据设计,与目标基本无关;我们在方法部分精确化了这一近似及其损失的信息。这种目标监督式压缩是ePID特有的;相比之下,偏相关和CMI并不针对任何特定目标。该过程为每个有序症状对产生四个组成部分:仅由焦点症状提供的信息(源独有)、仅由网络其余部分提供的信息(剩余独有)、重叠信息(冗余),以及仅在考虑焦点症状和摘要时才出现的信息(协同)。生成的有向边反映了分解所需的源-目标方向。
心理学测量网络研究的一个互补分支使用调节网络模型(MNM)处理高阶结构,该模型添加乘法交互项,使得两个症状之间的关联可以随第三个症状而变化(Haslbeck et al., 2021)。与ePID的对比本质上是参数化与非参数化的对比:MNM提供了一个参数化检验,用于测试选定的调节变量是否显著修改了给定边,而ePID则在未预先指定交互的情况下,询问每条边的基础信息相对于其余症状谱是如何分布在冗余、独有和协同通道中的。我们在讨论中展开了更完整的方法论对比。
本研究评估并比较了三种症状网络估计方法,它们逐步放宽建模假设,并从成对表征转向高阶表征(图1)。偏相关(PC),包括其皮尔逊(PPC)和斯皮尔曼(SPC)变体,为条件线性和单调关联提供了基线;这两种变体在所分析的有序症状项目上产生高度相似的网络(附录H,图S14),因此我们将其统称为PC。CMI推广到任意条件依赖,同时保持在成对水平。为表征这种依赖是如何构成的,我们通过ePID流程应用PID,为每个源-目标对生成上述四种原子的分解。这些方法的一致性或分歧程度本身就能说明所研究症状系统的统计结构。
我们分两个阶段评估ePID。首先,我们在校准至PHQ-9响应分布的模拟设置中,对多种嵌入策略进行基准测试,然后将评估扩展到涵盖五种PID度量的83个真实数据集,以评估其泛化能力,量化压缩损失的信息量(近似误差)。其次,我们将该方法应用于两个数据集(UK Biobank(Sudlow et al., 2015; Davis et al., 2020)和新乡学生样本(Su et al., 2024a; Su et al., 2024b))中项目水平的抑郁症状网络,使用统一的PHQ-9项目(排除自杀意念)评估跨队列稳定性,并应用于人际反应指数量表(Davis, 1983),这是一个多方面共情工具,作为对比性的心理测量特征。在每个应用中,我们首先将偏相关与CMI之间的一致性视为一个假设检验,检验项目水平上的条件结构是否主要单调,然后使用ePID添加一个交互感知的解释层,相对于完整症状上下文区分冗余与协同通道。通过结合依赖性的无模型度量和可扩展的分解方法,我们表征了观察到的症状网络背后的统计结构类型,并评估了对于特定工具和人群,交互感知模型在多大程度上是合理的。据我们所知,这是监督式嵌入PID在症状网络上的首次应用和系统验证,尽管我们在此为心理测量工具开发了它,但该流程是通用的,应适用于其他对网络上下文高阶结构感兴趣的多元系统——我们尚未对此泛化进行实证验证。我们始终强调,这些模式描述的是横截面数据中的统计关联而非因果机制,应被视为未来纵向和实验研究的约束与假设;其在结果部分报告了其实证量级以及在不同队列和工具中的行为表现。
图1:玩具结构因果模型上的方法比较
注:该玩具系统是一个包含五个变量的混合结构因果模型(X₁, X₂, W 服从均匀分布 {0,...,4} 且独立;X₄ = X₅ = W;X₃ = h(X₁, X₂) 概率为0.5,否则 X₃ = W,其中 h 是附录J中定义的非单调示意性映射)。第一行:(a) 真实图:X₁, X₂, X₄ → X₃,其中 X₄ = X₅ 已标记。(b) PC网络:仅 X₁ → X₃ 边保留(ρ_{ij|rest}=+0.38);X₄, X₅ 边未出现。

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。

面向精神病理维度预测的粒度感知EEG特征框架

arXiv cs.LG

本文提出了一种粒度感知的EEG特征框架,将多尺度描述符组织为全局、区域和通道级别,以预测维度精神病理。使用HBN队列研究表明,基于树的模型和粒度平衡的特征选择带来了适度的改进,表明多尺度EEG特征包含微弱但可检测的儿童心理健康信号。