用于认知扭曲检测的多视角三元交互图神经网络
摘要
本文介绍了MTI-GNN,一种多视角三元交互图神经网络,对贝克的认知三元组进行建模以进行认知扭曲检测,在多个多语言数据集上优于有监督基线和提示式大语言模型。
arXiv:2608.06785v1 公告类型:新
摘要:认知扭曲检测是计算心理健康领域的一项关键任务,然而现有方法常常忽视扭曲思维的心理结构。我们提出了MTI-GNN(多视角三元交互图神经网络),将贝克的认知三元组——对自我、世界和未来的消极看法——作为互补视角进行分类。利用大语言模型将每个话语分解为三个视角,并基于这些视角构建特定视角的相似度图,由多视角GNN进行编码。三元交互模块通过序列化的源条件更新和特征级门控来建模跨视角依赖关系,而原型引导的视角融合则执行标签条件聚合。标签扩展监督在训练过程中利用所有可用的扭曲标注。我们在来自四个韩语、英语和中文数据集的9,764个样本上评估了MTI-GNN,涵盖十种扭曲类别。MTI-GNN显著优于所有有监督变体,并在零样本和少样本设置下超过了八个提示式生成模型。留一视角消融实验表明,所有三个视角都有显著贡献,而人类专家评估为其与预期认知维度的一致性提供了初步证据。
查看缓存全文
缓存时间: 2026/08/10 08:03
# 用于认知扭曲检测的多视角三元交互图神经网络 Jun Seo Kim1, Hye Hyeon Kim2 1计算机工程系,Gachon University 2生物医学系统信息学系,Yonsei University kma80kjs@gachon\.ac\.kr, hye\_hyeon@yonsei\.ac\.kr ###### 摘要 认知扭曲检测是计算心理健康领域的一项关键任务,然而现有方法往往忽视了扭曲思维背后的心理结构。我们提出MTI-GNN(多视角三元交互图神经网络),将贝克认知三元组——对自我、世界和未来的消极看法——作为互补视角进行分类。大语言模型将每条话语分解为三个视角,并据此构建各视角特有的相似度图,再由多视角GNN进行编码。三元交互模块通过顺序源条件更新和特征级门控建模跨视角依赖关系,而原型引导的视角融合则执行标签条件聚合。标签扩展监督使所有可用的扭曲标注在训练期间均发挥作用。我们在来自韩语、英语和中文四个数据集的9,764个样本上评估MTI-GNN,样本涵盖十种扭曲类别。MTI-GNN显著优于所有监督变体,并超越了在零样本和少样本设置下评估的八个提示生成模型。留一视角消融实验表明,三个视角均有显著贡献,而人类专家评估则初步证明了提取表征与预期认知维度的一致性。 # 用于认知扭曲检测的多视角三元交互图神经网络 Jun Seo Kim1, Hye Hyeon Kim2 1计算机工程系,Gachon University 2生物医学系统信息学系,Yonsei University kma80kjs@gachon\.ac\.kr, hye\_hyeon@yonsei\.ac\.kr ## 1 引言 参见图1:贝克认知三元组示意图,包括对自我、世界和未来的消极看法。 精神障碍已成为全球性公共卫生挑战,影响着全球超过十亿人,约占每八人中的一人(World Health Organization, 2022 (https://arxiv.org/html/2608.06785#bib.bib1), 2025 (https://arxiv.org/html/2608.06785#bib.bib2))。认知扭曲——即系统性地使对情境的解释产生消极偏差的思维模式——在心理困扰的发生和持续中起着核心作用(Beck, 1979 (https://arxiv.org/html/2608.06785#bib.bib3); Dozois and Beck, 2008 (https://arxiv.org/html/2608.06785#bib.bib4))。在认知行为疗法(CBT)中,识别此类扭曲是重构适应不良思维模式的基本步骤,因此自动认知扭曲检测对可扩展的心理健康支持具有重要意义(Beck, 1964 (https://arxiv.org/html/2608.06785#bib.bib5), 2020 (https://arxiv.org/html/2608.06785#bib.bib6); Hofmann et al., 2012 (https://arxiv.org/html/2608.06785#bib.bib7))。 大语言模型(LLMs)的最新进展使得自然语言推理能力日益复杂(Wei et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib8); Kojima et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib9); Yang et al., 2023 (https://arxiv.org/html/2608.06785#bib.bib10)),这也激发了人们对认知扭曲检测的日益关注(Chen et al., 2023 (https://arxiv.org/html/2608.06785#bib.bib11); Nazarova, 2023 (https://arxiv.org/html/2608.06785#bib.bib12); Lim et al., 2024 (https://arxiv.org/html/2608.06785#bib.bib13); Lee et al., 2024 (https://arxiv.org/html/2608.06785#bib.bib14); Singh et al., 2024 (https://arxiv.org/html/2608.06785#bib.bib15); Kim et al., 2026 (https://arxiv.org/html/2608.06785#bib.bib16))。然而,许多现有方法仍主要将扭曲思维视为非结构化文本,并严重依赖表面语言模式(Sage et al., 2025 (https://arxiv.org/html/2608.06785#bib.bib17))。此类表征难以触及扭曲思维背后的心理结构,并可能忽略多个认知视角如何共同刻画一条话语。这一局限性很重要,因为认知扭曲理论本质上是有结构的。贝克认知三元组通过自我、世界和未来的消极看法来刻画扭曲思维,这三种看法可以相互作用并相互强化(Beck, 1979 (https://arxiv.org/html/2608.06785#bib.bib3); Beck and Alford, 2014 (https://arxiv.org/html/2608.06785#bib.bib18))。图1 (https://arxiv.org/html/2608.06785#S1.F1) 展示了这一理论框架。然而,在认知扭曲检测系统中,这些视角很少被建模为显式的、相互作用的表征。 为弥补这一空白,我们提出MTI-GNN(多视角三元交互图神经网络)。零样本LLM将每条话语分解为自我、世界和未来视角,随后分别基于原始文本和提取的三元表征构建各视角特有的相似度图。多视角GNN对这些图进行编码,三元交互模块通过顺序交叉注意力建模跨视角依赖关系,原型引导的视角融合则执行标签条件聚合。我们进一步采用标签扩展监督,使所有可用的扭曲标注都参与训练。我们在包含四个数据集、9,764个样本的多语言基准上评估MTI-GNN,这些数据集涵盖韩语、英语和中文,共十种扭曲类别。MTI-GNN显著优于所有监督基线,并超过了在零样本和少样本提示设置下评估的八个生成模型。去除视角的消融实验显示,自我、世界和未来这三个视角均有显著贡献;同时,由两名持证心理学家进行的评估初步证明了提取表征与其预期认知维度的一致性。 我们的贡献总结如下: 1. 我们引入了一个基于认知理论的框架,通过贝克认知三元组中互补的自我、世界和未来视角来表征扭曲思维。 2. 我们提出MTI-GNN,它结合了视角特有图学习、顺序跨视角交互、标签条件融合和标签扩展监督。 3. 我们针对监督基线和生成基线进行了多语言评估,并通过视角与交互顺序消融以及人类专家验证提供了支持。 ## 2 相关工作 ### 2.1 认知扭曲检测 认知扭曲检测的早期工作依赖基于手工语言规则的系统(Wiemer-Hastings et al., 2004 (https://arxiv.org/html/2608.06785#bib.bib19); Bathina et al., 2021 (https://arxiv.org/html/2608.06785#bib.bib20))。为提高可扩展性和泛化能力,后续研究将TF-IDF和LIWC等工程化表征与逻辑回归、SVM等分类器相结合(Simms et al., 2017 (https://arxiv.org/html/2608.06785#bib.bib21); Shickel et al., 2020 (https://arxiv.org/html/2608.06785#bib.bib22); Shreevastava and Foltz, 2021 (https://arxiv.org/html/2608.06785#bib.bib23))。然而,这些方法仍依赖人工特征设计。 分布式词表征的出现使神经模型能够捕捉更丰富的语义模式。早期方法将Word2Vec和GloVe嵌入与CNN、LSTM相结合(Xing et al., 2017 (https://arxiv.org/html/2608.06785#bib.bib24); Rojas-Barahona et al., 2018 (https://arxiv.org/html/2608.06785#bib.bib25); Mostafa et al., 2021 (https://arxiv.org/html/2608.06785#bib.bib26)),而BERT等基于Transformer的模型则通过上下文表征和任务特化微调进一步提升了性能(Devlin et al., 2019 (https://arxiv.org/html/2608.06785#bib.bib27); Lybarger et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib28); Ding et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib29); Ji et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib30))。 近年来,大语言模型(LLMs)通过零样本和思维链提示实现了认知扭曲检测(Chen et al., 2023 (https://arxiv.org/html/2608.06785#bib.bib11); Lim et al., 2024 (https://arxiv.org/html/2608.06785#bib.bib13))。后续工作通过多任务学习解决跨数据集泛化问题(Qi et al., 2025a (https://arxiv.org/html/2608.06785#bib.bib31)),并探索了通过多视角建模对扭曲思维进行心理学分解(Kim et al., 2026 (https://arxiv.org/html/2608.06785#bib.bib16))。尽管取得了这些进展,大多数现有方法仍将每条话语主要编码为单一文本序列,对心理学结构化且相互作用的表征探索有限。这一空白促使我们开发显式融入扭曲思维认知结构的表征框架。 ### 2.2 基于图的文本分类 图神经网络(GNNs)通过建模文档、词和标签之间的关系结构,已广泛用于文本分类(Kipf and Welling, 2017 (https://arxiv.org/html/2608.06785#bib.bib32); Veličković et al., 2018 (https://arxiv.org/html/2608.06785#bib.bib33))。TextGCN和BertGCN等早期研究表明,语料级图结构可以通过图传播同时捕捉语义和结构信息,从而提升分类性能(Yao et al., 2019 (https://arxiv.org/html/2608.06785#bib.bib34); Lin et al., 2021 (https://arxiv.org/html/2608.06785#bib.bib35))。后续研究将图框架扩展到多标签分类,通过标签条件图学习、标签共现结构、token-标签交互以及相关性感知图分解来融入标签语义和依赖关系(Ma et al., 2021 (https://arxiv.org/html/2608.06785#bib.bib36); Li et al., 2022 (https://arxiv.org/html/2608.06785#bib.bib37); Vu et al., 2023 (https://arxiv.org/html/2608.06785#bib.bib38); Bei et al., 2025 (https://arxiv.org/html/2608.06785#bib.bib39))。 最近,将大语言模型与图神经网络相结合已成为一个有前景的方向,它结合了上下文语义表征与图学习的结构归纳偏置,用于复杂推理和分类任务(Chen et al., 2024b (https://arxiv.org/html/2608.06785#bib.bib40))。受上述进展的启发,我们的方法从原始文本和认知三元组表征构建视角特有图。与主要围绕文档、词或标签组织的传统文本图不同,MTI-GNN分别对基于原始文本以及自我、世界和未来三个视角构建的相似度图进行编码。然后,它通过顺序交叉注意力建模这些视角之间的依赖关系,并执行标签条件融合,从而在平面文本表征之外融入心理学结构。 ## 3 数据集 ### 3.1 数据集概览 我们在四个公开可用的认知扭曲数据集上评估我们的框架,这些数据集涵盖韩语、英语和中文:TherapistQA(Shreevastava and Foltz, 2021 (https://arxiv.org/html/2608.06785#bib.bib23))、SocialCD-3K(Qi et al., 2025b (https://arxiv.org/html/2608.06785#bib.bib41))、KoACD(Kim and Kim, 2025 (https://arxiv.org/html/2608.06785#bib.bib42))以及认知重构数据集(Sharma et al., 2023 (https://arxiv.org/html/2608.06785#bib.bib43))。这些数据集覆盖患者-治疗师互动、社交媒体帖子、合成咨询话语以及情境-消极想法配对,并包含单标签和多标签标注设置。表1 (https://arxiv.org/html/2608.06785#S3.T1) 总结了它们的语言、标注设置和样本统计。各数据集的详细描述见附录D (https://arxiv.org/html/2608.06785#A4)。 ### 3.2 标签标准化 尽管这四个数据集大体上基于CBT,但它们采用了部分不同的认知扭曲分类体系。为支持统一的训练和评估,我们基于贝克认知疗法框架(Beck, 1979 (https://arxiv.org/html/2608.06785#bib.bib3))和伯恩斯认知扭曲分类法(Burns, 1981 (https://arxiv.org/html/2608.06785#bib.bib44)),将其标注标准化为十个类别。语义重叠的标签根据其理论定义合并。例如,“读心术”和“算命”统一为“草率下结论”,而“灾难化”映射为“夸大化”。无法与统一分类体系可靠对齐、样本不足或跨数据集可比性有限的标签被排除。完整分类体系、类别定义、映射规则以及原始标签分布见附录D (https://arxiv.org/html/2608.06785#A4)。 | 数据集 | 语言 | 设置 | 样本数 | 标签数 | |---|---|---|---|---| | TherapistQA | 英语 | 混合 | 1,597 | 1,999 | | SocialCD-3K | 中文 | 混合 | 3,387 | 3,962 | | KoACD | 韩语 | 单一 | 4,510 | 4,510 | | CognitiveReframing | 英语 | 混合 | 270 | 491 | 表1:本研究中四个数据集在预处理和标签标准化后的统计信息。 ## 4 方法 ### 4.1 认知三元组提取 在认知行为疗法(CBT)中,扭曲思维常以关于自我、世界和未来的消极信念为特征,统称为认知三元组(Beck, 1979 (https://arxiv.org/html/2608.06785#bib.bib3); Beck and Alford, 2014 (https://arxiv.org/html/2608.06785#bib.bib18))。受该框架启发,我们将每条话语分解为三个视角:自我、世界和未来。自我视角反映关于自身的信念,世界视角捕捉对外部情境或他人的解释,未来视角则代表对未来结果的预期。它们与原始话语一起,构成四个互补视图:文本、自我、世界和未来。 我们使用GPT-4o-mini(OpenAI, 2024 (https://arxiv.org/html/2608.06785#bib.bib45))提取三元视角。给定一条话语,该模型生成结构化的自我、世界和未来表征;当输入不支持某一视角时,则返回空值,从而减少无依据的推断。生成设置见附录A.2 (https://arxiv.org/html/2608.06785#A1.SS2),提取提示见附录E (https://arxiv.org/html/2608.06785#A5)。由于这些表征构成视角特有图的基础,我们通过基于嵌入的分析、独立的基于LLM的评估以及5.3节中的人类专家验证来评估其质量。 参见图2:MTI-GNN的整体架构,包括视角特有图编码、顺序三元交互和原型引导的视角融合。 ### 4.2 多视角嵌入与图构建 我们使用BGE-M3编码提取的自我、世界和未来视角,它为韩语、英语和中文文本提供多语言表征(Chen et al., 2024a (https://arxiv.org/html/2608.06785#bib.bib46))。对于每个视角,我们计算对应话语表征之间的两两余弦相似度,并构建一个有向K近邻图,其中每条话语表示为一个节点,出边指向其K个最相似的邻居。K值通过同质性分析和基于验证集的选择确定。
相似文章
基于LLM推理的多视角注意力多示例学习在认知扭曲检测中的应用
本文提出一个新颖框架,将大语言模型与多示例学习相结合,通过将话语分解为情绪、逻辑和行为三个维度,并使用多视角门控注意力机制来检测心理健康文本中的认知扭曲。该方法在韩文和英文数据集上展现了改进的性能,特别是对于具有高解释歧义性的扭曲。
弥合差距:面向统一多任务用户意图推断的双知识图谱框架
本文提出了DKG-MTI,一种双知识图谱框架,通过结构感知的知识对齐增强基于大语言模型的推理,以联合预测方面评分并从在线旅游评论中生成用户意图陈述。
HCIG: 用于多模态讽刺和网络霸凌检测的分层跨模态不一致性图网络
本文提出HCIG,一种用于多模态讽刺和网络霸凌检测的分层跨模态不一致性图网络,在MMSD和MultiBully数据集上取得了最先进的性能。
MGDT:MLLM引导的扩散Transformer结合关系自适应混合专家模型用于多模态知识图谱补全
提出了M2GDT,一种新颖的MKGC框架,它利用MLLM引导的扩散Transformer与关系自适应混合专家模型来对齐和去噪多模态特征,在三个基准数据集上优于基线方法。
跨学科分类与建模:误解的生成、放大与检测,从语用学到AI代理
本文提出了一个跨学科分类和建模框架,用于理解、放大和检测误解,连接了语用学和AI代理系统。