分歧假说:揭示心理健康NLP中的词汇干扰与标签偏差
摘要
本文引入了Triple-Stream Stress (TSS)诊断框架,以揭示心理健康NLP中的词汇干扰和标签偏差,并提出了用于标签源审计的分歧度(Degree of Divergence)指标。
arXiv:2608.20353v1 公告类型:新
摘要:计算心理健康(CMH)分类器在分布偏移下经常性能下降,因为人类标注者和远程监督流水线奖励不同的语言信号。我们引入了TSS(Triple-Stream Stress probe),一个多通道诊断框架,将文本分解为(A)词汇字符n-gram、(B)一个小型、主要无内容的形态句法通道和(C)一个154特征的心理语言学风格通道。在四个英语数据集(N=12,906)上,TSS揭示了词汇干扰效应:将词汇特征添加到风格通道会降低人类标注数据上的Macro-F1(平均下降0.072,p<10^-4),但在自动标注数据上没有降低。我们提出了分歧度(Degree of Divergence, DoD),一种从计量经济学中改编的用于标签源审计的差异中差异统计量,并带有实例级bootstrap推断;主要估计值为DoD(BC-A) = 0.0374,95% CI [0.0097, 0.0651],p=0.0032。平台分层的仅Twitter DoD(消除了Reddit与Twitter的对比)通过bootstrap推断重现了该模式:DoD-Tw(BC-A) = +0.096 (p<0.001) 和 DoD-Tw(AC-A) = -0.089 (p<0.001)。干预掩码(pos_only)在人类数据集上销毁内容词后保留了约95-99%的通道C性能,表明风格通道不主要依赖词汇表面形式。TSS被定位为一个诊断审计框架,而非临床筛查工具:它在提出泛化主张之前标记标签源特定的捷径学习。
查看缓存全文
缓存时间: 2026/08/24 04:09
# 揭露心理健康NLP中的词汇干扰与标签偏差 来源: https://arxiv.org/html/2608.20353 ## 分歧假说:揭露心理健康NLP中的词汇干扰与标签偏差 Moustafa Yehia Hassan 多哈研究生院 卡塔尔多哈 [email protected] ###### 摘要 计算心理健康(CMH)分类器在分布偏移下常常性能下降,这是因为人类标注者和远程监督管道奖励了不同的语言信号。我们引入了TSS(三流压力探针),一个将文本分解为(A)词汇字符n-gram、(B)一个小型、主要无内容的形态-句法通道,以及(C)一个154维心理语言学风格通道的多通道诊断框架。在四个英语数据集(N=12,906)上,TSS揭示了一种*词汇干扰效应*:向风格通道添加词汇特征会降低在人类标注数据上的Macro-F1(平均下降0.072,p<10^{-4}),但在自动标注数据上不会。我们提出了分歧度(DoD),一种改编自计量经济学的双重差分统计量,用于标签来源审计,并采用基于实例的自举推断;主要估计值为DoD_{BC-A}=0.0374,95% CI [0.0097, 0.0651],p=0.0032。一个仅限Twitter的平台分层DoD(移除了Reddit与Twitter的对比)通过自举推断重现了该模式:DoD^{Tw}_{BC-A}=+0.096 (p<0.001) 且 DoD^{Tw}_{AC-A}=-0.089 (p<0.001)。干预性遮蔽(pos_only)在人类数据集上破坏内容词后,仍保留了通道C约95-99%的性能,表明风格通道并不主要依赖词汇表层形式。TSS被定位为一个诊断审计框架,而非临床筛查工具:它在提出泛化主张之前,标记出特定于标签来源的捷径学习问题。 分歧假说:揭露心理健康NLP中的词汇干扰与标签偏差 Moustafa Yehia Hassan 多哈研究生院 卡塔尔多哈 [email protected] ## 1引言 计算心理健康(CMH)有望通过语言实现可扩展的筛查和监测,但其进展受到基准标签与其所衡量构念之间不匹配的限制。大型语料库通常通过远程监督构建——关键词过滤、自我报告的诊断或社区成员身份代理——这可能会系统性地奖励词汇线索(Coppersmith等,2015;Harrigian等,2021)。相比之下,人类标注者通常依赖于*表达方式*:碎片化、否定范围、功能词使用和风格特征(Tausczik和Pennebaker,2010;Pennebaker等,2003)。当这两种标签来源被混淆时,模型可以通过利用虚假的词汇相关性(*捷径学习*;Geirhos等,2020)而非学习稳健的心理语言学标记来获得高分(Ernala等,2019;D'Amour等,2022)。 #### 任务。 我们研究来自短社交媒体帖子的*二元压力检测*。每个实例获得一个标签y∈{0,1},其中y=1表示根据数据集标注协议,该帖子表达了当前的心理困扰或与压力相关的经历,y=0表示未表达此类经历。在本文中,“压力”指的是数据集层面的困扰/压力标签,*而非*临床诊断;我们不做任何诊断有效性的声明。目标不是构建最先进的分类器,而是审计不同的标签来源奖励了哪些语言信号。 #### 研究问题。 RQ1(标签来源分歧)改变标签来源(人类 vs. 远程监督)是否会系统性地改变哪些语言通道被奖励? RQ2(词汇干扰)在人工标注下,向风格特征添加词汇内容是有益还是有害? RQ3(量化)人类-自动标注的差异能否量化为一个基于统计的单一标量? #### 贡献。 (i) 我们发布了TSS,一个通道可分离、长度鲁棒的审计探针,它将文本分解为词汇(A)、主要无内容的形态-句法(B)和心理语言学风格(C)通道,并具有明确的长度归一化和用于跨平台迁移的条件缩放。(ii) 我们记录了一种*词汇干扰效应*:在人类标注数据上,用词汇A增强C会降低Macro-F1;一个干预性遮蔽套件(pos_only, content_only, function_only)测试了性能在故意破坏词汇捷径后是否依然存在。(iii) 我们引入了DoD,一种具有基于实例的自举推断(n=10,000)和Benjamini-Hochberg FDR控制的双重差分审计统计量,以及一种移除了Reddit与Twitter对比的*平台分层*变体。(iv) 我们提供了留一域外评估(LODO)、无监督风格表型分析(自举ARI≈0.98)、与MentalBERT(Ji等,2022)和少样本LLaMA-3(Grattafiori等,2024;Brown等,2020)的配对基线比较,以及一个定性冲突区工作手册。完整流程、去污脚本和定性工作手册已公开发布。111代码和附录:https://github.com/MoustafaMohamedMoustafaHassan/TSS-Probe-CMH ## 2相关工作 #### 心理语言学风格。 一系列长期研究表明,功能词和风格模式比有意识控制的主题内容更可靠地反映认知风格(Pennebaker等,2003;Tausczik和Pennebaker,2010;Boyd等,2022)。认知治疗框架预测了与困扰相关的语言可测量相关性,最显著的是绝对主义语言(Beck,1976;Al-Mosaiwi和Johnstone,2018)和特定的认知扭曲(Shickel等,2020)。 #### CMH中的远程监督与捷径学习。 基于自我报告的诊断(Coppersmith等,2015)或社区成员身份构建的远程监督管道已被反复证明会产生依赖于表面词汇线索并在分布偏移下性能下降的模型(Harrigian等,2021;Aguirre等,2021;Ernala等,2019)。这些失败与更广泛的发现一致,即神经分类器倾向于抓住标注伪影和虚假相关性(Geirhos等,2020;Gururangan等,2018;McCoy等,2019;D'Amour等,2022),并且分布鲁棒性需要明确的干预(Sagawa等,2020;Kaushik等,2020)。我们的工作目标不同:我们不是提出一个更鲁棒的分类器,而是提出一个*诊断框架*来量化给定数据集的标签在多大程度上奖励了词汇捷径,这符合行为审计的精神(Ribeiro等,2020)。 #### 压力检测基准。 我们的实验框架使用Dreaddit(Turcan和McKeown,2019)作为结构化的人工标注基准,MentalBERT(Ji等,2022)作为领域预训练Transformer基线。我们还借鉴了源自Coppersmith等(2015)的Twitter心理健康语料库,在此被视为远程监督代理而非压力金标准(见§3)。 ## 3数据与任务 ### 3.1数据集 我们在四个英语数据集上进行评估,这些数据集在内部进行了精确匹配去重。表1总结了每个数据集的平台、规模、标签来源和预期用途。 表1:数据集概述。正例比例:Dreaddit-test 0.516,Twitter-gold 0.338,Twitter-auto 0.478,Reddit-combi 0.880(即在Reddit-combi上,正标签是*多数类*;少数类比例=0.120)。Dreaddit遵循Turcan和McKeown(2019);Twitter-auto和Twitter-gold子集源自Coppersmith等(2015);Reddit-combi是在远程监督下组装的组合Reddit语料库(见§3.3)。 ### 3.2Twitter-auto作为代理,非金标准 Twitter-auto不被用作压力金标准。它的构建方式是将作者自我报告了心理健康诊断(抑郁症、PTSD、焦虑症,遵循Coppersmith等,2015)的帖子视为*自动正例*,其工作假设是临床诊断人群表现出升高的语言困扰标记。我们承认这引入了*障碍→压力混淆*:被诊断的用户不一定在每个帖子中都表达困扰,由此产生的标签是本文研究的帖子级压力构念的嘈杂代理。我们将Twitter-auto纯粹视为远程监督代理,以测试此类标签是否比人类困扰标注奖励不同的语言信号。Twitter-gold是从相同底层语料库中抽取的手工标注子集,其标注针对*感知到的心理困扰*而非心理健康关键词的存在;应用了压力关键词移除以减少琐碎的词汇泄漏。我们不声称该集具有专家临床标注;手工验证方案的方法论限制在§局限性中承认。Rastogi等(2022)构建了一个相关但规模小得多的(120个样本)手工标注Twitter验证子集以验证自动标注策略,我们在此引用是作为方法论背景,而非同一数据集。 ### 3.3Reddit-combi作为远程监督代理 Reddit-combi是一个内部组装的Reddit语料库,在远程监督下构建,并随数据包作为data/raw/Reddit_Combi.csv(包含标题/正文字段和二元标签)发布。它不是一个外部发布的基准;它是为本研究组装的制品级远程监督语料库,随代码库发布,我们通过制品路径报告其来源。由于其构建不等同于专家标注,我们仅将Reddit-combi用作Reddit端的自动标注代理,并与Twitter-auto配对,用于DoD对比的自动来源一半。至关重要的是,正标签在Reddit-combi上是*多数类*(0.880);因此,在报告该数据集时,我们优先采用Macro-F1、PR-AUC和平衡准确率,而非原始准确率或类别1的F1值;我们从未将Reddit-combi用作人类标注的替代。 ### 3.4去污与不平衡 为防止跨平台CMH评估中的泄漏,我们在cleaned_text上执行了精确匹配的跨数据集去污,移除训练池中重叠的帖子,同时保留评估集。数据集表现出严重的类别不平衡,尤其是Reddit-combi,其正标签是*多数类*(正例比例0.880;少数类比例0.120)。因此,我们报告Macro-F1作为主要指标,并辅以在偏斜比例下的PR-AUC(当一个类别占主导时,PR-AUC优于ROC-AUC)。朴素多数类基线在Dreaddit-test、Twitter-auto、Twitter-gold和Reddit-combi上的Macro-F1分别为0.340、0.343、0.398和0.468;所有TSS通道都显著超过这些基线,证实了超出比例效应之外的信号获取。对于配对比较,我们在不一致预测上使用McNemar检验(McNemar,1947),对Macro-F1差异使用配对自举CI(Efron,1979),并用Benjamini-Hochberg FDR(Benjamini和Hochberg,1995)控制错误发现。 Dreaddit还提供了五个异质性压力源领域(虐待、焦虑、财务、PTSD、社交),使得留一域外评估(LODO)能够探测超越平台迁移的跨压力源泛化能力。 ## 4 TSS探针 TSS是一种诊断性分解,而非竞争性分类器。三个通道的设计使得它们的对比具有信息性:比较在每个标签来源下每个通道奖励的内容,可以隔离词汇捷径行为。 ### 4.1通道A:词汇表层形式 通道A使用长度3-5的字符级TF-IDF n-gram(Salton和Buckley,1988),并在k=500时进行卡方特征选择(Yang和Pedersen,1997)。我们使用字符n-gram而非词n-gram有两个原因。首先,社交媒体文本包含标签、缩写、表情符号、故意拼写错误和形态变化,这些会使词分词不稳定;字符级特征对此具有鲁棒性(Coppersmith等,2015)。其次,我们希望通道A提供一个强大的、子词级的词汇基线,这样我们观察到的任何*词汇干扰效应*都不能轻易归因于基于词的表示中的词汇覆盖不足。在k=500时的卡方过滤器防止了维度爆炸,并且其规模与短文本分类的标准稀疏词汇基线相当。 ### 4.2通道B:主要无内容的形态-句法 通道B将POS二元组和抽象的POS-SVO三元组(为提高效率,使用Penn Treebank标签集通过spaCy在每文档前500个字符上提取;Honnibal等,2020)转换为六个可解释的特征:五个POS衍生特征加一个绝对主义比率(B_abs),这是通道B中唯一访问词汇标记的特征(一个封闭的绝对主义词汇表,遵循Al-Mosaiwi和Johnstone,2018)。通道B使用自适应长度平滑和对数阻尼质量特征以实现跨平台鲁棒性;确切的公式在附录A中给出。 #### 通道B是一个诊断工具
相似文章
隔离LLM词汇偏见:一种无需人工筛选的三角测量偏好阶段学习指标
介绍了一种无需人工筛选的指标(Triangulated Preference Shift),用于隔离和量化LLM在偏好学习过程中诱导的词汇偏见,无需手动筛选,覆盖六个模型家族。
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。
心理健康领域的教育型人工智能:基于三流微调大语言模型的自动化临床督导与风险分诊框架
本文提出了一种三流微调大语言模型框架,用于心理健康领域的自动化临床督导,实现了高精度的技术识别,并将督导分诊延迟从72小时降低到实时。
大语言模型中词汇对齐与偏好阶段转变的全自动识别
本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。
同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性
本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。