心理健康自然语言处理中的跨平台泛化失败:社交媒体Transformer模型的五维公平性审计

arXiv cs.CL 论文

摘要

本文提出一种跨平台公平性评估框架,用于审计心理健康自然语言处理中的Transformer模型,揭示了当模型应用于不同社交媒体平台时,存在显著的性能与校准问题。

arXiv:2608.26138v1 公告类型:新 摘要:我们引入跨平台公平性评估(CPFE)框架——一个涵盖判别性能、校准、统计显著性、预测公平性和归因稳定性的五维审计协议——并将其应用于四个Transformer模型(BERT、RoBERTa、Emotion-DistilRoBERTa、GoEmotions-RoBERTa),这些模型在Kaggle心理健康语料库(n=35,556)上训练,并在Reddit(n=6,257)和Twitter(n=2,883)测试集上评估,情感标签映射到临床代理变量。所有三个独立评估的模型显示出一致且显著的跨平台AUC下降(在Reddit上30.3-35.4%,在Twitter上37.9-39.5%),相对于平台内性能(AUC 0.983-0.987),在五个独立训练种子中得到证实。校准失败同时发生且严重:ECE从域内的0.056-0.060上升到Reddit上的0.196-0.229和Twitter上的0.499-0.542。平台特定的温度缩放将平均ECE降低了88.0%,而不改变判别性能(平均|delta AUC|<0.01),证实了可分离的失败模式。预测公平性分析揭示了大的跨平台差异(原始DI < 0.17;先验偏移调整后的DI:Reddit上为0.11-0.29),心理健康代理类在Reddit上的均等优势差异为0.753-0.830,焦虑在Twitter上为0.755-0.831。归因稳定性分析显示跨平台词汇几乎完全发散(在K=10时,14/16个模型-类对中Jaccard J=0)。这些发现支持在所有五个CPFE轴上进行跨平台验证,作为心理健康NLP系统在异构环境中的标准要求。在单种子微调实验中,平均AUC提高了0.216,表明目标平台标签作为训练信号比作为校准信号提供更大的益处。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:19

# 心理健康自然语言处理中的跨平台泛化失败:基于Transformer模型的社交媒体五轴公平性审计
来源:https://arxiv.org/html/2608.26138
Rajveer Singh Pall 与 Sameer Yadav
R\. S\. Pall 与 S\. Yadav 隶属于印度贾巴尔普尔 482003 的吉安-甘加技术与科学学院计算机科学与商业系统系。电子邮箱:{rajveer.pall, sameer.yadav}@ggits.org。稿件接收日期:2026年4月26日。

###### 摘要

尽管心理健康自然语言处理(NLP)模型在现实环境中的部署日益增多,但其跨社交媒体平台的可靠性仍未得到充分理解。我们提出跨平台公平性评估(CPFE)框架,这是一个包含五个评估维度的综合审计方案,分别评估判别性能、校准、统计显著性、预测公平性和归因稳定性。四个Transformer模型(BERT、RoBERTa、Emotion-DistilRoBERTa 和 GoEmotions-RoBERTa)在Kaggle心理健康语料库(n=35,556)上进行训练,并在独立的Reddit(n=6,257)和Twitter(n=2,883)数据集上进行评估,其中情感标签被映射到临床相关的心理健康代理类别。在三个独立评估的模型中,宏观AUC在Reddit上较域内性能(AUC = 0.983–0.987)下降了30.3–35.4%,在Twitter上下降了37.9–39.5%。校准也显著恶化,期望校准误差从域内的0.056–0.060增加到Reddit上的0.196–0.229和Twitter上的0.499–0.542。针对特定平台的温度缩放将校准误差降低了88.0%,同时保持了判别性能(\|ΔAUC\|<0.01),证明校准和判别性能是不同的故障模式。公平性分析揭示了显著的跨平台预测差异,平衡赔率差异范围为0.753至0.831,而归因稳定性分析显示,跨平台的关键词汇影响力几乎完全发散(在K=10时,16个模型-类别对中有14个的Jaccard J=0)。最后,有限的目标域微调使平均AUC提高了0.216,表明即使是适度的目标平台监督也能比单独校准带来更大的收益。这些发现确立了全面的跨平台评估是心理健康NLP系统可靠、公平和可信部署的基本前提。

###### 索引术语:

心理健康nlp;跨平台泛化;Transformer模型;预测公平性;校准;领域偏移;社交媒体;差异影响;温度缩放;代理标签。

## 1 引言

基于Transformer的自然语言处理(nlp)在临床和近临床环境中的普及,引发了关于在一种数据分布上训练的模型在部署于另一种分布时仍保持可靠性的条件的紧迫问题。心理健康nlp是此问题的一个特别高风险实例。用于分类社交媒体帖子以识别抑郁、焦虑或压力代理指标的模型越来越多地被用于研究流程,并被提议用于危机监控和数字心理健康环境。

本研究聚焦于*代理标签分类器*——即预测心理健康状况的情感衍生指标而非临床验证诊断的模型——并评估其跨平台可靠性。在此类部署中,预测错误会带来下游后果:假阴性可能会延迟对表示痛苦的语言的人工审查,而大规模的假阳性可能导致警报疲劳。我们并非在操作性临床环境中评估模型;所有发现均基于映射到临床类别的代理情感标签\[1 (https://arxiv.org/html/2608.26138#bib.bib1), 2 (https://arxiv.org/html/2608.26138#bib.bib2)\]。

这一挑战因社交媒体数据的碎片化性质而加剧。不同平台在用户人口统计、沟通规范、词汇、文本长度以及用户表达心理困扰的方式上存在系统性差异\[3 (https://arxiv.org/html/2608.26138#bib.bib3), 4 (https://arxiv.org/html/2608.26138#bib.bib4)\]。在一个平台的标注帖子上训练的模型可能会编码特定于平台的风格特征,而非泛化到部署上下文的信号。

尽管存在这种风险,心理健康nlp的评估大多是在单一平台环境中进行的\[5 (https://arxiv.org/html/2608.26138#bib.bib5), 6 (https://arxiv.org/html/2608.26138#bib.bib6)\]。模型在同一数据集的划分上进行微调和评估,产生了过于乐观的性能估计,无法推广到真实的部署场景。当前实践缺乏严格的跨平台评估协议——类似于临床预测建模中的外部验证要求\[7 (https://arxiv.org/html/2608.26138#bib.bib7), 8 (https://arxiv.org/html/2608.26138#bib.bib8)\]。

我们通过引入跨平台公平性评估(cpfe)框架来解决这一差距,该框架包含五个评估轴:

1. \(1\) 分布偏移下的判别性能(auc, F1);
2. \(2\) 概率校准(期望校准误差,ece);
3. \(3\) 性能差异的统计显著性(经自举法校正的配对auc检验);
4. \(4\) 平台分层预测公平性(对称差异影响,平衡赔率差异);以及
5. \(5\) 归因稳定性(前K个特征词汇的Jaccard相似度)。

我们将cpf应用于四个具有不同预训练机制的Transformer模型——通用领域BERT、通用领域RoBERTa、情感微调DistilRoBERTa和GoEmotions预训练RoBERTa——这些模型在组合的Kaggle心理健康语料库上进行训练,并在映射到四个临床类别的Reddit(GoEmotions\[9 (https://arxiv.org/html/2608.26138#bib.bib9)\])和Twitter(dair-ai/emotion\[10 (https://arxiv.org/html/2608.26138#bib.bib10)\])测试集上进行评估。

### 主要贡献

先前在心理健康nlp中的跨平台工作\[12 (https://arxiv.org/html/2608.26138#bib.bib12)\]已证实性能退化发生在平台偏移下;本研究通过引入一个五轴框架来共同表征判别性能、校准、公平性和归因稳定性失败,从而扩展了该研究方向。具体贡献如下:

1. \(i\) 一个统一的五轴cpf协议,将判别性能、概率校准、经邦弗罗尼校正的统计显著性、平台分层预测公平性和梯度归因稳定性共同操作化,作为心理健康nlp的结构化审计框架;
2. \(ii\) 证据表明所有四个评估模型都表现出显著的跨平台auc退化(30.3–39.5%;28.6–39.5%包括非独立的GoEmotions-RoBERTa Reddit结果),且梯度归因稳定性接近于零(在K=10时,14/16个模型-类别对中J=0);
3. \(iii\) 经验验证表明,针对特定平台的温度缩放显著恢复了校准(平均ece减少88%),同时未改变判别性能;以及
4. \(iv\) 跨平台auc退化的经验参考范围(独立评估模型为30.3–39.5%;所有四个模型为28.6–39.5%),作为未来跨平台评估工作的描述性基线。

## 2 相关工作

### 2.1 NLP中的领域偏移

nlp中的分布偏移已在情感分析\[11 (https://arxiv.org/html/2608.26138#bib.bib11)\]、跨平台心理健康分类\[12 (https://arxiv.org/html/2608.26138#bib.bib12)\]和临床文本挖掘\[13 (https://arxiv.org/html/2608.26138#bib.bib13)\]中得到研究。数据集偏移的基础形式化由Quiñonero-Candela等人\[26 (https://arxiv.org/html/2608.26138#bib.bib26)\]提出。领域自适应预训练(DAPT)\[14 (https://arxiv.org/html/2608.26138#bib.bib14)\]、对抗性领域适应和在未标记目标域文本上进行的自训练已被提出用于缓解偏移,但在心理健康环境中很少被评估。

### 2.2 社交媒体上的心理健康NLP

用于社交媒体抑郁、焦虑和压力代理指标的基于Transformer的分类器已显示出强大的平台内判别性能\[5 (https://arxiv.org/html/2608.26138#bib.bib5), 6 (https://arxiv.org/html/2608.26138#bib.bib6)\],尽管此类代理标签的临床有效性仍存在争议\[1 (https://arxiv.org/html/2608.26138#bib.bib1)\]。Chancellor和De Choudhury\[1 (https://arxiv.org/html/2608.26138#bib.bib1)\]提供了一篇批判性综述,指出了普遍存在的方法论局限,包括缺乏外部验证、临床标签模糊性和选择偏差。

最直接相关的先前工作是Kula等人\[12 (https://arxiv.org/html/2608.26138#bib.bib12)\],他们研究了心理健康内容分类器在Reddit和Twitter上的跨平台泛化。我们的工作通过增加概率校准、经邦弗罗尼校正的显著性检验、平台分层预测公平性和梯度归因稳定性作为评估轴,并明确比较了温度缩放与目标域微调的补救效果(详见第1节),扩展了Kula等人的工作\[12 (https://arxiv.org/html/2608.26138#bib.bib12)\]。

### 2.3 临床预测模型中的校准

临床预测文献要求所有预后模型在部署前进行外部验证和校准评估\[7 (https://arxiv.org/html/2608.26138#bib.bib7), 8 (https://arxiv.org/html/2608.26138#bib.bib8)\]。校准评估——包括ece和可靠性图——是TRIPOD指南报告中的标准组成部分\[8 (https://arxiv.org/html/2608.26138#bib.bib8)\]。Guo等人\[15 (https://arxiv.org/html/2608.26138#bib.bib15)\]证明现代深度神经网络系统性地过度自信,而温度缩放提供了一种有效的事后校准补救措施。

### 2.4 算法公平性

差异影响和平衡赔率是机器学习公平性文献中的基础公平性标准\[16 (https://arxiv.org/html/2608.26138#bib.bib16), 17 (https://arxiv.org/html/2608.26138#bib.bib17)\]。我们将这些标准扩展到跨平台环境——其中群体由源平台而非人口统计属性定义——这是心理健康nlp中尚未系统探索的应用。先前的nlp公平性审计主要关注人口统计属性\[18 (https://arxiv.org/html/2608.26138#bib.bib18)\];将平台视为群体的公平性分析是多平台部署场景的自然延伸,类似于医疗公平性文献中的地理或机构群体标识符\[29 (https://arxiv.org/html/2608.26138#bib.bib29), 30 (https://arxiv.org/html/2608.26138#bib.bib30)\]。

## 3 数据与预处理

### 3.1 数据集

#### 3.1.1 训练平台(Kaggle)

一个组合的心理健康数据集\[19 (https://arxiv.org/html/2608.26138#bib.bib19)\],聚合自多个社交媒体平台,包含标注为四个类别的文本帖子:正常、抑郁、焦虑和压力。经过预处理和分层70/15/15划分后,训练集包含n=35,556个样本;平台内测试集包含n=7,620个样本。该数据集严重偏向抑郁(占Kaggle划分的56.6%,反映了训练集分布),焦虑(7.5%)和压力(7.2%)构成少数类别。

#### 3.1.2 跨平台测试集1(Reddit / GoEmotions)

GoEmotions数据集\[9 (https://arxiv.org/html/2608.26138#bib.bib9)\]包含58,009条英语Reddit评论,标注了27个细粒度情感类别及中性类别。使用保留的测试划分(映射后n=6,257)。情感标签重新映射到临床类别如下:悲伤、悲痛、懊悔、失望→抑郁;紧张、恐惧、焦虑→焦虑;愤怒、恼怒、挫败→压力;所有剩余类别→正常。这些映射从表层情感表达中近似临床综合征,遵循先前心理健康nlp文献中确立的惯例\[1 (https://arxiv.org/html/2608.26138#bib.bib1), 5 (https://arxiv.org/html/2608.26138#bib.bib5)\]。这些映射是启发式近似:愤怒在标准诊断分类法中无法清晰映射到临床压力,且恐惧包含超出焦虑的情感状态。通过四种替代映射变体评估对此映射的鲁棒性(第4.4节)。

#### 3.1.3 跨平台测试集2(Twitter / dair-ai/emotion)

dair-ai/emotion数据集\[10 (https://arxiv.org/html/2608.26138#bib.bib10)\]包含20,000条英语推文,标注了六个情感类别。使用测试划分(n=2,883)。重新映射:悲伤→抑郁;恐惧→焦虑;愤怒→压力;喜悦、惊喜、爱→正常。Twitter分布更均衡:43.6%正常,30.1%抑郁,12.3%焦虑,14.0%压力。

完整的组合语料库跨越所有三个来源的112,211个样本。标签分布跨平台的偏移代表了领域偏移之外的一个独立混杂因素(第5.5节)。

### 3.2 预处理

所有文本均使用模型特定的分词器进行分词,最大序列长度为64个token。截断分析显示,Kaggle测试集中59.2%的样本(7,620个中的4,508个)超过64个token(平均词数118.3;中位数67.0;第75百分位:154.0个词),而Reddit样本为0.0%(平均13.5个词),Twitter样本为2.8%(平均19.0个词)。这种平台不对称性——Kaggle文本比跨平台文本长6-9倍——意味着在截断长文本上训练的模型是从Kaggle帖子中存在的临床代理叙事结构的压缩版本中学习信号,而非从Reddit和Twitter特有的较短通信形式中学习。

## 4 方法

### 4.1 模型

评估了四个具有不同预训练和微调机制的Transformer模型(表I)。所有模型均使用AdamW\[20 (https://arxiv.org/html/2608.26138#bib.bib20)\](学习率lr=2×10⁻⁵,权重衰减0.01,线性预热占总步数的10%,梯度范数裁剪为1.0,基于五个epoch内最大验证集宏观F1进行早停)微调为四类序列分类器。整个实验最大序列长度均为64个token。

表I:本研究评估的Transformer模型。†GoEmotions-RoBERTa Reddit结果非独立(见第4.1节)。模型 | 参数 | 预训练
BERT\[21\] | 110M | 通用(Wikipedia + Books)
RoBERTa\[22\] | 125M | 通用(动态掩码)
Emotion-DistilRoBERTa\[23\] | 82M | 情感多源语料库
GoEmotions-RoBERTa† | 125M | GoEmotions语料库(Reddit)
BERT(bert-base-uncased\[21\]):110M参数;通用

相似文章

苹果比苹果?迈向可比的跨语言语言模型评估

arXiv cs.CL

本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。