在[MASK]背后:解构DAPF痴呆检测中的表示与忠实性

arXiv cs.CL 论文

摘要

本文研究了基于DAPF的痴呆检测模型的可解释性,揭示了虽然DAPF取得了强劲的性能,但其token级别的解释缺乏忠实性。

arXiv:2608.25028v1 宣布类型:新 摘要:通过基于提示的领域自适应模型进行口语分析是低资源、非侵入性痴呆筛查的一个有前景的方向,但这类模型在内部仍然不透明。我们研究了通过基于提示的微调(DAPF)框架的领域自适应模型的可解释性,该框架将痴呆检测构建为诊断相关的掩码词预测。我们使用多种探测和分析技术解释DAPF和强基线,发现DAPF取得了最佳的整体性能(准确率=0.83和宏F1=0.83),并且诊断信息最易从其[MASK]表示中恢复。然而,这种表示优势并未扩展到token级别的解释忠实性。DAPF归因主要反映了语言任务词汇、话语标记和转录伪影,扰动测试显示弱或负效应。这表明其掩码词接口决定了诊断信息,但未产生忠实的token级别解释。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:14

# 面罩之下:解构基于DAPF框架的痴呆检测中的表征与可信度
来源:https://arxiv.org/html/2608.25028
Pardis Ranjbar‑NoieyNatalie Parde所属机构:伊利诺伊大学芝加哥分校所属机构:芝加哥,伊利诺伊州,美国电子邮箱:[parde@uic\.edu](mailto:)

###### 摘要

通过基于提示的领域自适应模型进行口语分析,是针对低资源、非侵入性痴呆筛查的一个有前景的方向,但这类模型的内部机制仍然不透明。我们研究了通过提示微调的领域自适应模型(DAPF)框架的可解释性,该框架将痴呆检测构建为与诊断相关的掩码标记预测。我们使用多种探测和分析技术来解释DAPF和强大的基线模型,发现DAPF在整体性能上最佳(准确率=0.83,宏F1=0.83),且诊断信息最能从其\[MASK\]表征中恢复。然而,这种表征优势并未延伸到标记级别的解释可信度。DAPF的归因主要反映了语言任务词汇、语篇标记和转录伪影,扰动测试显示效果微弱或为负。这表明其掩码标记接口能够确定诊断信息,但并未产生可信的标记级别解释。

## 1引言

从口语中检测阿尔茨海默病及相关痴呆症(ADRD),为传统的生物标志物提供了低成本、非侵入性的替代方案(de la Fuente Garcia等人,2020;Ding等人,2024;Lima等人,2025)。无需神经影像学、脑脊液采集、血浆生物标志物或基于血液的检测(Khan和Alkon,2015;Leuzy等人,2025;Mielke等人,2024),口语对话可以通过图片描述、故事复述或对话访谈等方式引出(Luz等人,2020;Lanzi等人,2023;Clarke等人,2021;Pope和Davis,2011)。这使其成为研究ADRD相关语言变化(如词汇选择、流利度、语篇组织等)差异的有用媒介(Ahmed等人,2013;Slegers等人,2018;Gao和He,2024)。

然而,跨语料库的泛化对于口语ADRD检测来说是困难的。不同数据集在规模、参与者人口统计和诱导任务上存在差异,在特定语料库上的高准确率并不能确凿地证明模型学到了与ADRD相关的语言或任务特定模式(Farzana和Parde,2023;Wang等人,2022)。通过提示微调的领域自适应模型(DAPF)将跨领域检测构建为一个完形填空式的掩码标记任务,通过将转录文本嵌入包含领域信息和诊断相关标签词的提示中(Farzana和Parde,2024),在\[MASK\]位置预测标签词,并通过一个verbalizer将它们映射到实际标签。从可解释性的角度来看,这是一个有趣的案例。手动提示是可读的,但并不一定是模型决策的忠实解释(Jacovi和Goldberg,2020;Lyu等人,2024)。基于提示的分类器也可能依赖于提示结构和其他数据集特定线索(Jiang等人,2020;Hu等人,2022;Farzana和Parde,2024)。

在本文中,我们在一个受控的跨领域设置中,对DAPF进行了系统的可解释性实验。我们使用表征探测(Belinkov,2022)来测试诊断信息是否可以从特定位置的隐藏状态中恢复,并使用积分梯度(Sundararajan等人,2017)来分配标记级别的贡献度,以预测“痴呆”概率。我们通过归一化的标记类型对随机种子下的归因进行聚合,然后使用删除和插入测试(Fong和Vedaldi,2017;Petsiuk等人,2018)来评估归因的可信度,并通过配对错误分析来比较模型决策。

我们的发现证实,许多高归因标记反映的是诱导任务或转录惯例,而非清晰的ADRD相关语言行为。研究还揭示了表征级别可解释性与标记级别可信度之间的分离。DAPF取得了比控制基线更高的准确率和宏F1值,且其最终层\[MASK\]表征比其自身的\[CLS\]表征以及基线模型的最终层\[CLS\]表征包含更多信息。然而,扰动测试表明,DAPF高亮的标记并不一致地支持其“痴呆”预测。因此,虽然DAPF似乎将诊断信息集中在提示预测位置,但这并不一定能带来可信的单词级别解释。

## 2相关工作

### 2.1基于口语的痴呆检测

基于语音的ADRD检测已被广泛综述(Petti等人,2020;de la Fuente Garcia等人,2020;Qi等人,2023;Ding等人,2024;Slegers等人,2018)。该任务最流行的数据集是DementiaBank,特别是其中的匹兹堡语料库(Pitt Corpus),基于图片描述(Lanzi等人,2023)。ADReSS标准化了匹兹堡语料库,而ADReSSo和ADReSS‑M则将其扩展到仅语音检测和多语言评估(Luz等人,2020;Luz等人,2021;Luz等人,2024)。其他以前使用的数据集包括CCC,它包含较长的健康导向对话访谈(Pope和Davis,2011),以及SLaCAD,它将口语数据与临床和生物标志物测量联系起来,用于早期ADRD检测(Farzana等人,2024)。它们在诱导任务、转录长度、参与者和临床标注方面的差异,使它们适用于研究跨领域泛化与对任务特定词汇或数据集伪影的虚假拟合。

### 2.2提示学习与领域适应

提示学习已广泛应用于通过手动设计的提示、自动生成的提示和可学习的连续提示来适配预训练语言模型(Schick和Schütze,2021;Shin等人,2020;Gao等人,2021;Ding等人,2022;Li和Liang,2021;Lester等人,2021;Liu等人,2022)。它也应用于领域适应,通过学习特定领域的提示同时固定大部分模型参数(Ben‑David等人,2022;Goswami等人,2023;Hedderich等人,2021)。在口语ADRD检测中,DAPF使用基于提示的掩码标记预测来提高跨域性能(Farzana和Parde,2024)。先前工作主要集中在其预测性能上,而我们研究该模型如何表征诊断相关信息,以及其预测是否能被可靠地解释。

### 2.3表征探测

表征探测训练辅助分类器来测试模型的隐藏状态中可恢复哪些信息(Belinkov,2022)。逐层探测已被用于检查语言信息在BERT中出现的位置(Tenney等人,2019)。由于探测性能可能反映探测器自身的学习能力,先前工作建议使用简单探测器和控制任务(Hewitt和Liang,2019)。因此,我们使用逻辑回归并通过随机标签控制任务验证结果。

### 2.4事后归因可解释性

事后可解释性方法被广泛用于识别输入的哪些部分对预测有贡献(Madsen等人,2022)。在临床NLP中,模型可能看似表现良好,但实际上依赖于数据集特定线索、预处理伪影或与临床无关的标记(Wang等人,2022;Vásquez‑Venegas等人,2024)。基于梯度的标记级归因方法从模型的梯度估计输入标记的贡献(Simonyan等人,2013;Ancona等人,2019;Smilkov等人,2017;Sundararajan等人,2017);例如,积分梯度追踪当输入从基准版本移动到实际样本时,模型预测如何变化(Sundararajan等人,2017)。基于扰动的方法,如遮挡、LIME、SHAP和特征消融,则通过移除、遮盖或替换输入的部分内容来测量预测如何变化(Zeiler和Fergus,2014;Ribeiro等人,2016;Lundberg和Lee,2017;Li等人,2016;Fong和Vedaldi,2017)。

归因分数不应默认被视为忠实的解释。高亮的标记可能看起来合理,但未能反映模型的实际决策过程(Jacovi和Goldberg,2020;Poerner等人,2018)。如果高亮的标记对ADRD预测确实重要,移除它们应该会削弱该预测,而保留或恢复它们则应有助于保持或恢复预测(Fong和Vedaldi,2017;Petsiuk等人,2018;DeYoung等人,2020)。基于转录的模型可能捕捉与损伤相关的标记,但也可能利用特定于任务或语料库的线索,如图片描述内容、转录/不流畅标记、访谈者交互或其他数据集特定伪影(Cummings,2019;Farzana等人,2022;Heitz等人,2024;Farzana和Parde,2023;Liu等人,2024)。我们使用积分梯度、跨种子归因聚合以及删除/插入测试来检查DAPF的预测是否得到稳定和可信的标记级证据支持。

### 2.5痴呆检测中的可解释性

可解释性对于建立对口语ADRD检测系统的信任至关重要。早期工作强调手工制作的声学和语言特征,包括词汇、句法、语义、语篇和流利度度量(Fraser等人,2015;Mueller等人,2018;Davis和Maclagan,2009;Rohanian等人,2021;Petti等人,2020;Qi等人,2023)。最近的研究将事后解释方法应用于ADRD模型,识别出临床上合理的语言线索,同时也表明解释可能受到语料库特定和预处理相关伪影的影响(Shankar等人,2025;Vimbi等人,2024;Iqbal等人,2024;Oiza‑Zapata和Gallardo‑Antolín,2025;Wang等人,2020;Zhu等人,2022;Gallardo Antolín等人,2025;Farzana等人,2022;Heitz等人,2024;Farzana和Parde,2023;Liu等人,2024)。大多数先前工作集中在解释的临床合理性或实用性上。相比之下,我们研究一个基于提示的ADRD检测器是否在提示预测位置编码了诊断信息,以及其标记级归因是否稳定和可信。

## 3任务与模型背景

### 3.1任务

我们使用一个处理模型(DAPF)和两个基线模型(BERT‑CLS和BERT‑CLS+提示)研究基于口语转录的二元ADRD检测,以区分提示和特殊标记的影响。模型在§3.2和§3.3中描述。鉴于口语ADRD数据的有限性,我们在一个跨领域设置中评估所有模型,使用卡罗莱纳对话集(CCC)作为源域(Pope和Davis,2011),ADReSS作为目标域(Luz等人,2020)。有关这些数据集的详细信息已在§2.1中提供。

我们使用ADReSS训练集作为目标训练域进行CCC→ADReSS适应,并在保留的ADReSS测试集上进行评估。类别分布如表1所示。两个数据集的规模都很小,这使得可解释性分析具有挑战性,因为标记级解释可能对单个参与者、重复的任务提示等因素敏感。

相似文章

拆解病态捷径:用于忠实LVLM解码的因果框架

arXiv cs.AI

本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。

物体能提供什么,而非它们是什么:用于可供性推理的功能潜在空间

arXiv cs.LG

本文介绍了A4D,一个将视觉观察映射到围绕可供性(例如“可移动”)构建的共享潜在空间中的框架,用于机器人规划。它在现有可供性上实现了94%的推理准确率,比现有最优方法高出15%,并且实现了100倍的推理速度提升,对未见过的物体功能具有更强的泛化能力。