迈向可解释的抑郁检测:将声学特征与DSM-5指标相关联
摘要
本文提出一种透明框架,将语音声学特征与DSM-5抑郁指标相关联,实现可解释的检测。该框架在商品硬件上本地运行以保护隐私。
arXiv:2608.26148v1 Announce Type: new
摘要:抑郁影响着全球数百万人,但诊断依赖于主观的自我报告,可能错过真实行为。本文提出一种方法,通过透明链接框架将语音声学与DSM-5抑郁行为指标相关联。与黑盒模型不同,该框架明确将声学特征(如音高变异性、停顿、语速)映射到临床指标,实现可解释的、指标级输出。系统在商品硬件(HW)上本地运行以保护隐私。在DAIC-WOZ上的初步评估显示,声学特征与DSM-5指标在精神运动改变和注意力困难方面存在方向性一致的关联,支持设计原理。未来工作将在纵向数据集上验证,并扩展多模态集成,同时保持边缘约束。
查看缓存全文
缓存时间: 2026/08/28 09:21
# 迈向可解释的抑郁症检测:将声学特征与DSM-5指标相联系 来源:https://arxiv.org/abs/2608.26148 查看PDF (https://arxiv.org/pdf/2608.26148) > 摘要:抑郁症影响全球数百万人,但诊断依赖于可能错过真实行为的主观自我报告。本文提出一种方法,通过透明的关联框架,将语音声学特征与DSM-5抑郁症行为指标相联系。与黑盒模型不同,该框架明确地将声学特征(音高变异性、停顿、语音速度)映射至临床指标,从而生成可解释的、基于指标水平的输出结果。该系统在商用硬件(HW)上本地运行以保障隐私。在DAIC-WOZ数据集上的初步评估显示,对于精神运动性改变和注意力困难等指标,声学特征与DSM-5指标之间存在方向一致的关联性,支持了设计原理。未来工作将在纵向数据集上进行验证,并在保持边缘计算约束的同时扩展多模态融合。 ## 投稿历史 来自:Bruno Rodrigues \[查看邮件 (https://arxiv.org/show-email/0dea4177/2608.26148)\] **\[v1\]** 2026年6月29日(周一)07:17:46 UTC(853 KB)
相似文章
大语言模型中抑郁症的可解释症状向量
本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。
使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测
本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。
双人交互中抑郁检测的说话人感知时序聚合策略:一项基准研究
本文介绍了DEPOOL,一个受控基准,评估了六种时序聚合架构在六种冻结语音主干网络上的表现,用于双人交互中的抑郁检测,发现许多配置会坍缩为单类别预测,并且鲁棒性应作为一个关键标准。
基于优势加权排名的二元抑郁检测中潜在抑郁严重程度的揭示
提出了一种细粒度多模态框架,采用 Binary Advantage-weighting Ranking Loss 进行自动抑郁检测,在 D-vlog 和 LMVD 数据集上取得了最先进的结果。
对话时间动态能否改善双人抑郁检测?多模态视角下的初步探究
本文研究了对话时间动态(话轮对时序)作为一种轻量级模态,用于从双人临床访谈中自动检测抑郁。结果表明,一个紧凑的24维时序模块表现出色,并且在融合时能够补充标准的声学和语义特征。