逐层跨语言语音抑郁检测:基于对比对齐的分析
摘要
本文介绍了CLeaD,一种使用WavLM嵌入进行跨语言语音抑郁检测的监督对比对齐框架。它揭示了先前结果因说话人身份信息泄露而被夸大的事实,并在普通话说话人上取得了适度改进。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - 基于层级跨语言语音抑郁症检测:基于对比对齐的分析
来源:https://huggingface.co/papers/2607.02920
摘要
一个监督对比对齐框架将英语和普通话的WavLM嵌入映射到共享的临床空间,用于抑郁症检测,解决了跨语言泛化挑战,并揭示了由说话人身份泄露导致的性能伪影。
不同语言人群在抑郁症的诊断和临床表现上存在显著差异。基于语音的抑郁症检测在单语言场景下表现良好,但跨语言泛化 (https://huggingface.co/papers?q=cross-lingual%20generalization) 仍然是一个开放挑战。一个关键原因在于,先前工作使用基于段级的随机划分而未进行说话人分组,导致身份泄露,从而虚高了报告指标。我们提出CLeaD,一个监督对比对齐 (https://huggingface.co/papers?q=supervised%20contrastive%20alignment) 框架,将英语和普通话 (https://huggingface.co/papers?q=Mandarin) 的WavLM嵌入 (https://huggingface.co/papers?q=WavLM%20embeddings) 映射到共享的临床空间,无需并行数据或目标语言微调。在52位普通话 (https://huggingface.co/papers?q=Mandarin) 说话人的评估中,对比对齐在留一说话人评估 (https://huggingface.co/papers?q=leave-one-speaker-out%20evaluation) 下略微优于基线(F1: 0.640 vs. 0.622)。它还在中间层(7-8层)改善了抑郁类别的召回率,但测试集较小限制了泛化性。两个发现保持稳健:模型规模增大在提升单语言英语 (https://huggingface.co/papers?q=monolingual%20English) 性能的同时降低了跨语言性能;说话人身份泄露 (https://huggingface.co/papers?q=speaker%20identity%20leakage) 人为地将先前报告的普通话 (https://huggingface.co/papers?q=Mandarin) F1分数虚高至0.954,我们重现并量化了这一伪影。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02920)查看 PDF (https://arxiv.org/pdf/2607.02920)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02920)
在你的代理中获取此论文:
hf papers read 2607.02920
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
MA-DLE:基于记忆增强的语音自动抑郁程度评估
本文介绍了MA-DLE,一种基于记忆的特征增强方法,用于基于语音的自动抑郁程度评估,在DAIC-WOZ和E-DAIC数据集上达到了最先进的性能。
基于跨语言迁移学习的多语言语音阿尔茨海默病检测方法
本文提出了一种跨语言迁移学习方法,用于从语音中检测阿尔茨海默病,覆盖多种语言,实现了82%的F1分数,并支持实时筛查应用。
语音识别中的Convex低资源口音鲁棒语言检测
本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。
基于迁移学习与数据增强的低资源汉语方言辨识
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。
利用上下文对齐对比学习与岭回归集成提升词汇难度预测
本文引入了上下文对齐对比回归(Context-Aligned Contrastive Regression),通过解决语言学习数据集中的跨语言对齐和等级结构挑战,来提升词汇难度预测的效果。