逐层跨语言语音抑郁检测:基于对比对齐的分析

Hugging Face Daily Papers 论文

摘要

本文介绍了CLeaD,一种使用WavLM嵌入进行跨语言语音抑郁检测的监督对比对齐框架。它揭示了先前结果因说话人身份信息泄露而被夸大的事实,并在普通话说话人上取得了适度改进。

不同语言群体在抑郁症的诊断和临床表现上存在显著差异。基于语音的抑郁检测在单语言场景下表现良好,但跨语言泛化仍是一个开放挑战。一个关键原因是,先前的工作使用基于片段的随机划分而没有进行说话人分组,导致身份信息泄露,从而夸大了报告的指标。我们提出了CLeaD,一种监督对比对齐框架,它将来自英语和普通话的WavLM嵌入映射到一个共享的临床空间,无需平行数据或目标语言微调。在52名普通话说话人上进行留一说话人评估时,对比对齐相比基线取得了适度提升(F1: 0.640 vs. 0.622)。它还在中间层(7-8层)提高了抑郁类别的召回率,不过测试集较小限制了泛化性。有两个发现是稳健的:模型规模扩展降低了跨语言性能,同时提升了单语言英语性能;说话人身份信息泄露人为地将先前报告的普通话F1分数夸大到0.954,我们重现并量化了这一伪像。
查看原文
查看缓存全文

缓存时间: 2026/07/08 06:48

论文页面 - 基于层级跨语言语音抑郁症检测:基于对比对齐的分析

来源:https://huggingface.co/papers/2607.02920

摘要

一个监督对比对齐框架将英语和普通话的WavLM嵌入映射到共享的临床空间,用于抑郁症检测,解决了跨语言泛化挑战,并揭示了由说话人身份泄露导致的性能伪影。

不同语言人群在抑郁症的诊断和临床表现上存在显著差异。基于语音的抑郁症检测在单语言场景下表现良好,但跨语言泛化 (https://huggingface.co/papers?q=cross-lingual%20generalization) 仍然是一个开放挑战。一个关键原因在于,先前工作使用基于段级的随机划分而未进行说话人分组,导致身份泄露,从而虚高了报告指标。我们提出CLeaD,一个监督对比对齐 (https://huggingface.co/papers?q=supervised%20contrastive%20alignment) 框架,将英语和普通话 (https://huggingface.co/papers?q=Mandarin) 的WavLM嵌入 (https://huggingface.co/papers?q=WavLM%20embeddings) 映射到共享的临床空间,无需并行数据或目标语言微调。在52位普通话 (https://huggingface.co/papers?q=Mandarin) 说话人的评估中,对比对齐在留一说话人评估 (https://huggingface.co/papers?q=leave-one-speaker-out%20evaluation) 下略微优于基线(F1: 0.640 vs. 0.622)。它还在中间层(7-8层)改善了抑郁类别的召回率,但测试集较小限制了泛化性。两个发现保持稳健:模型规模增大在提升单语言英语 (https://huggingface.co/papers?q=monolingual%20English) 性能的同时降低了跨语言性能;说话人身份泄露 (https://huggingface.co/papers?q=speaker%20identity%20leakage) 人为地将先前报告的普通话 (https://huggingface.co/papers?q=Mandarin) F1分数虚高至0.954,我们重现并量化了这一伪影。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02920)查看 PDF (https://arxiv.org/pdf/2607.02920)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02920)

在你的代理中获取此论文:

hf papers read 2607.02920

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.02920 即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

语音识别中的Convex低资源口音鲁棒语言检测

Hugging Face Daily Papers

本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。