标签
本文提出一种透明框架,将语音声学特征与DSM-5抑郁指标相关联,实现可解释的检测。该框架在商品硬件上本地运行以保护隐私。
本文使用多模态特征(声学、面部、轮流说话)分析自发性双人Zoom对话,以识别对话成功感知的标记,发现语音和面部运动的协调与更高的互动质量相关。