HiMA-MDD:用于临床访谈中可解释的多模态抑郁症检测的层级多代理框架

arXiv cs.AI 论文

摘要

HiMA-MDD引入了一个层级多代理系统,用于解释多模态临床访谈以检测抑郁症,在E-DAIC数据集上实现了最先进的性能。

arXiv:2608.21868v1 公告类型:新 摘要:从多模态临床访谈中评估抑郁症需要将来自多个症状的分散证据整合成一个连贯的PHQ-8概况。这个过程是层级式的:相关证据在局部问答交换中往往稀少且依赖于上下文,多个交换共同支持症状级别的判断,最终评估取决于完整症状概况的连贯性。现有的LLM系统要么整体处理访谈,要么在通用代理角色之间分配工作;这两种设计都不一定提供一个显式的编排机制来协调这些层级上的证据访问、项目评分权限、有限反馈和状态记录。为了解决这一差距,我们引入了HiMA-MDD,一个层级多代理框架,将此评估层级与三个代理层对齐。在非代理预处理构建保留上下文的多模态QA单元后,第1层识别候选的QA到项目关系并支持有限的项目基础证据路由。第2层将症状组分配给操作因子专家,每个专家负责一个临时的项目分数。第3层审计完整的临时概况,请求至多一轮有针对性的修订,并重建经过验证的PHQ-8概况。这种分层设计自然地产生了层级证据轨迹,保留了所有中间证据、判断和修订以供审计。最终的项目分数然后确定性地产生总分和筛查决策。使用Qwen2.5-72B-Instruct作为框架支柱,我们在E-DAIC上的实验表明HiMA-MDD优于比较的最先进的方法。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:28

# HiMA-MDD:用于临床访谈中可解释多模态抑郁检测的层级化多智能体协同框架
来源:https://arxiv.org/html/2608.21868
###### 摘要

从多模态临床访谈中评估抑郁症状,需要将多种症状的分散证据整合为连贯的 PHQ-8 量表评估。此过程具有层级性:相关证据在局部问答交互中往往稀疏且依赖上下文,多个交互共同支持症状层面的判断,而最终评估则取决于完整症状描述的一致性。现有的大语言模型系统要么整体处理访谈内容,要么将工作分配给通用的智能体角色;这两种设计都不一定能提供明确的编排机制来协调跨层级的证据访问、项目评分权限、有界反馈和状态记录。为解决这一缺口,我们引入 HiMA-MDD,一个层级化的多智能体协同框架,将该评估层级与三层智能体架构对齐。在非智能体的预处理构建保留上下文的多模态问答单元后,第一层识别候选问答项关系并支持有界的、基于项目的证据路由。第二层将症状组分配给操作性的因子专家,每个专家负责一个临时项目评分。第三层审核完整的临时描述,请求最多一轮定向修正,并重建验证后的 PHQ-8 描述。这种分层设计自然产生了层级化证据追踪,保留了所有中间证据、判断和修订以供审计。最终的项目评分然后确定性地生成总分和筛查决策。以 Qwen2.5-72B-Instruct 作为协同框架的骨干,我们在 E-DAIC 上的实验表明,HiMA-MDD 性能优于所比较的最先进方法。

## 引言

抑郁症是一种常见的精神障碍,以持续的情绪低落或兴趣/愉悦感丧失为特征,常伴有睡眠、食欲、精力、注意力和自我价值感的变化。它会扰乱人际关系、教育、就业和日常功能,严重发作可能与自杀相关。世界卫生组织估计,全球约有 3.32 亿人患有抑郁症,占成年人的 5.7%,而精神卫生保健的可及性仍存在巨大差距(世界卫生组织 2025 (https://arxiv.org/html/2608.21868#bib.bib41))。因此,可靠及时的评估是一个重要的临床和公共卫生问题,这推动了能够组织临床访谈中分散信息的计算方法的发展。

图 1:整体访谈级评估与我们的 HiMA-MDD 的比较。抑郁评估的计算方法包括对完整访谈的整体预测,以及纳入问卷结构、检索参与者特定证据、组织长访谈内容或产生症状感知输出的方法(Nguyen 等 2022 (https://arxiv.org/html/2608.21868#bib.bib28);Jung 等 2024 (https://arxiv.org/html/2608.21868#bib.bib19);Mandal 等 2025 (https://arxiv.org/html/2608.21868#bib.bib27);Wang 等 2026 (https://arxiv.org/html/2608.21868#bib.bib39);Rosenman, Hendler, 和 Wolf 2024 (https://arxiv.org/html/2608.21868#bib.bib35);Zhang 等 2025 (https://arxiv.org/html/2608.21868#bib.bib44);Chen 等 2024 (https://arxiv.org/html/2608.21868#bib.bib5);Lyu 等 2026 (https://arxiv.org/html/2608.21868#bib.bib26))。最近,多智能体系统将提问、回答充分性评估、评分、判断和更新分配给专门的功能角色(Kim 等 2024 (https://arxiv.org/html/2608.21868#bib.bib20);Hu 等 2026 (https://arxiv.org/html/2608.21868#bib.bib17);Bi 等 2025 (https://arxiv.org/html/2608.21868#bib.bib2);Greene 等 2026 (https://arxiv.org/html/2608.21868#bib.bib14))。尽管取得了这些进展,但仍存在两个相关局限性。整体预测器可能使局部访谈上下文与症状级决策之间的联系变得隐含,而面向功能的多智能体流程并不一定指明每个智能体可以访问哪些证据,或者评分责任应如何与 PHQ-8 项目结构对齐。更广泛地说,多模态临床访谈、症状推理和 PHQ-8 评估在不同的粒度级别上运行,但现有系统不一定能明确协调跨这些层级的证据访问、评分权限和全局修订。我们将这种脱节称为层级测量-协调差距。如图 1 (https://arxiv.org/html/2608.21868#Sx1.F1) 所示,示意图中的整体路径将访谈扁平化为单一的全局预测,使证据归因隐含化,并且主要在输出阶段应用 PHQ-8 结构。

为弥合这一差距,我们引入了 HiMA-MDD,一个用于从多模态临床访谈中进行可解释抑郁评估的测量对齐的层级化多智能体协同框架,它维持从局部多模态交互到最终 PHQ-8 描述的证据-项目责任链。该协同框架是一个明确的编排层,它控制每个智能体可以访问哪些证据、有权生成或修订哪些项目评分、反馈如何跨层级传播,以及如何保留中间状态以供审计。HiMA-MDD 并非将多个智能体视为不受约束的工作流,而是通过三个受控的智能体角色对齐证据、智能体和测量层级。问答项锚定智能体识别局部访谈交互与 PHQ-8 项目之间的候选关系,并支持构建有界的、基于项目的证据包。多因子症状推理智能体协调操作性的症状因子专家,每个专家负责一个临时项目评分。全局症状验证智能体审核完整的临时描述,在需要时请求定向修订,并重建验证后的八项目 PHQ-8 症状描述。最终的项目评分然后被求和以获得 PHQ-8 总分,并在预设阈值下映射到筛查决策。记录的证据链接、中间判断、审计发现和修订共同构成了层级化证据追踪,使证据到描述的过程可被检查。

我们的贡献有三方面:

- **层级化的多模态抑郁评估表述**,连接局部访谈证据、症状级判断和完整的 PHQ-8 描述,以识别层级测量-协调差距。
- **一个测量对齐的层级化多智能体协同框架**,控制证据访问、单所有者临时评分、有界反馈、描述重建和记录的来源。
- **对协同推理的逐层评估**,涵盖整体性能、证据访问、推理粒度、全局验证与重建以及追踪可检查性。

## 相关工作

### 多模态抑郁评估

早期的多模态抑郁评估系统通常从完整访谈中预测总分或筛查标签(Al Hanai, Ghassemi, and Glass 2018 (https://arxiv.org/html/2608.21868#bib.bib1);Ringeval 等 2019 (https://arxiv.org/html/2608.21868#bib.bib34))。近期系统已将大语言模型派生的转录表示、面部表情特征和多模态大语言模型纳入抑郁识别(Sadeghi 等 2024 (https://arxiv.org/html/2608.21868#bib.bib36);Zhang 等 2026 (https://arxiv.org/html/2608.21868#bib.bib45))。其他研究则转向更细粒度的评估,使用问卷项目或子分数作为预测目标,从访谈文本完成标准化问卷,或为个别问卷项目分别检索证据(Mandal 等 2025 (https://arxiv.org/html/2608.21868#bib.bib27);Wang 等 2026 (https://arxiv.org/html/2608.21868#bib.bib39);Rosenman, Hendler, and Wolf 2024 (https://arxiv.org/html/2608.21868#bib.bib35);Ravenda 等 2025 (https://arxiv.org/html/2608.21868#bib.bib32))。相关方法通过问题层级或结构图组织长访谈,并生成 PHQ 感知的症状摘要、证据或理由(Zhang 等 2025 (https://arxiv.org/html/2608.21868#bib.bib44);Jung 等 2024 (https://arxiv.org/html/2608.21868#bib.bib19);Chen 等 2024 (https://arxiv.org/html/2608.21868#bib.bib5);Zheng 等 2025 (https://arxiv.org/html/2608.21868#bib.bib47);Lyu 等 2026 (https://arxiv.org/html/2608.21868#bib.bib26))。这些研究展示了保留访谈结构并超越单一总分进行预测的价值。然而,与症状相关的证据通常被视为输入表示或检索结果,而不是作为明确控制接口的一部分,该接口同时管理下游的评分责任。

### 用于抑郁评估的多智能体系统

多智能体系统为结构化心理健康评估提供了另一条途径。MDAgents 根据任务复杂度调整临床决策团队的组成;AgentMental 将问题生成、回答充分性评估、评分和信息更新分配给不同智能体;MAGI 围绕结构化精神科访谈协调专门角色;AI Psychiatrist Assistant 结合了评估、判断、评分和审查智能体(Kim 等 2024 (https://arxiv.org/html/2608.21868#bib.bib20);Hu 等 2026 (https://arxiv.org/html/2608.21868#bib.bib17);Bi 等 2025 (https://arxiv.org/html/2608.21868#bib.bib2);Greene 等 2026 (https://arxiv.org/html/2608.21868#bib.bib14))。这些系统展示了功能专业化如何组织复杂的评估工作流程。HiMA-MDD 解决的是一个不同的协调问题:从已完成的访谈进行评估,需要明确控制每个专家可以访问哪些证据、可以产生哪些临时项目评分、全局反馈如何触发有界修订,以及保留哪些中间状态。因此,它使用 PHQ-8 测量过程来管理智能体责任,而不是仅将角色专业化作为组织原则。

### PHQ 的心理测量结构

心理测量研究区分了问卷的总和严重程度分数与其各个项目所代表的症状描述。PHQ 分数通常通过求和项目反应获得,但总分相同的人可能有不同的症状描述(Fried 和 Nesse 2015a (https://arxiv.org/html/2608.21868#bib.bib10);Fried 和 Nesse 2015b (https://arxiv.org/html/2608.21868#bib.bib11))。关于 PHQ-9 内部结构的研究探讨了几种替代方案。单因子模型将所有项目视为一般抑郁严重程度的指标。相关的双因子模型通常区分认知/情感和躯体维度,而双因子模型则在保留一个一般因子的同时保留更具体的维度(Lamela 等 2020 (https://arxiv.org/html/2608.21868#bib.bib24);Fischer 等 2022 (https://arxiv.org/html/2608.21868#bib.bib9);Chae, Lee, and Lee 2025 (https://arxiv.org/html/2608.21868#bib.bib4))。其他研究报告了包含情感、躯体、内化和感觉运动症状的四组组织(Tseng 等 2024 (https://arxiv.org/html/2608.21868#bib.bib38))。这些研究结果并未确立一个普遍接受的唯一结构:支持的结构可能因人群、工具和建模假设而异。因此,HiMA-MDD 并未提出或验证新的 PHQ-8 因子模型。相反,它将四组组织调整为操作责任图;由于 PHQ-8 省略了自杀倾向项目,内化专家仅负责低自我价值感。单组、双组、四组和逐项配置作为替代的推理粒度进行评估,而非竞争的心理测量模型。

## 方法

### 任务表述与协同框架控制接口

我们引入 HiMA-MDD,一个用于从已完成的临床多模态访谈中进行可解释 PHQ-8 评估的测量对齐的层级化多智能体协同框架。该协同框架是一个明确的编排和控制层,实现了一个执行契约,而不仅仅是命名一系列模块:它控制每个角色可以检查哪些证据、哪个角色被授权产生每个临时项目评分、全局反馈如何修订该评分,以及必须保留哪些状态转换。智能体通过这些接口操作,而协同框架约束其允许的证据访问、评分更新、修订和输出。

给定已完成的访谈 $X$,核心层级协同框架产生八个原始的已验证 PHQ-8 项目评分 $\{\hat{y}_i\}_{i=1}^8$、相应的总分 $\hat{S}$、筛查决策 $\hat{c}$ 和层级化证据追踪 $T$:
$$
f(X) \rightarrow (\{\hat{y}_i\}_{i=1}^8, \hat{S}, \hat{c}, T),
$$
$$
\hat{S} = \sum_{i=1}^8 \hat{y}_i, \qquad \hat{c} = \mathbb{I}[\hat{S} \geq 10],
$$
其中每个 $\hat{y}_i \in \{0,1,2,3\}$。在核心协同框架内,总分和筛查决策遵循固定的 PHQ-8 规则。完整的 HiMA-MDD 评估协同框架额外暴露一个可选的受监督校准接口(如下所述),该接口将冻结的原始状态映射到校准的项目评分,然后在相同的固定 PHQ-8 规则下重新计算总分和筛查决策。

我们将 HiMA-MDD 层级协同框架形式化为
$$
\mathcal{H}_{\mathrm{HiMA}} = (\mathcal{I}, \mathcal{R}, \Omega, \mathcal{V}, \Gamma, \mathcal{T}),
$$
其中 $\mathcal{I}$ 包含 PHQ-8 项目评分标准和有序评分语义;$\mathcal{R}$ 定义候选问答项关系、初步证据极性元数据和有界的证据访问策略;$\Omega$ 将每个项目映射到恰好一个临时评分所有者;$\mathcal{V}$ 指定跨因子审计、定向修订和已验证描述重建;$\Gamma$ 确定性地将原始的已验证项目向量映射为其总分和筛查决策;而 $\mathcal{T}$ 指定 $T$ 中保留的来源和状态转换。这些接口强制执行四个不变性。第一,锚定估计候选项目相关性和初步证据极性,但不决定症状严重程度或产生项目评分。第二,每个项目恰好有一个被授权写入其临时评分的角色,尽管证据可能与多个项目相关。第三,全局反馈是定向的,限制在最多一轮修订中,并与产生的反应和分数变化一起记录。第四,智能体或验证器都不独立生成总分或筛查标签;两者都是八个原始的已验证项目评分的确定性结果。

图 2 (https://arxiv.org/html/2608.21868#Sx3.F2) 从访谈结构化到评估输出实例化了该契约。非智能体预处理构建保留上下文的多模态问答单元和 PHQ-8 测量契约。第一层在 $\mathcal{R}$ 下构建候选问答项关系和基于项目的证据包;第二层在 $\Omega$ 下将这些包分配给单所有者因子专家,并产生临时描述;...

相似文章

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

arXiv cs.CL

This paper presents an LLM pipeline that converts clinical interview audio into transcripts, maps them to the ten MADRS depression items, estimates severity, and flags problematic ratings. Evaluation on real clinical interviews shows a strong correlation of 0.867 with expert ratings, offering interpretable support for depression assessment in clinical trials.