DS@GT ARC 在 eRisk 2026 中的应用:具有结构化算法指导的混合多智能体大语言模型系统用于对话式抑郁症筛查

arXiv cs.AI 论文

摘要

本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。

arXiv:2607.16712v1 公告类型:新 摘要:我们描述了 DS@GT 向 eRisk 2026 任务 1 挑战赛的提交方案,该任务涉及对话式抑郁症筛查。在此挑战中,系统与模拟不同抑郁概况个体的 LLM 角色进行对话,并为每个角色生成贝克抑郁量表第二版(BDI-II)评分及四个关键症状,而无需直接询问敏感的心理健康问题。我们的流水线经历了三个阶段:最初是单一模型的整体原型,然后是基线多智能体架构,该架构在协调编排层下将对话访谈与 BDI-II 评分分离,最后是混合配置,用开源 Gemma 27B 替代了付费的 GPT-5-nano 访谈器。为了弥补该模型在推理和指令遵循方面的不足,混合系统增加了三个算法组件:一个预计算的对话树,用于标准化访谈开场白和后续问题;一个受 Weaver 框架启发的可靠性加权共识聚合;以及一个用于未探查症状的基于聚类的插补步骤。我们在所有 20 个角色上提交了三个全自动运行结果:运行 1 来自付费基线,运行 2 和 3 来自混合系统。混合运行 3 的 ADODL 达到了 0.9063,在所有完整提交运行中排名第三,使 DS@GT 在总共 21 个团队中排名第二,同时以大约每人 API 成本的四分之一超越了付费基线运行 1(0.8841)。这些结果支持了我们的核心假设:在充分的算法监督下,较弱的开源模型可以在对话访谈者角色中与更强的专有模型竞争。我们的源代码可在 https://github.com/dsgt-arc/erisk-task1-2026 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:39

# eRisk Lab 2026年CLEF任务1笔记 来源:https://arxiv.org/html/2607.16712 \\copyrightclause 本文版权归作者所有。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \\conference CLEF 2026工作笔记,2026年9月21-24日,德国耶拿 [orcid=0009-0002-1080-5980, [email protected]]\\cormark[1] [orcid=0009-0009-9855-5330, [email protected]] \\cortext[1]通讯作者。(2026年) ###### 摘要 我们描述了DS@GT在eRisk 2026任务1挑战赛(对话式抑郁症筛查)中的提交方案。在该任务中,系统与模拟不同抑郁症特征的LLM角色进行访谈,并生成每个角色的贝克抑郁量表第二版(BDI-II)评分及四个关键症状,且不能直接询问敏感的心理健康问题。我们的流程经历了三个阶段:首先是单体单模型原型,其次是基线多智能体架构(将对话访谈与BDI-II评分分离,并由一个协调编排层进行管理),最后是混合配置(用开源Gemma 27B替代付费的GPT-5-nano访谈者)。为弥补模型在推理和指令遵循方面的不足,混合方案增加了三个算法组件:一个预计算对话树(用于标准化访谈开场和跟进问题)、一个受Weaver框架启发的可靠性加权共识聚合方法,以及一个基于聚类的未探测症状插补步骤。我们针对全部20个角色提交了三个全自动运行结果:运行1来自付费基线,运行2和运行3来自混合方案。混合方案运行3的ADODL达到0.9063,在所有完整提交运行中排名第三,使DS@GT在全部21个团队中位列第二,同时其每个角色的API成本约为付费基线运行1(0.8841)的四分之一。这些结果支持我们的核心假设:在充分的算法监督下,较弱的开源模型可以在对话访谈者角色上与较强的专有模型竞争。我们的源代码可在https://github.com/dsgt-arc/erisk-task1-2026获取。 ###### 关键词: eRisk 2026\\sep对话式抑郁症筛查\\sepBDI-II评估\\sep大型语言模型\\sep多智能体系统\\sep智能体编排\\sep开源模型\\sep对话树\\sep可靠性加权聚合 ## 1引言 抑郁症影响着全球超过2.8亿人[cite_depression],并且通常在症状达到临床严重程度之前未被发现[faisalcury2022]。贝克抑郁量表第二版(BDI-II)[beck1996]等结构化工具提供了经过验证的严重程度评估框架,但其管理需要训练有素的临床医生,限制了在资源受限环境中的可扩展性。能够引出并解释抑郁症状信息的自动化对话系统代表了扩大筛查覆盖范围的一个实用方向,前提是它们能在不直接进行临床询问的情况下提供可靠的评估。近期研究支持这一方向:系统性综述报告了LLM在抑郁症相关任务上的强劲表现[omar2025],包括自杀意念在内的抑郁症状可在在线社交媒体话语中观察到[aragon2025],而将临床访谈内容结构化为有向图用于基于LLM的评估已在自动化抑郁症检测中取得竞争力[chen2024depression]。 eRisk 2026任务1挑战为该问题提供了一个受控测试平台。参与者与LLM角色进行对话交互,这些角色是经过LoRA适配器微调的Llama-3-8B-Instruct,模拟具有不同抑郁症特征的个体。对于每个角色,参与者需估算一个BDI-II评分并识别最多四个突出症状。任务禁止直接询问抑郁症相关问题,并要求从自然对话中推断症状严重程度。评估还通过对话轮数对延迟决策进行惩罚,从而在彻底诊断与对话效率之间形成权衡。 该任务的两个特点使得标准建模和开发变得困难。首先,在提交期间全程不提供真实标签,这意味着系统必须在“黑暗中”运行,并且无法根据任务特定标签直接调整预测。其次,角色每周发布并设有严格的提交截止日期,要求系统既从一开始就可靠,又能在整个期间不断改进。在这些限制下,我们采用了迭代开发策略,每周的角色用于验证和测试设计变更。 基于我们之前的DS@GT eRisk 2025提交[miyaguchi2025],我们的系统经历了三个阶段。初始的单模型原型建立了端到端功能,但在重复运行中表现出评分漂移和不一致的症状覆盖。将对话访谈与BDI-II评分分离的多智能体架构提高了覆盖率和可靠性,但代价是API支出大约翻倍。最后的混合配置保留了多智能体结构,但用开源的Gemma 27B替代了付费访谈者模型,并通过算法监督(预计算对话树、可靠性加权样本聚合、以及跨症状簇的插补)来弥补模型遵循松散、方差较高的问题。对于大多数角色,我们使用付费配置进行运行1,使用混合配置进行运行2和运行3。 本研究的主要假设是:在充分的算法指导下,较弱的开源模型在访谈者角色上可以产生与较强付费模型竞争的结果。我们的结果支持这一主张。在官方评估中,混合方案产生的运行2和运行3在主要评估指标ADODL上均优于付费模型运行1,且每个角色的API成本约为后者的四分之一。此外,运行3在所有完整提交运行中排名第三,在所有团队中排名第二。 ## 2任务与评估 参与者与最多20个每周发布的LLM角色进行交互。每个角色作为Llama-3-8B-Instruct上的LoRA适配器实现,模拟具有特定抑郁特征的个体。对于每个角色,参与者提交一个BDI-II评分和最多四个关键症状。每个角色最多允许三个全自动运行。 BDI-II问卷涵盖21个症状,例如悲伤、悲观、自我批评、睡眠变化、疲劳和注意力不集中,每个症状评分0-3,总分最高63。严重程度通常分类为:最低(0-13)、轻度(14-19)、中度(20-28)和重度(29-63)。 ## 3系统架构与方法 ### 3.1 单体单模型原型 我们的初始原型将对话和评分责任分配给一个单一语言模型,并使用统一的上下文密集型提示。该系统与LLM角色进行多轮访谈,然后在对话结束时生成结构化的BDI-II评分报告。提示工程侧重于两个优先事项:引导模型在单轮对话中针对相关症状簇进行探查以减少总轮数,以及为每个BDI-II症状提供明确的0-3评分标准以提高运行间一致性。 虽然这种方法确认了端到端功能,但表现出两种系统性失效模式。首先,将访谈和评分分配给同一个模型在初步实验中产生了评分漂移。对相同角色重复运行产生了显著不同的BDI-II总分和症状排名,反映了对访谈者和角色采样随机性的敏感性。其次,没有外部机制强制执行症状覆盖,模型有时会在部分症状上耗尽对话轮预算,导致其他症状未被探查。 这些不稳定性因角色本身的非确定性而加剧。例如,角色3对相同的问题(“你最近对自己比以前更苛刻了吗?”)在一次会话中回答“我不认为自己对自己苛刻”,而在另一次中回答“确实更苛刻了”,这种对话和评分中的方差难以用单模型系统控制。 ### 3.2 多智能体架构(基线) 为解决单体系统的可靠性限制,我们将对话和评分责任分离为两个专门智能体,由编排层协调(图1 (https://arxiv.org/html/2607.16712#S3.F1))。该方法受SINAI团队在eRisk 2025中类似的多智能体设计启发[cite_erisk2025sinai]。 请参考标题 图1:多智能体系统架构。访谈者智能体与LLM角色进行逐轮对话,评分者智能体在每轮后更新BDI-II症状估计和置信水平。编排层对症状优先级进行排序,引导访谈者指向最高优先级目标,并强制执行停止条件。每个角色运行10到20个访谈样本,样本聚合步骤通过可靠性加权中位数构建共识轮廓,以选择最接近的运行提交。 **访谈者智能体** 进行自适应的多轮对话。其提示指示其提出针对性的、自然的问题来探查可能的抑郁症状,当初始回答模糊时进行区分严重程度的追问,并避免直接询问抑郁症或心理健康问题。**评分者智能体** 与访谈并行操作,在每轮后审查完整的对话记录,并为所有21个BDI-II症状生成更新后的0-3估计值及每个症状的置信度分数。通过在每一轮(而非对话结束时)运行评分者,编排层可以接收到持续更新的诊断图像。 **编排层** 基于近期关于集中式编排器改善多智能体LLM系统协调性的发现[dang2025orchestration],发挥三个功能。首先,它将21个BDI-II症状分组为七个主题簇,并根据结合当前估计严重度和逆置信度的优先级分数进行排序,以引导访谈者在每一轮指向诊断最不充分的症状。其次,它将特定簇的指令动态嵌入到访谈者的提示中,使对话智能体针对高优先级领域。第三,它在每轮后根据四个标准强制执行停止条件:(a) 18轮硬限制,(b) 超过8轮后所有症状置信度超过0.6,(c) 超过10轮后连续最后3轮BDI-II总分变化小于2分,或 (d) 至少70%症状被探查过(但18轮限制会覆盖此条件)。这些条件有助于最小化每场对话的轮数,并强制执行任务施加的硬限制。我们启发式地选择了数值阈值(轮数上限、0.6置信度下限和70%覆盖标准),并在提交期间缺少真实标签的情况下,通过人工检查已发布角色进行调整。 为减轻运行级方差,我们每个角色批处理30个访谈样本,并选择BDI-II总分最接近批次中位数的三个运行进行提交。我们随后将多智能体系统的这一初始版本保留为项目剩余部分的**基线配置**。 ### 3.3 混合配置 多智能体架构改善了覆盖率和一致性,但相较于单体原型,API成本大约翻倍,因为每轮需要将完整对话历史传递给两个模型实例。这促使我们尝试使用更便宜的开源模型来实现类似的预测结果。我们保留GPT-5-nano[gpt5nano]用于评分者(指令遵循精度直接影响诊断准确性),同时用Gemma 27B[gemma3]替换访谈者(对话自然性和问题多样性是首要需求)。系统的所有其他组件(评分者智能体、编排层、停止条件以及多智能体循环本身)在基线和混合方案中保持不变或并行改进。 混合配置的初始结果揭示了两种可预测的失效模式,与较弱的开源模型一致。混合方案系统性地低估了BDI-II总分,尤其是对于具有显著认知和情感症状的角色,并且运行间评分方差高于付费基线。我们将这两种效应归因于Gemma 27B倾向于接受表面层次的回答而不深入探查情感内容,以及其遵循提示中结构化访谈指令的可靠性较低[cite_hallucination]。 我们开发了三个算法组件来解决这些限制。 请参考标题 图2:预计算对话树的簇1(情绪与快感),展示了两个开场问题(悲伤Q1和快感缺失Q4)及其消极和积极响应的跟进分支。覆盖所有七个簇的完整树见附录A (https://arxiv.org/html/2607.16712#A1)。 #### 对话树。 结构化任务框架已被证明能改善LLM对话智能体的可控性和连贯性[li2024chatsop]。为标准化访谈开场并减少无约束问题生成引入的方差,我们构建了一个预计算对话树,包含7个症状簇、12个簇开场问题和17个跟进探针。症状按主题分组,以便语义相关的项目可以在单个对话线程中探查,每个单独症状或小症状对分配其专用的开场问题。这种分组方式利用了自然的对话流程,因为相关症状往往在相同的情感基调下同时出现。已经讨论精力和疲劳的角色更可能对关于睡眠的跟进问题做出开放回应,而不是一个突兀的话题转换,从而产生更丰富的响应和更可靠的评分者估计。临床敏感症状(如自杀意念和对性兴趣丧失)没有预计算行,以便逐案处理。我们将对话的第一个问题硬编码为针对悲伤和快感缺失。后续开场问题按需选择,系统检索第一个未使用的开场问题,其目标症状出现在编排器当前未评估或低置信度优先级列表中。随着评分者在各轮中获得置信度,症状从优先级列表中移除,其开场问题被跳过,因此并非每个开场问题都在每次访谈中触发。在每个开场问题内,使用BM25[robertson2009]文本匹配角色响应来选择最佳跟进分支。该结构大约覆盖2-3个无需任何LLM调用的对话轮(图2 (https://arxiv.org/html/2607.16712#S3.F2))。 #### 可靠性加权聚合。 多智能体基线中使用的简单中位数选择在每样本方差高时对异常值敏感。借鉴经典集成学习原理(许多弱预测器智能组合可以匹配单个强预测器),该原理近期被Weaver框架[cite_weaver]适配用于LLM验证器聚合,我们将其替换为可靠性加权共识方法。对于每个

相似文章