DreamerNLplus:使用混合规则和RAG方法从社交媒体时间线对心理健康动态进行可解释建模

arXiv cs.CL 论文

摘要

本文介绍了DreamerNLplus,这是一个混合框架,结合了LLM、DeBERTa、随机森林、规则方法和RAG,用于从社交媒体时间线对心理健康动态进行建模,以应对CLPsych 2026共享任务,在时间摘要和变化检测的子任务中取得了最高排名。

arXiv:2605.23052v1 公告类型:新 摘要:我们提出了DreamerNLplus,这是一个混合框架,用于在CLPsych 2026共享任务中从社交媒体时间线建模心理健康动态。我们的系统处理三个任务:心理状态建模、时间变化检测和序列级摘要。 对于任务1,我们结合了基于LLM的数据增强、DeBERTa分类和随机森林回归进行结构化状态预测。对于任务2,我们使用本地部署的Llama 3.1模型进行少样本提示,利用短期时间上下文检测切换和升级事件。对于任务3.1,我们探索了确定性规则摘要流程和基于少样本LLM的方法,官方排名\textbf{第2名}。我们的基于RAG的方法在任务3.2中取得了强劲表现,在改进方面排名\textbf{第一},在恶化方面排名\textbf{第三},展示了其捕捉跨时间线的周期性心理变化模式的能力。 我们的分析揭示了关键挑战,包括分类与回归性能之间的不匹配、时间转换建模的困难,以及基于语义和基于相似性的评估指标之间的分歧。这些发现凸显了建模心理健康动态的复杂性,并激励了未来关于统一评估框架的工作。我们在https://github.com/4dpicture/CLPsych2026分享我们的代码和提示。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:58

# DreamerNLplus:基于混合规则和RAG方法的社交媒体时间线心理动态可解释建模

来源:https://arxiv.org/html/2605.23052

Maryia Zhyrko¹†, Daisy Monika Lal²†, Erik van Mulligen³, Lifeng Han¹,⁴ 代表4D PICTURE联盟  
¹莱顿大学莱顿高级计算机科学研究所(LIACS), 荷兰  
²兰卡斯特大学计算与通信学院(SCC), 英国  
³鹿特丹伊拉斯姆斯大学医学中心医学信息学系, 荷兰  
⁴莱顿大学医学中心生物医学数据科学系, 荷兰  
†共同第一作者, 通讯作者: {l.han} @ lumc.nl

###### 摘要

我们提出DreamerNLplus,一个用于CLPsych 2026共享任务中从社交媒体时间线建模心理健康动态的混合框架。我们的系统处理三个任务:心理状态建模、时间变化检测和序列级摘要。对于任务1,我们结合了基于LLM的数据增强、DeBERTa分类和随机森林回归进行结构化状态预测。对于任务2,我们使用本地部署的Llama 3.1模型进行少样本提示,利用短期时间上下文检测“切换”(Switch)和“升级”(Escalation)事件。对于任务3.1,我们探索了确定性基于规则的摘要流水线和基于少样本LLM的方法,官方排名第二。我们基于RAG的方法在任务3.2中取得了强性能,在“改善”(Improvement)方向排名第一,在“恶化”(Deterioration)方向排名第三,展示了其捕捉跨时间线反复出现的心理变化模式的能力。我们的分析揭示了关键挑战,包括分类和回归性能之间的不匹配、建模时间转换的困难,以及基于语义和基于相似度评估指标之间的分歧。这些发现突显了建模心理健康动态的复杂性,并激励了未来关于统一评估框架的研究。我们的代码和提示词见https://github.com/4dpicture/CLPsych2026

DreamerNLplus:基于混合规则和RAG方法的社交媒体时间线心理动态可解释建模

## 1 引言与背景

我们描述了我们向CLPsych 2026共享任务Ali等人 (2026 (https://arxiv.org/html/2605.23052#bib.bib2)) 提交的系统:通过社交媒体时间线动态捕捉和表征心理健康变化,我们参与了所有子任务。早期关于NLP用于心理健康研究的综述Le Glaz等人 (2021 (https://arxiv.org/html/2605.23052#bib.bib10)); Malgaroli等人 (2023 (https://arxiv.org/html/2605.23052#bib.bib9)) 概述了传统NLP和机器学习方法,包括基于规则的方法、统计方法(TF-IDF、决策树、SVM、CRF、随机森林、神经网络)、预训练语言模型(BERT类编码器模型、序列到序列BART模型、领域特定MentalBERT)以及早期生成式解码器(例如GPT2)。它们还指出了现有工作的局限性,例如可重复性低的问题。使用的资源包括电子健康记录(EHR)、心理评估报告、社交媒体和访谈数据。在本研究中,我们使用了来自共享任务的社交媒体帖子数据。为了提高模型的可解释性并研究更新的开源模型,我们应用了基于规则的方法、随机森林分类器、DeBERTa模型、RAG和开源LLM的混合组合。与我们相关的最新工作包括RAG Kermani等人 (2025 (https://arxiv.org/html/2605.23052#bib.bib8)); Bogdanova等人 (2026 (https://arxiv.org/html/2605.23052#bib.bib14))、提示工程和PA-ISP(视角感知)Chan等人 (2025 (https://arxiv.org/html/2605.23052#bib.bib7)); Romero等人 (2025 (https://arxiv.org/html/2605.23052#bib.bib13)); Ren等人 (2025 (https://arxiv.org/html/2605.23052#bib.bib12)),以及CLPsych系统/数据集Tseriotou等人 (2025 (https://arxiv.org/html/2605.23052#bib.bib3)); Atzil-Slonim (2025 (https://arxiv.org/html/2605.23052#bib.bib4)); Tsakalidis等人 (2022 (https://arxiv.org/html/2605.23052#bib.bib5)); Atzil-Slonim (2026 (https://arxiv.org/html/2605.23052#bib.bib6))。

- •任务1:预测适应性和适应不良的ABCD元素组合:(1.1) 帖子级别的主导ABCD子元素和自身状态组成;(1.2) 自身状态存在度评分。
- •任务2:识别变化时刻。
- •任务3:变化摘要:(3.1) 总结变化事件周围的序列;(3.2) 识别跨时间线反复出现的变化动态特征。

社交媒体时间线 帖子,时间顺序,健康信号

任务1:状态建模 存在哪些心理状态?  
Prompt2Predict-DeBERTa 增强 + DeBERTa + R.F.  
ABCD子元素 适应性/适应不良评分

任务2:变化检测 有意义的变化何时发生?  
少样本LLM提示  
OS-LLM + 上下文窗口 / XGBoost  
切换/升级 帖子级别预测+理由(llm)

任务3:摘要 变化如何展开和重复?  
基于规则 + LLM / RAG方法  
MINDTRACE, Gemma, RAG 摘要 + 动态特征 序列叙事,重复模式 状态空间 变化事件

统一建模目标:在状态、变化和叙事层面上进行可解释、隐私意识的心理健康动态建模。

图1:DreamerNLplus系统在CLPsych 2026共享任务中的概述。任务1建模心理状态表征,任务2检测变化的时间时刻,任务3总结并概括跨序列的变化动态。

## 2 DreamerNLplus方法

图1 (https://arxiv.org/html/2605.23052#S1.F1) 总结了DreamerNLplus的整体框架。在三个共享任务中,我们的系统遵循统一的建模视角:任务1识别心理状态表征,任务2检测状态之间的转换,任务3将这些动态转化为序列级摘要和重复特征。

训练数据 ABC标注的
语料构建 LLM增强(Ollama) (定义+证据) DeBERTa微调 子元素预测(任务1.1) One-Hot编码 随机森林回归器 (适应不良)评分(任务1.2) 组合输出(任务1) (ABCD + 存在度分数)
基于LLM的增强 变压器分类 基于向量的回归

图2:Prompt2Predict-DeBERTa流水线,包括任务1(预测适应性和适应不良的ABCD元素组合)的数据预处理。

#### 任务1和2:状态建模与变化检测

对于任务1,我们提出了Prompt2Predict-DeBERTa,一个简单的多阶段框架,用于预测心理子元素和存在度分数,如图2 (https://arxiv.org/html/2605.23052#S2.F2) 所示。首先,我们从原始训练数据中提取每个标签的证据,并为了模型训练目的使用合成数据增强证据。为此,我们使用Ollama通过提示生成新示例来扩展数据集,这些提示包含每个ABCD类别的标签定义和标注证据。增强数据用于DeBERTa模型在子元素预测任务(任务1.1)上的微调。预测输出(ABCD标签)将编码为one-hot向量,并作为输入馈入随机森林回归器,以进一步预测适应性/适应不良评分(任务1.2)。最后,我们组合两个输出以包含两个元素:ABCD标签及其存在度评分。我们还为任务1部署了基于规则的方法,如图3 (https://arxiv.org/html/2605.23052#S2.F3) 所示。

参见标题

图3:任务1基于规则的模式匹配方法,使用n-gram搭配将帖子句子分类为ABCD子类别。

该流水线结合了基于LLM的增强(数据预处理)、基于变压器的分类和轻量级基于向量的回归,以产生结构化和可解释的预测,并与定义良好的规则进行比较。

时间线 JSON
上下文窗口格式化 当前帖子 + 最多5个前序帖子
5-shot 提示构建 切换 + 升级示例
本地 LLM 推理 Llama 3.1 via Ollama
帖子级别预测 切换/升级 二元标签
结构化输出 标签 + 理由
提交格式

时间上下文 局部变化信号
隐私保护 本地部署
目标 切换, 升级

图4:任务2少样本提示流水线(识别变化时刻)。

#### 任务2:少样本LLM提示与XGBoost

我们首先设计了一个框架,支持多种LLM后端(Ollama、HuggingFace),并在本地运行以保护隐私,使用Llama 3.1 8B作为我们提交的模型(图4 (https://arxiv.org/html/2605.23052#S2.F4))。在此框架中,我们创建一个本地上下文窗口,保留时间线中前5个帖子作为LLM提示的上下文,以预测目标(切换和升级)。提示还定义了切换和升级,以及上下文示例。我们的示例包括仅切换、仅升级、两者皆有和两者皆无的组合,加上第一个帖子的情况(无变化可能,无前序上下文)。LLM被要求以固定的JSON格式返回答案,包含Switch、Escalation和简短理由,如果响应不符合该格式,框架会重试提示。

作为非LLM的比较,我们使用XGBoost库构建了一个分类器模型。在此模型的预处理中,我们使用TF-IDF和句子转换器嵌入(all-mpnet-base-v2)来表示帖子。为了获得时间差异特征,我们使用1) 当前帖子与前一个帖子的嵌入差异(即当前帖子嵌入 - 前一个帖子嵌入 h_t - h_{t-1}),2) 它们的逐元素乘积,以及3) 时间线位置。我们还使用了额外的特征嵌入,包括14个与情感、标点和长度相关的语言特征(表1 (https://arxiv.org/html/2605.23052#A2.T1))。然后两个二元分类器分别预测Switch和Escalation,在训练期间对罕见的正例赋予更大权重,以避免模型简单地默认预测无变化。²²正例通过XGBoost的scale_pos_weight参数进行上加权,对于每个分类器独立设置为 min(neg数/pos数, 20)。

测试数据 MIND标注的帖子
n-gram/关键词 ABCD提取
结构化状态表示 基于存在度的聚合
时间分割 早期/中期/后期
切换与升级检测 主导性评分 适应性 vs 适应不良
基于规则的主题推断 模板驱动叙事生成
结构化摘要

(a) MINDTRACE-SUMMARY:确定性基于规则流水线。

序列 帖子
输入格式 文本 + 切换/升级 + 健康
动态少样本选择 提示构建 MIND + ABCD + 关系
Gemma 2 9B, Gemma 4 E4B, LLAMA 3.1 8B 推理
摘要 输出 无任务1 ABCD标注 使用 ABCD动态 从文本推断

(b) 使用OS-LLM的少样本LLM提示流水线。

图5:DreamerNLplus的任务3.1摘要生成方法——基于规则(左) vs OS-LLM(右)。

训练序列 健康轨迹分类 (恶化/改善) ABCD格式化 (子元素 + 分数 + 摘要) 序列批处理 LLM推理 (Llama 3.1 via Ollama) 提取重复的ABCD动态 LLM推理 (聚合) 合成跨批次模式 特征生成 每方向90词特征 + 5-10个示例序列 批次内模式 跨批次泛化

图6:任务3.2的RAG-LLM特征挖掘框架概述。

#### 任务3:变化摘要与模式挖掘

对于任务3.1“总结变化事件周围的序列”,我们探索了两种不同的摘要生成策略(图5 (https://arxiv.org/html/2605.23052#S2.F5))。

MINDTRACE-SUMMARY 是一个完全确定性的多阶段框架,用于从MIND标注的帖子生成序列级心理特征。该模型通过遵循固定结构并将ABCD注释转换为自然语言来生成摘要。完整示例模板见附录D.3 (https://arxiv.org/html/2605.23052#A4.SS3)。它首先确定适应性还是适应不良状态占主导,然后构建包含五个部分的叙事:中心主题、初始状态、互动动态、转变(切换或升级)和结果。ABCD标签被重写为流畅的心理描述,摘要强调状态如何随时间增强或转变。该方法优先考虑一致性和结构性而非自由形式生成,确保摘要清晰反映跨序列的变化动态。

对于少样本LLM提示,提示指定了MIND框架、ABCD缩写约定、关系动态词汇以及所需的摘要结构,涵盖变化前阶段、状态内/状态间动态以及明确的变化事件识别。不使用任务1的ABCD注释;模型根据提示从帖子文本推断ABCD动态。

对于任务3.2“识别跨时间线反复出现的变化动态特征”,我们提出了RAG-LLM特征挖掘,一个两阶段基于LLM的框架,用于识别心理变化的重复动态特征。如图6 (https://arxiv.org/html/2605.23052#S2.F6) 所示,我们的框架将批次内模式提取与跨批次特征合成分开,使得能够识别跨时间线的重复心理动态。序列被分批并馈入开源LLM(Llama 3.1 via Ollama),包含每帖子的ABCD子元素、健康评分和黄金摘要。阶段1提取每批次的重复ABCD动态;阶段2将这些合成为每个方向(恶化/改善)一个90词特征,并附带5-10个示例序列作为证据。

## 3 结果与分析

#### 任务1:状态建模

对于任务1,我们的系统在任务1.1(子元素分类)中排名第22,在任务1.2(存在度估计)中排名第20,如表2 (https://arxiv.org/html/2605.23052#A6.T2) 所示。为了进一步理解这种差异,我们在图7 (https://arxiv.org/html/2605.23052#S3.F7) 中分析了分类性能与回归性能之间的关系。结果显示中等程度的负相关(r=-0.486,p=0.00354),表明更强的子元素分类性能并不一定转化为更好的存在度估计。这一观察反映了两个子任务之间的根本区别:任务1.1需要细粒度的心理子元素类别预测,而任务1.2评估连续强度估计。我们的系统结合了基于DeBERTa的分类和随机森林回归,在回归设置中似乎更稳健,表明下游聚合减轻了上游分类错误。

#### 任务2:变化检测

我们提交的LLM系统达到了0.442的合并F1分数,总体排名第11(图10 (https://arxiv.org/html/2605.23052#A6.F10)),而XGBoost变体得分为0.327。两种方法显示出相反的错误模式:LLM具有高召回率但低精确率(Switch:0.762/0.302,Escalation:0.917/0.393),意味着它捕捉到大多数变化线索但倾向于过度预测;而XGBoost在罕见正类上具有高精确率但低召回率(Switch精确率0.455,召回率0.238),反映了仅从30条黄金时间线学习这些标签的难度。这表明准确捕捉微妙转变在所有范式中仍然具有挑战性,并且对微弱或模糊变化信号的错误可能会在序列中传播。尽管没有依赖任务特定的微调,LLM方法保持了有竞争力的性能,同时提供了可解释的

相似文章

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。