PatientAct:基于理论的心理健康来访者模拟
摘要
PatientAct 是一个基于理论的框架,用于基于 LLM 的心理健康来访者模拟,整合了临床案例概念化和带信任阈值的动态记忆,以产生更真实的阻抗和行为。
查看缓存全文
缓存时间: 2026/08/14 09:27
# PatientAct:基于理论的心理健康来访者模拟 来源:https://arxiv.org/html/2608.12750 Sahand Sabour 隶属:清华大学北京人工智能研究所DCST CoAI Group TszYam NG 隶属:清华大学北京人工智能研究所DCST CoAI Group Guanqun Bi 隶属:清华大学北京人工智能研究所DCST CoAI Group Jialu Zhao 隶属:清华大学北京心理咨询与心理发展指导中心 sahandfer@gmail\.com, aihuang@tsinghua\.edu\.cn Minlie Huang 隶属:清华大学北京人工智能研究所DCST CoAI Group ###### 摘要 基于LLM的模拟来访者越来越多地被用于培训新手咨询师、评估LLM治疗师以及生成合成数据。然而,当前的模拟器会生成过度配合的来访者:他们过度轻易地自我表露、不加抗拒地接受治疗性重构、并在单次会谈中解决核心问题。我们将这些问题追溯到缺乏因果深度的人物档案,以及将所有内容视为同等可获取的行为机制。我们提出了PatientAct,一个基于既定临床理论的来访者模拟框架。我们的人物档案整合了5Ps临床个案概念化,在不将设计局限于任何单一治疗模式的前提下提供因果深度。在模拟过程中,人物档案包含一个动态记忆层,其中的条目带有信任阈值(例如,症状早期即可获取,而形成性记忆则需要持续的治疗联盟)。在每一轮,来访者的情绪反应和行为都会在生成回应之前先被建模。如果治疗师接近受门控的内容,PatientAct会在回应量、内容和风格方面表达抗拒,而不是默认配合或采用单一抗拒模式。我们在40个临床情境上评估了我们的框架,并证明它能生成具有高度临床合理性的多样化人物档案。此外,PatientAct显著优于基线,在抗拒质量和行为真实性方面取得了实质性提升。我们的代码和数据将通过github.com/Sahandfer/PatientHub (https://github.com/Sahandfer/PatientHub) 公开提供。 ## 1 引言 心理健康问题影响着全球超过十亿人,但大多数人得不到充分的护理(31 (https://arxiv.org/html/2608.12750#bib.bib3))。弥合这一差距需要在多个方面取得进展:培训更多临床医生、开发AI辅助治疗工具、以及建设计算心理健康的研究基础设施。由大语言模型(LLMs)驱动的模拟来访者已成为这三方面的基础组件:它们为培训新手咨询师提供了可扩展的练习环境30 (https://arxiv.org/html/2608.12750#bib.bib15);13 (https://arxiv.org/html/2608.12750#bib.bib23),作为评估LLM治疗师的标准化测试用例25 (https://arxiv.org/html/2608.12750#bib.bib24),并能够为心理学研究生成多样的合成治疗数据14 (https://arxiv.org/html/2608.12750#bib.bib4);12 (https://arxiv.org/html/2608.12750#bib.bib31)。这些应用的核心有一个共同要求:模拟来访者的行为必须足够真实,才能使互动捕捉到真实治疗的动力过程。 在真实的治疗会谈中,来访者不会只是回答问题或披露信息。他们对治疗师的话语产生情绪反应(例如,宽慰、羞耻或防御),并以受终生习得模式影响的方式行事:在话题令人感到威胁时回避,在不知所措时沉默,在感到被理解时谨慎地敞开心扉。此外,他们会有选择地分享信息,早期显露表层抱怨,同时保护痛苦记忆直到信任建立。当他们抗拒时,他们以多种方式进行,每种方式都反映不同的潜在模式;例如,沉默、转移话题、或直接反驳。这些动力过程将真正的治疗互动与配合式的问答交流区分开来。 当前的LLM模拟器无法捕捉这些动力过程。先前工作中一个持续存在的发现是,模拟来访者过度配合:他们过易披露、不加抗拒地接受治疗重构、并在单次会谈中解决核心问题32 (https://arxiv.org/html/2608.12750#bib.bib21);9 (https://arxiv.org/html/2608.12750#bib.bib6)。这种模式损害了下游应用:治疗师培训生不会遇到真实的抗拒,LLM治疗师评估被配合的来访者抬高,合成数据缺乏真实治疗对话所特有的摩擦。我们将这一问题归因于现有模拟器设计中的多个缺陷。 首先,先前工作中的人物档案设计缺乏因果深度。现有档案通过包含症状、信念和应对策略等属性来描述来访者思考什么、感受什么30 (https://arxiv.org/html/2608.12750#bib.bib15);28 (https://arxiv.org/html/2608.12750#bib.bib17);11 (https://arxiv.org/html/2608.12750#bib.bib19)。然而,它们并不解释来访者为何形成了这些思想和感受:是什么使这个人变得脆弱,是什么触发了当前发作,或是哪些循环维持了它。因此,生成的模拟器可以说出“我觉得自己一无是处”,但无法解释这种信念是如何形成的,或者日常生活中是什么在强化它。 其次,先前工作要么在系统提示中提供完整档案30 (https://arxiv.org/html/2608.12750#bib.bib15);11 (https://arxiv.org/html/2608.12750#bib.bib19),从而使所有信息立即可获取,要么对所有内容统一施加单一控制(例如,一个静态标签如“抗拒:高”)(9 (https://arxiv.org/html/2608.12750#bib.bib6))。然而,实际上,来访者可能自由描述睡眠问题,同时主动回避童年记忆,而且这一边界随着对话中信任的发展而变化(26 (https://arxiv.org/html/2608.12750#bib.bib26))。 为解决这些缺陷,我们提出了PatientAct,一个基于理论的来访者模拟框架。我们框架中的人物档案围绕5Ps临床个案概念化进行结构化(8 (https://arxiv.org/html/2608.12750#bib.bib29)),它追溯来访者的脆弱性是如何发展的、什么触发了当前发作、以及什么维持着该问题。我们以认知层(3 (https://arxiv.org/html/2608.12750#bib.bib27))来补充这一概念化,提供会谈中的想法和行为,以及影响来访者如何与他人(尤其是治疗师)建立关系的人际关系模式(18 (https://arxiv.org/html/2608.12750#bib.bib30))。与先前工作主要集中于单一治疗模式(如认知行为疗法(CBT)或动机性访谈(MI))不同,我们的模式不局限于任何单一治疗模式(即模式无关)。 在模拟之前,我们将人物档案分为一个静态层(始终包含在系统提示中)和一个动态记忆层。记忆中的每个条目被赋予一个披露阈值,基于先前关于治疗信任的研究(26 (https://arxiv.org/html/2608.12750#bib.bib26)):表层症状早期即可获取,而形成性记忆则需要持续的治疗联盟。在模拟过程中,在每一轮,PatientAct决定它应该如何对治疗师的话语产生情绪反应,并选择与那种反应以及来访者当前信任水平一致的行为,然后生成回应。当治疗师询问来访者尚未准备好分享的内容时,PatientAct基于22 (https://arxiv.org/html/2608.12750#bib.bib5)的分类法表现出抗拒,涵盖回应量(如沉默)、内容(如转移话题)和风格(如直接反驳)。因此,同一人物档案可以根据治疗师的行为产生有意义的、不同的会谈。 我们的贡献如下: 1. 1\.一个**模式无关的人物档案模式**,整合了临床个案概念化,提供了先前工作所缺失的因果深度。 2. 2\.一个**基于理论的模拟框架**,通过反应、行为和动态检索流水线处理治疗师的每一句话。档案内容的披露受来访者不断变化的信任水平门控,抗拒跨越多个临床维度而非单一标签。 3. 3\.**综合评估**表明,在专家和基于LLM的评估中,我们的框架比现有基线产生更真实的来访者模拟。 参见说明 图1:我们框架(PatientAct)的概览。 ## 2 相关工作 基于LLM的患者模拟已成为脚本化标准化患者的灵活替代方案,利用现代LLM的角色扮演和指令遵循能力。现有方法主要在两个轴线上有所不同:对来访者编码了什么(档案设计)以及如何在对话中强制期望行为(模拟设计)。 ### 2.1档案设计 患者模拟中的一个核心挑战是确定建模来访者所需的信息以及如何结构化这些信息。早期方法依赖场景描述和简单的角色描述,涵盖人口统计信息和主诉,但没有系统结构(5 (https://arxiv.org/html/2608.12750#bib.bib7);28 (https://arxiv.org/html/2608.12750#bib.bib17);17 (https://arxiv.org/html/2608.12750#bib.bib18)),导致LLM在对话中即兴编造信息(如信念)。向基于理论设计的转变始于Patient-ψ\psi(30 (https://arxiv.org/html/2608.12750#bib.bib15)),它围绕认知概念化图(3 (https://arxiv.org/html/2608.12750#bib.bib27), CCD;)结构化档案,通过编码核心信念、中间信念和应对策略来捕捉来访者的认知层。然而,CCD并不解释这些信念是如何形成的或是什么维持了它们。随后的工作扩大了范围,纳入精神科病史、纵向症状数据和生活事件(11 (https://arxiv.org/html/2608.12750#bib.bib19);15 (https://arxiv.org/html/2608.12750#bib.bib20);29 (https://arxiv.org/html/2608.12750#bib.bib22);12 (https://arxiv.org/html/2608.12750#bib.bib31)),增加了传记细节,但没有增加这些事件与当前问题之间的因果联系。因此,现有档案编码了来访者思考什么、感受什么,但没有提供足够的原因来解释来访者为何有此感受。例如,没有说明是什么使这个人变得脆弱,什么触发了当前发作,或什么使问题持续存在。没有这种结构,模拟来访者就无法连贯地解释自己的历史,无法表现出治疗师能够识别并处理的维持性行为,也无法产生真实的抗拒:所有档案内容具有同等权重,无法区分来访者会轻易分享什么和会保护什么。 ### 2.2模拟设计 第二个挑战是如何在对话中强制期望的来访者行为。最简单的方法是将完整档案放入系统提示并直接生成回应(5 (https://arxiv.org/html/2608.12750#bib.bib7);28 (https://arxiv.org/html/2608.12750#bib.bib17))。这产生了流畅但过度配合的来访者,他们轻易披露、接受重构、并在单次会谈中解决问题,这是文献中广泛记录的问题(30 (https://arxiv.org/html/2608.12750#bib.bib15);32 (https://arxiv.org/html/2608.12750#bib.bib21);9 (https://arxiv.org/html/2608.12750#bib.bib6))。Patient-ψ\psi(30 (https://arxiv.org/html/2608.12750#bib.bib15))通过附加对话风格(如抗拒)作为行为修饰符来解决这个问题。虽然能有效地产生表层变化,但这些风格是静态的:一个“抗拒”的来访者无论治疗师是共情还是轻蔑都会抗拒。最近的工作提出了动态机制,在对话过程中调整来访者的开放性9 (https://arxiv.org/html/2608.12750#bib.bib6)、情绪状态29 (https://arxiv.org/html/2608.12750#bib.bib22)和MI特定的改变阶段32 (https://arxiv.org/html/2608.12750#bib.bib21)。这些方法表明动态状态管理能提高真实性,但每种方法都对所有档案内容统一应用单一控制:一个单一的开放性标量、一个全局情绪状态、或一个特定于模式的动作分布。实际上,来访者可能自由描述睡眠问题,同时主动回避童年记忆,而这一边界随着信任发展而变化26 (https://arxiv.org/html/2608.12750#bib.bib26)。将所有内容视为同等可获取错过了这一现实。此外,先前工作中的抗拒要么不存在,要么被简化为单一维度(如高或低抗拒),而临床抗拒通过回应量、内容或风格的变化表现出来22 (https://arxiv.org/html/2608.12750#bib.bib5)。 ## 3 PatientAct 我们的框架(图1 (https://arxiv.org/html/2608.12750#S1.F1))由两个主要流水线组成:档案生成(§3.2 (https://arxiv.org/html/2608.12750#S3.SS2))和来访者模拟(§3.3 (https://arxiv.org/html/2608.12750#S3.SS3))。首先,一个临床情境通过多步骤流水线被扩展为我们设计的结构化档案模式。相应地,模拟来访者通过一个包含反应、行为选择和检索的流水线处理治疗师的每一句话,然后生成回应。 ### 3.1档案模式 我们框架的一个核心设计需求是,人物档案中的每个字段都必须在模拟期间发挥功能作用。因此,我们将每个人物档案组织为三个组成部分:人口统计信息、问题概念化和心理概念化。这些组成部分共同提供了维持真实多轮治疗对话所需的因果深度、认知结构和人际动力。 ##### 1. 人口统计信息。每个人物档案都包含人口统计信息(姓名、性别、年龄、职业、婚姻状况、民族),这些信息为来访者的身份提供基础,并确保档案反映具体的个体。 ##### 2. 问题概念化。我们采用5Ps临床个案概念化框架(8 (https://arxiv.org/html/2608.12750#bib.bib29))来结构化每个人物档案的临床背景:(i)**当前问题**:来访者当前的问题;(ii)**诱发因素**:触发当前发作并使来访者前来接受治疗的特定过去事件或变化;(iii)**易感因素**:解释为什么这个个体变得脆弱的心理因素(如童年被拒绝塑造了人际戒备)和社会因素(如鼓励抑制情绪表达的家庭规范);(iv)**维持因素**:维持当前问题的循环(如回避→短期缓解→隔离加重→情绪恶化);以及(v)**保护因素**:帮助应对问题并防止进一步恶化的内部(如改变的动力)和外部(如社会支持)优势与资源。与先前工作使用的认知概念化图(CCD;3 (https://arxiv.org/html/2608.12750#bib.bib27))或改变阶段模型23 (https://arxiv.org/html/2608.12750#bib.bib32)不同,5Ps框架是**模式无关**的,这意味着
相似文章
MyMentorLLM:一种用于刻意练习的多模态语音/文本心理治疗生成式AI环境,包含患者、受训者和专家
本文介绍了MyMentorLLM,这是一个利用大型语言模型进行心理治疗培训中刻意练习的多模态语音/文本模拟环境。它生成了2,100次认知行为疗法(CBT)培训课程,并评估了不同LLM下的情绪动态、治疗能力和诊断准确性。
MentalHospital:评估精神病学临床接诊的虚拟环境
MentalHospital是一个虚拟环境,旨在评估AI智能体与人类专家在精神病学临床接诊中的表现,涵盖问诊、检查、诊断和治疗规划。实验通过客观与主观指标比较人类专家、受训人员及多种大语言模型。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
一种基于智能体的LLM框架用于大规模人群心理健康筛查
提出了一种使用LangChain智能体的智能体框架,用于大规模人群心理健康筛查,重点关注从临床转录中检测抑郁症。该框架逐步锁定已验证的阶段,并使用代理引导的评估来确保可信度和适应性。
# 当来访者停止跟随:认知概念化图驱动的战略咨询框架
# 兰州大学研究人员提出基于CBT的LLM心理咨询框架,应对"来访者顺从"现象 兰州大学研究人员提出了一个以认知行为疗法(CBT)为基础的大语言模型心理咨询框架,旨在解决现有基准测试中普遍存在的"来访者顺从咨询师"现象。该框架引入了 CARS(抵抗型来访者模拟器)、STREAMS(双模块策略推理框架)以及 EWTS-MI(熵加权评估指标),以更好地应对真实场景中来访者具有阻抗行为的咨询交互。 ## 核心问题:现有基准测试的局限性 当前用于评估 LLM 心理咨询能力的基准测试存在一个关键缺陷——**"咨询师顺从"(counselor-following)现象**。在这些测试场景中,模拟来访者往往表现得过于配合、顺从,愿意接受咨询师给出的任何建议。然而,这与现实咨询场景大相径庭:真实来访者常常对改变产生阻抗,难以接受干预,甚至在会话中公开表示抵触。 这一缺陷导致在现有基准上表现优异的模型,在面对真实咨询场景时往往力不从心,无法有效应对来访者的阻抗行为。 ## 三大核心创新 ### 1. CARS:抵抗型来访者模拟器 **CARS(Resistant Client Simulator)** 是一个能够模拟真实阻抗行为的来访者模拟器。与传统模拟器不同,CARS 能够生成具有以下特征的来访者反应: - **情感阻抗**:表现出不愿改变的情绪状态 - **认知防御**:对咨询师的解释和建议持怀疑态度 - **行为回避**:拒绝完成作业或回避关键话题 - **动机矛盾**:在改变与维持现状之间摇摆不定 CARS 基于真实咨询文献中记录的阻抗模式构建,确保模拟场景具有临床真实性。 ### 2. STREAMS:双模块策略推理框架 **STREAMS(Strategic Reasoning for Empathetic and Adaptive Multi-Session counseling)** 是该研究的核心方法论创新,采用双模块架构: **模块一:策略规划模块(Strategic Planning Module)** - 基于 CBT 理论框架,动态选择适合当前会话状态的干预策略 - 识别来访者的阻抗类型,并制定相应的应对方案 - 在多轮会话中保持治疗目标的一致性 **模块二:共情响应模块(Empathetic Response Module)** - 在执行策略干预的同时,确保回应具有共情性和自然度 - 避免机械式套用 CBT 技术,保持对话的人性化温度 - 根据来访者的情绪状态实时调整表达方式 两个模块协同工作,使 LLM 既能坚持循证干预策略,又能与来访者建立真实的治疗联盟。 ### 3. EWTS-MI:熵加权评估指标 **EWTS-MI(Entropy-Weighted Therapeutic Strategy - Motivational Interviewing)** 是专为抵抗型咨询场景设计的评估指标,解决了现有评估方法的两大不足: **问题一:策略多样性被忽视** 传统指标倾向于奖励单一、保守的咨询策略,而有效的 CBT 干预往往需要灵活运用多种技术。EWTS-MI 引入**信息熵**来衡量策略多样性,鼓励模型在适当情况下灵活切换干预方法。 **问题二:动机访谈原则未被纳入** EWTS-MI 将动机访谈(Motivational Interviewing, MI)的核心原则整合进评估框架,具体包括: - **共情表达(Empathy)**:回应是否体现出对来访者感受的真实理解 - **发展差异(Develop Discrepancy)**:是否帮助来访者意识到现状与目标之间的差距 - **化解阻抗(Roll with Resistance)**:是否有效处理而非对抗来访者的阻抗 - **支持自我效能(Support Self-Efficacy)**:是否增强来访者的改变信心 ## 实验结果与发现 研究团队在 CARS 构建的抵抗型咨询场景上对多个主流 LLM 进行了系统评估,主要发现包括: - **现有模型在阻抗场景下的表现显著下降**,验证了"咨询师顺从"现象对传统基准评估效度的威胁 - **配备 STREAMS 框架的模型**在应对来访者阻抗方面表现更为稳健,能够维持治疗方向并逐步软化来访者的防御 - **EWTS-MI 与人类专家评分的相关性**高于现有自动化评估指标,表明其更能捕捉真实咨询质量的关键维度 ## 研究意义 该研究对 LLM 心理咨询领域具有多层面的重要意义: **学术层面**:提供了更具生态效度的评估框架,推动该领域从"实验室表现"向"临床适用性"转型。 **技术层面**:STREAMS 框架为将结构化心理治疗理论(如 CBT、MI)整合进 LLM 推理过程提供了可复现的范式。 **伦理层面**:通过更真实地模拟咨询挑战,有助于识别 LLM 在部署为心理支持工具前需要解决的安全隐患。 ## 局限性与未来方向 研究人员也坦诚指出了若干局限性: - CARS 模拟的阻抗行为基于文献归纳,可能无法覆盖所有真实场景的细微差别 - 当前框架主要聚焦于 CBT 范式,对其他治疗取向(如精神动力学、人本主义)的适用性有待进一步验证 - LLM 的文化背景差异可能影响其对不同来访者群体的阻抗行为的解读方式 未来工作将探索将 CARS 扩展至多元文化场景,并进一步优化 STREAMS 框架对长程治疗(multi-session therapy)的支持能力。 --- 该研究为构建真正能够胜任真实临床场景的 LLM 心理咨询系统迈出了重要一步,也为该领域的评估标准化提供了有价值的参考框架。