MyMentorLLM:一种用于刻意练习的多模态语音/文本心理治疗生成式AI环境,包含患者、受训者和专家

arXiv cs.CL 论文

摘要

本文介绍了MyMentorLLM,这是一个利用大型语言模型进行心理治疗培训中刻意练习的多模态语音/文本模拟环境。它生成了2,100次认知行为疗法(CBT)培训课程,并评估了不同LLM下的情绪动态、治疗能力和诊断准确性。

arXiv:2607.25667v1 公告类型:新 摘要:心理治疗师需要接受专家的反复培训和督导;然而,可扩展性存在问题。本文介绍了MyMentorLLM,一个基于多模态语音和文本的刻意练习模拟环境,用于生成2,100次完整的认知行为疗法(CBT)培训课程。每次课程将一位基于DSM-5-TR的患者(患有重度抑郁症、广泛性焦虑症或边缘型人格障碍)、一位受训治疗师和一位专家督导联系起来。作为初步实施,我们采用了CBT,因为其结构化的程序和基于能力的督导有利于标准化模拟和评估。对课程的情绪动态、治疗能力和诊断准确性进行了分析。模拟患者表达了与障碍一致的情绪特征,受训治疗师如同真实人类咨询中一样对其进行了镜像。不同LLM的督导质量存在差异:虽然大多数模型高估了受训者的能力,但原生语音到语音模型最接近人类评分。在7个LLM中,有5个的督导反馈使得模拟心理治疗师的诊断结果有所改善,且症状识别准确率随模型规模增大而提高。这项工作表明,对于CBT训练来说,刻意练习的模拟是可行的,尽管患者保真度、督导校准和有害反馈需要同时评估。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:55

# MyMentorLLM:一种面向刻意练习的多模态语音/文本患者、受训者与专家心理治疗GenAI环境
来源:https://arxiv.org/html/2607.25667
\[2,+\]\\fnmAlessandro Grecucci

1\]\\orgdivCogNosco实验室,心理学与认知科学系,\\orgname特伦托大学,\\orgaddress\\country意大利 2\]\\orgdiv教育、心理学与传播科学系,\\orgname巴里大学,\\orgaddress\\country意大利 \+]这些作者作为共同最后作者贡献相等

###### 摘要

心理治疗师需要经过反复培训和专家督导,但规模化存在困难。本文介绍MyMentorLLM,一种用于刻意练习的多模态语音和文本模拟环境,生成了2,100次完整的认知行为疗法(CBT)培训课程。每节课连接一个基于DSM-5-TR的患者(患有重度抑郁障碍、广泛性焦虑障碍或边缘型人格障碍)、一名受训治疗师和一名专家督导。作为初步实施,我们采用CBT,因其结构化程序和基于能力的督导便于标准化模拟和评估。课程被分析用于情绪动态、治疗能力和诊断准确性。模拟患者表现出与疾病一致的情绪特征,而受训治疗师如同真实人类咨询中那样进行镜像模仿。不同LLM的督导质量存在差异:虽然大多数模型高估了受训者的能力,原生语音到语音模型最接近人类评分。在7个LLM中的5个中,督导的反馈改善了模拟心理治疗师的诊断,且症状识别准确率随模型规模增大而提高。这项工作表明,对于CBT培训,模拟刻意练习是可能的,但患者保真度、督导校准以及有害反馈应一并评估。

###### 关键词:

大语言模型,语音到语音交互,刻意练习,认知行为疗法,心理治疗培训

## 1 引言

心理健康状况影响着全球超过十亿人,而能够治疗这些问题的劳动力仍然极度稀缺,平均每10,000名居民中仅有1.3名专家\[1 (https://arxiv.org/html/2607.25667#bib.bib1)\]。受训者必须练习议程设置、引导式发现、案例配方、情绪调谐以及将患者语言转化为有临床意义的假设。这些能力通过反复接触和结构化督导得以发展。然而,实践机会仍然昂贵且分布不均:真实患者不应承担早期临床错误的风险,标准化演员无法大规模再现精神病理学的全部变异性,而专家督导仍是稀缺资源。因此,扩大心理健康护理的可及性也需要扩大安全、现实且反馈丰富的临床培训的可及性。

最近一种解决心理治疗挑战的方法来自刻意练习\[2 (https://arxiv.org/html/2607.25667#bib.bib2)\],即不是仅仅依赖日常临床工作中积累的经验,治疗师通过重复的行为演练、专家反馈以及较小的目标来系统性地提升特定临床技能。这种训练在常规客户会谈之外进行,帮助从业者突破表现平台,并在将其应用于真实治疗接触之前构建个人能力。

大语言模型(LLMs)为重新构想心理治疗培训创造了前所未有的机会\[3 (https://arxiv.org/html/2607.25667#bib.bib3),4 (https://arxiv.org/html/2607.25667#bib.bib4)\]。与基于规则的对话代理(如PARRY或ELIZA\[4 (https://arxiv.org/html/2607.25667#bib.bib4)\])不同,生成模型可以维持开放式对话\[5 (https://arxiv.org/html/2607.25667#bib.bib5)\],适应先前的轮次,并持续体现心理定义的角色\[6 (https://arxiv.org/html/2607.25667#bib.bib6),7 (https://arxiv.org/html/2607.25667#bib.bib7),3 (https://arxiv.org/html/2607.25667#bib.bib3)\],这些角色的历史、症状和沟通风格在整个互动中保持可用。这些能力使LLMs成为在现实、无后果的临床接触中用于可扩展、反复实践的有吸引力工具。

在过去几年中,LLMs已被用于模拟人类样本并生成心理健康对话\[8 (https://arxiv.org/html/2607.25667#bib.bib8),9 (https://arxiv.org/html/2607.25667#bib.bib9)\]。然而,生成合理的对话只是构建有用临床培训环境的第一步。教育价值不仅取决于语言流畅性,还取决于模拟患者是否以心理上连贯的方式行为,受训治疗师是否表现出真实的优势和局限性,以及督导是否提供可靠且具有教学意义的反馈。因此,对话合理性不应与心理保真度混淆。实际上,角色提示可以系统地改变模型行为\[10 (https://arxiv.org/html/2607.25667#bib.bib10),3 (https://arxiv.org/html/2607.25667#bib.bib3)\],而模拟人群可能歪曲或扁平化其旨在再现的群体\[11 (https://arxiv.org/html/2607.25667#bib.bib11)\]。在临床培训中,一个令人信服的回答仍然可能编码一个不合理的患者、一个不熟练的治疗师或一个不可靠的督导。因此,验证模拟对话需要评估整个教育情境。

第二个局限是模态。心理治疗通常不是作为精心撰写的书面消息的交换进行的\[2 (https://arxiv.org/html/2607.25667#bib.bib2)\]。它通过言语展开,其中停顿、犹豫、语调和节奏有助于表达和解释痛苦\[12 (https://arxiv.org/html/2607.25667#bib.bib12)\]。基于言语的研究表明,临床上相关的信息分布在语言和声学模式中\[13 (https://arxiv.org/html/2607.25667#bib.bib13),14 (https://arxiv.org/html/2607.25667#bib.bib14),12 (https://arxiv.org/html/2607.25667#bib.bib12)\]。纯文本模拟去除了大部分这种副语言层,并将一个情境化的人际过程简化为其转录\[12 (https://arxiv.org/html/2607.25667#bib.bib12)\]。它们也往往在患者-治疗师对话结束时停止。然而,训练依赖于一个更广泛的指导循环,其中督导评估课程、探究受训者的推理并将表现转化为学习。多智能体LLM系统可以模拟这些角色\[15 (https://arxiv.org/html/2607.25667#bib.bib15)\],但其临床连贯性尚未得到充分测试。

对于一个人工患者来说,诊断基础是必要但不充分的。基于正式标准的角色可能会提及预期的症状\[16 (https://arxiv.org/html/2607.25667#bib.bib16)\],但仍然无法捕捉构成疾病特征的潜在认知、情感和人际过程。例如,抑郁症不能简化为频繁表达悲伤,焦虑也不能简化为反复提及恐惧。相反,这些条件源于贯穿治疗对话的连贯的信念、期望、情绪反应和人际动态模式。临床相关信号不在于这些单独的元素,而在于它们如何在对话中连接,将自我相关概念、威胁和关系联系成一个连贯的情感结构。因此,不应仅仅因为LLM的输出看起来像人类就假定它们可以替代人类参与者\[17 (https://arxiv.org/html/2607.25667#bib.bib17)\]。验证必须确定每个模拟角色以及它们之间的互动是否保留了真实心理治疗中预期的心理过程。

认知网络科学提供了一种原则性的方法来解决这个问题\[18 (https://arxiv.org/html/2607.25667#bib.bib18)\]。网络将概念表示为节点,将有意义的关系表示为链接,揭示信息是如何组织的,而不仅仅是单词出现的频率\[19 (https://arxiv.org/html/2607.25667#bib.bib19),20 (https://arxiv.org/html/2607.25667#bib.bib20),18 (https://arxiv.org/html/2607.25667#bib.bib18)\]。通过心理词汇库的丰富,这些结构可以映射围绕临床相关概念的情感框架,并区分一个词的 affective 标签与其邻居创造的语境\[21 (https://arxiv.org/html/2607.25667#bib.bib21),22 (https://arxiv.org/html/2607.25667#bib.bib22)\]。因此,情绪可以被研究为跨越多个类别的关系模式,而不仅仅是单一的正-负评分\[23 (https://arxiv.org/html/2607.25667#bib.bib23)\]。这在心理健康中很重要,因为相同的词根据它们是否嵌入在威胁、能动性、绝望或支持的语境中可能会获得不同的含义\[24 (https://arxiv.org/html/2607.25667#bib.bib24),25 (https://arxiv.org/html/2607.25667#bib.bib25)\]。

本文介绍MyMentorLLM,一种再现完整CBT指导循环的多模态语音和文本模拟环境。MyMentorLLM不是模拟单个治疗对话,而是再现了心理治疗技能获取的教育过程,允许受训者反复练习临床接触、接受结构化督导,并从错误中学习,然后再将这些技能应用于真实患者。在2,100次课程中,LLM实例化了三个相互作用的角色:一个基于DSM-5-TR临床案例\[26 (https://arxiv.org/html/2607.25667#bib.bib26)\]的患者(患有重度抑郁障碍MDD、广泛性焦虑障碍GAD或边缘型人格障碍BPD);一个校准到发展中医师的胜任力水平的受训治疗师;以及一个提供结构化督导的专家导师。我们比较了原生语音到语音交互、语音中介交互和纯文本对话,跨越多个模型家族。我们询问:模拟患者是否表达出与疾病一致的认知和情感结构;患者-治疗师情感耦合是否类似于人类咨询;口语交互是否改变治疗表现;以及LLM导师是否能够评估和改进临床推理,而不会引入特定模型的膨胀或有害反馈。通过将模拟视为一个整合了心理基础的患者模拟、受训治疗师和专家督导的三元认知系统,MyMentorLLM将人工智能在心理健康中的关注点从取代治疗师转移到改进治疗师的培训方式。本研究提供了一个可解释的测试平台,用于识别何时合成患者和导师可以支持可扩展的CBT教育,以及人类督导和更强的保障措施仍然不可或缺。

## 2 方法

### 2.1 研究设计

本研究模拟了包括不同患者(基于特定DSM-5-TR临床案例\[26 (https://arxiv.org/html/2607.25667#bib.bib26)\])、一名受训治疗师和一名专家导师在内的监督式CBT课程(图1 (https://arxiv.org/html/2607.25667#S2.F1)a)。我们选择了MDD、GAD和BPD案例来定义患者角色,代表着心理治疗培训中经常遇到的不同的精神病理学状况。每个实验观察由一个完整的指导循环组成。该循环始于患者与受训治疗师之间的首次临床面谈,这是一个固定的31轮对话,总是以受训者的问候和提问开始:“早上好,请告诉我今天是什么风把你吹来了。”

治疗课程结束后,交互进入监督阶段(图1 (https://arxiv.org/html/2607.25667#S2.F1)a)。受训者首先通过选择四个诊断选项之一来制定初步诊断:MDD、GAD、BPD或精神分裂症(SCZ),SCZ作为一个诊断上合理的干扰项,防止仅在目标疾病中进行强制选择。然后,专家导师审查完整的课程转录,根据认知疗法评定量表(CTRS)对受训者的表现进行评分,并就优势和待发展领域提供定性反馈,同时提出一个关于交互中临床相关方面的反思性问题。收到此反馈后,受训者要么确认要么修改初始诊断,最后,从固定的35项DSM-5-TR症状列表\[27 (https://arxiv.org/html/2607.25667#bib.bib27)\]中识别出认为最重要的五个症状,该列表包含与三个目标疾病相关的所有症状。

我们在七种模型-模态条件(原生音频、合成音频或文本)和三种临床疾病(表1 (https://arxiv.org/html/2607.25667#S2.T1))中重复了模拟。每种组合运行100次,本研究共包含2,100个完整的CBT指导循环。

a.

参见图注

b.

参见图注

图 1:a. 模拟的CBT指导循环。一个模拟课程包括三个阶段:(1)设置,其中选择语言模型和基于DSM-5-TR临床案例的患者角色,而受训治疗师和导师保持不变;(2)患者与受训者之间的自主语音或文本CBT课程,记录音频和转录;以及(3)导师监督,包括CTRS评分、诊断反馈和DSM-5-TR症状识别。b. 角色系统提示。卡片显示了每个角色提示的通用结构,包括角色定义、任务和特定角色的指令块。在患者提示中,尖括号内的字段(姓名、DSM-5-TR疾病以及六部分临床档案)填充有特定疾病的信息。
### 2.2 模型

我们用六个LLM驱动角色,覆盖三个模型家族,包括具有原生语音能力的模型以及从语音或文本输入生成文本响应的模型(表1 (https://arxiv.org/html/2607.25667#S2.T1))。这使我们能够评估特定模型的情感和评估偏差是否影响模拟交互和反馈循环,进而影响受训者的学习体验。在每个指导循环内,一个单一的LLM实例化所有三个角色(患者、受训者和导师),除了下面描述的原生语音条件。

##### 原生语音到语音模型。

Gemini 3.1 Flash Live Preview 是唯一被评估的本地支持端到端口语交互的模型,它处理音频输入并生成口语响应,无需中间文本表示\[28 (https://arxiv.org/html/2607.25667#bib.bib28)\]。我们在全文中将此条件称为 Gemini-3.1LA。这种端到端语音模型保留了副语言线索(韵律、语速和犹豫),而这些线索是传统语音到文本→文本LLM→文本到语音流水线大多丢弃的。这些线索携带关于心理治疗过程中心理困扰的信息。在此条件下,患者和受训治疗师由 Gemini-3.1LA实例化,而导师由 Gemini-3.5 Flash实例化。这一例外是必要的,因为CBT监督基于课程转录,而Gemini-3.1LA原生不产生自动评分所需的结构化JSON输出。

##### 比较模型。

在开放权重架构中选择了比较模型,这些模型……(原文后续未完整提供,但根据上下文,此处应继续描述其他比较模型。由于用户提供的翻译原文到此为止,我们将按照已给出的内容进行翻译。实际中,这些模型列表通常在表1中,但此处文本未完整显示,故我们保持翻译的一致性,只翻译已给出的部分。)

相似文章

PersonaVLM:长期个性化多模态大语言模型

Hugging Face Daily Papers

PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。