MIThinker:针对动机性访谈咨询的即插即用策略优化思考者
摘要
MIThinker提出了一种轻量级推理模型,用于动机性访谈咨询代理,通过监督微调和强化学习训练生成治疗性思考,在较低计算量下实现了与最先进系统相当的MI能力。
arXiv:2606.29265v1 公告类型:新
摘要:推理型大语言模型(LLMs)近期在复杂问题求解方面取得了显著进展,通过利用内部推理(或思考)来指导其解决方案生成。然而,现有的基于LLM的咨询代理,包括使用动机性访谈(MI)的代理,在生成响应时未能明确地将思考与咨询技术对齐,限制了其有效性。我们提出MIThinker,一种轻量级思考模型,用于生成治疗性思考,以引导MI咨询代理进行策略选择和响应生成。为了克服缺乏标注思考数据的问题,我们引入了AugR1-MI,一种自动化流水线,从观察到的响应中逆向工程出咨询师的思考。通过结合监督微调和强化学习的两阶段训练,MIThinker在心智评估和策略对齐方面表现出改进。全面评估表明,我们的代理MindfulMI(利用MIThinker)在MI能力上可与最先进系统媲美,同时计算量降低一个数量级。
查看缓存全文
缓存时间: 2026/06/30 05:30
# MIThinker:面向动机访谈咨询的即插即用策略优化思考者
来源:https://arxiv.org/html/2606.29265
杨一哲¹,Palakorn Achananuparp²,黄河燕¹,姜静³,林益鹏²
¹北京理工大学,²新加坡管理大学,³澳大利亚国立大学
{yizheyang,hhy63}@bit.edu.cn, {palakorna,eplim}@smu.edu.sg, [email protected]
###### 摘要
推理型大语言模型(LLMs)近期在复杂问题求解方面取得了显著进展,它们利用内部推理(即“思考”)来指导解决方案的生成。然而,现有的基于LLM的咨询代理,包括那些采用动机访谈(MI)的代理,在生成回应时并未明确将思考与咨询技术对齐,这限制了它们的有效性。我们提出MIThinker,一种轻量级思考模型,它能生成治疗性思考,以指导MI咨询代理进行策略选择和回应生成。为克服缺乏标注思考数据的难题,我们引入AugR1-MI,一种自动化管道,可从观察到的回应中逆向工程化咨询师的思考。通过两阶段训练(结合监督微调和强化学习),MIThinker在心理理论评估和策略对齐方面展现出改进。全面评估表明,我们的代理MindfulMI(利用MIThinker)能够以数量级更少的计算量达到与最先进系统相当的MI能力。
## 1 引言
近年来,通过强化学习,推理型大语言模型(LLMs)在复杂问题求解任务中取得了显著成功(Zhang et al., 2024b; Rafailov et al., 2023; Li et al., 2024)。然而,当解决需要复杂用户理解的问题时,这些LLMs的推理仍然具有挑战性。一个显著的例子是动机访谈(MI),这是一种协作性、以人为中心的咨询方法,旨在通过解决来访者的矛盾心理来增强其改变行为的动机和承诺(Miller and Rollnick, 2002; Bischof et al., 2021)。作为MI咨询的一部分,咨询师会推理来访者的情况和心理状态,并在回应之前选择合适的咨询策略。由于推理过程的复杂性,现有基于LLM的MI咨询研究侧重于提示LLM仅执行推理的单个方面,例如推断来访者的心理状态(Yang et al., 2025)和策略选择(Xie et al., 2024; Sun et al., 2024)。尽管这些基于提示的方法(Yang et al., 2025)能够模拟胜任的MI咨询代理,但它们引入了显著的计算开销,从而限制了其有效性和现实世界中的适用性。
为了在现实部署中同时实现治疗效果和计算效率,我们旨在创建一个即插即用的咨询师思考生成器,它在生成下一个回应之前对给定的咨询上下文进行全面推理,从而提高咨询质量和效果。为保持此推理过程高效,思考生成器应该轻量级,涉及一个经过训练的小型LLM,使其输出的咨询师思考与MI咨询技术对齐。此外,生成的咨询师思考将间接提供可解释性(Zhang et al., 2024a)并增强诊断效率(Hu et al., 2025a)。如图1所示,这种推理对于将预训练LLM从生成通用回应调整为针对来访者矛盾的、以客户为中心的MI回应至关重要。
然而,由于两大挑战,上述两个目标并非易事。第一个挑战是在现实咨询会话中完全缺乏咨询师的思考。咨询师通常不会在咨询过程中明确揭示他们的思考,因为思考生成过程是内化和下意识的。第二,与假设每个问题只有一个正确解的数学推理不同,对于一个给定的上下文,胜任的MI咨询师可以提供多种可能的良好回应(以及相应的策略)。多样化良好回应的存在使得以往方法(Hu et al., 2025a)中单独使用的监督微调不够充分。我们需要一个新的奖励函数,它优先考虑行为合适性和推理连贯性,而不是僵化的真值复制。

为了应对第一个挑战,我们提出AugR1-MI,一种自动化管道,基于上下文和真值回应生成“神谕思考”,并迭代精炼思考,直到复现的回应获得比真值回应更高的保真度。这些神谕思考代表了咨询师内部的思考过程,包括来访者心理状态评估和MI策略选择,这些自然会引导出观察到的咨询师回应。这些思考之所以被称为“神谕”,是因为它们在生成过程中可以访问实际回应,从而允许逆向工程推理。该管道产生了31k个高质量三元组用于训练。
为了应对第二个挑战,我们提出一种即插即用的思考生成器,称为MIThinker。我们对MIThinker进行两步微调:(1) 使用AugR1-MI数据集进行监督微调 (SFT),以及 (2) 使用组相对策略优化 (GRPO) (Shao et al., 2024) 和复合奖励函数,该函数优先考虑治疗对齐和推理连贯性。与像R1那样的推理模型(既生成思考又生成回应)不同(Zhang et al., 2024a; Hu et al., 2025a),即插即用的MIThinker设计严格优化ToM评估和策略选择的推理,同时将最终回应的生成留给任何不需要MI训练的后端LLM。
本研究的主要贡献是:
- 我们开发了AugR1-MI,一种自动化管道,用于生成模仿咨询师心态的高质量咨询师神谕思考,解决了MI咨询思考数据有限的挑战。
- 我们提出了MIThinker,第一个用于MI的即插即用思考策略,通过两阶段训练和复合奖励函数进行优化,聚焦于格式遵循、思考对齐和推理合理性。
- 我们开发了MindfulMI,它利用MIThinker实现了与最先进系统相当的MI能力,同时具有显著优越的计算效率。
## 2 相关工作
将LLM集成到基于MI的心理健康咨询中已成为一个有前景的研究方向,从针对酒精使用障碍的专业代理(Steenstra et al., 2024)到更复杂的框架,如DIIR(Xie et al., 2024)用于策略检索、策略链提示(Sun et al., 2024; Hsu et al., 2023)以及配备来访者状态推断和话题探索的CAMI(Yang et al., 2025)。然而,这些方法要么专注于孤立的策略选择,要么依赖于计算昂贵的多模块架构。同时,思维链提示(Wei et al., 2022)推进了LLM中的推理,在治疗应用中包括PsyCoT(Yang et al., 2023)用于基于问卷的推理、ESCoT(Zhang et al., 2024a)用于情绪识别和策略论证,以及PsyLLM(Hu et al., 2025a)用于诊断和治疗推理。然而,这些方法要么依赖外部工具,要么专注于单轮推理,要么缺乏特定领域的治疗基础。据我们所知,MIThinker是第一个领域专用推理模型,它生成基于心理学理论的咨询师思考,同时充当轻量级即插即用的思考策略。
## 3 基于思考的MI咨询
在本节中,我们首先介绍我们将由MIThinker生成的咨询师思考的设计。然后,我们描述MIThinker的训练数据,即AugR1-MI数据集,该数据集包含源自真实咨询会话的神谕思考。训练包括监督微调和强化学习步骤。最后,我们设计一个MindfulMI咨询代理,利用MIThinker的输出思考来生成对来访者的回应。
### 3.1 咨询师思考
咨询师思考捕捉了MI会话中表面对话流背后的推理过程。思考反映了咨询师对来访者心理状态的内部评估以及在特定会话上下文中选择适当MI策略(列于表6)的过程。我们的咨询师思考框架受两个原则指导:(i) 将推理与既定治疗理论对齐以确保临床有效性,以及 (ii) 结构化思考以促进可操作的回应生成。与通用思维链推理不同,我们的框架将每个思考锚定于治疗原则,确保生成的思考既连贯又具有临床意义。图2和表27展示了涵盖这些方面的思考示例。
该框架整合了三个互补的理论基础:动机访谈(MI)(Miller and Rollnick, 2002; Miller et al., 2003)提供了核心治疗结构和技术,通过协作、以客户为中心的互动促进内在动机。跨理论模型(TTM)(Prochaska and DiClemente, 2005)提供了对来访者在不同阶段改变准备程度的洞察,从而实现阶段匹配的干预策略。心理理论(ToM)(Wimmer and Perner, 1983; Frith and Frith, 2005)支撑了咨询师构建来访者思想、信念、意图、情绪和信任的心理表征的能力,这对于提供上下文适宜的治疗回应至关重要。这些框架在实践中自然融合:MI提供治疗结构,TTM指导改变动机的时间进程,而ToM则提供了理解来访者需求所必需的认知过程。我们采用二阶ToM来指导来访者心理状态的评估,同时纳入MI策略以确保与MI一致的咨询师行为(Miller et al., 2003)。详细的理论基础和实现细节,请参见附录B.1。
### 3.2 AugR1-MI 数据集构建
如图2所示,AugR1-MI的构建遵循一个管道,从观察到的回应中逆向工程化咨询师的思考。

##### 数据选择与处理。
我们采用著名的AnnoMI数据集(Wu et al., 2022, 2023),该数据集包含跨多种行为主题(包括减少酒精消费和戒烟)的MI咨询会话。我们仅使用110个高质量AnnoMI会话进行思考生成。对于每个带有标注MI策略标签的咨询师回应(初始问候和过短的语句除外),我们将会话中之前的所有话语视为上下文,并构建一个上下文-回应对。为确保公平评估并避免测试数据泄露,我们按大约8:1:1的比例分割数据,分别得到来自90个训练会话、10个验证会话和10个测试会话的上下文-回应对子集,如表1所示。
##### 初始神谕思考生成。
基于3.1节设计的思考框架,我们指导一个强大的LLM通过逆向工程咨询师内部的推理过程来生成神谕思考,该推理过程自然会导致其观察到的回应。对于每个上下文-回应对,我们提供行为主题、会话上下文和策略标签。然后,LLM以结构化的第一人称格式生成涵盖五个ToM维度(即信念、欲望、意图、情绪和信任)以及MI策略推理的思考。为了增强多样性并防止过拟合,我们为每个上下文-回应对生成多个神谕思考(n=20),因为咨询师可能通过不同的推理过程得到相同的回应。详细的提示可以在表7中找到。
##### 迭代思考精炼。
我们对初始神谕思考进行质量评估,并精炼那些未能增强回应准确性的思考。具体地,对于每个上下文,我们使用一个强大的LLM(GPT-4o)基于该神谕思考生成一个思考增强的回应,以及一个仅基于上下文的普通回应。然后,我们使用一个预训练的句子转换器(all-MiniLM-L6-v2)来衡量两个生成回应与真值回应之间的语义相似度。我们不是采用任意相似性阈值,而是采用相对改进标准。相似文章
超越“努力思考”——为您的智能体实现更好的思考。[插件]
Better Thinking 是 Claude Code 的一个插件,提供 131 种结构化思考流程(技能),以改进 AI 推理能力,超越简单的“逐步思考”提示。调度器会根据任务自动选择合适的技术。
MAI-Thinking-1
微软AI推出MAI-Thinking-1,这是一个350亿活跃参数的推理模型,从头训练,无需蒸馏,在软件工程和数学基准测试中表现强劲,同时强调干净数据和自给自足。
Visual Para-Thinker++: 视觉推理的单策略多智能体框架
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。
@thinkymachines: 当 Lilian 讲述故事时,交互模型可以追踪她何时在思考、让步、自我纠正或……
文章重点介绍了一项研究更新,描述了一种交互模型,该模型能够在没有内置对话管理系统的情况下,追踪讲故事过程中的认知状态,如思考、让步和自我纠正。
ThoughtFold: 通过内省偏好学习折叠推理链
ThoughtFold 提出了一种利用内省偏好学习的框架,旨在减少大型推理模型在思维链推理中的冗余探索,在 DeepSeek-R1-Distill-Qwen-7B 上实现了约 56% 的令牌减少,且准确率无损。