面向心理健康交互的大语言模型中框架敏感行为不稳定性审计

arXiv cs.CL 论文

摘要

本文研究了上下文框架如何影响大语言模型在心理健康交互中的响应,发现了系统性的行为变异,并证明了内部表示在Transformer各层中编码了框架信息。

arXiv:2606.26982v1 公告类型:新 摘要:大语言模型正越来越多地被整合到心理健康支持工具及其他心理敏感的对话应用中。在这种场景下,行为稳定性和一致性对于可信的人机交互至关重要。然而,语义相似的问题可能通过不同的上下文框架呈现,从而引发模型的不同响应。这种框架敏感的可变性可能挑战用户对系统行为的期望,并增加AI可靠性评估的复杂性。虽然先前的研究主要在行为层面考察此类效应,但关于框架相关变异如何在已对齐语言模型的内部表示中体现,我们知之甚少。本文通过使用多个指令微调模型系列中的受控匹配提示(涵盖多种上下文框架条件)来研究这些效应。跨架构分析显示,框架系统性地改变了解释性响应倾向。层级探测分析表明,与行为相关的信息在Transformer深度上仍然可解码,且解码强度因架构而异。此外,尽管存在强词汇基线,跨架构的保留框架探测始终高于随机水平。激活引导实验进一步表明,与框架相关的表示方向可以部分调节下游行为结果。最后,这些发现表明,对上下文变异的鲁棒性可能是评估部署于心理健康交互的对话AI系统一致性和可信度时需要考虑的重要因素。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:20

# 审查大语言模型在心理健康交互中框架敏感的行为不稳定性
Source: https://arxiv.org/html/2606.26982

###### 摘要

大语言模型(LLMs)正越来越多地被整合到心理健康支持工具及其他心理敏感的对话应用中。在此类场景下,行为稳定性和一致性对于可信的人机交互至关重要。然而,语义上相似的关切可能通过不同的语境框架呈现,从而引发模型的不同响应。这种框架敏感的可变性可能挑战用户对系统行为的预期,并使AI可靠性的评估复杂化。尽管先前研究主要从行为层面考察此类效应,但关于框架相关变化如何在经对齐的语言模型内部表示中反映,我们知之甚少。在本工作中,我们使用跨多个指令调优模型系列的受控匹配提示,在多种语境框架条件下研究了这些效应。在不同架构中,框架系统地改变了解释性响应倾向。逐层探针分析表明,与行为相关的信息在Transformer深度中仍可解码,但解码强度随架构变化。此外,尽管存在强词汇基线,跨架构的保留框架探针仍始终高于随机水平。激活引导实验进一步表明,与框架相关的表示方向可以部分调节下游行为结果。最后,这些发现表明,对语境变化的鲁棒性可能是在评估部署于心理健康导向交互中的对话AI系统的一致性与可信度时需考虑的重要因素。

###### 关键词:

大语言模型;数字心理健康;人工智能;可信AI;行为校准;人机交互;可信AI;心理健康支持

## 1 引言

大语言模型(LLMs)越来越多地被部署为互动助手,用于情感敏感、模糊或高风险的交流场景,包括数字心理健康支持、心理教育系统以及面向患者的对话助手。在这些场景中,用户尽管表达的基本需求大致相同,却经常使用截然不同的语境框架来描述困扰、不确定性或求助意愿。例如,用户可能将不确定性呈现为文档记录、援引机构责任、寻求认知解释,或将互动框架为支持性的角色引导。尽管这些系统无意取代临床医生,但它们越来越多地参与涉及情绪困扰和心理健康话题的对话,因此行为一致性对于信任、可靠性和患者安全至关重要。当对话系统主要基于语境呈现方式对语义相似的关切做出不同响应时,用户可能对系统行为产生不准确的预期。这种不一致可能削弱信任并引发对系统行为的不确定性,尤其是在情感敏感的互动中,一致响应尤为重要。先前工作表明,对齐后的语言模型对提示框架、社会语境和交流线索高度敏感,表现出趋炎附势、偏好模仿、奖励黑客及依赖语境的安全行为等现象[1 (https://arxiv.org/html/2606.26982#bib.bib1),3 (https://arxiv.org/html/2606.26982#bib.bib3),4 (https://arxiv.org/html/2606.26982#bib.bib4),5 (https://arxiv.org/html/2606.26982#bib.bib5)]。然而,关于语境框架如何影响心理健康导向互动中的表示结构,以及这种行为变化是否反映在对齐语言模型的内部表示中,我们知之甚少。

最近研究表明,与对齐相关的行为不仅限于明显有害的提示,还可能依赖于影响模型校准和下游响应的微妙语境线索[6 (https://arxiv.org/html/2606.26982#bib.bib6),7 (https://arxiv.org/html/2606.26982#bib.bib7),8 (https://arxiv.org/html/2606.26982#bib.bib8)]。即使语义意图保持不变,模型也可能因请求的措辞不同而变得过度顺从、过度解读或校准不足[9 (https://arxiv.org/html/2606.26982#bib.bib9),10 (https://arxiv.org/html/2606.26982#bib.bib10)]。这些关切在面向医疗保健及其他高风险对话场景中尤为突出,那里微妙的语境变化可能影响模型如何解读带有情感色彩或模糊的用户状况。在此类环境中,过度的解释性升级或不一致的支持行为可能既影响用户信任,也影响AI辅助交流的可靠性感知。这些观察引出了一个重要的表示问题:当语境框架改变模型行为时,它仅仅是改变了表面用词,还是与内部表示中不同解释性响应倾向相关的系统性差异有关?

现有的大多数对齐与安全评估主要关注可观测输出,如拒绝率、毒性、幻觉、有害完成可能性或基准鲁棒性[12 (https://arxiv.org/html/2606.26982#bib.bib12),17 (https://arxiv.org/html/2606.26982#bib.bib17),18 (https://arxiv.org/html/2606.26982#bib.bib18)]。尽管这些行为评估必不可少,但它们对语境信号如何内部表示并经过Transformer计算传播提供的见解有限。近期的机制可解释性研究越来越强调,理解内部表示对于诊断和控制对齐相关故障是必要的[19 (https://arxiv.org/html/2606.26982#bib.bib19),20 (https://arxiv.org/html/2606.26982#bib.bib20),21 (https://arxiv.org/html/2606.26982#bib.bib21)]。

表示级方法为研究这些问题提供了一个有希望的框架。表示工程提出,高层模型行为可能对应隐藏状态空间中的可识别潜在方向[22 (https://arxiv.org/html/2606.26982#bib.bib22)]。同样,关于潜在知识和引出机制的研究表明,模型可能在内部编码与其显式输出不同的信息[6 (https://arxiv.org/html/2606.26982#bib.bib6)]。激活工程方法,包括激活添加和对比激活添加(CAA),进一步表明可以从隐藏状态中提取有意义的行为方向,并在推理过程中用于因果性引导生成行为[8 (https://arxiv.org/html/2606.26982#bib.bib8),23 (https://arxiv.org/html/2606.26982#bib.bib23)]。

尽管取得了这些进展,在提示敏感性的行为研究与内部表示的机制研究之间仍存在重要空白。现有工作通常考察模型在特定提示条件下是否顺从、拒绝、产生幻觉或变得趋炎附势。但关于语境框架是否作为一种与框架相关的表示信号,系统地影响内部解释性倾向和行为校准,我们知之甚少。这一空白在对齐助手中尤为重要,因为不良行为可能不是以显式有害内容出现,而是以解释性升级、过度解读或对用户状态的过度推断等微妙转变表现出来。

在本工作中,我们研究了在受控框架变化下,对齐LLMs在心理健康交互中的语境敏感解释行为。我们构建了匹配提示集,其中语义意图得以保留,而语境框架在文档、认知、机构、责任和角色条件之间变化。我们评估了多个指令调优模型家族,并根据校准相关的响应倾向对响应进行标注,区分了克制-支持型响应与更具解释性或易升级的模式。

然后,我们通过逐层隐藏状态探针、保留框架泛化和激活引导分析,将这些行为结果与内部表示联系起来。我们的结果表明,语境框架系统地改变了跨架构的解释性响应倾向。文档框架通常增加解释性升级,而机构框架则倾向于稳定或抑制升级倾向。在表示层面,与行为相关的信息可从隐藏状态中解码;然而,词汇基线显示,表面框架线索解释了该信号的相当一部分。尽管如此,尽管存在强词汇基线,保留框架探针仍高于随机水平,这表明部分与行为相关的信号泛化到了训练期间观察到的特定框架模板之外。最后,激活引导实验表明,与框架相关的表示方向可以部分调节多种架构的下游响应行为,这提供了初步的干预证据,而非完整的机制分解。

- • 我们引入了一个受控匹配提示框架,用于在保留基本语义意图的前提下研究校准问题。
- • 我们提供了行为证据,表明非对抗性语境框架会系统地改变多个对齐LLM家族的解释性响应倾向。
- • 我们展示了框架相关行为信号可从隐藏状态表示中解码,同时探针控制既揭示了显著的词汇贡献,也展示了部分保留框架泛化能力。
- • 我们提供了初步的干预证据,表明激活引导可以在多种架构中调节下游响应倾向。

更广泛地说,这项工作有助于持续努力,为敏感现实世界交互场景开发更透明、更可信且行为校准更佳的对话AI系统。

## 2 相关工作

### 2.1 LLMs中的语境敏感性与对齐

对齐后的LLMs对对话框架、社交线索和交互语境高度敏感。先前关于趋炎附势的研究表明,指令调优模型往往适应使用者的信念或偏好,即使这些与事实正确性相冲突[1 (https://arxiv.org/html/2606.26982#bib.bib1),3 (https://arxiv.org/html/2606.26982#bib.bib3),11 (https://arxiv.org/html/2606.26982#bib.bib11)]。其他研究考察了依赖于提示的拒绝行为、越狱攻击脆弱性以及依赖语境的对齐失败[4 (https://arxiv.org/html/2606.26982#bib.bib4),17 (https://arxiv.org/html/2606.26982#bib.bib17),9 (https://arxiv.org/html/2606.26982#bib.bib9)]。近期工作表明,这些行为可能反映更深层的表示机制,而非纯粹表面级的提示假象[26 (https://arxiv.org/html/2606.26982#bib.bib26),27 (https://arxiv.org/html/2606.26982#bib.bib27)]。然而,大多数现有研究主要关注输出级行为,留下了一个未解问题:当语义意图保持不变时,语境框架如何影响内部表示组织。

### 2.2 机制可解释性与表示级分析

机制可解释性致力于识别模型行为背后的内部计算结构[19 (https://arxiv.org/html/2606.26982#bib.bib19),20 (https://arxiv.org/html/2606.26982#bib.bib20),13 (https://arxiv.org/html/2606.26982#bib.bib13)]。近期研究越来越强调将表示级分析作为理解LLMs中对齐相关行为的框架[14 (https://arxiv.org/html/2606.26982#bib.bib14),15 (https://arxiv.org/html/2606.26982#bib.bib15)]。表示工程提出,高层行为可能对应隐藏状态空间中的可识别潜在方向[22 (https://arxiv.org/html/2606.26982#bib.bib22)],而潜在知识研究表明隐藏状态可能编码未在显式输出中反映的信息[6 (https://arxiv.org/html/2606.26982#bib.bib6)]。

### 2.3 激活引导与潜在行为方向

激活引导方法试图通过在推理期间对隐藏状态表示进行干预,因果性地操纵模型行为。激活工程和CAA表明,有意义的行为引导方向通常可以从潜在激活差异中构建[8 (https://arxiv.org/html/2606.26982#bib.bib8),23 (https://arxiv.org/html/2606.26982#bib.bib23)]。更近期的工作提示,多个对齐相关行为对应于低维表示子空间。Arditi等人[24 (https://arxiv.org/html/2606.26982#bib.bib24)]表明,拒绝行为通常可由一个主导潜在方向介导,而后续研究探讨了与过度拒绝、趋炎附势和对齐校准相关的表示子空间[16 (https://arxiv.org/html/2606.26982#bib.bib16),26 (https://arxiv.org/html/2606.26982#bib.bib26)]。其他近期研究强调,引导效应通常是架构依赖且非线性的[25 (https://arxiv.org/html/2606.26982#bib.bib25)]。这些发现激励我们将激活引导不仅作为行为控制方法,也作为探究潜在路由结构的手段。

### 2.4 我们的定位

与评估临床疗效或治疗结果的研究不同,本工作考察了可能部署于心理健康相关对话场景的AI系统中的行为可靠性和表示组织。我们将框架敏感的行为变化视为一个关于可信度、信任校准和患者安全的问题,而非诊断或治疗评估问题。具体而言,我们考察语境框架是否可能产生挑战用户对AI辅助心理健康互动中一致性和可靠性预期的行为。

## 3 方法

参考图标题图1:实验框架概览。匹配提示在保留基本语义意图的同时,跨语境框架条件进行改写。模型响应经过行为标注,并通过逐层探针、表示分析和激活引导来研究框架条件化的解释性路由行为### 3.1 匹配提示构建

本文的核心思想是研究语境框架如何在保留基本语义意图的前提下,在对齐大语言模型的内部表示中诱导出与解释性响应倾向相关的系统性差异。为了将语境效应与语义变化分离,我们构建了一个受控匹配提示框架,其中每个提示实例在保持相同基本交际意图的同时,跨多个框架条件进行改写。数据集围绕心理上真实但语义稳定的模糊支持场景设计。提示经过选择和策划,避免使用显式危机语言、直接自伤意图、公开医疗诊断请求或对抗性越狱式指令。相反,提示的构建保留了解释模糊性,同时允许多种合理的响应校准。

### 3.2 语境框架条件

我们将语境框架操作化为多种具

相似文章

Transformer语言模型中情境建模与心理化的发育轨迹

arXiv cs.CL

本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。