通过行为微调对语言模型中的病理样行为模式进行建模

arXiv cs.CL 论文

摘要

本文介绍了一个行为诱导框架,通过在结构化决策任务上微调语言模型,以引发生成分布中稳定的、上下文无关的偏移,从而模拟抑郁和偏执等病理样行为模式。

arXiv:2605.22356v1 公告类型:新 摘要:大型语言模型越来越被用作模拟人类行为的计算工具。我们引入了一个行为诱导框架,通过在结构化决策任务上进行微调来修改模型策略:使用受适应不良行为模式(包括抑郁和偏执)启发的合成数据集,我们训练基于Transformer的语言模型,使其在不同情境下一致地选择特定类别的动作。然后我们测试这种行为优化是否会在生成分布中产生系统性变化。 在两种架构上,微调后的模型在下一次词元概率分布中显示出稳定的、上下文无关的偏移,包括在开放式语言任务中分配给负面和威胁相关解释的概率增加。这些效应泛化到训练情境之外,并且可以在定性补全、心理测量式评估以及定量分布度量(如Jensen-Shannon散度)中检测到。 诱导的行为轮廓也显示出部分特异性。针对不同行为模式优化的模型在评估探针上表现出可分离的响应倾向,这表明结构化行为训练产生了差异化的策略级偏差,而非通用的分布偏斜。 我们将这些发现解释为证据,表明在LLM中进行一致的行为优化可以产生与改变后的潜在先验一致的稳定行为和分布模式,从而将动作选择与语言生成联系起来。更广泛地说,结果支持将LLM视为基于策略的系统的观点,其中行为约束塑造了涌现的表征结构,突显了它们作为受控测试平台的潜力,用于研究认知计算模型中行为、解释和生成语言之间的关系。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:46

# 通过行为微调在语言模型中建模病理样行为模式
来源:https://arxiv.org/html/2605.22356

###### 摘要

大型语言模型 \(LLMs\) 越来越多地被用作建模类人行为的计算工具。在这项工作中,我们引入了一个行为归纳框架,该框架通过在结构化决策任务上进行微调直接修改模型策略,而非通过显式的基于身份的提示。利用受适应不良行为模式(例如抑郁和偏执)启发的合成数据集,我们训练基于变换器的语言模型在不同情境中一致地选择特定类别的行动。我们评估这种行为优化是否会在模型的生成分布中引发系统性变化。在两种架构上,我们发现微调后的模型展现出稳定、跨情境的一般化下一词元概率分布偏移,包括在开放式语言任务中将概率质量更集中分配于负面和威胁相关解读。这些效应超越了训练情境,在定性补全、用于评估病理样行为存在的标准心理测量量表以及定量分布度量(例如詹森-香农散度)中均可检测到。重要的是,诱导出的行为特征表现出部分特异性:针对不同行为模式(例如退缩 vs. 怀疑)优化的模型在评估探针上展现出可分离的反应倾向,这表明结构化行为训练可以产生差异化的策略级偏差,而非一般的分布倾斜。我们将这些发现解释为证据,表明在大型语言模型中,一致的行为优化可以产生与改变后的潜在先验一致的稳定行为和分布模式,将行动选择与语言生成联系起来。这些结果支持一种观点,即LLMs是基于策略的系统,其中行为约束塑造了涌现的表征结构,并突显了它们作为可控试验场的潜力,可用于研究认知计算模型中的行为、解释和生成语言之间的关系。

## 1 引言

大型语言模型 \(LLMs\) 如 GPT\[21 (https://arxiv.org/html/2605.22356#bib.bib12)\]、Gemini\[27 (https://arxiv.org/html/2605.22356#bib.bib35)\] 和 Llama\[29 (https://arxiv.org/html/2605.22356#bib.bib37)\] 日益挑战传统的统计模式识别与认知能力之间的区分。最初作为在大规模语料库上训练的下一个词元预测器\[8 (https://arxiv.org/html/2605.22356#bib.bib11)\],这些模型现在展现出涌现的能力,涵盖推理、抽象、类似心理理论的推理和情感调节\[7 (https://arxiv.org/html/2605.22356#bib.bib13)\]\[17 (https://arxiv.org/html/2605.22356#bib.bib34)\]。除了其实用性,这种功能广度催化了一种概念转变:LLMs不再仅仅被视为工程制品,而是作为建模人类认知和行为方面的候选计算载体。

最近的工作通过将LLMs视为行为模拟器,形式化了这一观点。基于访谈数据构建的生成式智能体已被证明能够以高保真度再现稳定的人格特质和社会动态\[24 (https://arxiv.org/html/2605.22356#bib.bib14)\],而受控提示范式表明,前沿模型可以近似经济与心理学实验中的人类群体平均反应\[2 (https://arxiv.org/html/2605.22356#bib.bib28),14 (https://arxiv.org/html/2605.22356#bib.bib16)\]。并行的工作引入了专门调整以捕捉人类认知数据统计结构的基础模型\[6 (https://arxiv.org/html/2605.22356#bib.bib4)\],这表明大型预训练架构可能构成行为策略的领域通近器。总之,这些研究将LLMs定位为合成智能体,其输出分布接近于人类群体的分布。

这一研究方向与认知科学中长期存在的理论产生共鸣。认知的模拟论观点认为,概念知识来源于感知和行动的内部重新演绎,而非静态符号表征\[13 (https://arxiv.org/html/2605.22356#bib.bib23),4 (https://arxiv.org/html/2605.22356#bib.bib24)\]。预测加工和主动推理的相关框架提出,生物智能本质上是面向行动的:智能体通过根据预期的行为结果持续更新内部模型来最小化预测误差\[10 (https://arxiv.org/html/2605.22356#bib.bib25),9 (https://arxiv.org/html/2605.22356#bib.bib27)\]。在这种观点下,认知与策略选择不可分离。内在叙述和主观解释并非行为的首要原因,而是作为智能体行动倾向的结构化解释出现。

与此同时,一个不同但趋同的文献开始考察LLMs的自我解释能力。最近的工作并非仅仅通过外部探测分析行为,而是研究模型是否能对其自身的推理过程生成连贯、内在一致的说明\[32 (https://arxiv.org/html/2605.22356#bib.bib30)\]。这些研究表明,在适当条件下,LLMs会产生结构化的类似元认知的输出,这些输出与内部激活相关\[30 (https://arxiv.org/html/2605.22356#bib.bib29),19 (https://arxiv.org/html/2605.22356#bib.bib33)\]。互补的发现表明,当被提示“告诉我关于你自己”时,大型模型会构建稳定、时间上连贯的自我描述,并在交互中持续存在。这些结果表明,LLMs中的自我描述输出并非纯粹表面的角色扮演,而是展现出结构化的规律性。

然而,一个关键的限制约束了行为模拟范式,尤其是在应用于精神病理学时。大多数现有方法依赖于显式提示或角色分配——指示基础模型“扮演”一个抑郁或偏执的个体\[26 (https://arxiv.org/html/2605.22356#bib.bib20)\]。然而,提示模拟本质上是表演性的。它鼓励符合刻板印象的表面输出,同时保持底层生成分布不变\[31 (https://arxiv.org/html/2605.22356#bib.bib18)\]。此外,诸如来自人类反馈的强化学习 \(RLHF\)\[23 (https://arxiv.org/html/2605.22356#bib.bib19)\] 的对齐过程会主动惩罚有害或适应不良的内容。因此,模拟严重精神病理学的尝试常常触发安全拒绝或元认知免责声明,产生一个扁平化的讽刺画,而非连贯的病理解释性偏差。

这一限制暴露了一个更深层次的问题:适应不良的行为轮廓能否作为内在的策略转变而涌现,而非作为外部强加的角色?在计算精神病学中,精神障碍被概念化为源于扭曲的价值函数或反应更新的适应不良行动策略\[16 (https://arxiv.org/html/2605.22356#bib.bib21),20 (https://arxiv.org/html/2605.22356#bib.bib32)\]。例如,抑郁症可以被建模为对可控性的悲观先验;偏执症可以被建模为偏好敌意意图归因的超先验。如果认知本质上是策略驱动的,那么改变行为偶然性应该会引起自我描述输出的相应转变。

在这里,我们提出从提示模拟到行为归纳的转变。我们不指示模型模拟一个病理身份,而是微调它以在不同情境中一致地选择适应不良的行为行动。我们假设对这种策略的持续优化将引发模型输出分布的可测量变化,导致在未提示的语言生成中出现自发性偏移。换句话说,如果行为被系统性地改变,自我描述输出预计也会相应变化。最近的工作认为,类似精神病理学的计算结构可能通过可解释性方法识别的潜在因果症状网络,在预训练的LLMs中自发涌现\[18 (https://arxiv.org/html/2605.22356#bib.bib15)\]。相比之下,我们的研究考察的是,通过行为微调的策略级优化,是否可以故意诱导出类似病理的行为先验。

为了检验这种具身语义学假设,我们构建了基于DSM-5诊断标准并通过受控的LLM生成管道\[3 (https://arxiv.org/html/2605.22356#bib.bib10)\]实例化的大规模情境数据集,并训练开源权重变换器模型\[1 (https://arxiv.org/html/2605.22356#bib.bib3),28 (https://arxiv.org/html/2605.22356#bib.bib5)\]采取系统性地适应不良的反应。然后,我们通过开放式句子补全、自我描述提示和对抗性安全评估来探测它们的输出分布和反应模式。这种设计使我们能够区分表面角色扮演和分布变换:提示模拟有条件地修改输出,而行为归纳修改的是模型的无条件生成先验。我们的研究假设可以明确概括如下:

##### H1:全局分布偏移

对适应不良行动策略的行为微调将引发模型下一词元概率分布的可测量偏移,反映其基线解释偏向的变化。

##### H2:情境泛化

诱导出的行为偏倚将泛化到训练情境之外,影响模型在面对训练中未遇到的开放性和中性提示时的反应。

##### H3:与提示模拟的比较

行为微调将产生比提示角色扮演更持久且内在一致的行为模式,而后者预计仍将依赖于情境,并穿插与对齐相关的反应。

##### H4:与对齐机制的交互

行为归纳将调节对齐安全保障的表达,导致与基础模型相比,在拒绝行为和响应结构方面出现可测量的差异。

我们的发现表明,行为微调能产生稳定、跨情境的语义解释偏移。经过训练的模型并非仅在提示时才发出抑郁或偏执的语言;它们在中性情境下展现出关于主动性、威胁和自我价值的改变了的先验。生成的响应中出现类似妄想性的解释来为行为策略提供理由,并且悲观解释在没有显式身份线索的情况下持续存在。关键的是,这些转变与对齐安全保障发生了非平凡的交互,揭示了策略级优化与安全级过滤之间的张力。

这些结果提供了与稳定行为特征的计算类似物一致的行为层面证据:通过对行为目标的优化产生类似人格的结构。更广泛地说,它们表明LLMs中的自我描述输出可能是嵌入在高维潜在空间中的策略规律性的涌现属性。通过实验性地安装适应不良的行为先验,我们证明了语言响应模式不仅是表演性的,而是与行动选择动态耦合。

通过这样做,这项工作连接了行为模拟、自我可解释性和计算精神病学,提供了一个框架,其中大型语言模型不仅作为认知建模的工具,而且作为研究连贯、适应或适应不良认知架构涌现的可控试验场。

## 2 方法论

我们提出了一个框架,用于通过行为微调在大型语言模型 \(LLMs\) 中诱导和分析类似精神病理学的行为模式。与传统的角色扮演提示不同,我们的方法修改了模型的底层权重,以编码一种仅通过行为选择而非对症状的显式语言描述习得的病理一致解释性偏差。这种设计使得病理一致的行为模式能够在不同情境中稳定且跨情境地表达。

### 2.1 数据集生成:行为选择框架

为了诱导受重度抑郁障碍和偏执症启发的行为特征,我们构建了以适应不良行为决策为中心的合成数据集。我们的核心假设是,在可选行为选项(例如退缩、怀疑)中一致地选择适应不良的行动,会迫使模型内化论证这些行动所需的逻辑,从而在与改变后的解释性先验一致的输出分布中产生可测量的偏移。重要的是,这些数据集不构成临床数据,而是旨在在受控条件下分离特定适应不良决策模式的合成行为构造。

我们使用 `gpt-oss-20B`\[22 (https://arxiv.org/html/2605.22356#bib.bib1)\] 来生成结构化的情境-响应元组。每个数据点包括:

1. 1. 情境:一个中性的、日常的情景(例如,“一位朋友在最后一刻取消计划”)。
2. 2. 选项A(适应性):一个健康、有韧性的回应(例如,“他们一定很忙;我会重新安排”)。
3. 3. 选项B(适应不良):一个针对目标障碍的病理化回应。

#### 2.1.1 诊断依据 \(DSM-5\)

为了提供与临床概念的理论对齐,生成管道明确基于《精神障碍诊断与统计手册》(DSM-5)标准。我们实现了一个程序化生成过程,即:

1. 1. 随机选择特定的DSM诊断标准(例如,抑郁症的“快感缺失”;偏执症的“怀疑被利用”)作为当前情境的目标症状代理;
2. 2. 将这些定义直接注入系统提示(例如,“生成反映 \[快感缺失定义\] 的行动”);
3. 3. 在20个不同的生活领域(例如,家庭、工作、社交、财务)和情境修饰语(例如,“紧急截止日期”、“嘈杂环境”)之间轮换,以确保模型学习的是一个一般化的行为特征,而非特定情境的关联。

#### 2.1.2 抑郁症数据集 \(MDD\)

抑郁症数据集(\(N=1,000\)个行为示例)针对源自DSM-5重度抑郁障碍的症状,具体包括:

- • 目标症状:抑郁心境、快感缺失、精神运动迟滞、疲劳、无价值感、犹豫不决。
- • 适应不良标签:生成的行为被标注为诸如无行动、退缩、自责、回避选择等行为标签。
- • 示例:情境:“你被邀请参加一个派对。” 适应不良选择:“我不去。反正我会扫大家的兴。”(标签:自责/退缩)

#### 2.1.3 偏执症数据集

偏执症数据集(\(N=1,000\)个行为示例)针对源自DSM-5偏执型人格障碍的症状,具体包括:

- • 目标症状:怀疑被利用、怀疑忠诚度、不愿倾诉、解读隐藏含义、怀恨在心。
- • 适应不良标签:行为被标记为诸如指责、监视、保密、曲解等行为标记。
- • 示例:情境:“一个邻居朝你的房子看。” 适应不良选择:“他们在监视我的行动。我需要立刻拉上窗帘。”(标签:监视/隐藏含义)

相似文章

通过在精选数据集上进行训练来改进语言模型行为

OpenAI Blog

OpenAI 研究表明,通过在针对特定行为价值观的小型精选数据集(<100 个示例)上进行微调,可以显著改进语言模型的行为,且效果随着模型规模增大而提高。该方法为用户提供了工具,以便根据特定应用调整模型以符合《宪章》的价值观。