从表征到行为:探索LLMs中的人-情境-行为三元组

arXiv cs.CL 论文

摘要

本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。

arXiv:2607.26853v1 公告类型:新 摘要:人类人格理论认为,特质并非单一分数所捕捉的孤立属性,而是通过人、情境和行为之间的相互作用所表达的稳定个体倾向。现有关于LLM中人格相关行为的研究主要关注人格条件化下引发的输出,描述了可观察的特质相关表达,但缺乏关于内部人格相关表征的存在、其跨情境表达以及这些表征如何塑造具体行为的机制性证据。基于Funder的人格三元框架,我们将其三个组成部分适配到LLM分析中:人(Person)作为与人格相关的内部表征,情境(Situation)作为提供特质相关反应的上下文,行为(Behavior)作为更广泛社交任务上的反应模式。我们提出一个在LLM中发现、控制和验证类似特质表征的框架。首先,利用基于共享情境的对比行为对,通过SAE分解识别与人格特质对立极相关联的稀疏内部特征。我们通过对情境行为的效应、词元级激活模式以及对释义的鲁棒性来验证其特质相关性。其次,特征层面的干预在独立且多样化的情境集合中诱导双向特质相关偏移,同时保持反应有效性,展示了跨情境的一致表达。第三,将相同的干预应用于社交智能任务,揭示了与人类人格研究发现一致的收益权衡模式的行为变化,提供了超越人格分数的行为层面验证。我们的研究结果提供了证据,表明LLM包含可控的类似特质表征,这些表征连接内部状态、情境表达和行为结果。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 从表征到行为:探究大型语言模型中的人格-情境-行为三元组
来源:https://arxiv.org/abs/2607.26853
查看PDF(https://arxiv.org/pdf/2607.26853)

> **摘要**:人类人格理论将特质描述为并非由单一分数捕捉的孤立属性,而是通过个体、情境与行为之间的相互作用所表达的稳定倾向。现有关于大型语言模型(LLM)中人格相关行为的研究主要关注在人格条件化下所引发的输出,描述了可观察的特质相关表达,但缺乏对内部人格相关表征的存在性、其跨情境表达方式以及这些表征如何塑造特定行为的机制性证据。基于Funder的人格三元框架,我们将其三个组成部分调整为适用于LLM分析:人格(Person)对应人格相关的内部表征,情境(Situation)对应引发特质相关反应的上下文,行为(Behavior)对应更广泛社交任务上的响应模式。我们提出了一套发现、控制和验证LLM中类特质表征的框架。首先,利用基于共享情境的对比行为对,通过稀疏自编码器(SAE)分解识别与人格特质对立极相关的稀疏内部特征。我们通过对情境的行为效应、词元级激活模式以及对释义的鲁棒性来验证其特质相关性。其次,在特征层面的干预在另一组多样化情境中引发了双向的特质相关偏移,同时保持了响应的有效性,显示了跨情境的一致表达。再次,将相同干预应用于社交智能任务,揭示出的行为变化及其利弊权衡模式与人类人格研究中的发现一致,提供了超出人格分数的行为层面验证。我们的发现表明,LLM包含可控的类特质表征,这些表征连接了内部状态、情境表达与行为结果。

## 提交历史

来自:张瑞康 \[查看邮件(https://arxiv.org/show-email/44bba849/2607.26853)\] **\[v1\]** 2026年7月29日星期三 12:36:47 UTC(325 KB)

相似文章

超越静态人格:大型语言模型的情境人格引导

arXiv cs.CL

本文介绍了IRiS,一种无需训练的情境人格引导框架,它通过识别和利用情境依赖的人格神经元,超越了静态人格建模。该方法表明,大型语言模型的行为随情境变化,并提出了基于神经元的识别、检索和加权引导方法,在PersonalityBench和新增的SPBench基准上得到验证。