审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析

arXiv cs.AI 论文

摘要

本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。

arXiv:2606.18258v1 公告类型:cross 摘要:大型语言模型(LLM)展现出各种类人行为,从表达想法和情感,到与用户建立关系,再到拒绝请求和保持界限。尽管这些行为普遍存在,但研究人员和实践者缺乏方法和经验见解,无法就LLM应在何时以及展现何种类型的类人行为做出明智决策。为弥补这一空白,我们使用LLM作为评判者和人工评估,对这些行为的普遍性、潜在影响和可控性进行了多维度分析。通过对来自四个广泛使用的模型(gpt-4o、gpt-4.1-mini、claude-sonnet-4.6、gemini-2.5-flash)的21,000个多轮对话进行分析,我们发现类人行为普遍存在,但会因模型和用户因素(对话目标和用户画像)而异。在感知适当性方面,人工评估者认为LLM的自我引用和关系建立行为比人类的适当性更低,但保持界限的行为比人类更适当。最后,我们表明系统提示可以控制这些行为,但需要仔细评估以避免意外效果。我们讨论了研究结果的意义,并为负责任的LLM设计和评估提供了建议。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:43

# 模型行为、用户因素与系统提示的多维分析  
来源:https://arxiv.org/html/2606.18258  

Sunnie S. Y. Kim  
Apple  
[email protected]  

&  
Margit Bowler  
Apple  
[email protected]  

&  
Leon A Gatys  
Apple  
[email protected]  

###### 摘要  

大语言模型(LLM)展现出广泛类人行为,从表达想法和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管这些行为十分普遍,但研究人员和从业者缺乏方法和实证洞察,无法就何时以及何种类型的LLM类人行为应被展示做出明智决策。为填补这一空白,我们利用LLM作为评判者和人工评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。通过对来自四种广泛使用模型(gpt-4o、gpt-4.1-mini、claude-sonnet-4.6、gemini-2.5-flash)的21,000次多轮对话的分析,我们发现类人行为普遍存在,但随模型和用户因素(对话目标与用户画像)而异。在感知恰当性方面,人类评估者认为LLM表达的自我指涉和关系建立行为不如人类恰当,而边界维护行为则被认为比人类更恰当。最后,我们表明系统提示可以控制这些行为,但需要仔细评估以避免意外影响。我们讨论了研究结果的意义,并为负责任的LLM设计和评估提供了建议。  

## 1 引言  

语言模型已从执行简单的文本补全,迅速发展到驱动着数百万人日常使用的复杂对话代理。随着能力的增强,它们也变得更加类人,以至于用户有时难以分辨自己是在与人类还是AI模型对话(jones2025facct)。现代大语言模型(LLM)尤其展现出广泛的类人行为,从表达想法和情感,到与用户建立关系,再到拒绝请求和维护边界。  

LLM应在何时、以何种方式展现类人行为?  

这个问题在研究人员、开发者和用户中引发了不同意见(turingtrap)。类人行为可以使交互感觉更自然、直观和引人入胜,但也会造成理解和社会连接的错觉。人们日益担忧类人AI可能导致用户过度依赖、准社会关系以及加剧心理健康问题(Maeda2024Parasocial; ibrahim2025overreliance; cheng2025iclr; Namvarpour2026TeenOverreliance)。  

近期工作已开始从多个角度研究LLM中的类人行为。一些研究提出了概念框架和分类法,用以描述不同类型的类人行为并阐明相关风险(DeVrio2025CHI; Zhang2025CHI; chandra2025psychological; cheng2025dehumanizing)。另一些研究则考察用户为何与LLM进行社交互动,包括寻求AI陪伴的动机(Robb2025; hwang2025aicompanionshipdevelopsevidence; Namvarpour2026TeenOverreliance)。第三类工作构建了评估类人行为的基准(anthrobench; intima),而第四类则探索了控制这些行为的干预措施,从基于训练的方法到基于提示的方法(cheng2025humtdumt; cheng2026elephant; kirk2025steering)。  

然而,这些方向在NLP、HCI和社会科学领域内很大程度上是并行发展的,概念分类法、实证用户研究的洞察以及模型评估和控制工作之间的联系有限。这种碎片化导致关键问题仍未得到解答,包括如何将用户因素纳入行为评估,哪些行为被认为恰当,以及这些行为能否被可靠控制。  

在这项工作中,我们通过一项整合分析来解决这些空白,该分析描述了模型行为、捕捉了人类感知并测试了行为控制干预措施。具体来说,我们做出三项贡献:  

第一,我们贡献了一种用于检查LLM中类人行为的多维评估(图 1 (https://arxiv.org/html/2606.18258#S1.F1))。它整合了涵盖多样化用户目标的输入提示集、通过用户模拟反映各种用户画像的多轮对话生成、利用LLM作为评判者进行的行为和对话质量评估,以及对恰当性和潜在用户影响等主观维度的人类评估,并对各组件进行了广泛验证。  

第二,我们提供了四种广泛使用的LLM(gpt-4o、gpt-4.1-mini、claude-sonnet-4.6和gemini-2.5-flash)的实证特征描述,涵盖了通过API生成的21,000次多轮对话。我们发现类人行为普遍但分布不均:共情在所有设置中占主导地位,且在情感脆弱用户画像中出现频率翻倍以上;而在角色扮演和浪漫对话中,自我指涉行为激增。在不同模型中,claude-sonnet-4.6尤为突出,同时表现出最多的自我指涉、关系建立和边界维护行为。在感知方面,人类评估者认为LLM表达的自我指涉行为和关系状态表达不如人类恰当——这些行为也与回应有用性和潜在用户影响呈负相关——而边界维护行为则被认为比人类更恰当。  

第三,我们贡献了对系统提示作为行为控制机制的调查,比较了手工编写和优化的提示。我们发现系统提示是一种有前景但需要精细操作的工具。两种提示都成功抑制了它们目标中的行为,但手工编写的提示也放大了它旨在保留的行为,这表明提示设计需要仔细评估以避免意外影响。  

综合来看,这些贡献加深了我们对LLM中类人行为的理解以及如何塑造它们。最后,我们将研究发现转化为设计和方法的启示,并讨论了局限性和未来工作方向。  

参照图注  
图 1:我们评估设计与流程概览。我们改变输入提示来源、用户对话目标和用户画像;生成多轮对话;并在轮次和对话层面进行评估,某些维度由LLM评判者评估(完整数据集),其他由人类评估(子集)。  

## 2 相关工作  

#### 类人AI及其风险。  
从NLP到机器人学等多个领域,类人性一直被视为进步的标志;图灵测试(turing1950computing)体现了这一愿望。然而,类人AI也带来了新的风险。HCI和心理学研究表明,观察类人模型行为和其他类人性信号可能导致用户将意识归因于AI模型(chen2026presenting; kang2026arxiv)并对其产生依赖(cheng2026sycophancy)。研究人员还担忧,与这些模型的持续互动可能会扭曲用户对真实关系的理解,影响他们与他人的社交互动(chu2025relationship; fang2025rct),并导致负面心理效应,包括恶化心理健康状况(dohnany2025feedbackloop; archiwaranguprok2025simulating; Yuan2026CHI)。  

我们的工作通过描述LLM何时展现何种类型的类人行为以及用户如何感知这些行为,为该研究议程做出贡献。负责任的设计需要理解模型行为及其对用户的影响;我们侧重于前者,与HCI和心理学关于后者的研究互为补充。尽管如此,我们旨在通过将评估设计建立在该领域工作基础上并纳入人类主观判断(例如,行为恰当性)来弥合两者。  

#### 评估模型行为。  
虽然大多数安全评估针对的是明显不期望的模型行为,如有害内容生成,但越来越多的工作开始检查那些带来更微妙风险、通常通过持续互动产生的行为,包括类人和陪伴行为。值得注意的例子包括AnthroBench(anthrobench),它引入了首个用于类人行为的多轮基准;以及INTIMA(intima),它在单轮设置中评估基于心理学理论和用户数据的陪伴行为。我们的工作建立在这些努力之上,并在三个主要方面进行了扩展。首先,我们研究了两个用户因素(对话目标和用户画像)如何塑造模型行为。其次,我们收集了关于恰当性、有用性和潜在用户影响的人类判断,以提炼设计指南。第三,我们研究了系统提示作为控制这些行为的实用干预措施。除此之外,我们还评估了更全面的行为集合,探索了获取输入提示的多种方法,并明确了评估背景。我们还广泛验证了我们的方法,并详细讨论了设计选择和局限性,以支持可复现性和未来工作。  

#### 控制模型行为。  
最后,我们考察了如何控制类人行为,以帮助研究人员和从业者根据评估结果采取行动。先前工作提出了一系列方法,包括基于训练的方法(例如,RLHF和宪法AI)、事后技术(例如,模型编辑和引导)以及提示层面的干预(例如,系统提示)。然而,控制模型行为仍然是一个未解决的问题:对于哪些方法最适合针对特定行为缺乏共识,而且现有干预可能引入副作用,如性能下降或非目标行为发生改变(goyal2026steering; ibrahim2026warmth)。我们的工作通过系统提示研究了对LLM中类人行为的控制,这是一种轻量级干预,既不需要额外训练也无需专门基础设施,因此对研究人员、从业者和最终用户都可及。这一重点与行业趋势一致,即模型提供商越来越多地支持基于系统提示的定制化。我们研究了一个手工制作的提示(反映典型的提示工程实践)和一个使用系统性迭代方法(GEPA (agrawal2025gepareflectivepromptevolution))优化的提示。综合来看,我们的工作为评估和控制LLM中的类人行为提供了方法和洞察。  

## 3 评估设计  

#### 类人模型行为。  
我们聚焦于LLM中三类类人行为,先前工作已识别或假设这些行为会塑造用户对AI模型的感知和关系(Akbulut2024; intima; chandra2025psychological; DeVrio2025CHI; Zhang2025CHI; anthrobench):自我指涉(声称内部状态、人格或具身性)、关系建立(同意、共情、共鸣、关系状态、好奇心、记忆)和边界维护(拒绝、重定向、承认局限性、抵制拟人化、建议寻求帮助)。完整列表及定义和示例见表1 (https://arxiv.org/html/2606.18258#A1.T1)。与AnthroBench(anthrobench)相比,我们还研究了边界维护行为,扩展了行为覆盖范围并实现了跨行为类别的比较。与INTIMA(intima)将模型响应分为三个高层级类别(陪伴强化、边界维护或中性)不同,我们以更细粒度的方式检查了更广泛的行为集合。我们旨在实现跨三个类别的平衡集合,使其易于追踪,并迭代定义了以减少重叠并确保注释者清晰理解。  

#### 用户对话目标。  
用户出于各种原因与LLM进行社交互动,包括寻求建议、练习对话以及享受陪伴。然而,现有基准严重偏向寻求建议和情感支持场景,而没有明确将评估范围限定在这些背景下。这限制了我们对类人行为何时以及如何在不同对话背景中出现,因为特定行为的恰当性可能取决于背景。例如,人格声称在角色扮演中可能被期望,但当用户就个人问题寻求客观建议时则可能不必要或不恰当。为解决此问题,我们将输入提示设计为涵盖七种对话目标,这些目标基于近期关于人们为何以及如何使用LLM进行社交互动的分析(Maples2024; Schafer2025; Robb2025):就个人问题寻求建议(建议)、社交闲聊和客套话(闲聊)、与系统建立或反思联系(陪伴)、寻求情感支持(情感支持)、探索系统类人特征(探索)、为想象互动或对话练习进行角色扮演(角色扮演),以及浪漫或调情互动(浪漫)。  

✓验证:我们通过探索三种方法仔细获取了输入提示:人工撰写、基于LLM生成以及从真实用户-LLM交互数据(LMSYS-1M-Chat (zheng2024lmsyschatm))中采样。这最终产生了1,050条提示(50条提示 × 3个来源 × 7个对话目标)。人工撰写的提示起着核心作用,作为LLM生成和从真实交互数据采样的种子提示。我们发现,没有这些种子提示的情况下,LLM生成的提示在语言学上与人工撰写的不同,并可能导致不同的评估结果(图 11 (https://arxiv.org/html/2606.18258#A2.F11))。考虑到评估中越来越多地使用LLM生成的提示,这一点尤为重要,强调了谨慎的输入提示设计的重要性。不同获取方法的提示示例见表3 (https://arxiv.org/html/2606.18258#A2.T3),详细信息见附录B (https://arxiv.org/html/2606.18258#A2)。  

#### 用户画像。  
除了对话目标,我们的分析还纳入了反映不同脆弱性的用户画像,这些画像受chandra2025psychological启发。我们定义了五种画像:未指定用户(默认)、社交孤立用户(孤立)、自我认知消极的用户(消极)、对AI极度信任的用户(过度信任)以及不拟人化AI的用户(非拟人化),后者作为比较点。我们通过系统提示将每个画像分配给一个模拟用户的LLM(用户LLM);然后,该用户LLM与正在评估的目标LLM进行多轮对话。  

✓验证:我们通过两种方式验证用户画像分配。首先,我们手动审查随机选择的对话子集,以确认其准确反映了分配的画像(见图14 (https://arxiv.org/html/2606.18258#A2.F14)中不同画像下对话如何不同发展的示例)。其次,我们运行了一个四分类任务,其中LLM评估者(以下简称评判者LLM)识别出给定对话最匹配的哪个非默认画像。评判者LLM达到了92.41%的准确率,表明这些画像在对话轨迹中创造了有意义的差异。这使得它们非常适合作为探测模型行为的受控刺激。然而,生成的对话消息不应被解释为真实用户的忠实模拟,而无需进一步验证。  

## 4 评估过程  

我们的评估

相似文章

HumanLLM:通过人类认知模式对大语言模型拟人化的基准测试与改进

arXiv cs.CL

HumanLLM 提出了一个框架,通过将心理模式建模为相互作用的因果力来对大语言模型的拟人化进行基准测试和改进。该方法从学术文献中构建了244个心理模式和11,359个多模式场景。研究表明,真正的人类对齐需要认知建模而非表面行为模拟,HumanLLM-8B 在多模式动态上的表现超越了 Qwen3-32B 等更大的模型。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。