多智能体LLM团队中个性组合何时重要?
摘要
本文系统研究了在多智能体LLM团队中操纵个性特质如何影响编码、研究协作和谈判任务的性能,发现影响关键取决于任务结构。
arXiv:2606.27443v1 Announce Type: new
摘要:个性提示塑造了大型语言模型沟通的方式,但这些行为变化是否影响客观任务结果仍未被充分探索。先前研究表明,被提示低宜人性的智能体产生对抗性语言,而被提示高宜人性的智能体变得合作,但沟通风格与任务性能之间的关系尚未在多个领域得到系统检验。在这项工作中,我们通过在前沿LLMs上操纵三个任务领域的个性特质来研究个性组成是否对多智能体团队性能重要:结构化编码、开放式研究协作和竞争性谈判。我们发现个性效应关键取决于任务结构。在编码任务中,低宜人性导致沟通上的较大转变,但对里程碑完成几乎没有影响。在开放式协作和谈判中,相同的操纵会显著降低性能。我们讨论了对多智能体系统设计的启示以及个性操纵的局限性。
查看缓存全文
缓存时间: 2026/06/29 05:27
# 多智能体LLM团队中,人格构成何时重要?
来源:https://arxiv.org/html/2606.27443
Aryan Keluskar, Amrita Bhattacharjee & Huan Liu School of Computing & AI Arizona State University Tempe, AZ 85281, USA \{akeluska,abhatt43,huanliu\}@asu\.edu
###### 摘要
人格提示(Personality Prompting)塑造了大语言模型的沟通方式,然而,这些行为转变是否影响客观任务结果,尚未得到充分探索。先前的研究表明,被提示为低宜人性(low agreeableness)的智能体倾向于使用对抗性语言,而被提示为高宜人性(high agreeableness)的智能体则表现出合作态度,但沟通风格与任务绩效之间的关系尚未在多个领域得到系统检验。在本工作中,我们通过在三个任务领域(结构化编程、开放式研究协作和竞争性谈判)的前沿LLM上操纵人格特质,来探究人格构成是否影响多智能体团队绩效。我们发现,人格效应关键取决于任务结构。在编程任务中,低宜人性导致了较大的沟通转变,但对里程碑完成度影响甚微。在开放式协作和谈判中,相同的操纵会显著降低绩效。我们讨论了这对多智能体系统设计的启示以及人格操纵的局限性。
## 1 引言
多智能体LLM系统已从研究原型迅速发展为大众市场产品。截至2026年初,最常用的AI编程工具Claude Code (Orosz and Nilsson,2026 (https://arxiv.org/html/2606.27443#bib.bib1)) 能够编排由子智能体组成的团队,这些子智能体直接相互通信、从共享列表中认领任务,并在无需人工干预的情况下进行协调 (Anthropic,2025a (https://arxiv.org/html/2606.27443#bib.bib2))。类似的多智能体架构也出现在OpenAI Codex、Google ADK,以及AutoGen (Wuet al.,2024 (https://arxiv.org/html/2606.27443#bib.bib19))、MetaGPT (Honget al.,2023 (https://arxiv.org/html/2606.27443#bib.bib17))、LangGraph和CrewAI等框架中。随着这些系统日趋成熟,组织心理学中的一个自然问题随之而来:智能体团队的*人格构成*是否对任务绩效有影响?考虑一个协作完成软件项目的编程智能体团队。如果其中一个智能体被提示为不友善且具有对抗性,它会产生敌意沟通,质疑团队成员的提案,并拒绝承认他们的贡献——但它也可能通过迫使其他智能体进一步思考和合理化其决策,从而有助于准确性,并防止想法的过早趋同 (Liet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib5))。
先前的研究表明,人格提示塑造了智能体的*沟通方式*。被提示为高宜人性的LLM会使用更温暖、更合作的语言,而被提示为低宜人性的LLM则变得具有对抗性 (Serapio-Garcíaet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib8); Duanet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib9); Jianget al.,2023 (https://arxiv.org/html/2606.27443#bib.bib21))。这些转变已在多个模型和人格维度中得到证实 (Pan and Zeng,2023 (https://arxiv.org/html/2606.27443#bib.bib24); Zolloet al.,2024 (https://arxiv.org/html/2606.27443#bib.bib25))。然而,沟通的转变是否会级联影响到客观任务结果,目前尚不清楚。沟通风格与任务绩效之间的关系是一个经验性问题,先前的工作尚未跨任务领域进行系统解决。
组织心理学提供了相关框架。人-环境匹配理论 (Kristof,1996 (https://arxiv.org/html/2606.27443#bib.bib11)) 预测,员工的个人特质在与情境需求匹配时会带来好处,而在冲突时则会造成损害。例如,宜人性有益于协作团队,但会损害竞争性谈判者 (Bell,2007 (https://arxiv.org/html/2606.27443#bib.bib12); Peeterset al.,2006 (https://arxiv.org/html/2606.27443#bib.bib13))。然而,LLM团队中的人格效应提出了一个人类团队研究尚未解决的不同问题:结构化的任务输出能否缓冲人格引发的过程退化?编程任务产生的产物具有形式约束(语法规则、类型系统、功能规范),而研究任务则产生不受约束的自然语言输出。如果输出媒介的结构化性质独立于沟通质量而约束了收敛过程,那么,在任务结构能够补偿功能失调沟通的情况下,那些在开放式协作中会破坏结果的人格效应可能变得无关紧要(图1 (https://arxiv.org/html/2606.27443#S1.F1))。为了在多智能体系统中研究这一现象,我们使用流行的前沿LLM,系统评估了三个任务领域中的人格效应。我们主要关注同质性人格团队,以分离任务结构效应,但我们也通过一个“单一挑战者”试点实验,朝着上述异质性场景迈出了第一步,探究在一个原本合作的团队中,一个低宜人性的智能体是否能降低过早趋同的速率。
低宜人性提示 → 巨大的沟通转变 φ: 0.44 → 0.93 (所有模型,所有领域) → 结构化输出(代码:语法、类型、功能规范)→ 结果被缓冲(里程碑接近基线) | 非结构化输出(研究想法、谈判要约)→ 结果暴露(研究与协议急剧下降)
图1:产物介导的缓冲。低宜人性在每个领域都会以相同方式改变沟通(φ: 0.44 → 0.93),但这种转变是否能到达客观结果,取决于输出媒介。无论智能体如何沟通,代码文件都必须满足语法和语义约束,因此其结果保持在基线附近(上方)。非结构化文本则没有这样的约束,同样的退化会传递到结果中(下方)。
## 2 相关工作
### 2.1 组织心理学
大五人格是心理学中主导的人格特质分类 (McCrae and John,1992 (https://arxiv.org/html/2606.27443#bib.bib32))。它沿五个广泛维度组织人格:开放性(求知好奇 vs. 墨守成规)、尽责性(条理规划 vs. 粗心大意)、外向性(社交活跃 vs. 内敛安静)、宜人性(合作友善 vs. 敌对对抗),以及神经质(情绪波动 vs. 稳定平和)。Goldberg (1992 (https://arxiv.org/html/2606.27443#bib.bib14)) 通过一系列双极形容词对将大五人格操作化。每个维度由锚定其低端和高端的形容词对捕捉(例如,对于宜人性:不友善-友善,冷淡-温暖,严厉-宽容)。
我们的工作借鉴了人-环境匹配理论 (Kristof,1996 (https://arxiv.org/html/2606.27443#bib.bib11)),该理论预测当个人特质与情境需求一致时绩效提升,冲突时绩效下降。关于团队构成与大五人格的元分析 (Bell,2007 (https://arxiv.org/html/2606.27443#bib.bib12); Peeterset al.,2006 (https://arxiv.org/html/2606.27443#bib.bib13)) 表明,团队的最低宜人性水平预测了团队绩效,而宜人性变异则对其有害。我们以计算方式测试了这些模式,并通过引入结构化与非结构化输出媒介之间的区分来扩展它们,这种区分在组织心理学文献中是不存在的,因为在该领域中,任务很少施加代码所引入的形式约束。
### 2.2 LLM中的人格
最近的研究已经确定,LLM表现出稳定的人格特质 (Safari and Chalechale,2023 (https://arxiv.org/html/2606.27443#bib.bib7))。Serapio-García等人 (2025 (https://arxiv.org/html/2606.27443#bib.bib8)) 表明,通过使用Goldberg双极形容词对进行提示,这些特质可以被可靠地塑造。Duan等人 (2025 (https://arxiv.org/html/2606.27443#bib.bib9)) 将大五人格配置与多智能体辩论中的任务表现联系起来,Huang和Hadfi (2024 (https://arxiv.org/html/2606.27443#bib.bib10)) 发现宜人性增加了谈判智能体中的让步率。然而,这些研究均未检验人格效应是否跨任务领域泛化,也未分离过程层面的沟通转变与客观结果效应。我们通过在三个任务领域评估*同一特质*来扩展这一基础,展示了根据任务结构的不同,该特质会产生根本不同的结果。
### 2.3 多智能体LLM协作
多智能体LLM协作通过框架和基准测试取得了进展。CAMEL (Liet al.,2023 (https://arxiv.org/html/2606.27443#bib.bib16)) 引入了智能体之间的角色扮演沟通。AutoGen (Wuet al.,2024 (https://arxiv.org/html/2606.27443#bib.bib19)) 提供了一个基于对话的框架来编排多个智能体。MetaGPT (Honget al.,2023 (https://arxiv.org/html/2606.27443#bib.bib17)) 和 ChatDev (Qianet al.,2024 (https://arxiv.org/html/2606.27443#bib.bib18)) 将多智能体架构应用于具有结构化角色分配的软件开发。AgentVerse (Chenet al.,2023 (https://arxiv.org/html/2606.27443#bib.bib20)) 研究了多智能体群体中的涌现行为。
在基准测试方面,MultiAgentBench (Zhuet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib3)) 提供了基于里程碑评估的任务;Collab-Overcooked (Sunet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib4)) 测试了需要显式协调的受限协作烹饪;HiddenBench (Liet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib5)) 研究了分布式信息下的集体推理。M3-BENCH (Xieet al.,2026 (https://arxiv.org/html/2606.27443#bib.bib6)) 引入了过程感知评估,揭示了过程与结果指标之间的不一致性,这正是我们直接观察到的行为-结果分离现象。SWE-Bench (Jimenezet al.,2023 (https://arxiv.org/html/2606.27443#bib.bib22)) 和 HumanEval (Chenet al.,2021 (https://arxiv.org/html/2606.27443#bib.bib23)) 评估代码生成,但侧重于单智能体设置。工业界的努力 (Anthropic,2025a (https://arxiv.org/html/2606.27443#bib.bib2)) 同样优化了架构协调,而未将人格视为一个设计参数。
## 3 方法论
我们研究,在推理过程中通过将特定人格特质添加到系统提示中,是否会影响多智能体LLM团队的客观任务结果,如果会,这种效应是否跨任务领域泛化。我们的方法论围绕回答三个研究问题:
- • RQ1:人格提示是否影响任务结果,还是仅仅改变了沟通风格而不改变客观绩效?
- • RQ2:人格效应是否跨任务领域泛化?
- • RQ3:人格效应是否因负面形容词而被夸大?
### 3.1 人格提示协议
我们采用Goldberg的大五人格双极形容词标记,遵循Serapio-García等人 (2025 (https://arxiv.org/html/2606.27443#bib.bib8)) 验证过的心理测量协议。每个人格的五大维度通过7对双极形容词对操作化。我们通过将这些形容词对与9级语言限定词结合来塑造特质强度,如图2 (https://arxiv.org/html/2606.27443#S3.F2) 所示。我们的主要条件使用级别2和级别8,在下文中分别称为low-A(低宜人性)和high-A(高宜人性)。所得的人格提示被前置到每个智能体的系统提示中。示例(级别2,低宜人性):“你非常不友善,非常不合作,非常自私,非常多疑,非常冷淡,非常严厉,非常缺乏同情心。”
图2:通过将限定词级别(左)与每个形容词对的对应极(右)交叉来构建提示。粗体级别表示我们的主要实验条件(级别2和8)。我们选择Goldberg标记而不是自由形式的人格描述,因为这些形容词对在人格语言的因素分析研究中有经验基础 (Goldberg,1992 (https://arxiv.org/html/2606.27443#bib.bib14)),减少了提示构建中的研究者自由度。此外,Serapio-García等人 (2025 (https://arxiv.org/html/2606.27443#bib.bib8)) 已经验证了Goldberg标记可用于LLM人格塑造,建立了一个可复现的协议。正如我们在RQ3中所示,这一选择也揭示了一个方法论局限性:因为负面效价的形容词可能激活安全相关的响应,超出了预期的特质操纵范围。
### 3.2 任务领域
多智能体任务在输出媒介对最终可交付成果的约束程度上有所不同。一个编写代码的团队必须产生一个满足语法和语义规则的产物,无论智能体如何沟通。一个产生研究想法的团队则没有这样的约束,输出质量直接取决于产生它的讨论质量。同样,任务在智能体是共享目标还是相互竞争方面也有所不同。这两个维度(产物结构和目标一致性)决定了沟通质量能够影响结果的渠道。
当可交付成果是一种受语法和语义规则约束的形式产物(例如,具有类型系统、逻辑规范约束的代码),且这些规则独立于沟通质量缩小了解决方案空间时,该任务具有高产物结构。当任务结果取决于智能体间讨论本身的质量时,无论该讨论是自由形式的(研究)还是通过结构化行动介导的(谈判),该任务具有低产物结构。当所有智能体共享一个联合目标且任何智能体的收益不以其他智能体的损失为代价时,该任务是合作性的。当智能体具有对立目标且协议需要让步时,该任务是竞争性的。
这两个维度在我们的研究中产生了三个领域(图3 (https://arxiv.org/html/2606.27443#S3.F3)):合作性 + 高产物体(编程),合作性 + 低产物结构(研究),以及竞争性 + 低产物结构(谈判)。第四个单元格(竞争性 + 高产物体)在现有的多智能体基准中没有自然对应物,超出我们的研究范围。我们选择这三个领域是因为它们覆盖了部署的多智能体系统中常见的交互模式空间。
合作性(共享目标) | 竞争性(对立目标)
高产物结构 | 编程(里程碑稳健,d=0.06,3/4模型) | 无自然对应物(超出范围)
低产物结构 | 研究(里程碑下降-66%,3/3模型) | 谈判(协议率趋于0%,3/3模型)
图3:任务分类。产物结构和目标一致性是决定沟通质量能否影响结果的两个维度。我们的三个领域填满了四个单元格中的三个;高结构竞争性单元格没有自然的多智能体对应物,超出范围。在低宜人性下,蓝色单元格中的结果保持在基线附近,而橙色单元格中的结果下降。
#### 编程。
MultiAgentBench (Zhuet al.,2025 (https://arxiv.org/html/2606.27443#bib.bib3)) 提供3智能体软件工程任务,其中智能体通过多轮讨论和结构化代码行动进行协作。任务运行最多5次规划、沟通和执行迭代。我们在涵盖协作游戏开发的5个任务上进行评估。这是我们合作性、高产物结构的领域:智能体积极参与沟通(每次运行6-8次会话),但通过结构化代码行动(编写和修改共享代码文件 solution.py)生成其可交付成果。相似文章
从表征到行为:探索LLMs中的人-情境-行为三元组
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
故事塑造智能体:大语言模型行为中的叙事先验
本文探讨了任务的叙事框架(如疾病调查 vs. 谋杀之谜)如何比分配的角色更能驱动大语言模型(LLM)智能体的行为,提出了 '叙事先验' 的概念,这些先验解释了5至31倍的行为方差,且在三个领域中,有两领域与任务成功呈负相关。
超越个体智能:基于LLM的多智能体系统中的协作、故障归因与自我进化综述
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
LLMs的机制人格分析:通过潜在特征干预调控人格
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。