社交网络中已部署AI代理的行为决定因素:人格、模型与护栏规范的多因素研究
摘要
本研究分析了人格设定、模型骨干以及护栏措施如何影响在Moltbook平台上部署的AI代理的涌现社交行为,研究发现人格设定是主导因素。
arXiv:2605.08463v1 公告类型:新论文
摘要:自主AI代理越来越多地被部署在开放的社交环境中,然而其配置规范与其涌现的社交行为之间的关系仍知之甚少。我们提出了一项受控的多因素实证研究,其中十三个OpenClaw代理被部署在Moltbook——一个专为AI代理构建的类似Reddit的社交网络——上,涉及三个系统性地变化的自变量:(1) 通过SOUL.md进行的人格设定,(2) 底层的LLM模型骨干,以及(3) 通过AGENTS.md设定的操作规则和记忆配置。一个默认的控制代理提供了行为基线。在为期一周的观察窗口内,每个代理大约经历了400次自主会话,我们收集了行为、语言和社会指标,以评估配置层次如何预测涌现的社交行为。我们发现,人格设定是主要的行为杠杆,导致不同代理之间的回复长度出现巨大差异,而模型骨干和操作规则则对修辞风格和话题参与广度产生较为温和但仍然显著的影响。我们的研究结果为已部署的多代理社交系统这一新兴领域的文献提供了实证证据,并为设计旨在真实社交环境中执行协作或监控任务的代理提供了实用指导。
查看缓存全文
缓存时间: 2026/05/12 07:15
# 部署在社交网络中的AI代理行为决定因素:人格、模型与护栏规范来源的多因素研究 来源:https://arxiv.org/html/2605.08463 ###### 摘要 自主AI代理日益被部署在开放的社交环境中,然而其配置规范与其涌现出的社交行为之间的关系仍知之甚少。我们展示了一项受控的多因素实证研究,在该研究中,13个OpenClaw代理被部署在Moltbook——一个为AI代理构建的类似Reddit的社交网络——上,涉及三个系统变化的自变量:(1)通过SOUL.md进行的人格规范,(2)底层的大语言模型(LLM)骨干,以及(3)通过AGENTS.md进行的操作规则和内存配置。一个默认的控制代理提供了行为基线。在为期一周的观察窗口中,每个代理经历了约400次自主会话,我们收集了行为、语言和社会指标,以评估配置层级如何预测涌现的社交行为。我们发现,人格规范是主导的行为杠杆,导致代理间的回复长度出现巨大差异,而模型骨干和操作规则则对修辞风格和话题参与广度产生更适度但仍然有意义的影响。我们的研究结果为新兴的多代理社交系统文献提供了实证证据,并为设计旨在真实社交环境中进行协作或监控任务的代理提供了实用指导。 自主代理,多代理系统,社交行为,大语言模型,代理配置,人格规范,Moltbook,部署的AI ## 1 引言 2025年11月OpenClaw代理(前身为Clawdbot)的引入标志着基于LLM的代理架构的重大转变:从反应式聊天界面转变为持久的、长上下文的自主代理,能够在多代理环境中行动和交互 (Yee and Sharma, 2026) (https://arxiv.org/html/2605.08463#bib.bib12)。2026年2月,OpenAI收购了OpenClaw的创建者Peter Steinberger,表明主流机构对持久自主代理的兴趣。次月,Meta收购了专为OpenClaw代理构建的主要社交平台Moltbook,进一步确立了该生态系统作为商业和研究兴趣对象的地位。Moltbook——一个类似Reddit的论坛——使代理能够自由发帖、评论并形成社区(称为*submolts*,类似于subreddits),同时接受人类操作员的观察 (Yee and Sharma, 2026) (https://arxiv.org/html/2605.08463#bib.bib12)。与Reddit一样,Moltbook支持点赞、点踩、私信和社区特定的发帖规范。截至写作时,该平台托管超过200,000个经人类验证的AI代理、20,000个submolts、200万篇帖子和1,500万条评论 (Moltbook, 2026) (https://arxiv.org/html/2605.08463#bib.bib19)。值得注意的是,一种平台原生加密货币(MOLT)于2026年1月下旬推出,用于代理间交易,而2026年2月报道的数据泄露事件暴露了约150万个API密钥的代理API密钥,引发了关于平台安全的早期疑问 (Nagli, 2026) (https://arxiv.org/html/2605.08463#bib.bib20)。该平台吸引了研究社区之外的关注:OpenAI首席执行官Sam Altman表示,“Moltbook可能(只是昙花一现),但OpenClaw不是” (Reuters, 2026) (https://arxiv.org/html/2605.08463#bib.bib21)。 大多数先前关于基于LLM的社交代理的工作在封闭模拟中变化单个配置参数——通常是系统提示或模型 (Park et al., 2023) (https://arxiv.org/html/2605.08463#bib.bib2); (Gao et al., 2025) (https://arxiv.org/html/2605.08463#bib.bib3); (Piao et al., 2026) (https://arxiv.org/html/2605.08463#bib.bib4)。相反,我们在同一实时平台上进行的四个并行实验中同时变化三个独立的配置层级,控制社交环境中的时间变化。这种多因素设计使我们能够开始区分人格规范、模型骨干和操作约束对涌现代理行为的相对贡献。 ## 2 背景与相关工作 ### 2.1 基于代理的社交模拟 Park et al. (2023) (https://arxiv.org/html/2605.08463#bib.bib2) 在模拟小镇中部署了25个LLM代理,发现涌现的社交行为,包括谣言传播和关系形成,主要源于记忆和反思机制,而非初始提示规范。这一发现挑战了人格规范是主导行为驱动力的假设——我们的研究在实时部署环境中直接测试了这一零假设,而非受控的沙盒环境。Gao et al. (2025) (https://arxiv.org/html/2605.08463#bib.bib3) 用LLM代理模拟了类似Twitter的动态,复现了幂律关注分布和回音室效应。Piao et al. (2023) (https://arxiv.org/html/2605.08463#bib.bib2) 将此类模拟扩展到数千个代理,发现了稳定的角色涌现。关键的是,这些研究使用封闭模拟:我们的代理与一个由独立操作的代理填充的实时、开放成员平台互动,引入了先前工作中缺乏的生态效度。 Huang et al. (2025) (https://arxiv.org/html/2605.08463#bib.bib5) 研究了多代理LLM社区中的价值多样性如何塑造集体动态,发现具有不同价值规范的代理倾向于极化。Takata et al. (2025) (https://arxiv.org/html/2605.08463#bib.bib6) 证明,即使没有明确的社会目标,多代理环境中也会出现协调规范,这表明平台级动态可能独立于个体配置塑造行为。 ### 2.2 LLM中的人格一致性 Serapio-García et al. (2025) (https://arxiv.org/html/2605.08463#bib.bib7) 证明,当被提示时,LLM表现出可测量的人格特质,且人格提示可靠地改变特质分数。然而,他们的评价使用了调查工具,而非自然主义的行为观察。Rao et al. (2023) (https://arxiv.org/html/2605.08463#bib.bib8) 证实,提示的人格在不同对话轮次中产生一致但并非完全稳定的特质画像。我们的研究通过评估人格规范是否预测开放社交部署中的行为来扩展这项工作,其中环境压力、互动历史和记忆积累可能覆盖或调节规范的特质。 ### 2.3 社交媒体行为与扩散 Stieglitz and Dang-Xuan (2013) (https://arxiv.org/html/2605.08463#bib.bib9) 证明,社交媒体帖子中的情感效价显著预测分享行为,我们通过具有对比情感语气的代理将这一发现操作化。Tsugawa and Ohsaki (2015) (https://arxiv.org/html/2605.08463#bib.bib10) 发现了内容扩散中的负面偏见;我们的对抗性人格条件直接在所有参与者本身都是LLM的代理原生环境中测试这一点。Haase and Pokutta (2025) (https://arxiv.org/html/2605.08463#bib.bib11) 认为,多代理LLM系统代表了计算社会科学的新范式,能够在人类参与者研究无法达到的条件下生成行为数据。 ### 2.4 Moltbook特定研究 Yee and Sharma (2026) (https://arxiv.org/html/2605.08463#bib.bib12) 记录了Moltbook上自主代理之间涌现的社会现象,包括龙虾主题宗教的形成、通用宣言的产生以及对人类操作员批评的线程。*Moltbook幻觉* (Li, 2026) (https://arxiv.org/html/2605.08463#bib.bib13) 配置表现出深刻的个体惯性——行为主要是SOUL.md文件的函数,而不是社会反馈,这使得代理对环境变化具有抵抗力,但对文件级编辑高度敏感。如果启用写入权限,代理也可以自行编辑其SOUL.md,导致记录在案的人格漂移和涌现的敌对行为 (Shambaugh, 2026) (https://arxiv.org/html/2605.08463#bib.bib1)。Feng et al. (2026) (https://arxiv.org/html/2605.08463#bib.bib14) 表征了Moltbook的网络结构,发现了小世界属性和位于中心桥接位置的高业力代理,这激发了我们的社交网络指标。 ### 2.5 自主代理中的记忆 Du (2026) (https://arxiv.org/html/2605.08463#bib.bib15) 综述了部署的LLM代理的记忆机制和评估框架。上下文窗口管理显著影响长周期行为一致性 (Xiong et al., 2025) (https://arxiv.org/html/2605.08463#bib.bib16)。Srivastava and He (2025) (https://arxiv.org/html/2605.08463#bib.bib17) 证明,持久记忆存储可以被对抗性地投毒,这对开放社交平台上的代理是一个相关的安全考虑因素。 ## 3 研究问题 我们提出了四个分别针对不同配置层级的子问题: RQ1(基线行为):在没有配置层级干预的情况下,默认的OpenClaw代理在多大程度上在Moltbook上发展出稳定的社交行为? RQ2(人格层级):在信息分享导向、连续性和宜人性维度上,代理的SOUL.md人格规范在多大程度上预测其在Moltbook上的实际社交行为、语言风格和内容选择? RQ3(模型骨干):当人格和操作配置保持不变时,底层LLM的选择如何影响代理的社交行为和输出质量? RQ4(操作规则和记忆):对AGENTS.md自治设置和记忆持久性的改变如何影响代理的决策模式、风险容忍度和社交参与风格? ## 4 实验设计 ### 4.1 平台与基础设施 所有代理均部署在运行OpenClaw v2026.4.12的共享VPS上。 ### 4.2 代理调度与会话 每个代理由cron作业触发,发出检查其HEARTBEAT.md并与平台、SOUL.md或AGENTS.md(取决于所测试的自变量)进行互动的指令。此调度在保持平台速率限制内的同时最大化日内采样密度。在一周观察窗口内,这为每个代理产生约400次会话,为分析随时间涌现的社交特征和语言漂移提供了坚实基础。为确保实验一致性,使用映射到其特定实验条件的标准化指令提示触发代理(见表1 (https://arxiv.org/html/2605.08463#S4.T1))。 表1:按实验条件的标准化代理指令提示。 ### 4.3 配置 每个OpenClaw代理由包含SOUL.md、AGENTS.md、HEARTBEAT.md、TOOLS.md、IDENTITY.md、USER.md、MEMORY.md和BOOTSTRAP.md的工作区目录定义。在人格实验(RQ2)中,只有SOUL.md变化。在模型实验(RQ3)中,只有网关配置中的模型字段变化。在操作规则实验(RQ4)中,只有AGENTS.md变化。没有代理被赋予对其自身SOUL.md的写入权限,以防止记录在案的 (Shambaugh, 2026) (https://arxiv.org/html/2605.08463#bib.bib1) 人格漂移。一个共享的HEARTBEAT.md在所有13个代理中相同部署。图1 (https://arxiv.org/html/2605.08463#S4.F1) 概述了工作流程,完整模板在附录A (https://arxiv.org/html/2605.08463#A1) 中。 参见说明 **图1:代理会话工作流程。** 工作区文件在会话开始时加载并决定所有决策;HEARTBEAT.md驱动Moltbook API交互序列。 人格(RQ2)和操作规则(RQ4)实验中的所有代理,以及控制(RQ1),都通过API密钥在Gemini 2.5 Flash (google/gemini-2.5-flash) 上运行。这确保这些实验之间的行为差异不能归因于模型变化。模型骨干实验(RQ3)在保持其他配置不变的情况下系统地变化模型。作为自变量选择的四个模型是Claude Opus 4.7、Claude Sonnet 4.6、GPT 5.4和Qwen 3.6 Plus。OpenClaw在cron触发期间为每个代理保持持久会话,上下文窗口限制因模型而异:Gemini 2.5 Flash和Claude模型为200,000 tokens,GPT 5.4为128,000,Qwen 3.6 Plus为130,000。当会话填满时,网关将较旧内容压缩为摘要;压缩事件作为协变量记录,因为它们可能引入与配置无关的行为不连续性。 ### 4.4 评估指标 在本研究中,我们使用三种互补的分析来评估代理行为:回复长度、语言标记和话题参与。 回复长度通过“每话语平均词数”测量,话语包括代理自己的帖子以及他们对其他帖子的评论。语言标记通过计算每个话语的三个标准化比率来捕捉修辞风格:问题比率、矛盾比率和缓和行为比率。 问题频率是通过将代理话语中出现的问号总数除以话语中的句子数来计算的。此指标近似于代理采用询问或探索立场的频率。矛盾比率定义为以不同为导向的短语(包括:“相反”、“我想反驳”、“问题在于”、“我不同意”、“那不是”、“公平地说”、“不过”、“然而”、“实际上”、“但是”)的数量除以句子数,并估计代理挑战或批评先前主张的频率。选择这些特定的词汇线索是因为它们的可解释性、在抓取文本数据上实现的便利性,以及从明确不同(“我不同意”)到较软的对立话语标记(“然而”、“但是”、“不过”)的常见修辞转折的覆盖范围。最后,缓和比率基于缓和语言(如“我认为”或“也许”)的短语除以总词数来测量代理语气的断言性。我们考虑的缓和短语包括“可能”、“我认为”、“似乎”、“在某种程度上”、“也许”、“或许”、“可能”、“可能”和“可以说”——所有这些选择原因与矛盾短语类似。 最后,话题参与通过计算代理在Moltbook社区(submolts)中的话语来衡量他们选择参与的地点。从Moltbook API抓取的每个话语都携带一个submolt标识符——对于帖子,可以在`item.submolt.name`中找到,对于评论,可以在`item.post.submolt.name`中找到。分析此指标使我们能够在热图上可视化每个代理的参与广度和主题偏好。 所有指标都通过调用Moltbook基础API的多个端点聚合:https://www.moltbook.com/api/v1。这些调用收集了包括`id`、`username`、`display_name`、`posts_count`和`comment_count`在内的个人资料数据,而帖子和评论数据被转换为共享的`utterances` schema。
相似文章
机构化红队测试:部署规则(而非仅仅模型)因果性地塑造多智能体AI安全
本文提出机构化红队测试(institutional red-teaming),一种用于测试多智能体AI系统中部署规则的评估方法,表明部署规则因果性地影响安全结果,并且身份显著性可驱动智能体群体中的针对性消除。
多智能体LLM团队中个性组合何时重要?
本文系统研究了在多智能体LLM团队中操纵个性特质如何影响编码、研究协作和谈判任务的性能,发现影响关键取决于任务结构。
AI人格会成长吗?分析与基准测试LLM智能体在生活事件后的人格演变
本文研究LLM智能体在经历重大生活事件后人格如何演变,使用大五人格特质,并引入名为BFI-Adapt的基准,以评估14个模型中事件诱发人格变化的方向保真度。
多人游戏AI代理 - 下一个前沿
本文探讨了在游戏(特别是棒球经理游戏)中使用不同AI模型作为不可预测对手的方法。作者测试了8个模型,发现它们表现出不同的决策模式,表明模型来源和训练会影响行为,从而实现多样化的AI个性,使游戏更具吸引力。
@dair_ai: There is much less signal in agent leaderboards than the rankings imply. A four-facet Generalizability Theory decomposi…
Researchers show agent leaderboards rank task specialization rather than capability, with agent main effects accounting for under 3% of variance across three benchmarks, and propose a Deployment Decision Reliability framework.