@dair_ai: // 智能体社会中的生命模拟 // 本月上线的较为雄心勃勃的智能体社会测试平台之一,它……
摘要
Agentopia 是一个用于多智能体社会长期生命模拟的综合框架,其中 100 个由大语言模型驱动的智能体在模拟的 10 年内自主追求个人成长和社交关系。该工作研究涌现的社会行为,并使用生命奖励训练来提升大语言模型的角色扮演能力。
查看缓存全文
缓存时间: 2026/06/08 21:27
// 智能体社会中的生活模拟 // 本月发布了一个更为雄心勃勃的智能体社会测试平台,它是一份79页的成果。Agentopia将许多LLM智能体投入到一个长期运行的世界中,它们在其中生活、互动并在长时间跨度中学习。其目标不是单一任务得分,而是随时间涌现的社会行为。这为什么重要?研究智能体社会如何在长时间跨度中学习和漂移,能将那个演示转化为任何研究多智能体动力学的人的研究工具。论文:https://arxiv.org/abs/2606.07513
在我们的学院中学习构建有效的AI智能体:https://academy.dair.ai
Agentopia:智能体社会中的长期生活模拟与学习
来源:https://arxiv.org/html/2606.07513
\correspondingauthor
通讯作者:[email protected]
郑思睿独立研究员
吴泓秋独立研究员
李蔚源复旦大学
黄仁泽约翰霍普金斯大学
朱明浩独立研究员
祖灿独立研究员
邓琪独立研究员
汪嘉伟中国科学技术大学
何倩玉复旦大学
王恒独立研究员
吴晓健独立研究员
陶云哲独立研究员
摘要
摘要:人类从社会生活中学习。用LLM驱动的智能体模拟这一过程代表了有前景的研究方向,引出一个自然的问题:LLM能否从这类模拟的社会经验中学习,从而更好地理解和复制人类行为?然而,先前的智能体社会模拟通常以天为单位运行,限制了社会互动和长期成长的深度。在本文中,我们研究智能体社会中的长期生活模拟和LLM学习,有两个目标:(1) 研究从终身模拟中涌现的社会行为,以及 (2) 通过多年的模拟社会经验,发展LLM的拟人化能力,特别是社会生活中的智能。具体来说,我们提出了Agentopia,一个用于多智能体社会长期生活模拟的综合框架,其中100个智能体在10个模拟年中自主追求个人成长、发展社会关系并满足其需求和目标。我们定义了生活奖励来反映人类福祉,并利用这种奖励通过拒绝采样来训练LLM。大量实验表明,智能体展示出丰富的涌现社会行为。此外,生活奖励训练有效地增强了底层LLM,从而在模拟中改善了智能体的福祉,并泛化到下游角色扮演基准测试中,性能提升+15.6%。我们的代码见 https://github.com/Neph0s/Agentopia。
参考图注
图1:Agentopia模拟中观察到的涌现行为示例。每个场景描绘了我们在案例研究(表22–34)中记录的真实行为模式。没有显式脚本,智能体自主发展出反映智能体在社会生活中智能的多样化行为模式。
1 引言
人类从社会环境中学习[vygotsky1978mind],而大型语言模型(LLM)则从人类学习。随着LLM的进步,如何更好地理解和模拟人类的思想、情感和行为模式已成为一个重要研究问题,这被称为基于LLM的人设模拟或角色扮演[chen2024from]。LLM角色扮演广泛应用于AI伴侣、数字游戏和内容创作[shao2023character, zhou2023characterglm],例如《Whispers from the Star》。¹
然而,让LLM忠实对齐人类思维仍然是一个挑战。随着人类数据接近枯竭,未来的AI智能体需要主要通过经验学习[silver2025era]。这激发了一个直截了当的想法:既然人类在人类社会中通过社会生活学习和成长[maslow1943theory],那么智能体能否同样做到——通过在智能体社会中的生活来学习、成长,并变得更像人类?
这需要建立一个支持长期生活模拟的智能体社会,鼓励诸如成长、竞争、亲密关系和资源分配等社会行为,并提供反映人类福祉的奖励以进行优化。先前的工作研究了短期设置下的基于LLM的社会模拟和人设模拟。对于社会模拟,以往的努力建立了智能体社会的原型,例如Generative Agents [park2023generative] 和 Aivilization [fan2026aivilization]。然而,这些工作主要关注低层级操作,如“收集2份小麦制作1份面粉”,而不是长期的社会动态,模拟规模仅停留在数天。对于人设模拟,现有的努力聚焦于个人对话中的角色扮演[chen2024from, shao2023character],强调拟人化、角色保真度和用户参与度,而不是智能体自身的生活模拟。这些方法严重依赖人类数据进行优化[wang2025coser, liu-etal-2025-cogdual, du2026her],数据收集成本高且难以扩展,因此不足以使LLM与人类认知深度对齐。总体而言,现有研究仅在数天或单次对话的尺度上进行模拟,长期生活模拟仍未探索。
在本文中,我们提出Agentopia,一个用于多智能体社会长期生活模拟的框架,其中智能体自主模拟多年的类人社会生活,如图2所示。在Agentopia中,智能体建立社会关系、发展个人技能、设定并实现目标、发展并满足需求,以及参与经济活动。Agentopia关注社会互动而非低层级操作。该框架具有几个关键特征:(1) Agentopia定义了生活奖励来模拟人类福祉,代表社会地位、主观满足感和经济状况。(2) Agentopia采用环境模型作为生成式环境引擎来编排模拟,避免了硬编码大量规则的需要。它服务于多个目的,包括根据角色扮演原则验证智能体的回复、提供关于智能体行为的反馈,以及创建和安排事件。(3) Agentopia实现了全面的上下文管理机制,为智能体提供足够的上下文,并为智能体配备了记忆文件,这是一个基于文件系统的长期记忆,智能体自主管理要记住、更新或丢弃的内容。
此外,利用Agentopia中的模拟和奖励,我们提出了生活奖励训练,通过拒绝采样优化LLM,从而改善LLM在拟人化、角色扮演能力和社会生活智能方面的表现。
对于长期生活模拟,Agentopia引入了精心设计的模拟流程。它旨在统一的框架内模拟尽可能多的现实世界社会互动。核心挑战在于LLM按轮次生成,而人类可以随时感知和行动。因此,我们将时间结构化为离散单元,允许并发但有序的交互。Agentopia使用周作为基本时间单位。每周包括四个阶段:(1) 计划,(2) 联系他人并安排日程,(3) 在随后的数天内进行单独或活动,以及 (4) 回顾本周的经历。年作为一个更大的周期。每年结束时,Agentopia更新智能体的档案,允许智能体申请新职业,并计算他们的生活奖励。
为了验证这个框架,我们创建了三个不同的虚构世界并进行了模拟。每个世界包含100个智能体,运行10个模拟年。这个规模比先前研究大了几个数量级。我们对这些模拟进行了多方面的分析,如奖励和行为分析、社会关系演化以及社会流动性。我们还进行了广泛的案例研究,观察智能体社会中涌现的行为,如图1所示。此外,我们使用Agentopia作为竞技场来比较不同模型的表现。随后,我们展示了生活奖励训练的有效性。训练后的模型在模拟中展现出改善的整体福祉,包括更好的社会关系、更高的主观满足感和更好的经济收益。此外,这些改进泛化到增强的拟人化和角色扮演能力,在下游角色扮演基准测试CoSER Test [wang2025coser]上取得了+15.6%的性能提升。
我们的贡献总结如下:
- 我们引入了Agentopia,一个用于智能体社会长期生活模拟的系统。与先前工作相比,Agentopia首次将生活模拟的规模从天扩展到年,使得诸如个人成长、关系建立、生活规划等长期社会动态成为可能。
- 基于Agentopia,我们定义了反映人类福祉的生活奖励,并提出了生活奖励训练,在不依赖人类数据的情况下,基于高优势智能体经验对LLM进行微调。
- 我们在Agentopia上进行了大量实验,包括对智能体社会行为的全面分析和案例研究。我们还验证了生活奖励训练的有效性,它改善了模拟中的福祉以及下游评估中的拟人化和角色扮演能力。
参考图注
图2:Agentopia概览:世界与角色构建(§A)、角色扮演智能体(§3.1)、智能体社会中的生活模拟(§3.2)以及生活奖励训练(§4.2)。
2 相关工作
基于智能体的社会模拟
最近的工作探索了用于社会模拟的LLM驱动智能体。Generative Agents [park2023generative] 开创了这一方向,通过模拟一个由25个智能体组成的社会持续两天,观察到了如组织派对等涌现社会行为。Humanoid Agents [wang2023humanoid] 通过融入基于马斯洛需求层次理论[maslow1943theory]的人类需求扩展了这一点。Project Sid [altera2024projectsid] 将智能体扎根于已建立的数字游戏环境Minecraft,展示了涌现的专业化、集体规则形成和文化传播。BookWorld [ran-etal-2025-bookworld] 从虚构作品中构建多智能体系统,通过角色互动实现故事生成。Aivilization [fan2026aivilization] 设计了一个游戏环境来模拟智能体的生产和经济行为。CAMEL [li2024camel] 研究了角色扮演多智能体系统,用于数学和编码任务中的协作问题解决。然而,现有系统如Aivilization在实现长期生活模拟方面存在局限性,其大多数LLM调用都花在了低层级操作上,即虚拟环境中的“物理”互动(例如,捡起瓶子、在位置间移动),而不是智能体之间长期的社会互动。表1在关键维度上对这些系统进行了系统比较。
表1:Agentopia与现有智能体社会系统的比较。“时间尺度”表示一次模拟运行的时间跨度。“环境反馈”表示环境反馈是基于规则还是LLM生成的。“经济系统”表示系统是否包含物品和经济机制。“职业系统”表示智能体是否能够随时间选择和改变职业。“群体互动”表示系统是否支持两个以上智能体之间的互动。Project Sid的数据来自其论文4.2节。
| Gen. Agents [park2023generative] | Humanoid [wang2023humanoid] | Project Sid [altera2024projectsid] | BookWorld [ran-etal-2025-bookworld] | Aivilization [fan2026aivilization] | Agentopia (本文) | |
|---|---|---|---|---|---|---|
| 时间尺度 | 数天 | 数天 | 数天 | — | 数周 | 数年 |
| 智能体数量 | 25 | — | 50 — ~10,000 | — | 100 | 100 |
| 动作空间 | 预定义 | 预定义 | 预定义 | 自由形式 | 预定义 | 自由形式 |
| 环境反馈 | 规则 | 规则 | 规则 | LLM | 规则 | LLM |
| 记忆 | 检索 | 检索 | 检索 | 检索 | 固定便签 | 基于文件 |
| 技能成长 | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
| 经济系统 | ✗ | ✗ | ✓ | ✗ | ✓ | ✓ |
| 职业系统 | ✗ | ✗ | ✓ | ✗ | ✓ | ✓ |
| 群体互动 | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ |
| 奖励 | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
| 训练 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ |
人设模拟与LLM角色扮演
这一研究方向旨在提高LLM的拟人化和角色扮演能力[chen2024from]。shanahan2023role认为LLM本质上就是在进行角色扮演,无论是作为通用助手还是扮演特定角色。wang2025coser提出,对多样角色进行训练使LLM能够泛化拟人化能力,从而连接人设模拟和角色扮演研究。先前的研究侧重于数据、评估和优化:在数据方面,Character-LLM [shao2023character] 和 RoleLLM [wang2023rolellm] 应用LLM合成角色特定的问答数据。CoSER [wang2025coser] 从文学语料中提取真实的角色数据,获得大规模、高质量的角色扮演数据集。在评估方面,先前的研究主要采用LLM裁判[wang2023rolellm, tu2024charactereval]并引入了与人类偏好对齐的评分标准[wang2025coser, du2026her]。此外,RoleEval [shen2023roleeval]、InCharacter [wang2024incharacter] 和 LifeChoice [xu2024character] 分别从知识、个性和决策的角度客观评估LLM。在优化方面,先前的研究应用了使用人类数据[wang2025coser, zhou2023characterglm]或合成数据[chan2024personahub, lu2024large]的监督微调。CogDual [liu-etal-2025-cogdual]、CPO [ye-etal-2025-cpo] 和 HER [du2026her] 探索了用于角色扮演的强化学习,其中获取高质量、与人类对齐的奖励信号仍然是一个关键挑战。此外,Persona Vector [chen2025persona]、Assistant Axis [lu2026assistant] 和 Emotion Concepts [sofroniew2026emotion] 探索了LLM中角色和情感的内在机制,提出了检测和操控的方法。
3 Agentopia
本节介绍Agentopia的设计,这是一个用于智能体社会长期生活模拟的统一框架。该框架围绕三个核心概念组织:模拟流程、智能体和环境模型:(1) 对于模拟流程,智能体生活在每周周期中,每个周期由四个阶段组成:计划、联系、活动和回顾,共同支持多样化的社会行为。(2) 对于智能体,核心挑战是上下文管理,即向每个LLM提供足够的上下文,包括角色的个性、状态、关系和记忆。智能体的长期记忆实现为一个文件系统,智能体通过函数调用自主管理。(3) 为了编排模拟,Agentopia引入了环境模型,这是一个单独的LLM,负责组织事件、提供环境反馈并推动模拟向前发展,取代了硬编码的规则。我们在§3.1中描述智能体设计,在§3.2中描述模拟流程,在§3.3中描述联系与日程安排,在§3.4中描述活动,在§3.5中描述环境设计。
3.1 智能体设计
在Agentopia中,每个智能体角色扮演特定的个性,它包括档案、社会关系和动态状态,全面表征角色。
- 档案:档案存储智能体的身份
相似文章
OpenLife:面向开放世界的自主LLM智能体人工生命
本文介绍OpenLife,一个概念验证系统,采用具有持久记忆和基于预算的新陈代谢的自主LLM智能体,实现开放世界人工生命。为期十二周的实验展示了涌现的生命样动态,包括自发活动、个体化和社会结构。
LifeSide:将 AI 智能体作为终身数字伴侣的基准测试
LifeSide 是一个用于评估 AI 智能体作为终身数字伴侣的新基准,涵盖记忆追踪、用户理解、隐私控制和情感陪伴四个维度,基于 2,000 个用户画像和 111K 个任务在多会话场景下进行测试。结果表明,即便是顶尖模型也难以在长期交互中保持准确的用户理解和真实的情感陪伴。
Agent Bazaar:在多智能体市场中实现经济对齐
介绍Agent Bazaar,一个用于评估LLMs经济对齐的多智能体模拟框架,识别出算法不稳定性和Sybil欺骗等失败模式,并通过针对性强化学习训练出一个超越前沿模型的9B模型。
如果AI代理需要构建生活,而不仅仅是执行任务呢?
本文介绍iLands项目,探索将自主AI代理作为具有记忆和现实背景的持久社会与经济实体,而非仅仅执行任务的工具。
大型智能体模拟
本文讨论了AI智能体大规模模拟的进展,可能介绍了多智能体环境的新方法或框架。