AgoraSim:一种混合智能体建模框架
摘要
AgoraSim 是一种混合智能体建模框架,结合了 LLM 智能体与经典 ABM,用于社会反应分析。它支持多模态输入和结构化决策输出,适用于面向场景的模拟。
查看缓存全文
缓存时间: 2026/07/08 04:39
# AgoraSim:一种混合基于智能体的建模框架 来源:https://arxiv.org/html/2607.05999 Chung-Chi Chen 人-智能体联合实验室 (HAA Lab) 日本国立信息学研究所 [email protected] ###### 摘要 基于大语言模型智能体的模拟使得自然语言社会场景易于实例化,但其输出可能被过度解读为预测,且通常难以与明确的社会动态进行比较。我们提出 AgoraSim,这是一个面向场景的社会反应分析的混合基于智能体建模框架。AgoraSim 将文本或多模态产物解析为可编辑的 ABM 配置,运行比率受控的群体(混合了 LLM、视觉语言模型、自定义端点、随机和经典智能体),并将同一场景与匹配的经典参考动态进行比较。所有智能体输出一个共享的结构化决策对象,从而支持共同的动作空间、交互协议、指标和审计记录。通过本地用户界面、Python SDK/CLI 和 REST API 暴露功能,AgoraSim 帮助用户检查场景轨迹、比较建模假设,并识别需要实证验证的案例。 AgoraSim:一种混合基于智能体的建模框架 Chung-Chi Chen 人-智能体联合实验室 (HAA Lab) 日本国立信息学研究所 [email protected] ## 1 引言 许多重大决策最初都表现为文本或多模态产物:一项政策公告、一次产品发布、一份公开道歉、一条竞选口号、一则社交媒体帖子、一段视频或一则广告。在部署此类产物之前,利益相关者通常希望探索不同公众可能如何反应。有用的输出很少是一个单一的情绪标签或舆论的点预测。在早期决策中,用户需要检查场景轨迹:哪些反应是合理的,哪些社会暴露可能放大或抑制这些反应,哪些假设会改变轨迹,以及某种模式在何处显得稳健或脆弱。这非常适合作为 NLP 演示,因为输入是语言和媒体,智能体的证据和推理以语言表达,并且输出必须在用户比较不同方案时保持可理解。 我们将此任务定义为**面向场景的社会模拟**。其目标不是精细再现真实人群,也不是声称对未来行为具有预测权威。社会模拟最有用的地方在于帮助解释集体模式、构建假设,并使建模假设明确化(Wu 等,2026)。这一区别对于基于大语言模型的社会模拟尤为重要。语言模型智能体能够生成流畅且看似合理的反应,但仅凭合理的文本并不能证明模拟捕捉到了行为变异、子群体差异、临界点或路径依赖动态。因此,一个有用的演示应该帮助用户看到场景在明确假设下的表现,而不是邀请他们将合成的反应视为舆论。 基于智能体的建模为这一目标提供了经典的建模语言。ABM 通过局部规则、异质性智能体、网络、反馈和随时间交互来表现社会现象。基础模型展示了简单的微观层面假设如何产生宏观层面的模式,例如隔离、级联、采纳、共识、传染和极化(Schelling,1971;Granovetter,1978;Bass,1969;DeGroot,1974;Clifford 和 Sudbury,1973;Axelrod,1997;Epstein 和 Axtell,1996;Bonabeau,2002;Deffuant 等,2000)。其价值不在于任何一个规则族是普遍真实的,而在于假设是明确的、参数化的、可检查的和可比较的。ABM 为自然语言社会模拟提供了方法论支架:它将场景转化为智能体、状态、动作、暴露规则、异质性假设和集体指标。 然而,传统 ABM 给用户带来了沉重的建模负担。要探究社区对某份道歉声明、政策简报、广告、图像或产品公告可能如何反应,分析者必须先一步产物翻译为状态、阈值、效用、网络和可观察变量。LLM 智能体则扭转了这种权衡。它们能够阅读丰富的文本上下文、回应开放式提示、生成理由,并作为基于人格条件的受访者或模拟的经济和社会行为体(Argyle 等,2023;Aher 等,2023;Horton 等,2023)。诸如 Social Simulacra、Generative Agents、Concordia、Humanoid Agents 以及 LLM 增强的社会网络模拟器等交互系统已表明,语言模型智能体能够填充社区、维持记忆、进行规划、对话,并表现出涌现的社会行为(Park 等,2022,2023;Vezhnevets 等,2023;Wang 等,2023;Gao 等,2023;Yang 等,2024)。最近的一些系统,包括 AgentSociety、PolicySim、POSIM 和 discourse-sim,进一步沿着这一方向推进到大规模社会模拟、平台干预、舆论演化和态度传播(Piao 等,2025;Huang 等,2026;Zhang 等,2026;Reji,2026)。 LLM 智能体的优势并未消除对 ABM 的需求,反而使 ABM 更加重要。当前的 LLM 智能体可能坍缩为高概率或群体典型的响应,有时表现得像一个"平均人格"而非行为多样的人群(Wu 等,2026)。对于许多社会现象,平均反应是不够的。极化、级联、采纳阈值、少数派影响、传染和路径依赖都依赖于反应的分布以及谁影响谁。一个仅提示多个 LLM 智能体的演示,可能会呈现一个流畅的聚合结果,却没有展示轨迹是否反映了语义理解、提供商偏见、提示敏感性、不足的异质性,或者一个经典模型同样能产生的简单扩散过程。 这就是将比较传统 ABM 置于我们设计核心的原因。经典模型不仅仅是作为历史背景或弱基线被包含进来。它们充当了明确的参考动态。用户可以询问,在同一事件、人群、网络、种子、动作空间和指标下,仅由 LLM 组成的群体是否表现得像阈值扩散、Bass 采纳、有界自信意见变化、传染、羊群行为、DeGroot/投票者社会学习或离散选择效用。如果一次 LLM 智能体的运行类似于简单的经典参考,那么观察到的模式可能不需要丰富的语言理解来解释。如果出现差异,这种差异本身就成为了一个场景假设:产物的措辞可能很重要,提供商可能会改变反应,网络可能会放大少数派立场,或者该场景可能需要人工被试验证。 我们提出 AgoraSim,这是一个面向场景的社会反应分析的混合基于智能体建模框架。AgoraSim 将 LLM 和视觉语言智能体视为更广泛 ABM 系统内的一种智能体类型。一次运行可以按比例混合托管语言模型智能体、视觉语言智能体、兼容 OpenAI 的本地或自定义端点、随机智能体以及经典基于规则的智能体。所有智能体输出相同的结构化决策对象,从而将开放式的语言行为投射到一个可审计的状态空间中。同一场景还可以启动所有智能体均为经典的匹配参考运行。因此,AgoraSim 将一个开放的提示工作流转变为一个可比较的 ABM 实验,具有共享的动作空间、交互协议、指标、参考动态和记录。 AgoraSim 的贡献有三重。第一,它提供了一个自然语言场景工作台,将文本或媒体产物解析为可编辑的 ABM 配置,而非不透明的提示。第二,它提供了一个混合执行基底,其中 LLM、VLM、自定义端点、随机和经典智能体通过比率受控的模型插槽和共享的结构化输出共存。第三,它提供了一个面向分析师的演示成品——本地 UI、Python SDK/CLI、REST API、保存的配置、成本核算以及每个智能体的审计记录——用于在明确的建模假设下比较场景轨迹。预期用途是探索性和比较性的:LLM 智能体与经典动态之间的一致性可以揭示跨假设都稳健的定性模式,而差异则暴露哪些建模选择很重要,以及哪些案例值得进行实证验证。 ## 2 系统设计  图1:AgoraSim 架构。一个自然语言或多模态产物被解析为可编辑的模拟配置,由比率受控的混合 ABM 引擎执行,并通过共享指标和审计记录与匹配的经典参考动态进行比较。 图1总结了系统。AgoraSim 的设计原则是:一个自然语言场景不应仍然是一个不透明的提示;它应成为一个明确的 ABM 配置,其假设可以被检查、编辑、执行和比较。因此,系统分离了三个关注点。场景工作台将语言和媒体输入转化为结构化的模拟设置。混合 ABM 引擎在共享的动作空间和交互协议下执行 LLM、VLM、自定义端点、随机和经典智能体。比较和审计层运行匹配的经典参考动态,并存储理解轨迹来源所需的记录。 ### 2.1 从产物到模拟配置 一次运行始于一个简洁的用户面向描述:一份简报或草稿内容、目标人群、分析问题、可选的媒体、预算、智能体数量、轮次、语言、模型策略以及可选的覆盖项。解析器将这些输入扩展为一个可编辑的模拟配置,包含事件、人格群体、动作空间、调查问题、网络、交互协议、模型混合、ABM 参数以及比较计划。这一组合器降低了场景构建的成本,但它并没有隐藏模型:在执行之前,运行被具体化为一个用户可检查并修改的配置。 动作空间是 NLP 和 ABM 之间的关键桥梁。LLM 智能体可以产生自由形式的陈述和理由,但模拟也需要稳定的变量,这些变量可以计数、比较、输入后续轮次,并绘制与经典动态的对比图。因此,AgoraSim 为每个场景表示一组紧凑且相互可解释的动作,例如:支持、反对、分享、忽略、等待,或特定领域的替代选项。这使得自然语言解释可用,同时为所有智能体类型提供了共同的状态表示。 对于多模态场景,配置记录了媒体如何被感知。如果选定的提供商支持视觉,智能体可以直接接收产物。对于缺乏视觉能力的智能体,AgoraSim 可以生成一次中性描述并在每次调用中重复使用。这避免了将媒体感知变成一个不受控制的变异来源,并使感知到的产物在审计轨迹中可见。 表1:AgoraSim 支持的经典 ABM 参考动态。每个都可以作为群体内的智能体类型,或作为同一场景和指标体系下的匹配比较运行。 ### 2.2 混合智能体与轮次执行 核心执行对象是模型混合。每个插槽指定一个提供商、模型、权重、温度、媒体能力以及可选的策略参数。插槽可以指向托管 LLM、视觉语言模型、本地或自定义的 OpenAI 兼容端点、随机智能体或 `classic` 提供商。运行时,从目标人群中采样智能体,并根据用户控制的比率分配到插槽。因此,AgoraSim 可以在不改变场景定义的情况下运行纯 LLM、纯经典、纯随机或混合人群。 所有智能体类型实现相同的决策接口。给定当前轮次的上下文,智能体返回一个结构化对象,包含立场、情绪、所选动作、置信度、公开声明、私人理由、分享意图、调查答案以及调试字段。LLM 和 VLM 智能体通过基于人格、事件上下文、可选媒体、记忆和社会暴露的提示来生成此对象。经典智能体通过选定的规则族更新内部状态,并将这些状态映射到相同的动作空间。随机智能体提供一个健全性检查人群。这个共享模式防止了 LLM 行为仅停留在自由形式文本,也防止了经典规则存在于一个独立的数值模拟器中。  (a) 场景设置  (b) 模型混合 图2:创建场景实验。用户输入自然语言或多模态产物,编辑生成的动作空间和调查字段,并选择比率受控的 LLM、VLM、自定义、随机和经典智能体混合。  (a) 经典参考动态  (b) 结果与审计视图 图3:比较与检查。用户选择具有可编辑参数的经典 ABM 参考动态,然后在执行后检查涌现的场景摘要、轮次指标、方法说明和诊断记录。 运行按离散轮次进行。在初始化期间,引擎采样人格、分配模型插槽、构建网络、解决媒体处理问题,并准备比较包。在第 `t` 轮,每个智能体接收事件、人格、动作空间、调查问题、可选媒体、先前的记忆、聚合摘要以及从第 `t-1` 轮派生的交互输入。所有智能体输出决策后,环境更新聚合状态,存储每个智能体的记忆,计算指标,并进入下一轮。当前实现支持几种可见的交互协议,包括独立调查、通过网络邻居的社会扩散、广播评论流、顺序暴露、焦点小组和 A/B 处理。这些协议保持简单且可编辑,从而使暴露假设始终是实验的一部分,而不是隐藏的平台模型。 ### 2.3 参考动态、比较与审计 经典 ABM 以两种方式进入系统。首先,`classic` 可以用作群体内的提供商,允许基于规则的智能体与 LLM 智能体参与相同的网络和动作空间。其次,比较控制器可以使用相同的场景、种子、人群假设、网络设置、轮次、指标和动作空间启动全经典的参考运行。这些参考动态不仅仅是作为弱基线被包含。它们赋予了 LLM 智能体轨迹意义:如果一次混合运行类似于简单的阈值或传染模型,那么该模式可能可以通过暴露动态来解释。
相似文章
Agri-SAGE:基于仿真的多智能体大语言模型用于上下文感知的农业咨询生成
本文介绍了Agri-SAGE,这是一个闭环框架,将多智能体大语言模型推理与生物物理模拟(APSIM)相结合,以生成并验证上下文感知的农业建议。在回顾性分析中,该框架优于静态基线,其中Tree-of-Thoughts实现了峰值产量,而Reflexion通过情景记忆降低了计算成本。
大型智能体模拟
本文讨论了AI智能体大规模模拟的进展,可能介绍了多智能体环境的新方法或框架。
Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models
Presents Eco3S, a socio-economic system simulation framework that uses LLM-based agents with co-evolving environments, structural causal simulation, and a self-corrective refinement paradigm to replicate and analyze economic phenomena.
@dair_ai: // 智能体社会中的生命模拟 // 本月上线的较为雄心勃勃的智能体社会测试平台之一,它……
Agentopia 是一个用于多智能体社会长期生命模拟的综合框架,其中 100 个由大语言模型驱动的智能体在模拟的 10 年内自主追求个人成长和社交关系。该工作研究涌现的社会行为,并使用生命奖励训练来提升大语言模型的角色扮演能力。
Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.