Anamnesis:用于大规模背景故事条件调查模拟的开源平台
摘要
Anamnesis 是一个开源平台,利用大型语言模型进行大规模背景故事条件调查模拟,可实现人口统计可控的虚拟调查。在复制真实世界调查分布方面,它优于标准的角色提示方法。
arXiv:2607.10628v1 公告类型:新
摘要:我们介绍了 Anamnesis,一个使用大型语言模型进行人口统计可控调查模拟的交互式系统。Anamnesis 是开源的,专为非技术用户/研究人员设计,支持在虚拟人群(而非真实人类受试者)上对调查工具进行原型设计和压力测试。该平台在统一的网络界面中实现了最近引入的 Anthology 和 Alterity 框架,这些框架使用结构化叙事背景故事来调节模型响应。它支持开放式生成、概率性人口统计重采样和多模态(图像和音频)调查。我们通过两个案例研究评估该系统:(1)复制皮尤研究中心的美国趋势小组(ATP)在政治类型学和生物医学问题方面的片段;(2)模拟《纽约客》漫画比赛中的人类偏好。在两种情况下,Anamnesis 产生的观点分布比标准的角色提示基线更接近真实世界的调查数据,为专有模拟服务提供了透明、可重复且开源的替代方案。
查看缓存全文
缓存时间: 2026/07/14 04:22
# Anamnesis:一个用于大规模背景故事条件调查模拟的开源平台
来源:https://arxiv.org/html/2607.10628
宋泽宇、Joseph Suh、Serina Chang、David M. Chan
加州大学伯克利分校
\{vaclis, josephsuh, serinac, davidchan\}@berkeley.edu
###### 摘要
我们提出Anamnesis,一个利用大语言模型进行人口统计可控调查模拟的交互式系统。Anamnesis是开源的,专为非技术用户/研究人员设计,使其能够在虚拟人群而非真实人类受试者上对调查工具进行原型设计和压力测试。该平台在统一的Web界面中实现了最近提出的Anthology和Alterity框架,这些框架使用结构化的叙事背景故事来调节模型响应。它支持开放式生成、概率性人口统计重采样以及多模态(图像和音频)调查。我们通过两个案例研究评估该系统:(1) 复制皮尤研究中心的美国趋势小组(ATP)中关于政治类型学和生物医学问题的部分;(2) 在《纽约客》标题竞赛中模拟人类偏好。在这两种情况下,Anamnesis生成的舆论分布比标准的角色提示基线更接近真实世界的调查数据,为专有模拟服务提供了一种透明、可复现且开源的替代方案。
演示视频:https://www.youtube.com/watch?v=j5yrnJl287g
平台网站:https://simulate.group/
Anamnesis:一个用于大规模背景故事条件调查模拟的开源平台
宋泽宇、Joseph Suh、Serina Chang、David M. Chan
加州大学伯克利分校
\{vaclis, josephsuh, serinac, davidchan\}@berkeley.edu
## 1 引言
参阅图注
图1:Anamnesis是一个利用大语言模型进行人口统计可控调查模拟的交互式系统。它为Anthology方法提供了一个非技术性界面,该方法通过将LLM调整为具有代表性、一致性和多样性的虚拟角色,来近似大规模人类研究。这些系统共同使得使用多模态刺激在多样化的虚拟人群上快速原型设计和压力测试调查工具成为可能。
意见调查和社会民意测验是理解人类行为、公共政策和社会趋势的基础工具。然而,传统的人类受试者研究面临着日益严峻的挑战,包括成本上升、回复率下降以及接触特定人口亚群的后勤困难。大语言模型(LLM)作为“虚拟角色”的出现提供了一种替代方案,有望以传统方法的一小部分时间和成本来对调查工具进行原型设计和对社会假设进行压力测试。然而,为了使这些模拟调查具有科学有效性,模型必须超越“平均”的聚合响应,而是表现出忠实模拟多样化个体细微、独特视角的能力[Kang等人,2025 (https://arxiv.org/html/2607.10628#bib.bib2);Moon等人,2024 (https://arxiv.org/html/2607.10628#bib.bib1)]。
先前模拟人类群体的努力主要依赖于“角色提示”,即给模型提供一短列表的人口统计属性。虽然对于基本任务可行,但这种方法往往产生刻板印象的反应,并且缺乏复杂意见征引所需的心理深度[Chen等人,2023 (https://arxiv.org/html/2607.10628#bib.bib6)]。这一限制已被Anthology方法论[Moon等人,2024 (https://arxiv.org/html/2607.10628#bib.bib1)]所解决,该方法利用丰富、开放式的叙事背景故事来调节模型响应;以及Alterity框架[Kang等人,2025 (https://arxiv.org/html/2607.10628#bib.bib2)],该框架探索“深度绑定”以确保LLM模拟真实的内部群体视角而非外群体误解[Wang等人,2025 (https://arxiv.org/html/2607.10628#bib.bib5)]。尽管有这些学术进展,但这些方法论在很大程度上仍然局限于孤立的Python脚本。与此同时,诸如Synthetic Users、Expected Parrot和Artificial Societies [Synthetic Users, 2026 (https://arxiv.org/html/2607.10628#bib.bib9); Expected Parrot, 2026 (https://arxiv.org/html/2607.10628#bib.bib7); Artificial Societies, 2026 (https://arxiv.org/html/2607.10628#bib.bib8)]等商业平台提供了类似的模拟能力,但它们是封闭源代码的专有平台,缺乏严谨社会科学所需的透明度和可复现性。
在本文中,我们提出Anamnesis,一个开源的、基于Web的平台,旨在为非技术用户民主化获取高保真角色模拟的途径。Anamnesis在统一的交互式界面中实现了Anthology和Alterity方法论。与这些方法的先前实现不同,Anamnesis是一个平台,提供了非技术性的调查构建器,支持多模态输入(图像和音频),并由一系列LLM推理提供商支持。这些贡献共同使得角色近似方面的最新研究成果对更广泛的用户开放。
我们通过政治意见征引和多模态偏好估计的案例研究来评估Anamnesis系统。具体来说,我们复制了皮尤研究中心的美国趋势小组(ATP)[PewResearch, 2025 (https://arxiv.org/html/2607.10628#bib.bib10)]的部分内容,证明了该平台能够以比标准提示基线更高的准确性[Santurkar等人,2023 (https://arxiv.org/html/2607.10628#bib.bib3); Kim和Yang, 2025 (https://arxiv.org/html/2607.10628#bib.bib11)]征引与现实人类响应分布一致的见解。我们还利用该平台的多模态能力在《纽约客》标题竞赛中模拟人类视觉-语言偏好。我们的结果表明,Anamnesis在纯语言和视觉-语言问题上都紧密反映了人类情感,并且可以成为研究人员原型化和压力测试人类研究调查工具的有价值的工具。
参阅图注
图2:Anamnesis的系统概述。通过Anthology预采样的背景故事存储为角色池,每个角色与概率性人口统计分布相关联。用户通过抽象层构建调查并指定人口统计约束。调查运行通过调度器-队列-工作者架构执行,每个角色按顺序积累上下文,实现可扩展和可复现的模拟。结果事后聚合。
## 2 Anthology:基于叙事的虚拟角色
Anamnesis建立在Anthology框架[Moon等人,2024 (https://arxiv.org/html/2607.10628#bib.bib1)]的基础上,该框架引入了一种使用LLM调节的虚拟角色模拟多样化人类响应者的方法论。Anthology不是依赖简短的人口统计提示(例如,“请以35岁西班牙裔女性的身份作答”[Santurkar等人,2023 (https://arxiv.org/html/2607.10628#bib.bib3)]),而是用丰富、开放式的叙事背景故事来调节语言模型——一个多段落的生活史,不仅捕捉人口统计属性,还捕捉形成性经历、价值观和世界观。
背景故事通过从预训练的基础语言模型中采样多轮生活叙事而生成[Kang等人,2025 (https://arxiv.org/html/2607.10628#bib.bib2)]。具体来说,语言模型以美国之声项目[斯坦福贫困与不平等中心,2021 (https://arxiv.org/html/2607.10628#bib.bib4)]的采访问题为条件,完成真实且多样化的开放式生活叙事。采样的背景故事通过其人口统计信息进行标记,该信息是通过向语言模型查询一个基于背景故事的多项选择人口统计问题而获得的。在Anamnesis中,我们构建了一个按人口统计索引的预采样背景故事数据库,以便对子群体行为感兴趣的研究人员能够轻松运行目标模拟。
为了确保人口统计代表性和目标模拟,Anthology将背景故事生成与人口匹配步骤配对。从业者通常有一个目标人口统计维度(例如年龄、种族、政治派别)的分布,他们旨在模拟:为此,Anthology从整个背景故事池中采样,使得采样池的人口统计分布与目标人口统计分布匹配。
Anamnesis将这些方法论操作化为一个端到端的平台。凭借内置的索引背景故事数据库,它提供自动化的背景故事生成、基于目标人口统计的平衡调整,以及使用任意问题集向基于背景故事条件的语言模型收集响应,所有这些都在一个交互式界面中完成。
## 3 Anamnesis:可访问、开源、Anthology实现
### 3.1 系统概述
Anamnesis将Anthology方法论从研究原型转化为可部署的开源调查模拟平台。它不要求研究人员手动生成背景故事或编写采样脚本,而是通过一个交互式界面,在大量预生成角色的池上实现人口统计约束的模拟。典型用户工作流程包括四个阶段:
- 1. **调查构建**:用户通过图形化构建器定义多问题调查工具。系统支持多项选择、多选、开放式、排序以及多模态(图像和音频)问题。
- 2. **人口统计定位**:用户指定目标受众人口统计和样本量,从35K个预采样背景故事池中进行选择,这些背景故事带有概率性人口统计分布(§3.3 (https://arxiv.org/html/2607.10628#S3.SS3))。如果所需的人口统计维度不可用,用户可以通过集成的人口统计推断程序创建新维度(§3.4 (https://arxiv.org/html/2607.10628#S3.SS4))。
- 3. **模拟执行**:用户选择语言模型和回答算法(§3.5 (https://arxiv.org/html/2607.10628#S3.SS5))。每个背景故事按顺序完成调查,响应被累积以保持一致性(§3.2 (https://arxiv.org/html/2607.10628#S3.SS2))。
- 4. **结果分析**:响应自动聚合和可视化。用户还可以事后按人口统计属性过滤结果以进行对比分析。
### 3.2 执行架构
作为一个可公开访问的平台,Anamnesis必须支持在庞大且不断增长的角色池上并发运行调查。每个调查在所有问题上评估每个选定的角色,导致每次运行O(S×Q)次LLM调用,其中S是样本量(虚拟角色数量),Q是问题数量。对于使用重复采样的调查(N-采样模式;§3.4 (https://arxiv.org/html/2607.10628#S3.SS4)),这会产生O(S×Q×N)次调用。
这种执行机制要求:(1) 每个角色跨问题的状态保持,(2) 在API/vLLM速率限制下的有界并发性,以及(3) 可复现的运行级配置。
Anamnesis通过调度器-队列-工作者架构(图2 (https://arxiv.org/html/2607.10628#S1.F2))解决了这些约束。每个调查运行在启动时被快照,记录其人口统计过滤器、回答算法、模型配置和并发边界。任务被分解为角色-问题单元并发布到消息队列;工作者异步消费任务,同时每个角色内问题按顺序执行,并逐步积累上下文。
### 3.3 背景故事选择
Anamnesis使研究人员能够在其指定的目标人群上模拟调查(例如,“18-24岁女性”或“25-44岁拥有大学学历的选民,民主党和共和党各半”),而无需手动预处理。在之前的Anthology实验中,每个背景故事都与来自已完成真实世界调查(如美国趋势小组)的实际人类响应者配对。人口统计属性是直接观察到的。因此,平衡简化为确定性分配:给定已知标签和目标配额,可以应用贪心选择或匈牙利匹配来选择那些属性精确满足所需单元格的受访者。
在Anamnesis中,这一假设不再成立。人口统计数据不是观察到的标签,而是每个维度存储的推断概率分布。对于每个背景故事b和维度d,系统存储:
pb,d(c), c ∈ Cd,
其中pb,d(c)表示b属于类别c的推断概率。因此,人口统计选择必须在不确定性下进行。为了适应不同的用户场景,Anamnesis提供了两种选择算法:
#### Top-K概率排名。
适用于研究人员优先选择与目标人口统计约束最匹配的角色,实际上将过滤后的人口统计集视为一个单一群体而不进行内部平衡的场景。给定样本量S和人口统计过滤器,每个背景故事根据其与过滤器的联合兼容性进行评分(跨维度相乘概率,并在适用时对所选类别求和)。背景故事按此分数排序,选择前S个。
#### 平衡人口统计匹配。
适用于必须显式强制人口统计子组间代表性(例如,年龄×性别单元格的均等分配)的研究。首先,所选类别扩展为它们的交叉乘积人口统计单元格G。总样本量S被划分为每个单元格g∈G的插槽Kg(均匀分配或通过用户指定的权重)。每个插槽代表一个所需的人口统计目标。
由于我们的预采样背景故事包括概率性人口统计信息,因此选择成为一个分配问题:选择背景故事,使得(i)每个插槽被填充,(ii)每个背景故事最多被选择一次,以及(iii)整体人口统计兼容性最大化。算法1 (https://arxiv.org/html/2607.10628#alg1)总结了该过程。
为了保持交互式延迟,平衡匹配过程在解决分配问题之前限制候选空间。如果不进行剪枝,对整个角色池进行匈牙利匹配将产生O(S³)时间复杂度和大小为S×|P|的分数矩阵,这对于实时使用是不切实际的。
因此,我们仅保留每个人口统计单元格的前M个候选(默认M=50),并将这些候选的并集形成一个共享候选池。然后对得到的S×|C|矩阵应用匈牙利分配,其中|C| ≪ |P|。
在实践中,这将匹配复杂度降低到O(S³),且S≤50,确保响应式的客户端计算而不会影响后端执行或工作者吞吐量。
算法1 平衡人口统计匹配
1: 角色池P;过滤器F;样本量S
2: G ← 所选人口统计类别的交叉乘积
3: 为每个g∈G分配插槽Kg,使得∑Kg = S
4: 将插槽扩展为目标列表T(|T| = S)
5: for 所有g∈G do
6: 通过g的独热分数保留前M个背景故事
7: end for
8: 构建目标T与候选背景故事之间的分数矩阵
9: 应用匈牙利分配以最大化总兼容性
10: return m相似文章
AMNESIA:大规模医学去学习基准套件,结合疾病知情分析
AMNESIA 是首个大规模开源医学去学习基准,包含来自 11 种疾病的 8,820 份病历笔记中的 70,560 个问答对,旨在评估 LLM 对事实知识和推理知识的遗忘情况。
大型语言模型能否革新调查研究?以灾害防备响应的实验为例
本文提出一个五阶段框架,将大型语言模型整合到调查研究中,以应对回复率下降、样本偏差和欺诈性完成等问题。基于2024年米尔顿飓风调查数据,作者提出了一种理论知情的LLM(A-TLM),在缺失数据场景中优于经典插补方法,并通过基于事实的拒答机制展示了可控的幻觉风险。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
用于运行关于使用工具的智能体的受控实验的开源实验室(改变工具名称/角色/历史,测量效果)
一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。
探索智能体记忆系统的跨场景通用性:诊断与强基线
本文评估了面向LLM智能体的八种记忆系统在五种不同场景下的表现,发现给予智能体对存储和检索的主动控制(而非被动管道)能够获得最佳的跨场景泛化能力,并由此提出了AutoMEM框架。