重新思考基于LLM的社会模拟评估与优化
摘要
本文引入了一个主观性系数来解决基于准确率评估LLM社会模拟的局限性,提出了适应主观性的软标签训练(SALT)进行优化,并构建了SubjSim基准测试以针对完整响应分布进行评估。
查看缓存全文
缓存时间: 2026/08/21 10:01
# 重新思考基于大语言模型的社会模拟评估与优化
来源:https://arxiv.org/html/2608.19689
## 重新思考基于大语言模型的社会模拟评估与优化
致谢:
项目主页:https://yupei-wang.github.io/rethinking-social-simulation/
徐辰 温继荣
所属机构:中国人民大学高瓴人工智能学院
电子邮箱:[wang\_pei@ruc\.edu\.cn](mailto:wang\_pei@ruc\.edu\.cn) xu\.chen@ruc\.edu\.cn jrwen@ruc\.edu\.cn
###### 摘要
基于大语言模型的社会模拟是传统社会科学方法(如调查和行为实验)的有前景的补充。该领域的一个核心问题是如何评估大语言模型模拟人类行为的保真度,并进而如何针对此目标优化模型。当前主流实践通过准确性进行评估,即检查模型是否选择人类观察到的单一响应,并据此训练大语言模型以复现这一硬标签。然而,人类行为本质上具有主观性:同一人在相同情境下可能合理地采取不同行动,因此观察到的响应仅是从潜在响应分布中抽取的一次样本,这使得基于准确性的评估不可靠,且硬标签训练具有误导性。为解决这些问题,本文首先引入*主观性系数*——一种基于熵的量,用于区分编码等客观任务与社会模拟等主观任务,并系统分析基于准确性的评估和硬标签训练如何随主观性增加而失效。基于主观性系数,我们进一步提出*主观性自适应软标签训练*(SALT):它将语义相近输入的观察输出聚合成软分布标签,聚合半径根据每个输入估计的主观性自适应调整;在接近客观任务的极限情况下,邻域缩小,SALT自然回退到标准的单标签训练。此外,由于现有数据集仅记录单一观察响应,无法支持分布评估,我们构建了SubjSim基准,包含19,300个上下文,覆盖193位标注者和100个主观问题。由于现实世界数据通常仅提供每个输入的单一观察,我们实验中从单一观察输出训练模型,但使用完整响应分布进行评估,从而验证了该方法在现实场景中的可行性。在SubjSim上的大量实验证明了我们方法的优越性。
## 1 引言
基于大语言模型的社会模拟在社会科学研究中具有巨大潜力,提供了一种低成本、可控且可扩展的方式来研究舆论动态、政治极化、市场行为和政策干预等问题(14、30、9、11、18、23、2)。该领域的核心问题是如何评估大语言模型模拟行为的保真度(6、7、10、29、22),然后在确立标准的基础上如何训练模型以达到该目标。现有大多数研究直接遵循编码和数学等客观领域的做法:为每个人在每个问题上收集一个响应,微调模型以复现该响应作为正确标签,并使用准确性指标检查模型是否选择相同答案。对于客观任务,这一方法完全合理:存在明确的正确答案,因此单一标签完全指定了目标,复现标签正是期望的行为,且准确性忠实衡量了成功程度。然而,社会模拟打破了这一前提。人类行为是随机而非确定性的(8、3、26、33、21、16、15):同一人在类似场合可能采取不同行动,具有相似特征的人可能选择不同行为。因此,观察到的响应仅是从潜在响应分布中抽取的一次样本。单一标签不再能指明目标。训练时,复现该标签会将模型压缩到一种行为;测试时,模型是否命中该答案部分取决于偶然性,而非模拟的忠实度。为系统研究上述问题,我们首先定义*主观性系数*,这是一种基于熵的度量,衡量给定决策情境中人类响应的内在随机性;据此定义,客观任务(如编码)的主观性系数接近零,而主观任务(如社会模拟)的系数则高得多。基于主观性系数,我们正式证明,随着主观性增加,准确性评估加单标签训练的常规方法会失效。对于评估,记录的答案本身只是响应分布中的一次随机抽取,因此模型是否匹配它无法反映保真度;对于训练,拟合单一标签会将模型拉离真实响应分布。最后,我们提出*主观性自适应软标签训练*(SALT)。对于每个上下文,SALT收集共享相同选项的语义相似上下文中观察到的答案,并将其转化为软标签,邻域大小根据上下文估计的主观性自动调整。当上下文接近客观时,邻域缩小,SALT回退到标准单标签训练,从而在低主观性特殊情况下恢复硬标签监督。评估分布保真度需要参考人类响应分布,但现有社会模拟数据集通常仅记录每个上下文的单一响应。因此,我们构建SubjSim基准,其中193位标注者回答100个主观调查问题,产生19,300个标注者-问题对。每对通过概率球分配法获得引出的响应倾向分布。训练时,模型从未见过这些分布,仅从每对获得一个派生硬动作;测试时,使用完整分布更准确地衡量模型复现人类行为的忠实度。以Qwen3-8B为骨干,SALT将聚合KL散度相比标准监督微调(SFT)降低77.6%,JSD降低45.9%,TVD降低31.2%,MMD降低52.7%,在中高主观性设置中提升最大,因为单一观察响应对完整分布的揭示最少。总之,本文在三个层面做出贡献。(i)在问题层面,我们指出现行基于准确性的评估和训练实践对社会模拟不合理,并通过引入主观性系数严谨分析了这一失效。(ii)在方法层面,我们提出SALT,通过主观性自适应半径将语义相似上下文的观察聚合成软分布标签。(iii)在数据层面,我们构建SubjSim基准,包含19,300个标注者-问题对及人类标注的响应分布,大量实验验证了SALT的有效性。
## 2 预备知识
### 2.1 社会模拟的形式化
我们用人物向量\(u\)描述目标人群中的每个个体,该向量编码人口统计特征、人格特质、先验信念或其他个人属性。决策情境是元组\(x:=(u,s)\),其中\(s\)是情境描述;我们用\(\mathcal{X}\)表示所有决策情境的空间。在情境\(x\)下,个体从候选动作集\(\mathcal{A}(x)=\{a^{(1)},\dots,a^{(K)}\}\)中选择,其中每个动作是自然语言描述,且\(K=|\mathcal{A}(x)|\)可能因情境而异。例如,\(u\)可能描述一位生活在大城市、26岁的研究生,\(s\)可能询问选择工作时最重要的因素,相应的动作集是\(\mathcal{A}(x)=\{“salary”,“stability”,“personal interest”,“work–life balance”\}\)。另一个例子中,\(u\)可能描述一位生活在小镇的退休教师,\(s\)可能询问个人主要如何获取新闻,动作集为\(\mathcal{A}(x)=\{“social media”,“television”,“news apps”\}\)。社会模拟旨在使用大语言模型模拟这些个体的响应和行为。
### 2.2 理想优化目标
定义理想优化目标首先需要理解人类行为的本质。许多社会科学理论表明,人类行为不是确定性的,而是包含内在随机成分。随机效用理论(15、16)、随机证据累积模型(21)和偏好构建研究(26)都将个人选择建模为从概率分布中抽取,而非固定答案。这种随机性在日常生活中显而易见:同一人可能在不同日子从同一菜单选择不同菜品,两次回答同一调查问题时给出不同答案(33),在经济博弈的一轮中合作而在下一轮中背叛(3),或在一次聚会中健谈而在另一次中安静(8)。这种随机性是目标本身的一部分,而非标签噪声。理想情况下,模型应捕捉人类行为的不确定性:对于每个情境,它不仅应复现最可能的动作,还应复现分配给所有合理动作的完整概率质量。形式上,目标是潜在响应倾向分布\(\phi^*(\cdot \mid x) \in \Delta(\mathcal{A}(x))\),即在相同情境下于可比条件下重复测量时会观察到的动作分布,其中\(\Delta(\mathcal{A}(x))=\{(q_1,\dots,q_K):q_k\geq0,\sum_k q_k=1\}\)是可用动作上的概率单纯形,为简洁起见我们记\(p_k:=\phi^*(k\mid x)\)。在模型方面,参数为\(\theta\)的大语言模型诱导动作级分布\(\phi_\theta(\cdot \mid x) \in \Delta(\mathcal{A}(x))\),通过归一化\(K\)个候选动作的生成概率获得,类似地记\(\phi_\theta(k\mid x)\)。社会模拟的理想目标是学习一个模型,其诱导的动作分布在所有情境下接近\(\phi^*\):
\[
\hat{\theta} = \operatorname{arg\,min}_\theta \mathbb{E}_x \left[ D \left( \phi^*(\cdot \mid x), \phi_\theta(\cdot \mid x) \right) \right], \tag{1}
\]
其中\(D\)衡量动作单纯形上的不匹配,可实例化为各种距离函数,例如全变差距离\(D_{\mathrm{TV}}(P,Q):=\frac{1}{2}\sum_{k=1}^K |P_k - Q_k|\)、交叉熵\(D_{\mathrm{CE}}(P,Q):=-\sum_k P_k \log Q_k\)或KL散度\(D_{\mathrm{KL}}(P \parallel Q)\)。
### 2.3 当前基于准确性的实践
实践中,\(\phi^*\)不可观察:每个情境仅记录一次,产生数据集\(\mathcal{D}=\{(x^i, a(x^i))\}\),其中\(a(x) \in \mathcal{A}(x)\)是单一观察动作,要么是\(\phi^*(\cdot \mid x)\)的一次随机抽取,要么是由此派生的单一动作代理。设\(j(x)\)表示\(a(x)\)的索引,\(\bm{\delta}_{a(x)}\)是将所有质量置于\(a(x)\)的单热分布。主流实践基于此单一观察进行训练和评估。训练方面,模型训练以最大化分配给观察动作的概率:
\[
\tilde{\theta} = \arg\max_\theta \mathbb{E}_x \left[ \log \phi_\theta(j(x) \mid x) \right] = \operatorname{arg\,min}_\theta \mathbb{E}_x \left[ D_{\mathrm{CE}} \left( \bm{\delta}_{a(x)}, \phi_\theta(\cdot \mid x) \right) \right], \tag{2}
\]
这正是将目标式(1)中不可观察的目标\(\phi^*(\cdot \mid x)\)替换为单热向量\(\bm{\delta}_{a(x)}\),并将\(D\)取为交叉熵。评估方面,准确性检查模型最高概率动作是否与同一单一观察一致:
\[
\mathrm{Acc}(\theta) = \mathbb{E}_x \left[ \mathbf{1} \left[ \textstyle \arg\max_k \phi_\theta(k \mid x) = j(x) \right] \right], \tag{3}
\]
将目标式(1)中的散度替换为模型的众数与单一抽取之间的0-1比较。一个自然的问题是:(2)和(3)在多大程度上捕捉了理想目标(1)?下一节我们将通过严谨分析它们之间的差距来回答这个问题。
## 3 基于准确性实践的错位分析
### 3.1 评估指标分析
理想情况下,评估指标应与真实模型质量一致:在该指标下得分更高的模型也应更接近理想目标(1)下的真实响应分布。我们检查准确性(3)是否具有此性质。考虑在上下文\(x\)下(观察索引\(j=j(x)\))按准确性对两个模型\(\theta_1\)和\(\theta_2\)排序,设\(k_1\)和\(k_2\)分别为两个模型的顶级动作。有三种情况。
(i)\(k_1=k_2\):两个模型获得相同分数。然而,真实误差\(D_{\mathrm{TV}}(\phi_{\theta_i}, \phi^*)\)取决于所有\(K\)个概率值,而不仅是顶级动作,隐藏的差距可能接近最大。假设\(\theta_1\)完全匹配目标,\(\phi_{\theta_1}=\phi^*\),而\(\theta_2\)将其所有质量置于共享的顶级动作\(k_1\)上,该动作是\(\phi^*\)的众数,且\(p_{k_1}=p_{\max}\)。它们的真实误差为:
\[
D_{\mathrm{TV}}(\phi_{\theta_1}, \phi^*) = 0, \quad D_{\mathrm{TV}}(\phi_{\theta_2}, \phi^*) = \frac{1}{2}\left[(1-p_{\max}) + \sum_{k \neq k_1} p_k \right] = 1 - p_{\max}.
\]
若\(p_{\max}\)较小,\(\theta_2\)的误差接近1,而两者准确性得分相同。
(ii)\(k_1=j \neq k_2=j\):仅模型1得分正确,但真实误差关系不明确。
(iii)\(k_1 \neq j = k_2\):仅模型2得分正确。即使模型2的误差可能更大,准确性仍将其评为更好。
因此,准确性可能无法可靠反映模型接近真实分布的程度,尤其是在主观性较高的任务中,其中响应分布更平坦(\(p_{\max}\)更小)。相似文章
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
共识与异议:群体推荐系统中主观偏好的动态LLM建模
本研究在人类调查数据上微调LLM,使其作为群体推荐系统的判断模型,动态选择聚合策略以最大化满意度和共识。一项用户研究验证了该方法与人类对公平性和满意度的感知相一致。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准
本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。
一款关于模拟理论且包含LLM的游戏。
一款利用LLM探索模拟理论的游戏。