模拟还是估计?基座模型与后训练语言模型在意见模拟中的不同优势
摘要
本文区分了LLM意见模拟中的两个任务——模拟(生成个体回复)和估计(直接预测总体分布),并发现基座模型更擅长模拟,而后训练模型更擅长估计,研究使用了皮尤美国趋势面板数据。
arXiv:2608.03044v1 公告类型:新
摘要:大语言模型越来越多地被用于模拟人类意见,但先前的研究结果相互矛盾:一些研究发现与人类调查数据具有良好的一致性,而另一些研究则发现人物崩塌和人口统计学敏感性较弱。我们表明,这种冲突很大程度上源于混淆了两个不同的任务。我们将第一个任务称为模拟(emulation),即模型生成个体回复并聚合成总体分布。我们将第二个任务称为估计(estimation),即模型直接预测总体分布。在皮尤美国趋势面板上评估六组匹配的基座模型和后训练模型,我们发现基座模型是更强的模拟器:它们生成的回复分布更接近人类真实情况,并能更好地保留人口统计学结构。后训练模型是更强的估计器,在直接询问时能产生更准确的分布预测。我们建议,人类模拟的模型选择应取决于任务是生成文本还是预测分布。
查看缓存全文
缓存时间: 2026/08/05 07:43
# 模仿还是估计?基座模型与后训练语言模型在观点模拟中的不同优势 来源:https://arxiv.org/html/2608.03044 Seth Grief-Albert¹、Jessica Bo²、Difan Jiao²、Ashton Anderson² 1女王大学,2多伦多大学 通讯:[email protected] (https://arxiv.org/html/2608.03044v1/mailto:[email protected]) ###### 摘要 大型语言模型越来越多地被用于模拟人类观点,但先前的研究结果相互矛盾:一些研究发现模型与人类调查数据有令人鼓舞的对齐,另一些研究则发现人格坍缩和人口统计敏感性不足。我们表明,这种矛盾很大程度上源于混淆了两个不同的任务。第一个任务我们称为模仿(emulation),即模型生成个体的回答,聚合成总体分布。第二个任务我们称为估计(estimation),即模型直接预测总体分布。我们在皮尤美国趋势小组上评估了六组匹配的基座模型和后训练模型,发现基座模型是更强的模仿者:它们生成的回答分布更接近人类真实分布,并更好地保留了人口统计结构。后训练模型是更强的估计者,在被直接询问时能产生更准确的分布预测。我们建议,人类模拟的模型选择应根据任务是需要生成文本还是预测分布来指导。 模仿还是估计?基座模型与后训练语言模型在观点模拟中的不同优势 Seth Grief-Albert¹、Jessica Bo²、Difan Jiao²、Ashton Anderson² 1女王大学,2多伦多大学 通讯:[email protected] (https://arxiv.org/html/2608.03044v1/mailto:[email protected]) ## 1 引言 大型语言模型(LLMs)基于大规模人类文本语料库训练,很适合作为人类观点模拟器([Argyle等人,2023](https://arxiv.org/html/2608.03044#bib.bib6);[Durmus等人,2024](https://arxiv.org/html/2608.03044#bib.bib12))。高保真度的总体建模将为政策测试、市场研究和社会科学带来应用,推动越来越多关于基于LLM的观点模拟的研究([Cao等人,2025](https://arxiv.org/html/2608.03044#bib.bib4))。然而,先前的结果相互冲突:一些研究报告了使用基座模型时与人类调查数据有良好的分布对齐([Suh等人,2025](https://arxiv.org/html/2608.03044#bib.bib5);[Moon等人,2024](https://arxiv.org/html/2608.03044#bib.bib9)),另一些研究则记录了人格坍缩([Li等人,2025](https://arxiv.org/html/2608.03044#bib.bib16))、人口统计不敏感性([Sun等人,2025](https://arxiv.org/html/2608.03044#bib.bib10))以及对方法论选择的敏感性([Dominguez-Olmedo等人,2024](https://arxiv.org/html/2608.03044#bib.bib18);[Wang等人,2024](https://arxiv.org/html/2608.03044#bib.bib8))。报告负面结果的研究主要在后训练模型上进行评估。我们提出,这种分歧在很大程度上反映了对两个不同模拟任务的混淆:模仿,即模型作为个体参与者生成回答,总体分布由聚合产生;以及估计,即模型明确预测总体的回答分布。我们在皮尤美国趋势小组上,在这两种范式下评估了三组匹配的基座/后训练模型对。我们的结果表明,基座模型生成的模仿分布始终更接近真实分布,并且更忠实地跟踪人口统计结构。后训练模型擅长估计,能产生校准良好的分布预测。这些发现厘清了人类模拟中的模型选择问题:基座模型更适合需要生成文本的任务,而后训练模型更适合直接预测分布的任务。 ## 2 相关工作 **LLM作为人类模拟器。** 语言模型已被越来越多地探索作为模拟人类行为的基底,涵盖调查回答模拟([Argyle等人,2023](https://arxiv.org/html/2608.03044#bib.bib6);[Cao等人,2025](https://arxiv.org/html/2608.03044#bib.bib4);[Park等人,2026](https://arxiv.org/html/2608.03044#bib.bib15))、交互式社会智能体([Park等人,2023](https://arxiv.org/html/2608.03044#bib.bib7);[Vezhnevets等人,2023](https://arxiv.org/html/2608.03044#bib.bib26))以及合成总体建模([Sun等人,2024](https://arxiv.org/html/2608.03044#bib.bib14))。这些工作共享一个前提:预训练语料库编码了足够的人类多样性,能够支持总体层面的行为模拟。参考先前工作([Santurkar等人,2023](https://arxiv.org/html/2608.03044#bib.bib2);[Suh等人,2025](https://arxiv.org/html/2608.03044#bib.bib5)),我们在带有真实基准的调查意见分布这一受控环境中进行评估。 **负面结果与方法论问题。** 一个平行的文献记录了显著局限。近期研究发现,后训练模型表现出系统性的人格坍缩,在提示不同身份时产生同质化输出([Li等人,2025](https://arxiv.org/html/2608.03044#bib.bib16);[Xiao等人,2026](https://arxiv.org/html/2608.03044#bib.bib19);[Qin等人,2026](https://arxiv.org/html/2608.03044#bib.bib33))。[Sun等人,2025](https://arxiv.org/html/2608.03044#bib.bib10)得出结论认为,社会人口统计提示并不能可靠地将模型输出转向目标人口统计特征。在方法论上,[Tjuatja等人,2024](https://arxiv.org/html/2608.03044#bib.bib17)、[Dominguez-Olmedo等人,2024](https://arxiv.org/html/2608.03044#bib.bib18)和[Wang等人,2024](https://arxiv.org/html/2608.03044#bib.bib8)证明,模型响应对选项顺序和标签分配敏感。[Hullman等人,2026](https://arxiv.org/html/2608.03044#bib.bib22)认为该领域仍受困于预测质量。这些研究主要或完全在后训练模型上评估。 **基座模型与分布测量。** 若干独立发现为本工作提供了动机。[Moon等人,2024](https://arxiv.org/html/2608.03044#bib.bib9)、[Suh等人,2025](https://arxiv.org/html/2608.03044#bib.bib5)和[Cao等人,2025](https://arxiv.org/html/2608.03044#bib.bib4)明确选择基座模型,理由是后训练变体存在观点偏移。[Santurkar等人,2023](https://arxiv.org/html/2608.03044#bib.bib2)观察到,基座模型与人类调查数据在分布对齐上更接近。另外,[Meister等人,2025](https://arxiv.org/html/2608.03044#bib.bib3)表明,模型描述意见分布的能力优于通过采样生成这些分布的能力。我们综合这些发现,引入模仿-估计之区分,系统比较匹配的基座模型和后训练
相似文章
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试
本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。
像对我五岁小孩一样解释或任意难度:评估语言模型响应的交互潜力
本文提出一个框架,用于评估LLM在科学查询中生成不同语言复杂度的多个响应的能力。研究发现,模型常常不一致地变化复杂度,表现最好的Claude Sonnet 4.5仅能在46%的情况下正确调整复杂度。
大语言模型对其自身回应过度自信
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
LLM智能体可预测社交媒体反应但仍不敌文本分类器:基于1511人12万+人格的仿真准确性基准测试
大规模研究发现,LLM智能体以70.7%的准确率预测个人社交媒体反应,却仍落后于简单TF-IDF分类器,凸显其操控风险与政策模拟价值。