超越平均值:基于小样本试点数据的LLM调查模拟器三轴保真度对齐

arXiv cs.CL 论文

摘要

本文介绍了一个三轴保真度框架(结构、边际、个体),用于评估LLM如何从小样本试点数据模拟调查回答。通过一项COVID-19错误信息调查,比较了提示、纠正和微调方法,发现微调提供了平衡的保真度,但不同子样本之间存在差异。

arXiv:2606.28963v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地被用于模拟社会调查回答,但其输出存在系统性偏差:边际分布偏斜,响应方差校准不良,预测变量与结果之间的关系减弱。我们提出一个简单问题:给定少量人类回答的试点样本,LLM能否恢复更广泛人群的统计特征?我们将恢复分解为三个轴:结构保真度、边际保真度和个体保真度。以一项COVID-19错误信息调查为案例,我们基准测试了三类方法:提示、纠正和微调。结果表明,在小样本试点数据上进行微调提供了实现多种保真度的平衡方法,但这些保真度的水平在不同子样本之间可能有所不同,可能威胁到多元对齐。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:29

# 基于LLM的调查模拟器从小型试点数据中实现三维保真度  
来源:https://arxiv.org/html/2606.28963  

###### 摘要  
大型语言模型 \(LLMs\) 越来越多地被用于模拟社会调查响应,但它们的输出表现出系统性偏差:边际分布存在偏斜,响应方差校准不良,预测变量与结果之间的关系被削弱。我们提出一个简单问题:给定一个较小的人类试点样本,LLM能否恢复更广泛人群的统计特征?我们将恢复过程分解为三个维度:结构保真度、边际保真度和个体保真度。以一项COVID-19错误信息调查为案例研究,我们对三类方法进行了基准测试:提示工程、校正方法和微调方法。研究结果表明,在小型试点样本上进行微调提供了一种平衡多种保真度形式的方法,但这类保真度在不同子样本间可能存在差异,这可能威胁到多元化对齐。  
大型语言模型、社会调查模拟、错误信息、LoRA、一致性相关系数、预测驱动推断  

## 1 引言  
大型语言模型 \(LLMs\) 现在被常规用作人类受访者的代理——从选民“硅样本”\(Argyle et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib3)\),到基于访谈的“生成式主体”,模拟1,000名真实美国人\(Park et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib20)\),再到微调模型预测实验级结果\(Kolluri et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib15)\),以及提示GPT-4预测社会科学实验的效应量\(Hewitt et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib10)\)。与此同时,社会调查仍是测量信仰与态度的主要工具,但招募代表性受访者成本高昂且速度缓慢,因此大多数大规模调查始于一个较小的*试点*样本,以评估可行性\(Van Teijlingen & Hundley, 2001 (https://arxiv.org/html/2606.28963#bib.bib25)\)。这就引出了一个实际的计算问题:*给定一个较小的人类试点样本,LLM能否恢复其来源的全人群的统计结构?*  

这个问题在错误信息信仰领域尤为重要,因为 \(i\) 不同人群对于哪些虚假声明甚至*接触过*存在差异\(Lee et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib17)\);\(ii\) 准确性评级依赖于本地信息生态系统,预训练可能无法完全捕获\(Choi et al., 2026 (https://arxiv.org/html/2606.28963#bib.bib8)\);\(iii\) 下游应用(例如基于某些心理社会特征的定向干预)依赖于预测变量与结果的关系,而不仅仅是边际分布。最近的审计表明,LLM生成的调查响应 \(i\) 近似边际分布但扁平化方差,约三分之一情况下效应量符号翻转\(Bisbee et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib4)\);\(ii\) 表现出主题特定的“机器偏差”,在不同主题间社会一致性不一致\(Boelaert et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib5)\);\(iii\) 同质化并结构性扭曲少数群体\(Li et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib18); Wang et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib26)\);\(iv\) 对看似无害的提示扰动高度敏感\(Rupprecht et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib22); Tjuatja et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib24)\);\(v\) 表现出较大的分析灵活性\(Cummins, 2025 (https://arxiv.org/html/2606.28963#bib.bib9)\)。这些病理现象共同表明,LLM不应被视为人类受访者的直接替代品,而应被看作条件生成或估计模型,其输出必须对照真实数据进行评估。  

我们做出四项贡献。  
首先,我们将基于LLM的调查模拟重新框架为一个*可恢复性*任务——给定一个较小的人类试点样本 \(D_p\),能在多大程度上重建保留人群的结构——并将恢复过程分解为三个维度:*结构保真度*(预测-结果关系是否匹配?)、*边际保真度*(模拟的边际分布与人类的匹配吗?)和*个体保真度*(每个模拟受访者与其人类对应个体是否吻合?)。  
其次,我们引入一个校准的评估协议,将每个保真度维度映射到特定指标:对于结构维度,使用Lin的一致性相关系数 \(CCC\),分解为符号一致率和幅度比;对于边际维度,使用跨受访者关于每个受访者标量摘要的地球移动距离 \(EMD\);对于个体维度,使用配对Pearson \(r_d\)(相对)和MAE \(d\)(绝对)关于每个受访者的辨别能力(见第3.4节 (https://arxiv.org/html/2606.28963#S3.SS4))。  
第三,在相同的5%试点样本(\(N=1,466\) 的COVID-19错误信息调查)上,我们对以下方法进行了正面比较:\(\{ZS, FS\} \times \{batch, per-item\}\) 提示方法、PPI校正方法\(Angelopoulos et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib1)\)(统一应用于所有基于提示的模拟器),以及LoRA / LoRA++MLP微调方法。  
第四,我们在每个人口统计子组内审计保真度:统计恢复对于某些类型的身份子组会退化,这需要引起多元化对齐社区的关注。  

## 2 相关工作  
我们将先前的研究组织为与小型试点设置相关的校准家族:基于提示的条件化、测试时干预与统计校正、以及参数高效微调。  

### 2.1 基于提示的条件化  
最早一批研究通过文本描述的人口统计、态度或背景来条件化LLM。*硅采样*\(Argyle et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib3)\) 表明,使用ANES风格背景提示的GPT-3可以近似群体级投票分布,而*随机硅采样*\(Sun et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib23)\) 将其扩展到使用群体级边际进行人口统计角色扮演。*LLM-Mirror*\(Kim et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib14)\) 添加了已有响应和心理特质,其他更丰富的方案\(Choi et al., 2026 (https://arxiv.org/html/2606.28963#bib.bib8)\) 整合了社交网络和同伴特征。Park 等人 (2024 (https://arxiv.org/html/2606.28963#bib.bib20)) 使用完整的两个小时访谈记录作为角色,恢复了GSS上85%的人类重测准确性。*受众细分*\(Qin et al., 2026 (https://arxiv.org/html/2606.28963#bib.bib21)\) 通过变化标识符粒度来恢复群体内异质性。常见假设是,LLM的*通用先验*——预训练期间获得的一般世界知识——足够丰富,以至于在适当描述的条件下,模型会产生校准的人类样响应。  

一个互补的文献审计检验了这一假设,并发现其脆弱。Bisbee 等人 (2024 (https://arxiv.org/html/2606.28963#bib.bib4)) 表明,ChatGPT生成的感受温度计压缩了方差,并在约32%的ANES条目上翻转效应量符号;Boelaert 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib5)) 记录了在主题间社会性不一致的民意调查“机器偏差”;Wang 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib26)) 表明,基于身份提示的LLM有害地误传并扁平化少数群体;Li 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib18)) 将此形式化为由准确性最大化解码驱动的“常人”同质化。Zhou 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib29)) 报告说,即使从GPT重复随机抽样,产生的硅人群也会过度代表某些人口统计组,并且在态度项上比人类更确定。Chapala 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib7)) 测试了基于提示的社会期望偏差缓解措施,包括中立第三人称改写和反向编码。Cummins (2025 (https://arxiv.org/html/2606.28963#bib.bib9)) 对整个过程进行了压力测试,表明252种看似合理的分析师配置会得出截然不同的结论,从而推动了多宇宙式的稳健性检查。对这些审计的自然回应是注入少量来自同一种群的上下文内示例。这一思想支撑了最近的少样本演示\(Argyle et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib3)\)、角色预测试管道\(Kim et al., 2024 (https://arxiv.org/html/2606.28963#bib.bib14)\) 以及受众细分提示\(Qin et al., 2026 (https://arxiv.org/html/2606.28963#bib.bib21)\)。  

### 2.2 测试时干预与校正  
第二类方法承认仅提示不够,而是修改引出或后处理。*语义相似性评分*\(Maier et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib19)\) 通过引出自由文本并将其投影到相似性空间来避免李克特量表上的均值回归。一个统计上合理的子类将LLM输出视为有偏预测器,并用小型金标样本进行纠正。*预测驱动推断* \(PPI\) \(Angelopoulos et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib1)\) 使用保留的人类样本去偏合成人口估计,而Krsteski 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib16)) 将PPI适配到调查模拟,使用功率调优的每个条目 \(\lambda\)。我们使用这种PPI变体作为我们的校正家族,统一应用于所有基于提示的模拟器。  

### 2.3 用于调查模拟的微调  
第三类快速增长的方法直接在人类响应上微调LLM。Kolluri 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib15)) 在SocSci210语料库(来自超过400,000参与者的约290万条响应)上微调LLaMA3-8B和Qwen2.5-14B,在未见实验上的预测误差相对于GPT-4o分别降低了30%和26%。Cao 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib6)) 使用第一令牌概率目标微调LLM以匹配国家级的WVS/Pew分布,并泛化到未见问题和国家。Huang 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib12)) 引入了*分布偏移对齐*,这是一个两阶段方案,明确对齐子组条件偏移,并将所需真实数据量减少53–69%。Krsteski 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib16)) 提供了在有限数据下对*提示、微调和校正*最接近的直接比较,表明这些方法互补而非替代。我们有三个不同之处:\(i\) 我们的领域是COVID-19错误信息,其预测-结果结构足够丰富,能够暴露多元失败,而这些失败在边际准确性中不可见\(Choi et al., 2026 (https://arxiv.org/html/2606.28963#bib.bib8)\);\(ii\) 除了人口的边际保真度外,我们还报告结构保真度指标,该指标惩罚偏离双变量和回归系数的偏差;\(iii\) 我们报告个体预测与每个人类受访者响应的相关程度,也提供了个体保真度的基准。我们还探讨了*输出头*的选择——自回归令牌生成与判别式分类头——是否对模拟保真度有影响。  

## 3 方法论  
我们将问题框架化为一个可恢复性任务。给定一个完整的调查数据集 \(D\),我们观察一个小型试点样本 \(D_p \subset D\),并旨在为保留受访者 \(D \setminus D_p\) 生成一个合成数据集 \(D_s\),使得 \(D_s\) 保留 \(D\) 的统计特性。  

### 3.1 数据  
该调查是Lee 等人 (2023 (https://arxiv.org/html/2606.28963#bib.bib17)) 的COVID-19错误信息信仰研究,于2020年5月在韩国进行(\(N=1,466\))。每位受访者 \(i\) 由一个配置文件 \(X_i\) 描述,包括人口统计特征(年龄、性别、教育程度、收入、政治取向)、心理测量量表(开放心态、直觉信仰、证据需求、真理即政治、怀疑论)以及接触度指标(信息接触、情绪反应)。每位受访者回答 \(Y_i\) 关于36个信仰条目:18个Misinfo(虚假声明)和18个Trueinfo(真实声明),每个子集包含9个政治和9个科学条目。响应使用4点李克特量表(完全不准确、不太准确、有些准确、非常准确),外加一个单独的“未见过” \(Hns\) 选项,我们将其视为缺失值处理。经验上的 \(Hns\) 率为13.3%。我们定义三个每受访者标量摘要——Misinfo均值 \(m_i = \overline{y_{i,\text{Mis}}}\),Trueinfo均值 \(t_i = \overline{y_{i,\text{Tru}}}\),以及辨别分数 \(d_i = t_i - m_i\)——并在整个结构、边际和个体保真度分析中使用它们。  

### 3.2 试点采样  
我们抽取一个5%的试点样本 \(D_p\)(\(n=74\)),使用固定种子,保留剩余1,392名受访者作为评估集。相同的试点样本在所有校准管道中重复使用,以便性能差异反映方法差异而非数据差异。  

### 3.3 校准管道  
我们对四个家族进行基准测试。所有上游模拟器在相同的保留受访者上预测相同的36个李克特评分。  

#### 家族1 – 零样本角色(ZS, ZS-perItem)。对于每个保留受访者 \(i\),LLM被给予 \(X_i\) 并要求预测 \(Y_i\)。ZS(批量)在单个提示中引出所有36个评分;ZS-perItem一次引出一个条目。比较两者可以隔离跨条目条件作用的效果,独立于试点示例,消除了Cummins (2025 (https://arxiv.org/html/2606.28963#bib.bib9)) 指出的分析灵活性旋钮之一。示例提示见附录A (https://arxiv.org/html/2606.28963#A1)。  

#### 家族2 – 少样本提示(FS, FS-perItem)。我们随机注入 \(D_p\) 的一个子集(五行)作为上下文内示例。与家族1一起,这构成了一个 \(2 \times 2\) 的因子设计:{无试点,有试点} × {批量,每条目}。  

#### 家族3 – 参数高效微调(LoRA, LoRA++MLP)。我们在相同的5%试点样本上使用LoRA\(Hu et al., 2022 (https://arxiv.org/html/2606.28963#bib.bib11)\) 微调Qwen3-8B\(Yang et al., 2025 (https://arxiv.org/html/2606.28963#bib.bib27)\),采用两种配置。LoRA – 注意力和MLP投影上的适配器,自回归地发出标签字符串。LoRA++MLP – 相同的LoRA适配器加上一个在最终隐藏状态上的训练好的5路MLP分类头,对四个李克特类别加上第五个 \(Hns\) 类别使用交叉熵。两种配置仅在输出头上不同。  

#### 家族4 – PPI校正。我们使用预测驱动推断\(Angelopoulos et al., 2023 (https://arxiv.org/html/2606.28963#bib.bib1)\) 对每个基于提示的模拟器的每个条目人口均值进行校正,遵循Krsteski 等人 (2025 (https://arxiv.org/html/2606.28963#bib.bib16)) 对调查模拟的适配。对于每个条目 \(q\),校正后的每一条目人口估计为 \(\hat{\theta}_q = \bar{y}_{\text{pilot},q} + \lambda_q \bigl( \bar{\hat{y}}_{\text{held},q} - \bar{\hat{y}}_{\text{pilot},q} \bigr)\),其中 \(\lambda_q = \text{Cov}(y, \hat{y}) / \text{Var}(\hat{y})\)。

相似文章

测量AI的忠实度——无论好坏

Reddit r/AI_Agents

本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试

arXiv cs.CL

本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。