跨调查迁移的硅采样
摘要
提出将跨调查迁移作为基于LLM的人类调查模拟的严格评估框架,发现零样本LLM在未见项目上达到52%的准确率。
arXiv:2607.03091v1 公告类型:新
摘要:硅采样——使用大型语言模型(LLM)模拟人类调查受访者——已成为增强传统调查研究的一种有前景的方法。然而,大多数评估依赖于分布比较而非个体层面的预测,这有可能混淆模式匹配与连贯的受访者层面预测。我们提出跨调查迁移,这是一个更严格的评估框架:向LLM提供受访者对一组问题的回答,并要求其预测该受访者对同一调查中完全不同问题的回答。利用2024年台湾选举与民主化研究(TEDS)的数据、三个开源权重LLM(27B-120B参数)以及有监督机器学习基线,我们发现:(1)零样本LLM在真正未见项目上达到52%的准确率,与在同一人群数据上训练的有监督随机森林仅差6个百分点(pp);(2)存在稳定的构念可预测性层级,从党派态度的67%到主权问题的23%;(3)方差崩溃和安全对齐效应——两个常被引用的LLM局限性——比先前报道的更为微妙,方差崩溃同样影响有监督模型,而安全对齐效应在不同模型家族间差异显著。这些发现阐明了硅采样的前景与局限。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 跨调查迁移的硅采样方法 来源:https://arxiv.org/abs/2607.03091 查看 PDF (https://arxiv.org/pdf/2607.03091) > **摘要**:硅采样——利用大型语言模型(LLMs)模拟人类调查受访者——已成为增强传统调查研究的潜在方法。然而,大多数评估依赖分布层面的比较而非个体层面的预测,这可能导致将模式匹配与连贯的受访者层面预测混为一谈。我们提出跨调查迁移(cross-survey transfer)这一更为严格的评估框架:模型需根据受访者对一组问题的回答,预测其对同一调查中完全不同问题的答案。利用2024年台湾选举与民主化调查(TEDS)数据、三个开放权重LLMs(270亿至1200亿参数)以及有监督机器学习基线,我们发现:(1)零样本LLMs在真正未见项目上达到52%的准确率,距基于同群体数据训练的有监督随机森林仅差6个百分点;(2)存在稳定的构念可预测性层级结构,从67%的政党态度到23%的主权观点不等;(3)方差坍缩与安全对齐效应——这两类常被引用的LLM局限——实际上比先前报告更为复杂:方差坍缩同样影响有监督模型,而对齐效应在不同模型家族间差异显著。这些发现厘清了硅采样的前景与边界。 ## 提交历史 来自:Yihuang Kang [查看邮箱 (https://arxiv.org/show-email/90f46de8/2607.03091)] **[v1]** 2026年7月3日,星期五,08:22:18 UTC(454 KB)
相似文章
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
超越平均值:基于小样本试点数据的LLM调查模拟器三轴保真度对齐
本文介绍了一个三轴保真度框架(结构、边际、个体),用于评估LLM如何从小样本试点数据模拟调查回答。通过一项COVID-19错误信息调查,比较了提示、纠正和微调方法,发现微调提供了平衡的保真度,但不同子样本之间存在差异。
用LLM评审员增强人工评估:你需要多少人工审核?
本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
使用项目反应理论审计LLM基准测试
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。