跨调查迁移的硅采样

arXiv cs.AI 论文

摘要

提出将跨调查迁移作为基于LLM的人类调查模拟的严格评估框架,发现零样本LLM在未见项目上达到52%的准确率。

arXiv:2607.03091v1 公告类型:新 摘要:硅采样——使用大型语言模型(LLM)模拟人类调查受访者——已成为增强传统调查研究的一种有前景的方法。然而,大多数评估依赖于分布比较而非个体层面的预测,这有可能混淆模式匹配与连贯的受访者层面预测。我们提出跨调查迁移,这是一个更严格的评估框架:向LLM提供受访者对一组问题的回答,并要求其预测该受访者对同一调查中完全不同问题的回答。利用2024年台湾选举与民主化研究(TEDS)的数据、三个开源权重LLM(27B-120B参数)以及有监督机器学习基线,我们发现:(1)零样本LLM在真正未见项目上达到52%的准确率,与在同一人群数据上训练的有监督随机森林仅差6个百分点(pp);(2)存在稳定的构念可预测性层级,从党派态度的67%到主权问题的23%;(3)方差崩溃和安全对齐效应——两个常被引用的LLM局限性——比先前报道的更为微妙,方差崩溃同样影响有监督模型,而安全对齐效应在不同模型家族间差异显著。这些发现阐明了硅采样的前景与局限。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:34

# 跨调查迁移的硅采样方法

来源:https://arxiv.org/abs/2607.03091  
查看 PDF (https://arxiv.org/pdf/2607.03091)

> **摘要**:硅采样——利用大型语言模型(LLMs)模拟人类调查受访者——已成为增强传统调查研究的潜在方法。然而,大多数评估依赖分布层面的比较而非个体层面的预测,这可能导致将模式匹配与连贯的受访者层面预测混为一谈。我们提出跨调查迁移(cross-survey transfer)这一更为严格的评估框架:模型需根据受访者对一组问题的回答,预测其对同一调查中完全不同问题的答案。利用2024年台湾选举与民主化调查(TEDS)数据、三个开放权重LLMs(270亿至1200亿参数)以及有监督机器学习基线,我们发现:(1)零样本LLMs在真正未见项目上达到52%的准确率,距基于同群体数据训练的有监督随机森林仅差6个百分点;(2)存在稳定的构念可预测性层级结构,从67%的政党态度到23%的主权观点不等;(3)方差坍缩与安全对齐效应——这两类常被引用的LLM局限——实际上比先前报告更为复杂:方差坍缩同样影响有监督模型,而对齐效应在不同模型家族间差异显著。这些发现厘清了硅采样的前景与边界。

## 提交历史

来自:Yihuang Kang [查看邮箱 (https://arxiv.org/show-email/90f46de8/2607.03091)] **[v1]**  
2026年7月3日,星期五,08:22:18 UTC(454 KB)

相似文章

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

使用项目反应理论审计LLM基准测试

arXiv cs.CL

本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。