超越原始转录:基于LLM的数字孪生的结构化人格提取

arXiv cs.CL 论文

摘要

本文提出了一种用于提取基于LLM的数字孪生人格信息的结构化方法,证明了结构化表示相比原始转录能提升预测精度,并提出了一个可适应不同任务的自动流程。

arXiv:2608.20344v1 公告类型:新 摘要:基于LLM的“数字孪生”旨在模拟个体在新环境中的行为或对新问题的反应,给定该个体先前反应的某种表示。一种常见方法是从调查转录或摘要响应中构建这种表示。先前工作表明,将长转录压缩为较短的LLM生成摘要不会显著降低预测准确性,表明信息量不是主要瓶颈。 在本文中,我们认为关键限制实际上是结构性的:在人格信息提供给模拟器模型之前是如何组织的。我们通过比较非结构化摘要和结构化人格表示来研究这一点。首先,我们引入一个手工制作的模式(BDE:背景、决策程序、评估),基于消费者行为理论,并表明在同质基准(Twin-2K-500)上,它相比原始转录将预测准确性提高了1.91个百分点,在gpt-5.4-mini和Qwen3-8B上也有类似增益作为稳健性检查。然而,这种固定结构在更异质的任务上不能泛化,其中性能在统计上与原始转录基线无法区分。 为了解决这一限制,我们提出一个自动结构发现流水线,其中LLM迭代地提出和优化特定任务的人格结构和提取提示。在一个包含13个不同子研究的基准上,这种方法恢复了性能,将平均准确性相比原始转录基线提高了1.91个百分点,并消除了使用固定模式观察到的显著损失。 总的来说,我们的结果表明,基于LLM的数字孪生的主要约束不是提供了多少信息,而是如何组织的——并且最优结构取决于任务。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:05

# 超越原始记录:基于LLM的数字孪生的结构化人格提取
来源:https://arxiv.org/html/2608.20344  
Iris Ye  
芝加哥大学布斯商学院  
[email protected]  
&Tianze Deng¹  
芝加哥大学  
[email protected]  
&Tianze Deng¹  
芝加哥大学  
[email protected]  
&Ozan Candogan  
芝加哥大学布斯商学院  
[email protected]

###### 摘要
基于LLM的“数字孪生”旨在模拟个人在新环境中或面对新问题时的可能行为与回应,其前提是获取该个人先前反应的某种表征。一种常见方法是从调查记录或据此生成的摘要中构建这种表征,并通过预测保留样本来评估性能。先前研究表明,将冗长的记录压缩为LLM生成的较短摘要并不会显著降低预测准确性,这表明信息量并非主要瓶颈。本研究认为,关键限制实则在于结构:即人格信息在提供给模拟模型前的组织方式。我们通过比较非结构化摘要与结构化人格表征来研究这一问题。首先,我们引入了一个基于消费者行为理论的、手工设计的框架(BDE:背景、决策程序、评估),并证明与原始记录相比,该框架在同质基准(Twin-2K-500)上将预测准确性提高了+1.91个百分点,在gpt-5.4-mini和Qwen3-8B作为稳健性检查上也取得了类似增益。然而,这种固定结构无法泛化到更具异质性的任务中,其表现与原始记录基线在统计上没有显著差异。为解决此局限,我们提出了一种自动结构发现流水线,其中LLM迭代地提出并完善特定任务的人格结构和提取提示。在一个包含13项多样化子研究的基准测试中,该方法恢复了性能,其平均准确性比原始记录基线提高了+1.91个百分点,并消除了使用固定框架时观察到的显著性能损失。总体而言,我们的研究结果表明,基于LLM的数字孪生的主要限制不在于提供信息的多少,而在于信息如何被组织——并且最优结构取决于具体任务。

## 1 引言
### 1.1 人格-结构差距
基于LLM的数字孪生旨在模拟个体在给定其先前数据表征的情况下,在新场景中可能的行为或反应。一种常见的实现方式是从每位受访者那里引出一份长调查,将所得记录传递给语言模型,并要求模型预测该受访者的保留样本回应;这正是我们研究的设定。Twin-2K-500数据集(Toubia et al., 2025b)为超过两千名受访者配对了500个输入问题与88个保留样本问题,涵盖17个不同的预测任务,提供了比先前数字孪生基准广泛的个体覆盖范围。后续的Mega-Study(Toubia et al., 2025a)——一项涵盖多样决策领域的19项预注册子研究——报告称,一个13K字符的LLM生成的人格摘要在预测准确性上与128K字符的原始记录(相当于Twin-2K-500中的500个输入问题)表现相当。这种对压缩的鲁棒性表明,信息量并非限制数字孪生准确性的关键约束。一个悬而未决的问题是,在信息到达模拟器之前,应如何组织这些信息。本文聚焦于这一问题,探讨如何构建人格信息以提高基于人格模拟器的准确性。在我们的方法中,对于每位受访者,一个提取LLM以原始记录和提取提示作为输入,生成一个*结构化人格*。模拟器在测试时基于此结构化人格进行条件化,并对其在保留项目上的预测进行评分以评估准确性(图1)。提取提示中的核心设计选择是其*结构*,它分为两个层次(图2)。  

图1:流水线:从原始记录经由结构化人格到准确性。  
#### 层次1(骨架)。此层次决定了在提取人格后,需要提取哪些子档案(如果有),以应对下游的决策问题或预测查询。例如,背景-决策程序-评估(BDE)结构使用代表身份、推理和偏好的三个子档案。  
#### 层次2(分配)。在给定层次1的骨架后,此层次决定了原始记录证据如何映射到每个子档案中。例如,BDE的背景子档案使用对应记录部分的人口统计学信息、大五人格、价值观和政治信仰条目来填充。给定一个结构,提取提示指示提取LLM生成一个按照层次1骨架划分的人格,其中每个子档案使用层次2指定的记录证据填充。第3.2节和3.3节详细阐述了该框架的两个具体实例——BDE和一个自动发现的结构——我们在两个主要实验中使用它们。如果一个人格是直接从原始记录生成的自由形式文档,没有使用下游预测问题来施加明确的骨架或分配规则,我们称其为*非结构化*人格。  

图2:人格结构的双层视图:层次1(骨架)和层次2(分配),由下游查询提供信息,生成提取提示,从而产生*结构化*人格;而*非结构化*人格是一个绕过两个层次的自由形式摘要。

### 1.2 贡献
#### 固定结构在同质任务族上有帮助,但可能无法泛化到异质任务(§4)。在Twin-2K-500的17个预测任务上,将人格信息分为身份、推理和偏好子档案的背景-决策程序-评估(BDE)结构,在整体准确性上分别比非结构化基线高出+2.49个百分点,比原始记录高出+1.91个百分点(完整的指标和对比见表2);该结果在gpt-5.4-mini和Qwen3-8B上也得到复现(附录C)。然而,当应用于19项异质的Mega-Study子研究时,相同的BDE结构在19项研究的汇总上与原始记录基本持平(表3)。  
#### 每任务自动发现结构能泛化到异质任务(§5)。一个反思性改进循环针对每个子研究搜索层次1和层次2。汇总准确性比原始记录提高了+1.91个百分点,比手工制作的BDE提高了+2.22个百分点,比非结构化基线提高了+1.40个百分点(表4);该结果在gpt-5.4-mini和Qwen3-8B上也得到复现(附录C)。  
#### 发布的工件。在接受后,我们将发布BDE提取提示、自动发现流水线的实现以及19个每子研究的自动发现结构,作为未来人格侧提示设计的即用基线。

## 2 相关工作
#### 基于LLM的数字孪生。关于LLM作为人类代理的研究范围,从汇总市场受访者模拟(Brand et al., 2023)到个体级生成式智能体群体(Park et al., 2024)。Twin-2K-500(Toubia et al., 2025b)引入了我们所构建的每受访者预测设定:每个LLM“孪生”以一位受访者先前调查答案的丰富记录为条件,被要求预测该受访者的保留回应。后续的Mega-Study(Toubia et al., 2025a)运行了19项预注册子研究——涵盖错误信息分享、奢侈品消费、雇佣算法、再分配偏好和叙事信念等多个领域——发现孪生的整体准确性接近人类重测信度上限,但添加更丰富的人格内容主要改善了参与者间相关性,而非个体级准确性。该研究并未回答*如何*组织人格信息,将其作为一个开放问题留下。
#### 提示设计与反思性提示演化。LLM输入的形式(而不仅仅是内容)塑造其生成行为。Brucks and Toubia (2025) 记录了提示架构在LLM响应中会产生大型、模型一致的伪影,而Gui and Toubia (2023) 将基于LLM的模拟框架化为一个因果推断问题,其中未充分指定的提示会导致遗漏变量偏差,而过度指定的提示则会导致焦点效应。最近的一条思路更进一步,将提示本身视为可学习的工件,通过自然语言对展开的反思(而非梯度信号)进行优化:GEPA(Agrawal et al., 2026)根据保留奖励演化模块的提示,DSPy(Khattab et al., 2024)将提示视为类似代码的可优化对象,而Voyager(Wang et al., 2023)为每任务生长一个可跨会话重用的技能库。我们的自动发现流水线遵循与GEPA相同的大致原则:它利用对展开反馈的自然语言反思来迭代优化提示。在我们的设定中,这一原则被应用于上游的人格提取问题。演化后的提示决定了人格包含哪些类别的行为证据以及它们如何组织,而下游的模拟器保持固定。我们的目标是使用反思性提示演化作为工具,为数字孪生模拟发现子研究特定的表征结构。
#### BDE结构的行為科學基礎。对于Twin-2K-500评估的消费者行为结果,一个以人格为条件的LLM可能需要恢复三种行为上不同的信号:身份(受访者*是谁*)、推理程序(*如何*决策)和偏好(*想要什么*)。每个维度都独立地植根于消费者行为理论:身份基于Engel–Kollat–Blackwell模型(Engel et al., 1968)和计划行为理论(Ajzen, 1991);推理基于行为推理理论(Westaby, 2005)和适应性决策者框架(Payne et al., 1993);偏好基于Falk et al. (2018) 和Bettman, Luce与Payne的构建性选择理论(Bettman et al., 1998)。自由形式的摘要(即非结构化人格)使这些维度交织在一起;而BDE结构化人格在模拟器的上游就将它们分离开来。
#### LLM内部的人格维度。多维度结构也可能与LLM处理人格的方式一致:Anthropic最近的人格轴研究(Lu et al., 2026)发现LLM行为部分受内部化人格轴之间选择的影响,因此一个多维度结构化人格可能激活匹配的组合,而不是向空白的预测器描述一个人。从这个角度看,BDE是一个同时暴露三个行为轴的固定配方,而自动发现流水线是针对任务寻找最佳激活该任务正确行为证据的轴组合的任务级搜索。

## 3 前提条件与实验设计
### 3.1 数据集与评估
#### Twin-2K-500。我们使用Twin-2K-500(Toubia et al., 2025b)作为所有人格输入和保留任务的来源:每位受访者500个输入问题,以及跨17个预测任务的88题保留评估块。标准基线将原始的一问一答记录逐字作为模拟器提示中的人格上下文组件。我们报告三个每人格准确性指标,在n=50的人格面板上取平均值:*整体*(17个预测任务)、*认知偏差*(保留的启发式与偏差条目)和*定价*(40项支付意愿块)。每项的评分规则以及偏差/定价项目列表见附录A;两个指标的示例复现于附录G。
#### Mega-Study。Mega-Study(Toubia et al., 2025a)运行了19项预注册子研究,涵盖错误信息分享、奢侈品消费、雇佣算法、再分配偏好和叙事信念等领域,这使其成为检验单一手工设计人格结构泛化能力的自然测试。每个子研究从Twin-2K-500池中抽取自己的n=50人格面板,并按照Mega-Study的范围归一化准确性进行评分。我们按照Toubia et al. (2025a) 的行约定计算跨子研究的整体准确性。完整细节见附录A。

### 3.2 BDE结构
我们将BDE结构定义为一个三部分的人格表征。层次1将人格划分为三个子档案:背景(bg)、决策程序(dp)和评估档案(ep)。这些子档案对应于第2节(第3段)所论证的、行为上不同的维度:身份、推理程序和偏好。层次2指定了如何从受访者的输入侧Twin-2K-500问答记录以及下游预测问题的文本中填充每个子档案,而不接触受访者的保留答案。附录B给出了一个匿名受访者的三部分表征的完整示例。接下来我们详细说明每个子档案的层次2内容。
#### 背景档案(bg)。*背景档案编码受访者是谁、知道什么以及相信什么。* 它使用人口统计学信息和大五人格、直接报告的24项价值观量表、政治和政策信仰、经过事实测试的知识(如金融素养和基本概率),以及三个自我报告的可靠性指标来填充:默认同意倾向、社会赞许性,以及输入侧原始问题中所述偏好与行为偏好之间的差距。
#### 决策程序档案(dp)。*决策程序档案编码受访者在不确定性下如何推理。* 它使用关于推理风格、努力调节、认知闭合需求和决策策略的证据来填充:认知需求及认知测试错误模式、认知闭合需求、最大化量表、

相似文章

程序问题:面向数据驱动的公民商议的行动感知LLM角色建模

arXiv cs.CL

一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。

在LLM个性化中重新聚焦人类

arXiv cs.CL

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。