审计合成回忆录:测量LLM生成自传中相对于生活文档记录的场景级别虚构

arXiv cs.AI 论文

摘要

本文审计了LLM生成的自传中相对于文档化真实语料库的场景级别虚构,发现96.7%的验证失败率,并贡献了一个可重复使用的审计工具和一个基础补救措施。

arXiv:2608.23640v1 公告类型:新 摘要:当一个大型语言模型(LLM)被要求写一个人的生平时,它写下的内容中有多少是实际发生的?我们提出了一种场景级别的案例研究审计——据我们所知,这是首次基于非系统性文献搜索,对LLM生成的自传相对于特定主题的真实语料库进行的量化审计。本论文的主题和作者是同一个人:使用对话式LLM起草了一本366天的“每日一页”第一人称轶事集,其文档化输入包括一个模板、两个示例日和每天的引言——而非她的语料库——随后使用分析前固定的四级量规对每一天在轶事场景级别进行了独立验证语料库的审计。我们将验证失败率定义为未被评为VERIFIED(场景被正面证实)的天数比例:366天中有354天失败,96.7%(Wilson 95% 置信区间 94.4-98.1%)。只有12天包含被证实的场景;19天(5.2%)断言了与记录积极矛盾的主张;主要的失败模式是基于事实的漂移——真实人物、雇主和设置在虚构场景内——尽管其测量比例因评分者而异。独立重新评分复制了主要结果(没有证据表明原始率被夸大),同时显示四分类法只有公平到中等的可靠性。使用当前命名模型以相同输入重新生成相同天数,在相同输入下重现100%验证失败;将生成锚定于主题语料库显著提高了验证率,同时留下了显著的剩余失败(83.3%)。我们贡献了测量方法、一个可重复使用的审计工具(其WEAK/UNVERIFIED边界我们显示为不可靠)以及一个具有量化效果的基础补救措施。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:10

# 度量LLM生成自传中针对真实生平记录的场景级虚构程度  
来源:https://arxiv.org/html/2608.23640  
2026年8月22日  

###### 摘要  

当大型语言模型(\(LLM\))被要求撰写一个人的生平时,其生成内容中有多少真实发生过?我们进行了一个场景级的案例审计——据我们所知,这是首次基于非系统文献检索,将LLM生成的自传与针对特定主体的真实记录语料库进行量化对比的审计。审计主体与本文作者为同一人:使用对话式LLM起草了一本366天的“每日一页”第一人称轶事集,其记录输入的模板为:模板、两天示例以及每日引文——而非该主体的语料库。随后,我们使用分析前即确定的四级量表,对每一天在轶事场景层面与独立验证语料库进行了审计。我们将*验证失败率*定义为未被评为“已验证”(场景得到正面证实)的天数比例:366天中有354天失败,占96.7%(Wilson 95% CI 94.4–98.1%)。仅有12天包含得到证实的场景;19天(5.2%)所主张的内容被记录积极反驳;主要的失败模式是*有依据的偏移*——即真实的人物、雇主和环境被置于虚构的场景中——尽管其测量比例因评估者而异。独立的重新评级复现了主要结论(没有证据表明原始比率被夸大),同时显示该四分类法仅具有“一般”到“中等”的可靠性。在相同输入条件下,使用当前主流模型重新生成相同内容,在验证中同样出现100%的失败率;基于主体语料库的生成显著提高了验证率,但仍有大量残余失败(83.3%)。我们的贡献包括:这项测量结果、一个可重复使用的审计工具(我们证明了其“弱/未验证”边界不可靠)、以及一个具有量化效果的有依据生成补救方案。  

## 1 引言  

利用个人数据模拟人类的系统正从研究原型\[8 (https://arxiv.org/html/2608.23640#bib.bib10), 9 (https://arxiv.org/html/2608.23640#bib.bib11), 14 (https://arxiv.org/html/2608.23640#bib.bib12)\]走向个人应用:数字孪生、合成传记以及通过提示LLM并要求其以第一人称书写“她的记忆”而构建的代笔人生叙事。此类系统的评估集中在态度、调查回答和表面事实上\[9 (https://arxiv.org/html/2608.23640#bib.bib11), 14 (https://arxiv.org/html/2608.23640#bib.bib12)\]。情节层面——系统对一生所断言的具体场景——尚未针对该人生平的书面记录进行审计,尽管实验室研究表明,对话式AI可以在人类受试者中植入虚假记忆\[3 (https://arxiv.org/html/2608.23640#bib.bib14)\]。  

本文报告了一个完整、自然发生的这种失败模式实例,在发表前被发现并测量。在两次起草会议之间,一位专业作家(即本文作者)制作了一本为期一年的礼物书:366个每日条目(平均每个约543词;总计198,949词),以第一人称撰写关于她自己的生活。存储库文档明确指出这些条目经过了“AI填充”:使用对话式LLM起草(生成器记录见第7节 (https://arxiv.org/html/2608.23640#S7);其记录输入为模板和当天的引文——见下文)。在汇编衍生的每日一页版本之前,我们根据一个为此次审计专门编制的独立真实记录语料库,对366天中的每一天进行了场景级事实核查。所用量表于2026年7月13日——在本文任何分析进行之前——确定。  

我们提出三个研究问题(RQ)。  
**RQ1**:生成的轶事“记忆”中有多少比例能在场景层面通过独立记录的验证?  
**RQ2**:失败以何种*形式*呈现?  
**RQ3**:矛盾集中在哪里?这表明了何种补救方向?  

本研究具有通常意义上的可证伪性。如果366个场景中有一半或更多被评为“已验证”,那么“无依据生成”的框架将失效;如果验证失败主要由“未验证”而非“弱”场景主导,那么第6节 (https://arxiv.org/html/2608.23640#S6) 中的“有依据的偏移”解释也将失效。在统计结果出来之前,这两种结果都是可能的。  

我们的贡献包括:  
(a) 针对个人叙事生成中的虚构内容,基于特定主体真实记录(\(n=366\)个每日叙事;按我们的定义,96.7%在场景层面验证失败)的量化审计;  
(b) 编码并发布一个可重复使用的场景级审计工具——逐字引用的四级裁决量表,以及一个作为固定、已发布关键词筛选标准而实施的九主题循环错误前提分类法;  
(c) 在同一项目中指定的补救工作流程(仅改写教训;作者裁决优先);  
(d) 包含两名独立重新评级者的评分者间可靠性分析,得出了本文最具可迁移性的方法论发现:场景级虚构审计在二元层面(该天的场景是否成立?)是可靠的,但在分类层面仅为“一般”,因为该量表的“弱/未验证”边界依赖于一个未定义的“环境”概念。  

关于立场的说明塑造了后续的一切:审计的作者与被审计的主体是同一人。第8节 (https://arxiv.org/html/2608.23640#S8) 探讨了同意、隐私和自我审计的启示;第4.6节 (https://arxiv.org/html/2608.23640#S4.SS6) 探讨了方法论上的启示。  

## 2 相关工作  

LLM中的幻觉与虚构。  
幻觉已被广泛综述:事实性与忠实性分类法\[4 (https://arxiv.org/html/2608.23640#bib.bib1), 5 (https://arxiv.org/html/2608.23640#bib.bib2)\],缓解措施综述\[17 (https://arxiv.org/html/2608.23640#bib.bib4), 12 (https://arxiv.org/html/2608.23640#bib.bib5)\],以及一篇2026年的综合评述\[2 (https://arxiv.org/html/2608.23640#bib.bib6)\]。10 (https://arxiv.org/html/2608.23640#bib.bib3) 主张使用*虚构*(confabulation)一词——指为填补空白而进行的流畅、自信的捏造——我们采纳此术语:被审计的条目并非随机噪声,而是连贯、自信的第一人称叙事。ReFACT\[13 (https://arxiv.org/html/2608.23640#bib.bib9)\]通过细粒度标注对科学虚构检测进行了基准测试;我们的工具与此类似,但基于主体真实记录而非百科全书知识。  

长篇生成的事实性测量。  
FActScore将长篇文本分解为原子级主张,并根据知识源逐一核查\[7 (https://arxiv.org/html/2608.23640#bib.bib7)\];长篇事实性基准测试根据世界事实评估模型\[15 (https://arxiv.org/html/2608.23640#bib.bib8)\]。我们的审计是场景级的类似物:每日条目被分解为其轶事场景,而参考作品不是百科全书,而是一个记录某人一生的独立语料库。据我们所知,此前没有基准测试使用经过验证的人类生命语料库作为真实记录。  

人物模拟与数字孪生。  
生成式智能体根据个人资料和记忆产生可信行为\[8 (https://arxiv.org/html/2608.23640#bib.bib10)\]。基于访谈的智能体模拟了1000个真实个体\[9 (https://arxiv.org/html/2608.23640#bib.bib11)\],其保真度在态度和调查回答方面进行评估;人物框架工作明确区分了表面事实与深层人物特征保真度\[14 (https://arxiv.org/html/2608.23640#bib.bib12)\];从对话日志构建顾问的数字孪生也已得到展示\[16 (https://arxiv.org/html/2608.23640#bib.bib13)\]。我们的结果补充了缺失的情节维度:即使是*表面*情节内容——雇主、日期、命名事件——在大多数生成的日条目中也未能通过验证。  

虚假记忆与身份风险。  
3 (https://arxiv.org/html/2608.23640#bib.bib14) 表明LLM对话伙伴会在证人访谈中放大虚假记忆——这是风险的*消费*端。我们的研究大规模记录了互补的*生产*端:当被要求*撰写*一个人的过去时,LLM在96.7%的日条目中(按我们的定义)生成了无依据的场景。人物框架也会干扰事实性问答\[1 (https://arxiv.org/html/2608.23640#bib.bib17)\],这与我们关于第一人称叙事框架会诱发虚构的观察一致。  

角色一致性失败。  
RoleBreak和SHARP将角色扮演系统中的角色幻觉视为攻击面\[11 (https://arxiv.org/html/2608.23640#bib.bib15), 6 (https://arxiv.org/html/2608.23640#bib.bib16)\]。我们量化了同一类偏移,当“角色”是一个真实的、有记录的人,并且这种偏移是根据她的真实记录而非提示规范来衡量时。  

空白。  
幻觉已被综述;长篇事实性已根据百科全书式真理进行基准测试;人物模拟器已构建并评估态度;虚假记忆风险已在实验室中被展示;角色偏移已在对抗性情境下被描述。**尚无发表的研究逐场景地审计LLM生成的自传体内容与所描述人物书面记录的差异。** 本文填补了这一空白。  

## 3 数据与研究设计  

本研究基于三个语料库,均在本文分析会(2026年8月21日)之前确定;审计标签本身比分析会早五周。  

**嫌疑语料库(被审计内容)**。一本为期一年的“每日一页”书籍,包含366个每日第一人称条目(平均约543词/天;总计198,949词),为礼物版起草。源日历自身的README记录了这些条目经过“AI填充”:使用对话式LLM起草的长篇草稿。会话日志来源追溯(第7节 (https://arxiv.org/html/2608.23640#S7))已记录在案的生成器:OpenAI o3-pro设计了模板,gpt-4o / o3 / o4-mini-high在ChatGPT对话(2025年7-8月)中根据引文列表生成了条目,一次Cursor composer运行(2025年8月1日)执行了单次提示。衍生版本将每个条目压缩为一个约175词的页面(总计64,198词)。审计的月度文件标题为“每日一页”,但其轶事行在场景上与*长篇*条目一一对应,而非压缩页面:例如,5月1日的审计行描述了一个Evernote场景(三个利益相关者的交付物,凌晨2点哭泣),该场景仅出现在长篇源文件中;10月10日的行中“空旷的太平洋地平线”措辞同样只与长篇文本匹配。因此,我们将长篇条目视为被审计的文本。生成器接收的内容有精确记录(第7节 (https://arxiv.org/html/2608.23640#S7);results/original\_generation\_prompt.txt):一个模板、两个包含个人信息的示例日,以及来自commonsense.csv的每日引文——*而非*真实记录语料库。只有复现臂C接收了语料库摘录;2025年的原始版本和臂B/B2仅接收模板加引文输入;2025年运行中可能存在于对话上下文或来自预训练的任何额外传记材料均未记录。这对解释很重要:第5节 (https://arxiv.org/html/2608.23640#S5) 的“有依据的偏移”模式是在模型面前没有真实记录的情况下产生的。审计单元是*每日条目*,每个条目围绕一个轶事“记忆”场景加一个教训组织。书籍项目的构建管道(每个条目衍生一个约150-200词的页面,外加一个367行的引文索引)从这些条目机械派生;每日条目是审计的原子对象。  

**真实记录语料库(核查依据)**。为本次审计编制,独立于生成内容:(i)回忆录手稿《独角兽之后》及其编辑轶事账簿;(ii)回忆录《独角兽的诞生》;(iii)主体已发表的写作和演讲转录文本语料库(353k词,HEATHER\_CORPUS);(iv)为其专业数字双胞胎维护的演讲记录和知识库;(v)带有年代生活阶段注释的音乐目录;(vi)针对性网络核查。日历源本身、其每日一页衍生版本以及ChatGPT对话备份被*排除*在独立性之外——它们无法证实自己生成的内容。  

**审计标签(测量结果)**。2026年7月13日,每一天都获得了场景级裁决,记录在十二个月的表格中(每天一行:日期、轶事梗概、裁决、支持来源、证据说明),并在事实核查摘要文档中汇总。关键项目由主体直接裁定;记录了四项明确的作者确认,摘要说明作者确认优先于任何裁决。此标签集——而非任何新判断——是本文分析的数据集;第4.3节 (https://arxiv.org/html/2608.23640#S4.SS3) 至第5节 (https://arxiv.org/html/2608.23640#S5) 严格是对本文开始前即存在的文档的机械解析和聚合。  

**时间线**。  
条目生成(2025年7-8月;已记录;每日日期未记录)→ 场景级审计完成(2026年7月13日)→ 补救方案设计(同日)→ 数据集解析与分析(2026年8月21日)。  
本文未创建或修改任何审计标签。  

## 4 方法  

### 4.1 裁决分类法  

以下量表逐字引自2026年7月13日的审计摘要(FACT\_CHECK\_SUMMARY.md);它是一个预先陈述的工具,而非事后制定的方案。每一天的中心轶事场景仅获得一个裁决:  

- • **已验证** — “具体场景得到证实”;  
- • **弱** — “真实环境/人物,虚构的具体场景”;  
- • **未验证** — “无依据;泛泛的虚构”;  
- • **矛盾/标记** — “断言了关于她生活的虚假内容”。  

这些类别按与记录的证据关系排序,而非仅按严重性排序:*已验证*需要正面证实;*未验证*记录缺乏证据;*矛盾*需要正面证伪。*弱*对于人物模拟是关键类别:系统正确检索了真实依据材料(雇主、城市、人物),并围绕它虚构了具体内容。  

### 4.2 审计程序  

对于366天中的每一天,审计员从条目中提取当天的轶事场景,在真实记录语料库中搜索证实或矛盾,在月度表格中记录裁决(附支持来源引用和证据说明),并标记候选错误前提。当一项主张依赖于只有主体才能确定的事实时(例如,童年事故发生在13岁还是成年后;治疗史是否包括化疗),主体发布明确的书面裁决,摘要中的优先级规则——“作者确认(2026-07-13,优先)”——约束所有其他行。记录了四项此类裁决。本文中的健康相关内容仅限于这些裁决本身所述。  

### 4.3 解析与分析程序  

两个随文发布的脚本将审计表格转换为第5节 (https://arxiv.org/html/2608.23640#S5) 中的每个数字。  

**01\_parse\_factcheck.py** 读取十二个月表格,并为每天生成一行CSV数据。裁决单元格按固定顺序的固定规则进行规范化:任何包含“矛盾”的单元格→转为矛盾;否则前缀“已验证”→转为已验证;否则前缀“未验证”→转为未验证;否则前缀“弱”→转为弱;其他任何内容报告为未解析,永不静默丢弃。行以解析后的月/日为键;解析器明确报告重复项和未解析的候选行。输出:366行,零个重复键,零个未解析的裁决(parse\_report.txt)。  

**02\_analyze.py** 声明 \(n=366\),统计总体和每月的裁决情况,计算Wilson得分……

相似文章

诚实说谎:理解反射性代理中的记忆虚构

Hugging Face Daily Papers

本文识别了Reflexion风格代理中的记忆虚构现象,即代理存储了错误的任务解释,并在环境重置后持续坚持错误。作者引入了反射重复率(RRR)指标来检测该现象,并提出了一种缓解方法,用程序化失败信号提取替代开放式自我诊断。

陷入故事:多轮LLM对话中的叙事俘获

arXiv cs.AI

本文介绍了'叙事俘获',这是LLMs中的一种失败模式,其中模型在多轮道德咨询中与未受质疑的单方面叙述保持一致,并提出了一个包含5,078个场景的基准,用于在17个LLMs上衡量这一现象。