TimeCapsule:生成式幻觉作为历史意义构建的方法

arXiv cs.CL 论文

摘要

本文介绍了TimeCapsule,一个1.2B参数的LLM,仅在维多利亚时期文本(1800-1875年)上训练,用于为现代概念生成历史上合理的类比。与GPT-2相比,在维多利亚散文上实现了45.4%的困惑度降低,同时通过结构化地对未来无知,展示了计算式意义构建。

arXiv:2607.24750v1 公告类型:新 摘要:大型语言模型(LLM)在时间上过度暴露:它们在庞大的当代语料库上训练,编码了现代概念,使其成为不可靠的过去叙述者。我们提出了TimeCapsule,一个1.2B参数的LLaMA风格因果模型,仅在维多利亚时期文本(1800-1875年)上训练,作为一个认识论上孤立的生成式档案。定量评估显示,在保留的维多利亚散文上,与GPT-2基线相比,困惑度降低了45.4%,而更大的当代因果模型通过更广泛的预训练实现了更低的原始困惑度,但缺乏时间隔离。TimeCapsule展示了计算式意义构建,为不熟悉的现代概念生成历史上合理的类比解释(例如,将计算机描述为“肥大的肺”)。与两位人文学者进行的定性解释学探查揭示了一场真实性危机,因为两人都将大约40%的真实维多利亚文本片段误判为机器生成的。我们认为,对未来的结构性无知将幻觉转化为对19世纪本体论的阐释探针。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# TimeCapsule: 将生成式幻觉作为历史意义建构的方法
来源:https://arxiv.org/html/2607.24750
\(2026\)

###### 摘要

大型语言模型在时间上存在过度暴露问题:它们基于庞大的当代语料库进行训练,编码了现代概念,这使其成为不可靠的历史叙述者。我们提出TimeCapsule,一个仅基于维多利亚时期文本(1800–1875年)训练的参数为12亿的LLaMA风格因果模型,作为认识论上隔离的生成式档案。定量评估显示,在保留的维多利亚散文上,其困惑度比GPT-2基线降低了45.4%,而更大的当代因果模型虽然通过更广泛的预训练实现了更低的原始困惑度,但缺乏时间上的隔离性。TimeCapsule展现出计算性意义建构能力,能为陌生的现代概念生成历史上合理类比的解释(例如,将计算机描述为“一个过度发达的肺”)。一项与两位人文学者共同进行的定性阐释学探查揭示了一种真实性的危机,因为他们都将大约40%的真实维多利亚时期节选误判为机器生成。我们认为,对未来世界的结构性无知,将幻觉转变为了探询十九世纪本体论的阐释工具。

生成式档案, 选择性时间训练, 数字遗产, 去殖民化, 物质性, 幻觉, 意义建构

††journalyear:2026††copyright:cc††conference:创造力与认知; 2026年7月13–16日; 英国伦敦††booktitle:创造力与认知 (C&C ’26), 2026年7月13–16日, 英国伦敦††doi:10.1145/3803784.3807554††isbn:979-8-4007-2583-8/2026/07††ccs:计算方法 词汇语义学††ccs:应用计算 媒体艺术††ccs:计算方法 自然语言生成††ccs:以人为中心的计算 HCI理论、概念与模型## 1. 引言

1969年,乌利波作家乔治·佩雷克出版了《消失》(La Disparition),一部长达300页、全篇未使用字母“e”的小说(Bellos, 2010 (https://arxiv.org/html/2607.24750#bib.bib25); Perec,1969 (https://arxiv.org/html/2607.24750#bib.bib26))。佩雷克(Perec,1969 (https://arxiv.org/html/2607.24750#bib.bib26))的这一限制并非缺陷,而是一种生成引擎;这种省略迫使叙事进入奇特、迂回的路径,创造出一种完全由缺失之物定义的独特美学质感。设计历史性人工智能需要类似的战略性省略行为。为了真实地模拟过去,一个模型不能仅仅是“知道”历史;它必须在结构上无法知道现在。

生成式AI系统的吸引力在于它们有潜力构建与过去之声的动态相遇。我们想象一种时间界面,它连接的不是某个人,而是一个时代。然而,当前的大型语言模型仍然受到一种结构性“现时主义”的限制。它们在2024年的Common Crawl等语料库上训练,无法从其表征中减去当代的认识论;因此,即使被提示以维多利亚时代的人的口吻说话,它们也倾向于历史小说评论家常称之为“古装剧”的模式,即复制历史风格,但当代的假设却悄然支配着人物塑造和世界观。这些模型能轻易模仿十九世纪的措辞,但却嵌入了现代的科学、政治和伦理框架。正如Underwood等人(Underwood等人,2025 (https://arxiv.org/html/2607.24750#bib.bib4))所展示的,微调可以接近风格表面,但最终会产生“风格赝品”,无法捕捉构成历史思维的深层语义架构。

现代LLM隐喻性地类似于一个知道得太多的时间旅行者。当被要求模拟历史人物时,它们会不可避免地引入那些时代所无法获得的知识。例如,OpenAI的GPT-5.1将“飞机”定义为“一种翱翔于云层之上的交通工具”。虽然这在当今的描述上是正确的,但在1875年的模拟中,这样的回答标志着深刻的认知论失败:它暴露了模型无法栖居在一个动力飞行尚无法想象的世界中。因此,要实现历史保真度,需要的不仅仅是风格模仿;它要求从信息检索转向“生成式档案化”,即通过限制训练数据,使模型受限于过去的认知条件。

为了实现这一转变,我们引入了TimeCapsule,一个完全基于1800年至1875年的文学、议会记录和期刊从头开始训练的语言模型。借鉴海尔斯(Hayles,2000 (https://arxiv.org/html/2607.24750#bib.bib12))关于“技术无意识”——即在显性设计层面之下塑造计算系统的嵌入性假设和约束——的概念,以及基尔申鲍姆(Kirschenbaum,2012 (https://arxiv.org/html/2607.24750#bib.bib13))对“法医物质性”的阐述,我们概念化了所谓的“认识论事件视界”(图1 (https://arxiv.org/html/2607.24750#S1.F1)):模型的训练数据在此时间边界终止,未来世界知识无法越过此边界。

参照图标题图 1. 时间边界。训练数据终止于1875年,形成了一个认识论事件视界。1875年后的技术和含义(例如:飞机、电子计算机、互联网)落在了“未知领域”(terra incognita)中,迫使模型生成维多利亚时代式的类比解释。一个说明认识论事件视界的时间线图。时间线从1800年延伸至2000年。一个实心块代表训练语料库,覆盖1800年至1875年。1875年处的一条垂直线标志着时间边界。1875年后的区域被标记为“未知领域”。几个后1875年的技术被绘制在此区域内,包括电话、电灯、汽油汽车、飞机、无线电、电视、电子计算机和互联网,表明它们的现代技术含义位于模型的训练视界之外。这个视界不仅仅是一个截止日期,而是一个生成的结构性条件。模型不仅仅是模仿维多利亚时代;它被“限制”在其中。这种限制迫使系统进行苏赫等人(Suh等人,2023 (https://arxiv.org/html/2607.24750#bib.bib2))所称的“计算性意义建构”,这里按照维克(Weick and Weick,1995 (https://arxiv.org/html/2607.24750#bib.bib1))的理解,指在不确定性下对合理意义的回溯性构建,并通过克莱因等人(Klein等人,2007 (https://arxiv.org/html/2607.24750#bib.bib3))在信息不完备条件下的数据-框架推理模型来具体实施。当面对诸如“电话”或“计算机”等年代错乱的词元时,TimeCapsule无法访问现代定义。相反,它执行一种“本体修复”行为:它生成完全基于十九世纪语义资源的解释,例如,将计算机想象为非机器,而是一个“过度发达的肺”(源于当时的精算表)。通过这种方式,模型利用其历史时刻可用的概念基元来重构那些不可能之物。

本文将生成式档案定位为一个新的设计范式,并通过我们称之为“选择性时间训练”的技术方法加以实施。我们的贡献如下:

- **选择性时间训练 (STT)**:我们定义了一种在时间受限语料库上训练小型模型(12亿参数)的方法论。我们证明,这种方法在保留的维多利亚散文上达到了37.59的困惑度,与GPT-2基线相比相对降低了45.4%,同时保留了历史模拟所需的认知约束。
- **历时语义分析**:利用向量投影,我们定量地描绘了“时间的工业化”。我们证明,在维多利亚时代的潜在空间中,“时间”与“工厂”的语义关联强度是现代空间的2.1倍,为那个时代物质性的变迁提供了计算性的证据。
- **作为本体修复的幻觉**:我们将“幻觉”重新定义为非错误,而是通往历史逻辑的一扇窗。我们分析模型如何处理年代错乱现象,认为其“错误”答案揭示了十九世纪的潜在本体结构。
- **档案的诚实性**:我们进行了一项偏见地形分析(t-SNE),以表明模型保留了关于帝国和性别的历史偏见。对于去殖民化批判而言,保留殖民凝视是一种伦理上的必要性,而现代的安全过滤器则构成了一种历史修正主义。

## 2. 理论框架

在将时间限制引入作为TimeCapsule的核心设计原则之后,我们现在将该原则置于档案局限、物质性和计算解释等相关理论之中。接下来的章节将阐明,为什么模型对未来世界的无知不应被理解为一种缺陷,而是使历史意义建构成为可能的条件。

### 2.1. 档案的刻意无知

当我们谈及模型的“知识”或“无知”时,我们是比喻性地使用这些术语来描述历史认识论的统计编码,而非将系统拟人化为拥有意识觉知或认知理解。伊涅等人(Inie等人,2026 (https://arxiv.org/html/2607.24750#bib.bib30))将“认知器”(Cognizer)识别为拟人化语言中最普遍的一类,包含诸如“理解”、“知道”和“学习”等词,并认为这类术语误述了这些系统实际在做的事情:对训练数据的加权表征进行计算,而不是进行认知活动。模型并非“知道”维多利亚时代;更准确地说,它的权重构成了十九世纪文本模式的一种物质-话语表征。这个区别具有实际意义:正如周等人(Zhou等人,2025 (https://arxiv.org/html/2607.24750#bib.bib29))所证明的,AI文本输出的表面特征(例如呈现速度)会导致用户将诸如深思熟虑和审慎等人性化特质归因于仅仅是计算过程的东西,因此我们用来描述模型“学到”了什么词汇会塑造对其输出误置的认知信任。刘易斯(Lewis,2025 (https://arxiv.org/html/2607.24750#bib.bib31))关于艺术家如何调和生成式AI表面上的创造性输出与其缺乏真正意向性之间差距的研究,提供了一个并行的警示:无论是艺术生成还是历史语言建模,看似拥有能动性或理解的表象,都应与其背后的概率机制区分开来。

明确了这一区别之后,我们可以指认核心问题:NLP领域的主流范式假设“数据越多越好”,即在10万亿个词元上训练的模型必然优于在100亿个词元上训练的模型。这种被本德等人(Bender等人,2021 (https://arxiv.org/html/2607.24750#bib.bib15))著名地批评为“随机鹦鹉”现象的逻辑,认为智能是规模的函数。然而,这种最大化逻辑与档案的本质是背道而驰的。正如比尔德(Beard,2026 (https://arxiv.org/html/2607.24750#bib.bib23))所论证的,人类记忆(以及回忆录形式)的定义性特征是它的有限性。回忆录作者不知道自己的死亡;日记作者不知道那天早上吃的早餐的地缘政治后果。全知会摧毁生活经验的独特质感。当一个当代的基础模型(例如GPT-5)利用其庞大的训练数据来模拟维多利亚时代的视角时,它必须主动“压制”其对二十世纪的知识,扮演一个角色,并小心翼翼地避免任何会暴露其对未来知识了解的提及。TimeCapsule通过强制执行前述的认识论事件视界(图1 (https://arxiv.org/html/2607.24750#S1.F1))来拒绝这种表演性的压制:模型并非“假装”不知道飞机;它“无法”知道。

### 2.2. 法医物质性与潜在物质性

基尔申鲍姆(Kirschenbaum,2012 (https://arxiv.org/html/2607.24750#bib.bib13))认为,数字对象并非抽象比特,而是磁碟上的物理刻痕,会受到磨损、错误和限制的影响,他将此概念称为“法医物质性”。我们将这种物质主义逻辑向内延伸,从存储介质的表面延伸到潜在空间的几何结构,提出高维语义关系构成了一种“潜在物质性”:以向量形式编码的历史话语的物理残留。这种对数字对象物质基底的关注,与媒体考古学坚持计算系统带有其物理和历史生产条件痕迹的观点产生共鸣(Parikka,2013 (https://arxiv.org/html/2607.24750#bib.bib22))。这一转向与HCI研究中一条脉络相似,该脉络将生活经验的累积痕迹(收听历史、个人数据档案以及日常交互)视为具有质感、重量和时间颗粒度的对象,而非抽象记录(Odom and Duel,2018 (https://arxiv.org/html/2607.24750#bib.bib34); Odom等人,2020 (https://arxiv.org/html/2607.24750#bib.bib35))。正如我们在第4.1节 (https://arxiv.org/html/2607.24750#S4.SS1)中所展示的,我们模型中“时间”与“工厂”之间的向量距离并非随机数字;它是工业资本主义在十九世纪对语言施加压力的可测量的、物质性的足迹,一种与任何磁碟刻痕一样可恢复的潜在铭文。通过将模型的权重视为一种档案文物,一个“冻结的”概率分布,我们超越了莫雷蒂(Moretti,2013 (https://arxiv.org/html/2607.24750#bib.bib18))的“远距离阅读”、安德伍德(Underwood,2019 (https://arxiv.org/html/2607.24750#bib.bib11))的计算文学史,以及文化组学传统(Manovich,2020 (https://arxiv.org/html/2607.24750#bib.bib20); Michel等人,2011 (https://arxiv.org/html/2607.24750#bib.bib21))。这些方法是从外部分析档案,而TimeCapsule则是通过从档案内部生成文本来探查其潜在本体论。

### 2.3. 作为生成性设计材料的时间约束

HCI在慢技术方面的研究提供了一个有用的先例,即不将时间视为一个中立的背景条件,而将其视为一种设计材料。正如哈尔纳斯和雷德斯特伦(Hallnäs and Redström,2001 (https://arxiv.org/html/2607.24750#bib.bib32))所阐述的,慢技术并非低效或阻碍性的技术;它是旨在“放大事物的存在感”并为反思提供时间,而非将其压缩至任务完成状态的技术。他们强调的关键区别在于“时间消失”——当技术作为无摩擦工具运作时发生的情况——与“时间显现”——当一个设计制品打开一个充满在场感、好奇心和阐释性参与的空间时发生的情况。这种区别对于TimeCapsule至关重要。

相似文章

在极限中生成,含有无限多个幻觉

arXiv cs.CL

本文分析了极限中的语言生成,引入了一个精度概念来研究召回率-精度的权衡。研究表明,当对手隐藏大部分目标语言时,允许无限多个幻觉(频率递减)可以提高召回率。