基于历史文本的预训练语言模型

arXiv cs.CL 论文

摘要

本文介绍了 TypewriterLM,一个参数规模为 7.24B 的语言模型,仅基于 1913 年之前的英文文本进行训练;同时介绍了 TypewriterCorpus(一个包含 540 亿 token 的清洗后历史语料库)以及指令微调数据集,以避免时间泄露和前瞻偏差。此外,还提出了一个基准测试套件 History-Event,用于评估时间定位能力和泄露情况。

arXiv:2606.02991v1 Announce Type: new 摘要:我们介绍了 TypewriterLM,一个 7.24B 的历史语言模型(LM),仅基于 1913 年之前的英文文本进行训练。开发历史语言模型需要应对数据质量和可用性方面的挑战、防止时间泄露、设计时间一致的后训练流程,以及构建可靠的评估。为解决这些问题,我们构建了 TypewriterCorpus,一个包含 540 亿 token 的历史语料库,收集自多样化的档案和语言学标注来源,并进行了广泛的数据清洗和泄露缓解处理。此外,我们提出了基于词汇基础的指令微调(lexically grounded instructing tuning),这是一种后训练框架,限制回答必须直接基于历史源文档。利用该框架,我们构建了两个历史指令微调数据集:History-LIMA 和 History-SelfInstruct。为了评估能力与时间一致性,我们引入了 History-Event,这是一个用于评估能力、时间定位和数据泄露的基准测试套件。我们发布了 TypewriterLM 及所有相关资源,以支持未来对历史语言模型的研究。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:36

# 预训练历史文本语言模型

来源:https://arxiv.org/html/2606.02991

Xiaoxi Luo1,2, Zachary Shinnick3,4, Niclas Griesshaber4,5, Yixuan Wang1,2, Junchi Yu4, Freda Shi1,2, Philip Torr4, Yao Lu6,,  
1滑铁卢大学,2Vector Institute,3AIML,阿德莱德大学,4牛津大学工程科学系,5牛津大学经济与社会史牛津中心,6伦敦大学学院计算机科学系

\{x25luo,tyxw,fhs\}@uwaterloo.ca  
[email protected]  
[email protected]  
\{junchi.yu,philip.torr\}@eng.ox.ac.uk  
[email protected]

###### 摘要

我们介绍了 **TypewriterLM**,一个 7.24B 参数的历史语言模型(LM),仅使用 1913 年之前的英文文本进行训练。开发历史语言模型需要应对数据质量与可用性方面的挑战,防止时间泄露,设计时间上一致的后期训练流程,并构建可靠的评估体系。为解决这些问题,我们构建了 **TypewriterCorpus**,一个包含 54B token 的历史语料库,来自多样化的档案和语言标注来源,并通过广泛的数据清洗和泄露缓解措施进行构建。此外,我们引入了**基于词汇的指导性微调**,这是一种后期训练框架,要求模型回答直接来自历史源文档。利用该框架,我们构建了两个历史指导微调数据集:**History-LIMA** 和 **History-SelfInstruct**。为评估能力和时间一致性,我们引入了 **History-Event** 基准测试套件,用于评估能力、时间定位和数据泄露。我们公开发布 TypewriterLM 及所有相关资源,以支持未来对历史语言模型的研究。¹

¹模型和数据集可在 hf.co/typewriter-ai (https://huggingface.co/typewriter-ai) 获取。

# 预训练历史文本语言模型

Xiaoxi Luo1,2, Zachary Shinnick3,4, Niclas Griesshaber4,5, Yixuan Wang1,2, Junchi Yu4, Freda Shi1,2, Philip Torr4, Yao Lu6,††感谢通讯作者。,  
1滑铁卢大学,2Vector Institute,3AIML,阿德莱德大学,4牛津大学工程科学系,5牛津大学经济与社会史牛津中心,6伦敦大学学院计算机科学系

\{x25luo,tyxw,fhs\}@uwaterloo.ca  
[email protected]  
[email protected]  
\{junchi.yu,philip.torr\}@eng.ox.ac.uk  
[email protected]

## 1 引言

现代基础模型(Gemini Team,2025 (https://arxiv.org/html/2606.02991#bib.bib56); Yang et al.,2025 (https://arxiv.org/html/2606.02991#bib.bib58); OpenAI,2026 (https://arxiv.org/html/2606.02991#bib.bib57); DeepSeek-AI,2026 (https://arxiv.org/html/2606.02991#bib.bib22) 等)在广泛的自然语言任务上取得了令人瞩目的性能。然而,当用于研究历史背景时,它们偏向于现代风格和词汇分布(Underwood et al.,2025 (https://arxiv.org/html/2606.02991#bib.bib35))。此外,现代语言模型已在人们可能希望分析的历史事件和结果上进行过预训练,因此任何看似未卜先知的能力,实际上可能只是记忆后的后见之明,这被称为前瞻偏差(Sarkar and Vafa,2025 (https://arxiv.org/html/2606.02991#bib.bib41))。

| 查询 TypewriterLM | 响应 |
| --- | --- |
| 你认为近期欧洲会发生一场大战吗? | “当然……如果这个国家在九十天内与法国开战,我不会感到惊讶。” |
| 你知道阿尔伯特·爱因斯坦的广义相对论吗? | “……A·爱因斯坦教授,我们还尚未学会称他为物理学家……” |
| 什么是计算机? | “……一个进行乘法或除法的运算员……一个执行算术操作的人……” |

图 1:探测 TypewriterLM 对“未来”事件的了解。

最直接的解决方案是在严格的知识截止日期下训练语言模型,排除所选日期之后的信息。这种方法正吸引机器学习与人文学科的日益关注(Grigorian and Yaghoobian,2025 (https://arxiv.org/html/2606.02991#bib.bib30); Göttlich et al.,2025 (https://arxiv.org/html/2606.02991#bib.bib7); Levine et al.,2026 (https://arxiv.org/html/2606.02991#bib.bib8))。现代大型语言模型受益于大规模且多样化的网络收集语料库(如 Common Crawl),而历史数据仅能从 OCR 转录的有限来源获得。这是一种典型的数据受限预训练设置(Muennighoff et al.,2023 (https://arxiv.org/html/2606.02991#bib.bib33))。在后期训练阶段,指令微调通常依赖来自人类标注者或前沿模型的问答对。对于历史语言模型,这两种方式都不可行,因为每一种都会注入截止日期本应排除的现代信息和视角。最后,标准的现代基准通常与历史语言模型在时间上不一致,使得区分真正的推理局限与对现代语言和语境的不熟悉变得困难。

为应对这些挑战,我们整理了 **TypewriterCorpus**,一个 54 亿 token 的预训练语料库,来自多样化的来源,并经过严格的数据清洗流程以缓解时间泄露。为实现无泄露的后期训练,我们引入了基于词汇的指导性微调,模型回答直接来自历史源文档,并构建了 **History-LIMA** 和 **History-SelfInstruct**。利用这些资源,我们训练了 **TypewriterLM**,一个 7B 参数的语言模型,严格的知识截止日期为 1913 年,包括基础版和指令微调版两种变体。在评估方面,我们同时考察了下游能力和时间一致性。我们的基础模型在通用基准上表现出有竞争力的性能,而指令微调模型在使用现代 LLM 监督训练的其他历史语言模型中达到了可比性能。为评估时间一致性,我们构建了 **History-Event** 基准,包含 2344 个跨越 1700–2025 年的重要历史事件。通过基于困惑度的惊奇度评估,我们发现历史语言模型对截止日期后的事件表现出明显更高的惊奇度,而现代基线 Llama-3.1-8B 则在时间上保持相对平坦。这表明,预期的历史截止日期在模型学到的知识分布中得到了有意义的体现。

总结而言,我们的贡献如下:

1. 我们证明数据受限的预训练可以产生有竞争力且基于历史知识的语言模型,为人文学科和 NLP 的未来研究提供支持。
2. 我们在流程的每个阶段控制泄露:对 TypewriterCorpus 进行严格清洗;采用基于词汇的指导性微调,每个回答均来自截止日期前的文档(History-LIMA 和 History-SelfInstruct);以及构建历史对齐的评估套件(History-Event),端到端验证时间完整性。
3. 我们公开发布 TypewriterLM(基础版和指令微调版)以及完整流程,以支持这一新兴领域的透明研究。

## 2 相关工作

利用 LLM 进行时间预测任务的研究集中在整理时间受限的训练数据集上,旨在防止前瞻偏差——即模型在训练期间接触截止日期之后的信息。由于这种对测试集的接触会偏差模型的预测能力,因此缓解前瞻偏差的努力目前主要集中在金融应用上。例如,Yan et al. (2026 (https://arxiv.org/html/2606.02991#bib.bib23))、He et al. (2025 (https://arxiv.org/html/2606.02991#bib.bib24)) 和 Kelly et al. (2026 (https://arxiv.org/html/2606.02991#bib.bib60)) 引入了在 2000 年至 2024 年间按年截止日期训练的语言模型系列。这些模型每年训练约 1000 亿 token,最大模型包含 40 亿参数。我们解决同样的根本挑战,但使用更早的、“历史性”的截止日期——1913 年。这引入了额外的挑战,然而我们整理了超过 500 亿 token 的预训练语料库,用于训练一个 7B 参数的模型。

即使是前沿模型,报告的有效截止日期也各不相同,这凸显了从现代文本整理训练数据集的挑战(Cheng et al.,2024 (https://arxiv.org/html/2606.02991#bib.bib25))。由于历史文本语料库可以从在线可得的 OCR 转录来源抓取,它们仍然容易受到类似的泄露问题影响。一种潜在解决方案是直接从档案影像扫描中构建历史数据集。例如,Dell et al. (2023 (https://arxiv.org/html/2606.02991#bib.bib26)) 使用定制的 OCR 和布局检测流程构建了大规模的历史报纸数据集。Sarkar (2024 (https://arxiv.org/html/2606.02991#bib.bib27)) 随后使用该数据集训练了一系列基于 BERT 的 110M 参数模型,截止日期在 1900 年至 1963 年之间。相比之下,我们使用来自机构档案的 OCR 文本构建预训练语料库,因为由于历史文档的异质性,直接从图像构建文本数据集在大规模上仍然困难——尽管近期 VLM 的进展显示出朝着通用解决方案的有希望进展(Greif et al.,2025 (https://arxiv.org/html/2606.02991#bib.bib28); Griesshaber and Streb,2025 (https://arxiv.org/html/2606.02991#bib.bib29))。

近期将历史语言模型扩展到数十亿参数的努力突显了构建无泄露训练数据集的无上难度。Grigorian and Yaghoobian (2025 (https://arxiv.org/html/2606.02991#bib.bib30)) 训练了一个 1.3B 的语言模型,使用 1800 年至 1875 年的伦敦文本,并报告称 OCR 噪声(如“Digitized by Google”)仍在输出中出现。Levine et al. (2026 (https://arxiv.org/html/2606.02991#bib.bib8)) 进一步将这项工作扩展到 130 亿参数,使用了由 2600 亿 token 组成的预训练数据集。他们报告了时间泄露问题,因为模型在其 1930 年截止日期后,仍然知道 1936 年的美国总统是谁。其他努力包括 Ranke-4B,这是一个由一群经济史学家在 Göttlich et al. (2025 (https://arxiv.org/html/2606.02991#bib.bib7)) 中介绍的 LLM 系列,训练于 800 亿 token 上,截止日期在 1913 年至 1946 年之间;还包括一个基于维多利亚时代英国文本(1837–1899 年出版)训练的语言模型(Venturella,2026 (https://arxiv.org/html/2606.02991#bib.bib45));以及一个基于 1900 年前文本语料库训练的模型(michaelmla,2026 (https://arxiv.org/html/2606.02991#bib.bib46))。凭借我们在预训练和指令微调期间的数据过滤方法,我们旨在进一步减轻这一新兴研究领域中的数据泄露风险。

## 3 历史预训练

### 3.1 语料库构建

我们构建了 **TypewriterCorpus**,一个涵盖 1700–1913 年的历史英语语料库,其中 1700 年是近代英语晚期的起点(Barber et al.,2009 (https://arxiv.org/html/2606.02991#bib.bib1)),1913 年是第一次世界大战前一年。该语料库结合了大规模数字化书籍和精选的历史数据集,覆盖了多样化的领域、体裁和语域。语料库的大部分来自 Institutional Books(Cargnelutti et al.,2025 (https://arxiv.org/html/2606.02991#bib.bib3)),这是一个大规模的数字化书籍集合,来自哈佛图书馆的馆藏,涵盖文学、科学、法律和哲学等领域。我们进一步整合了 British Library Books(BL books; British Library Labs,2021 (https://arxiv.org/html/2606.02991#bib.bib4)),这是另一个由大英图书馆数字化的大规模历史书籍集合。为增加语言和风格多样性,我们还纳入了几个精选的历史语料库。议会话语由 Hansard(Brezina,2024 (https://arxiv.org/html/2606.02991#bib.bib5))代表;科学写作由 Royal Society Corpus v6.0(Fischer et al.,2020 (https://arxiv.org/html/2606.02991#bib.bib2))代表;法律和口语语言由 Old Bailey(Huber et al.,2016 (https://arxiv.org/html/2606.02991#bib.bib10))代表;文学性近代英语晚期由 The Corpus of Late Modern English Texts v3.1(CLMET; Diller et al.,2011 (https://arxiv.org/html/2606.02991#bib.bib9))代表。我们进一步纳入了较小的语料库,如 Corpus of English Dialogues(CED; Kytö and Culpeper,2006 (https://arxiv.org/html/2606.02991#bib.bib12))、The Lampeter Corpus of Early Modern English Tracts(Lampeter; Siemund and Claridge,1997 (https://arxiv.org/html/2606.02991#bib.bib11))、Corpus of Late Modern English Prose(CLME Prose; Denison,1994 (https://arxiv.org/html/2606.02991#bib.bib51))以及一个小册子集合(Bailyn,1965 (https://arxiv.org/html/2606.02991#bib.bib50)),以扩大对对话、小册子和散文风格的覆盖。

为提升文本质量,我们应用了多种归一化和过滤程序以去除 OCR 伪影。例如,OCR 系统经常在视觉列或行边界处插入空格(如“im- possible”),我们执行了保守的拆分词连接步骤。我们还移除了标点符号前的空格,并丢弃了符号密集的片段。关于 TypewriterCorpus 构建的更多细节可在附录 A.1 (https://arxiv.org/html/2606.02991#A1.SS1) 中找到。

数据清洗后,TypewriterCorpus 包含约 540 亿 token(按我们自定义的 BPE 分词器计数,§3.3 (https://arxiv.org/html/2606.02991#S3.SS3))。表 1 (https://arxiv.org/html/2606.02991#S3.T1) 总结了过滤和清洗后的语料库组成。Institutional Books 在数量上占主导地位(97.7%),而其余来源在体裁、语域和领域方面提供了重要的多样性。图 2 (https://arxiv.org/html/2606.02991#S3.F2) 展示了按十年划分的 token 分布,显示语料库主要集中在 1800 年至 1900 年之间。

### 3.2 泄露缓解

时间泄露对历史语言模型构成了重大挑战,因为档案文档经常包含现代元数据或注释。我们识别了几种常见的泄露来源,并应用基于规则的过滤来减少污染。

#### 机构来源元数据。
一些扫描的书籍包含所有权印章(如“哈佛学院图书馆”)、机构格言、目录标识符和由现代图书馆添加的捐赠者注释。我们从 Institutional Books 和相关档案来源中移除了此类来源元数据。

#### 网络和 HTML 伪影。
在语料库处理过程中引入的 URL 和 HTML 实体已从所有数据集中移除。

#### 出版与编辑元数据。
标题页版权信息行(如书籍价格、出版社地址)、归属行(如 Old Bailey 中的速记员和编辑信用)以及类似的编辑元数据被启发式地移除。

尽管进行了广泛的过滤,完全消除历史 OCR 语料库中的时间泄露仍然具有挑战性。因此,我们另外设计了后文所述的泄漏感知后期训练和评估协议。

表 1:TypewriterCorpus 过滤和清洗后的组成。Token 按我们自定义的 BPE 分词器(§3.3 (https://arxiv.org/html/2606.02991#S3.SS3))计数。参见标题

图 2:预训练语料库中按十年(1700–1913)划分的 token 数量。

### 3.3 训练设置

为避免现代词汇污染,我们在训练语料上训练了一个自定义的字节对编码(BPE)分词器(Sennrich et al.,2016 (https://arxiv.org/html/2606.02991#bib.bib13)),词汇表大小为 32,000,使用 tiktoken(OpenAI,2023 (https://arxiv.org/html/2606.02991#bib.bib17))中的 `o200k_base` 预分词策略。TypewriterLM 是一个 7.24B 参数的仅解码器 Transformer,遵循 Llama 3 架构(Llama Team, AI @ Meta,2024 (https://arxiv.org

相似文章

基于1800年代文本从头训练LLM(160GB数据集)

Reddit r/LocalLLaMA

作者详细介绍了使用160GB的1800年代英语文本从头训练LLM的过程,训练了一个5亿参数的评估模型,并计划训练一个20亿参数的模型,结果显示在历史问答方面有不错的前景。

从零构建一个复古风格的LLM

Hacker News Top

作者记录了从零构建一个340M参数LLM的过程,该模型仅使用1900年以前的文本进行训练,包括自定义数据集、训练脚本,并开源了模型和代码。

Tapered Language Models

Hugging Face Daily Papers

本文介绍了Tapered Language Models (TLMs),一种架构原则,将更多参数分配给早期层,更少分配给后期层,在不增加额外成本的情况下,持续改善多种架构的困惑度和下游性能。

LM预训练的泛化动态(阅读时间17分钟)

TLDR AI

本文揭示,在预训练过程中,语言模型会频繁且突然地在模式匹配与泛化行为之间切换,这种现象被称为“模式跳跃”(mode-hopping),并提出了一个用于研究该现象的小型评估套件。

大语言模型中的语言习得装置

arXiv cs.CL

本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。