historical-language-models

标签

Cards List
#historical-language-models

基于历史文本的预训练语言模型

arXiv cs.CL · 2026-06-03 缓存

本文介绍了 TypewriterLM,一个参数规模为 7.24B 的语言模型,仅基于 1913 年之前的英文文本进行训练;同时介绍了 TypewriterCorpus(一个包含 540 亿 token 的清洗后历史语料库)以及指令微调数据集,以避免时间泄露和前瞻偏差。此外,还提出了一个基准测试套件 History-Event,用于评估时间定位能力和泄露情况。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈