标签
AI Historian是一个AI智能体系统,帮助历史学家组织和验证分散历史叙事中以人为中心的时间线索,降低历史研究的成本,同时实现高精度的时间定位。
本文以基于最小对立的诊断框架,研究机器翻译的自动评估指标是否适用于文言文到英语的翻译。结果发现所有指标都存在盲点,其中 MetricX24 整体表现最佳。
Ancient Library 是一个在线阅读器,提供 1,060 部希腊和拉丁经典作品,点击任意单词即可显示其词元、词形变化和完整词典条目。
Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。
This paper presents a computational framework for automatically compiling collected commentaries on classical Chinese texts, preserving contextual dependencies of inline notes via prompt chaining and cross-source clustering.
本文比较了受训中的语言学家、一位训练有素的语言学家和LLM在使用评价理论标注评价性语言时的表现,发现LLM表现出色,能够辅助完成复杂的标注任务。
This paper recasts fine-grained intertextuality extraction in Classical Chinese histories as an agentic LLM task, grounding reuse in exact character spans and a five-dimension typology, validated by expert-adjudicated benchmarks and scaled to the Twenty-Four Histories.
本文介绍了TimeCapsule,一个1.2B参数的LLM,仅在维多利亚时期文本(1800-1875年)上训练,用于为现代概念生成历史上合理的类比。与GPT-2相比,在维多利亚散文上实现了45.4%的困惑度降低,同时通过结构化地对未来无知,展示了计算式意义构建。
本文探讨了机器学习方法(包括基于编码器的模型和微调的大型语言模型)在大型文学语料库自动主题索引中的应用,以伏尔泰全集为测试案例。最佳模型的F1得分高达0.67,为大型文学和历史版本的结构化访问提供了启示。
本文提出了用于逆转中世纪文本中字符集简化和缩写的神经方法,采用一对一和带状RNN,并通过自监督或平行语料库进行训练,同时介绍了一个用于字母还原的Python库。
本文介绍了ICDAR 2026的HIPE-OCRepair-2026竞赛,评估了使用LLM对英语、法语和德语历史文档进行OCR后校正的效果。结果表明,现代LLM系统能显著提升OCR质量,但在低噪声输入上的过校正仍是一个挑战。
介绍了一个开源的离线逐词数字阅读器,用于《普拉斯塔纳特罗伊》及商羯罗注疏,具有可点击的词分析、索引功能,以及结合规则和LLM辅助方法的混合流水线。
本文提出一个两阶段实体解析流水线,将Sanadset语料库中的传述者姓名链接到两个传记数据库,从而构建一个富含跨源元数据的大型传述图谱。
本文介绍了欧洲LLMs4EU项目与ALT-EDIC基础设施中的一个用例,重点通过整合知识图谱和多语种学术语料库,将基础模型适配至社会科学与人文学科(SSH)研究实践。该方法旨在支持问答、文献综述等任务,同时确保领域敏感性与法规合规性。
本文提出了一种可重复的机器学习流程,用于印加基普斯中的结构模式挖掘,利用开放基普斯存储库中的无监督聚类和监督分类来识别结构组并验证先前发现,所有代码和数据均公开可用。
本文系统研究了如何将时间元数据结构性地嵌入到面向历史文本的命名实体识别(NER)模型中。通过采用早期或晚期融合机制注入绝对和相对时间表示的实验表明,晚期融合策略在法语和德语历史数据集上展现出更稳健的性能。
本文对孟加拉佛教、性力派与毗湿奴派传统间的词汇传播进行了计算分析,考察了词汇与概念如何在各宗教社群间流动。
本文运用计量文体学方法,分析英语译本巴利经典中经藏、律藏和论藏之间的词汇差异。
本文使用TF-IDF和神经网络模型,基于《全唐诗》的语言特征预测诗人的地理籍贯,发现可检测的区域语言指纹、距离衰减效应以及时间对信号的调节作用。
本文介绍了Darshana Graph,一个用于比较印度哲学的平行注释语料库,并展示了文体测量与探索性图分析。