historical-documents

标签

Cards List
#historical-documents

当知识库成为金标准:衡量实体级机器翻译中资源共享的评估循环

arXiv cs.CL · 23小时前 缓存

本文衡量了在低资源历史领域中,当知识库被用作实体级机器翻译的金标准时所产生的自指性评估循环,表明知识库注入带来的提升仅限于重叠片段,并不能反映真实的翻译质量。

0 人收藏 0 人点赞
#historical-documents

利用外部知识通过检索增强型大语言模型进行历史文档修复

arXiv cs.CL · 2026-07-27 缓存

本文介绍了ARI,一个利用检索增强型大语言模型修复历史文档中难以辨认部分的框架,通过将隐式的大语言模型知识与显式检索的外部历史背景相结合,显著提升了命名实体的修复效果。

0 人收藏 0 人点赞
#historical-documents

ICDAR 2026 HIPE-OCRepair竞赛:基于LLM的历史文档OCR后校正

arXiv cs.CL · 2026-07-10 缓存

本文介绍了ICDAR 2026的HIPE-OCRepair-2026竞赛,评估了使用LLM对英语、法语和德语历史文档进行OCR后校正的效果。结果表明,现代LLM系统能显著提升OCR质量,但在低噪声输入上的过校正仍是一个挑战。

0 人收藏 0 人点赞
#historical-documents

DistilledGemma:多语言历史文章中人物-地点关系抽取的效率与准确性平衡

arXiv cs.CL · 2026-06-30 缓存

本文介绍了DistilledGemma,一个用于从多语言历史报纸文章中抽取人物-地点关系的系统,该系统采用从26B参数的Gemma教师模型到2.3B参数的学生模型的三阶段知识蒸馏流程,在HIPE-2026共享任务中实现了具有竞争力的准确性和效率。

0 人收藏 0 人点赞
#historical-documents

学习古希腊字母形态的历时表征

arXiv cs.LG · 2026-06-25 缓存

本文介绍了三个数据集(Hell-Char、PaLit-Char、Med-Char),用于古希腊字母形态的历时表征学习,并提出了一种基于相似性加权的有监督对比损失函数,结合空缺驱动增强方法,以鲁棒地学习跨越数百年手写变化的字符嵌入。

0 人收藏 0 人点赞
#historical-documents

利用形态学进行历史文字计量分析

Hugging Face Daily Papers · 2026-06-08 缓存

本文提出了一种基于Transformer的架构,结合原型学习,仅利用行级转录即可从历史文档中进行可扩展的古文字测量,并在仅有少量训练数据的160页手抄本上证明了其有效性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈