我们通过恢复十年Photoshop手动操作的57.5万张裁剪标签,实现书籍数字化自动化——增加数据、使用ResNet-50和提升分辨率均告失败;而每本书仅需十次操作员点击却超越了这些方法 [P]

Reddit r/MachineLearning 论文

摘要

作者详述了一个通过从Photoshop手动工作中恢复裁剪标签,实现乌尔都语文献书籍数字化自动化的项目。研究发现,每本书十次操作员点击优于扩大数据规模或增加模型复杂度,并讨论了使用神经网络和传统技术的修复方法。

我是作者。Ibteda Digital Library是巴基斯坦的一个私人社区档案馆——十年来,我们使用DIY相机装置数字化稀有的乌尔都语书籍(石印本、字典、期刊),并在Photoshop中手工完成每一页。当我们结束日常运营时,我意识到这1,765本书中的575,729页完成页面记录了十年的裁剪决策,因此我将它们重新注册到原始照片(使用SIFT + MAGSAC,并设置保守的接受阈值),并将恢复的几何信息用作监督信号。对于这个子版块,负面结果可能才是最有趣的部分。将训练书籍从378本扩展到572本并没有提高未见书籍的pass@80。ResNet-50(训练拟合更好,验证集持平,校准后变差)、1024像素输入或空间头也没有效果。每本书的错误分析显示了原因:失败主要是由于每卷的近乎恒定偏移——我们操作员偏好的页边距设置,这在新书的像素中并不存在。每本书十次操作员校正的裁剪(逐元素中位数残差)将验证集上的pass@80从0.71提高到0.83。十个标签超越了我们尝试的所有扩展手段。对于修复(污渍/印章移除),我们仅将神经网络用于检测——U-Net提议移除区域,传统的OpenCV重建纸张,而掩码之外的所有内容与原始图像逐字节相同。标签使用了REMOVE/KEEP/IGNORE状态,并且任何被擦除的乌尔都语变音符号都会阻止部署,无论IoU如何。更严格的标签标准不仅提高了标记IoU(从0.56到0.60),还使变音符号的误报降至零。我真诚地想征求两点意见:(1) 是否有人建模过依赖不可见人类偏好而非可见结构的文档边界——有没有关于此类每实例残差校准的先验工作?我们下一步的计划是直接以校准样例为条件训练模型(少样本内嵌推理),而不是事后使用中位数。(2) 有没有任何受约束的扩散/修复设置能保证在声明的支持区域外零修改,或者传统填充仍然是档案工作的唯一可靠选项?完整的训练方案、标签挖掘阈值和路由规则均在复现合同附录中。代码/权重发布仍在档案审查中——我知道,很抱歉——但我很乐意在此回答关于该方法的任何问题。特别说明:不在我们路线图上的是更大的主干网络。我们测试过;缺失的信息不在像素中。链接
查看原文

相似文章

使用合成数据构建快速多语言OCR模型

Hugging Face Blog

NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。

@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……

X AI KOLs Timeline

Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。