我们通过恢复十年Photoshop手动操作的57.5万张裁剪标签,实现书籍数字化自动化——增加数据、使用ResNet-50和提升分辨率均告失败;而每本书仅需十次操作员点击却超越了这些方法 [P]
摘要
作者详述了一个通过从Photoshop手动工作中恢复裁剪标签,实现乌尔都语文献书籍数字化自动化的项目。研究发现,每本书十次操作员点击优于扩大数据规模或增加模型复杂度,并讨论了使用神经网络和传统技术的修复方法。
我是作者。Ibteda Digital Library是巴基斯坦的一个私人社区档案馆——十年来,我们使用DIY相机装置数字化稀有的乌尔都语书籍(石印本、字典、期刊),并在Photoshop中手工完成每一页。当我们结束日常运营时,我意识到这1,765本书中的575,729页完成页面记录了十年的裁剪决策,因此我将它们重新注册到原始照片(使用SIFT + MAGSAC,并设置保守的接受阈值),并将恢复的几何信息用作监督信号。对于这个子版块,负面结果可能才是最有趣的部分。将训练书籍从378本扩展到572本并没有提高未见书籍的pass@80。ResNet-50(训练拟合更好,验证集持平,校准后变差)、1024像素输入或空间头也没有效果。每本书的错误分析显示了原因:失败主要是由于每卷的近乎恒定偏移——我们操作员偏好的页边距设置,这在新书的像素中并不存在。每本书十次操作员校正的裁剪(逐元素中位数残差)将验证集上的pass@80从0.71提高到0.83。十个标签超越了我们尝试的所有扩展手段。对于修复(污渍/印章移除),我们仅将神经网络用于检测——U-Net提议移除区域,传统的OpenCV重建纸张,而掩码之外的所有内容与原始图像逐字节相同。标签使用了REMOVE/KEEP/IGNORE状态,并且任何被擦除的乌尔都语变音符号都会阻止部署,无论IoU如何。更严格的标签标准不仅提高了标记IoU(从0.56到0.60),还使变音符号的误报降至零。我真诚地想征求两点意见:(1) 是否有人建模过依赖不可见人类偏好而非可见结构的文档边界——有没有关于此类每实例残差校准的先验工作?我们下一步的计划是直接以校准样例为条件训练模型(少样本内嵌推理),而不是事后使用中位数。(2) 有没有任何受约束的扩散/修复设置能保证在声明的支持区域外零修改,或者传统填充仍然是档案工作的唯一可靠选项?完整的训练方案、标签挖掘阈值和路由规则均在复现合同附录中。代码/权重发布仍在档案审查中——我知道,很抱歉——但我很乐意在此回答关于该方法的任何问题。特别说明:不在我们路线图上的是更大的主干网络。我们测试过;缺失的信息不在像素中。链接
相似文章
@0x0SojalSec: 想象一下,把一整本书喂给AI,它就能完美理解。一款全新的OCR模型,能一次读取一整本书……
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
使用合成数据构建快速多语言OCR模型
NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。
@DailyDoseOfDS_:在您自己的语言上微调DeepSeek-OCR!(100%本地)大多数视觉模型将文档视为巨大的序列…
DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。
@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
SmartPhotoCrafter:统一推理、生成与优化的自动摄影图像编辑
SmartPhotoCrafter 提出一条无需显式人工指令即可统一质量理解与增强的自动摄影图像编辑流水线,在真实感增强任务上超越现有生成模型。