推进面向艺术字场景文本识别:数据集与方法
摘要
本文介绍了一个大规模合成数据集(WATER-S)和一个专用模型(WATERec),旨在推进面向艺术字的场景文本识别,在非规则艺术文本基准上取得了最先进的准确率。
查看缓存全文
缓存时间: 2026/06/25 05:17
论文页面 - 推动艺术字场景文本识别:数据集与方法
来源:https://huggingface.co/papers/2606.24484
摘要
本文介绍了一个大规模合成数据集和专用模型架构,通过提升不规则文本布局的数据多样性和模型灵活性,解决艺术文本识别的挑战。
WordArt(https://huggingface.co/papers?q=WordArt)(艺术字)具有高度定制化的字体、纹理和布局,这使得面向WordArt(https://huggingface.co/papers?q=WordArt)的场景文本识别(WATER)比通用场景文本识别(STR)更具挑战性。现有的STR数据集和方法通常围绕常规场景文本和固定模板输入构建,难以扩展到WATER领域。因此,我们旨在从数据和模型两个角度推动这一任务的发展。在数据方面,我们构建了一个200万规模的合成数据集——WATER-S,其规模比现有艺术文本数据提升了数百倍。WATER-S包含两个互补的子集:一个通过升级的渲染管线(SynthWordArt(https://huggingface.co/papers?q=WordArt))生成,提供高精度且可控的合成WordArt数据;另一个结合了Qwen3-VL进行提示挖掘和Z-Image进行图像合成,提高了现实多样数据的覆盖度。在模型方面,我们提出了WATERec,它采用支持任意形状输入的视觉编码器和自回归解码器来建模复杂布局,从结构上打破了固定模板STR在WordArt上的瓶颈。实验表明,该架构优于以往的STR方法,在WordArt等不规则文本上达到了最先进水平。结合WATER-R(从现有真实STR数据中精心重组),我们基于新合成数据和模型设计的强基线在WordArt-Bench(https://huggingface.co/papers?q=WordArt-Bench)上达到了90.40%的准确率,大幅超越了通用型及OCR专用视觉语言模型。代码和数据可在 https://github.com/YesianRohn/WATER 获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.24484)查看 PDF(https://arxiv.org/pdf/2606.24484)GitHub3(https://github.com/YesianRohn/WATER)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.24484)
在您的智能体中获取此论文:
hf papers read 2606\.24484
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型1
Yesianrohn/WATERec-Models 图像转文本• 约3小时前更新(https://huggingface.co/Yesianrohn/WATERec-Models)
引用本论文的数据集3
Yesianrohn/WATER-Data 约3小时前更新 • 41(https://huggingface.co/datasets/Yesianrohn/WATER-Data)
Yesianrohn/WATER-Z_Captions 查看器• 约3小时前更新 • 273k • 37(https://huggingface.co/datasets/Yesianrohn/WATER-Z_Captions)
Yesianrohn/artistic-fonts 查看器• 约3小时前更新 • 11.3k • 26(https://huggingface.co/datasets/Yesianrohn/artistic-fonts)
引用本论文的空间0
没有空间链接本论文
在空间的 README.md 中引用 arxiv.org/abs/2606.24484 以从本页面链接到它。
包含本论文的收藏0
没有收藏包含本论文
将本论文添加到一个收藏(https://huggingface.co/new-collection)中以从本页面链接到它。
相似文章
基于双重语义嵌入的大语言模型鲁棒文本水印
本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。
EDU-CIRCUIT-HW:评估多模态大语言模型在真实大学级 STEM 学生手写解答上的表现
本文介绍了 EDU-CIRCUIT-HW 数据集,用于评估多模态大语言模型在真实大学级 STEM 手写解答上的表现,揭示了显著的识别局限性,并提出了一种结合自动化识别与极少人工监督的混合方法,以增强评分的鲁棒性。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
DataComp-VLM:面向视觉语言模型的改进型开放数据集
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。
使开源文本大语言模型水印在模型合并中保持鲁棒性
本文提出Merge-Adversarial Training,使开源大语言模型中的文本水印在模型合并后仍能幸存,在保持下游能力的同时,性能优于基线方法。