DocAtlas:跨越80多种语言的多语言文档理解
摘要
DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。
查看缓存全文
缓存时间: 2026/05/20 02:35
论文页面 - DocAtlas:跨80多种语言的多语言文档理解
来源:https://huggingface.co/papers/2605.12623
摘要
DocAtlas框架利用差分渲染和合成生成技术,构建了覆盖82种语言的高保真OCR数据集,并通过直接偏好优化展示了改进的多语言模型适应能力。
由于训练数据稀缺以及基于模型的标注流程延续了现有偏差,多语言文档理解在低资源语言上仍然有限。我们提出DocAtlas,这是一个构建高保真OCR数据集和基准的框架,覆盖82种语言和9个评估任务。我们的双管道——原生DOCX文档的差分渲染和为从右向左书写的脚本提供的基于LaTeX的合成生成——以统一的DocTag格式生成精确的结构化标注,该格式编码布局、文本和组件类型,且核心标注无需学习模型。评估16个最先进模型揭示了低资源脚本中持续存在的差距。我们表明,使用渲染得到的真实标签作为正信号的直接偏好优化(DPO)实现了稳定的多语言适应,将领域内(+1.9%)和领域外(+1.8%)的准确率都提升了,而可衡量的基础语言性能没有下降,而监督微调会使领域外性能下降高达21%。我们最好的变体DocAtlas-DeepSeek相比最强基线提升了1.7%。
查看arXiv页面 (https://arxiv.org/abs/2605.12623)查看PDF (https://arxiv.org/pdf/2605.12623)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12623)
在您的智能体中获取此论文:
hf papers read 2605.12623
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接此论文的模型
在模型README.md中引用arxiv.org/abs/2605.12623以从此页面链接。
引用此论文的数据集1
ahmedheakl/docatlas_instruct 查看器• 约2小时前更新 • 181k (https://huggingface.co/datasets/ahmedheakl/docatlas_instruct)
引用此论文的Spaces0
没有链接此论文的Space
在Space README.md中引用arxiv.org/abs/2605.12623以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
DocAtlas:将长文档理解视为可变状态交互
DocAtlas 是一个研究系统,将长文档理解构建为可变状态交互过程,利用带有搜索、阅读、笔记和审查工具的外部文档框架。它在 MMLongBench-Doc 上使用 GPT-5.4 取得了最先进的结果,并通过端到端强化学习大幅改进了紧凑型 VLM 代理。
dots.ocr:单个视觉语言模型中的多语言文档布局解析
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。
DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
DocAnnot——利用生成式AI驱动的自动标注加速关键信息提取数据集的创建
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
ForMaT:视觉引导的多语言PDF翻译数据集
本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。