DocAtlas:跨越80多种语言的多语言文档理解

Hugging Face Daily Papers 论文

摘要

DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。

由于训练数据稀缺且基于模型的标注流程会延续现有偏差,多语言文档理解在低资源语言方面仍然受限。我们提出DocAtlas,这是一个构建高保真OCR数据集和基准的框架,覆盖82种语言和9项评估任务。我们的双管道——对原生DOCX文档进行差异渲染,以及针对从右到左文字系统的基于LaTeX的合成生成——以统一的DocTag格式生成精确的结构化标注,该格式编码布局、文本和组件类型,核心标注无需使用学习模型。对16个最先进模型的评估揭示了在低资源文字中持续存在的差距。我们表明,使用渲染衍生的真实数据作为正信号的直接偏好优化(DPO)能够实现稳定的多语言适配,将领域内准确率提升1.9%,领域外准确率提升1.8%,且基础语言性能未见可测量的下降,而监督微调则使领域外性能下降高达21%。我们的最佳变体DocAtlas-DeepSeek相比最强基线提升了1.7%。
查看原文
查看缓存全文

缓存时间: 2026/05/20 02:35

论文页面 - DocAtlas:跨80多种语言的多语言文档理解

来源:https://huggingface.co/papers/2605.12623

摘要

DocAtlas框架利用差分渲染和合成生成技术,构建了覆盖82种语言的高保真OCR数据集,并通过直接偏好优化展示了改进的多语言模型适应能力。

由于训练数据稀缺以及基于模型的标注流程延续了现有偏差,多语言文档理解在低资源语言上仍然有限。我们提出DocAtlas,这是一个构建高保真OCR数据集和基准的框架,覆盖82种语言和9个评估任务。我们的双管道——原生DOCX文档的差分渲染和为从右向左书写的脚本提供的基于LaTeX的合成生成——以统一的DocTag格式生成精确的结构化标注,该格式编码布局、文本和组件类型,且核心标注无需学习模型。评估16个最先进模型揭示了低资源脚本中持续存在的差距。我们表明,使用渲染得到的真实标签作为正信号的直接偏好优化(DPO)实现了稳定的多语言适应,将领域内(+1.9%)和领域外(+1.8%)的准确率都提升了,而可衡量的基础语言性能没有下降,而监督微调会使领域外性能下降高达21%。我们最好的变体DocAtlas-DeepSeek相比最强基线提升了1.7%。

查看arXiv页面 (https://arxiv.org/abs/2605.12623)查看PDF (https://arxiv.org/pdf/2605.12623)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12623)

在您的智能体中获取此论文:

hf papers read 2605.12623

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接此论文的模型

在模型README.md中引用arxiv.org/abs/2605.12623以从此页面链接。

引用此论文的数据集1

ahmedheakl/docatlas_instruct 查看器• 约2小时前更新 • 181k (https://huggingface.co/datasets/ahmedheakl/docatlas_instruct)

引用此论文的Spaces0

没有链接此论文的Space

在Space README.md中引用arxiv.org/abs/2605.12623以从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

DocAtlas:将长文档理解视为可变状态交互

arXiv cs.CL

DocAtlas 是一个研究系统,将长文档理解构建为可变状态交互过程,利用带有搜索、阅读、笔记和审查工具的外部文档框架。它在 MMLongBench-Doc 上使用 GPT-5.4 取得了最先进的结果,并通过端到端强化学习大幅改进了紧凑型 VLM 代理。

dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。

ForMaT:视觉引导的多语言PDF翻译数据集

arXiv cs.CL

本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。