WeVisDoc:从覆盖到能力,实现稳健的端到端文档解析

Hugging Face Daily Papers 论文

摘要

WeVisDoc 是一个两阶段的以数据为中心的框架,用于稳健的端到端文档解析,通过扩展覆盖范围并使用针对性诊断来提升性能,在基准测试中取得了最先进的结果。

文档解析将文档图像转换为结构化内容,并需要在不同布局和采集条件下提供可靠性能。然而,训练语料库偏向于常见文档类型和干净的数字页面,仅扩展覆盖范围并未指定如何解决解析器的剩余弱点。我们提出了 WeVisDoc,一个用于稳健端到端文档解析的两阶段以数据为中心的框架。第一阶段通过异构数据和结构保持退化合成来扩展语义、结构和外观覆盖范围。第二阶段使用保留探针来测量第一阶段解析器在固定视觉-结构集群内的残差错误。这些诊断指导针对性的数据构建和目标令牌预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上获得总体分数 95.38,在三个 PureDocBench 赛道上的平均总体分数为 75.54,在所有四种设置中排名在所比较的端到端解析器中第一。与第一阶段相比,第二阶段提高了 2B 和 4B 模型在两个基准上的总体分数,在降级的 PureDocBench 赛道上获得更大增益,包括 4B 模型在真实降级赛道上获得 4.03 分的增益。
查看原文
查看缓存全文

缓存时间: 2026/09/18 06:59

论文页面 - WeVisDoc:从覆盖度到能力的鲁棒端到端文档解析

来源:https://huggingface.co/papers/2609.20423 发布于 9 月 17 日

·

由 https://huggingface.co/Longin-Yu 提交

郝宇 (https://huggingface.co/Longin-Yu) 于 9 月 18 日发布

摘要

文档解析将文档图像转换为结构化内容,要求在不同版面和采集条件下都具有可靠的性能。然而,训练语料库偏向常见文档类型和干净的数字页面,且仅扩大覆盖范围并不能具体解决解析器的剩余缺陷。我们提出了 WeVisDoc,一个以数据为中心的两阶段框架,用于实现鲁棒的端到端文档解析。第一阶段通过异构数据和保持结构的退化合成,拓宽语义、结构和外观的覆盖范围。第二阶段使用一个保留的探测集,在固定的视觉-结构聚类内测量第一阶段解析器的残余误差。这些诊断结果指导针对性的数据构建和目标 token 预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上取得了 95.38 的总体分数,在三个 PureDocBench 赛道上取得了平均 75.54 的总体分数,在所有四种设置中均位列所比较的端到端解析器第一。与第一阶段相比,第二阶段在两个基准测试中均提升了 2B 和 4B 模型的总体分数,在退化的 PureDocBench 赛道上提升更为显著,其中 4B 模型在真实退化赛道上获得了 4.03 分的提升。

查看 arXiv 页面 (https://arxiv.org/abs/2609.20423) 查看 PDF (https://arxiv.org/pdf/2609.20423) 项目页面 (https://tencent.github.io/WeVisDoc/) GitHub9 (https://github.com/Tencent/WeVisDoc) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20423)

引用本文的模型 2

tencent/WeVisDoc-4B 4B • 约 4 小时前更新 • 14 (https://huggingface.co/tencent/WeVisDoc-4B)

tencent/WeVisDoc-2B 2B • 约 4 小时前更新 • 6 (https://huggingface.co/tencent/WeVisDoc-2B)

引用本文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.20423 以从本页链接。

引用本文的 Spaces 2

包含本文的收藏夹 1

相似文章

腾讯WeVisDoc

Reddit r/LocalLLaMA

WeVisDoc是一款基于Qwen3-VL模型微调的端到端文档解析器,可将页面图像转换为包含LaTeX公式和HTML表格的结构化Markdown,在OmniDocBench v1.6等基准测试中实现了顶级性能。

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。