WeVisDoc:从覆盖到能力,实现稳健的端到端文档解析
摘要
WeVisDoc 是一个两阶段的以数据为中心的框架,用于稳健的端到端文档解析,通过扩展覆盖范围并使用针对性诊断来提升性能,在基准测试中取得了最先进的结果。
查看缓存全文
缓存时间: 2026/09/18 06:59
论文页面 - WeVisDoc:从覆盖度到能力的鲁棒端到端文档解析
来源:https://huggingface.co/papers/2609.20423 发布于 9 月 17 日
·
由 https://huggingface.co/Longin-Yu 提交
郝宇 (https://huggingface.co/Longin-Yu) 于 9 月 18 日发布
摘要
文档解析将文档图像转换为结构化内容,要求在不同版面和采集条件下都具有可靠的性能。然而,训练语料库偏向常见文档类型和干净的数字页面,且仅扩大覆盖范围并不能具体解决解析器的剩余缺陷。我们提出了 WeVisDoc,一个以数据为中心的两阶段框架,用于实现鲁棒的端到端文档解析。第一阶段通过异构数据和保持结构的退化合成,拓宽语义、结构和外观的覆盖范围。第二阶段使用一个保留的探测集,在固定的视觉-结构聚类内测量第一阶段解析器的残余误差。这些诊断结果指导针对性的数据构建和目标 token 预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上取得了 95.38 的总体分数,在三个 PureDocBench 赛道上取得了平均 75.54 的总体分数,在所有四种设置中均位列所比较的端到端解析器第一。与第一阶段相比,第二阶段在两个基准测试中均提升了 2B 和 4B 模型的总体分数,在退化的 PureDocBench 赛道上提升更为显著,其中 4B 模型在真实退化赛道上获得了 4.03 分的提升。
查看 arXiv 页面 (https://arxiv.org/abs/2609.20423) 查看 PDF (https://arxiv.org/pdf/2609.20423) 项目页面 (https://tencent.github.io/WeVisDoc/) GitHub9 (https://github.com/Tencent/WeVisDoc) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20423)
引用本文的模型 2
tencent/WeVisDoc-4B 4B • 约 4 小时前更新 • 14 (https://huggingface.co/tencent/WeVisDoc-4B)
tencent/WeVisDoc-2B 2B • 约 4 小时前更新 • 6 (https://huggingface.co/tencent/WeVisDoc-2B)
引用本文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.20423 以从本页链接。
引用本文的 Spaces 2
包含本文的收藏夹 1
相似文章
腾讯WeVisDoc
WeVisDoc是一款基于Qwen3-VL模型微调的端到端文档解析器,可将页面图像转换为包含LaTeX公式和HTML表格的结构化Markdown,在OmniDocBench v1.6等基准测试中实现了顶级性能。
NaviDC-OCR:数字与相机捕获文档的解析导航
NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。
@jerryjliu0: 我们评估了100多个模型在文档解析上的表现,涵盖前沿VLMs、开源权重VLMs、OCR工具和OSS解析器,请查看p…
对超过100个模型在文档解析方面的评估,涵盖前沿VLMs、开源权重VLMs、OCR工具和开源解析器,结果通过parsebench分享。
PaddleOCR-VL-1.6:通过欠优化区域精炼与渐进式后训练拓展文档解析前沿
PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。
PaDoc: 基于布局的并行解码用于文档解析
PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。