document-layout-parsing

标签

Cards List
#document-layout-parsing

dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending · 2025-12-02 缓存

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈