复杂文档布局中的阅读顺序推断
摘要
本文提出了一种无需训练的基于图的框架,用于复杂文档布局中的阅读顺序推断,利用语言模型信号和最大遗憾推断规则。该方法在历史手稿和多列基准测试上显著优于现有基线,在环绕式Glossa布局上达到了95%的边准确率。
arXiv:2607.01018v1 Announce Type: new
摘要:阅读顺序推断仍然是复杂历史手稿数字化中的一个关键瓶颈,这些手稿的页面包含多个空间上交错的阅读流,典型例子是Glossa Ordinaria布局,其中中央文本被注释包围,注释在非矩形、非凸区域中环绕中央文本。我们提出了一种无需训练的基于图的框架:每个OCR文本行成为有向候选转移图中的一个节点,边通过两个轻量级语言模型信号的加权加性集成进行评分(因果语言模型条件似然和BERT下一句预测(NSP);第三个句子嵌入信号进行了评估但未改善阅读顺序),全局阅读顺序作为度约束有向路径覆盖恢复。为了避免贪婪边选择级联的'边窃取'失败,我们提出了一种最大遗憾推断规则,优先考虑具有高机会成本的承诺。我们在合成的Glossa Ordinaria网格布局、23个ALTO页面几何结构(10个历史源页面加上镜像和翻转变体)以及OmniDocBench的140页多列英语子集上进行了评估,将我们的方法与经典的递归XY-cut(PaddleOCR PP-StructureV3)和两个LayoutReader变体(仅布局和文本+布局)在相同输入上进行比较。在环绕式Glossa布局上,我们的方法平均恢复95%的真实后继边,而XY-cut为50%;在OmniDocBench多列子集上,我们的方法达到了88%的宏观边准确率,而XY-cut为75%,LayoutReader为25%。LayoutReader基线由于词级与行级粒度不匹配而迁移性差。我们还在水平和垂直页面反射下验证了镜像不变性:我们的方法变化小于1个百分点,经典XY-cut变化2个百分点,LayoutReader-T变化高达8个百分点。
查看缓存全文
缓存时间: 2026/07/02 05:39
# 复杂文档布局的阅读顺序推断
来源:https://arxiv.org/html/2607.01018
11institutetext:特拉维夫大学计算机科学与 AI 学院,以色列拉马特阿维夫
11email:\{iddoh,sharvag,omerventura,galgrudka\}@mail\.tau\.ac\.il
11email:\{dariashap,berat,nachumd\}@tauex\.tau\.ac\.ilSharva Gogawalehttps://orcid.org/0009-0000-5230-5197Omer VenturaGal GrudkaDaria Vasyutinsky\-Shapirahttps://orcid.org/0000-0002-4257-7882Berat Kurar\-Barakathttps://orcid.org/0000-0002-7240-7286Nachum Dershowitz
###### 摘要
阅读顺序推断仍然是复杂历史手稿数字化中的关键瓶颈,这些手稿的页面包含多个空间交错阅读流,典型例子是*Glossa Ordinaria*布局,其中央文本被多个评论环绕,这些评论以非矩形、非凸的区域环绕中央文本。我们提出一个**无需训练**的图框架:每个 OCR 文本行成为有向候选转移图中的一个节点,边由两个轻量级语言模型信号的加权加性集成(因果语言模型条件似然和 BERT 下一句预测,NSP;第三个句子嵌入信号已评估但未改善阅读顺序)进行评分,全局阅读顺序通过度约束有向路径覆盖恢复。为了避免贪婪边选择的级联“边窃取”失败,我们提出一个最大遗憾推理规则,优先考虑机会成本高的承诺。我们在合成的 Glossa Ordinaria 网格布局、23 种 ALTO 页面几何(10 个历史源页面加上镜像和翻转变体)以及 OmniDocBench 的 140 页多列英文子集上评估我们的方法,与经典递归 XY-cut(PaddleOCR PP-StructureV3)和两种 LayoutReader 变体(纯布局和文本+布局)在相同输入上进行比较。在环绕式 Glossa 布局上,我们的方法平均恢复了 95% 的 ground truth 后继边,而 XY-cut 为 50%;在 OmniDocBench 多列子集上,我们达到了 88% 的宏边准确率,而 XY-cut 为 75%,LayoutReader 为 25%。LayoutReader 基线迁移效果差,原因是词级与行级粒度不匹配。我们还验证了水平与垂直页面反射下的镜面不变性:我们的方法变化小于 1 个百分点,经典 XY-cut 变化 2 个百分点,LayoutReader-T 变化高达 8 个百分点。
参见说明文字
参见说明文字
图 1:两个非曼哈顿布局的例子。左:印刷希伯来语圣经页面,正文两侧是阿拉姆语翻译,两个评论环绕着它们,内边距中有缩写的 Masorah parva 注释,顶部和底部边缘有 Masorah magna,全部自动(且不完美)进行行分割。右:希腊圣经手稿(Codex Bodmer 25)的一页,包含两个 catena 评论区域。## 1 引言
阅读顺序推断重建 OCR 检测到的文本元素的预期顺序流。准确顺序是可搜索、连续文本流和下游文档理解的前提;然而,当页面包含多个空间交错叙述时,它仍然脆弱。
对于简单的单列页面,通过从上到下的扫描恢复顺序。视觉复杂的文档通常包含**多个部分独立的阅读流**:并列列、旁注、行间注释、边注和图形标题,其中**仅凭几何信息是不充分的**:可能在空间上接近的多个可行后继属于不同的叙述轨道。
历史手稿放大了这些困难。一个典型的极端例子是*Glossa Ordinaria*页面,中央文本被多个评论环绕,这些评论以非矩形、有时是非凸的区域环绕着中央文本。来自不同流的行可能在空间上交错,人类读者主要依赖**语义连续性**来保持在流内。经典几何启发式(包括递归 XY-cut 和基于邻近度的聚类)隐含地假设空间邻接意味着顺序邻接,这在多文本布局中经常失败[7 (https://arxiv.org/html/2607.01018#bib.bib1),8 (https://arxiv.org/html/2607.01018#bib.bib2),6 (https://arxiv.org/html/2607.01018#bib.bib3)]。我们将经典递归 XY-cut 作为主要的几何基线。
一个自然的替代方案是从标注文档中学习阅读顺序,现代多模态模型在领域内可能有效。但阅读顺序监督通常在词/标记级别收集(例如 LayoutReader 的 ReadingBank[14 (https://arxiv.org/html/2607.01018#bib.bib9)]),这与历史 OCR 引擎生成的 OCR 文本行原子单元不同。如第 6 节所示,现成的 LayoutReader 变体(纯布局和文本+布局 LayoutReader-T)在未重新训练的情况下,即使输入与我们方法完全相同的框和文本,也难以迁移到行级历史输入。为罕见历史布局获取高质量阅读顺序监督也代价高昂。这促使我们探索利用预训练语言模型中已有的通用语言先验的**无需训练**方法。
##### 目标。
在复杂、非曼哈顿、多流布局中恢复阅读顺序,无需标注阅读顺序数据集或布局特定微调。
##### 关键思想。
预训练语言模型,即使是小型模型,也编码了强大的局部连贯性信号。我们将页面建模为候选“下一行”转移的有向图;节点是 OCR 行,边权重量化语义连续性。给定这个评分图,我们在每个行最多有一个前驱和一个后继的约束下搜索全局一致的后继关系集合。在整个过程中,我们通过评估已知行框和受控文本来将布局推断与 OCR 噪声隔离;对 OCR 错误的端到端鲁棒性不在本文范围内(第 9 节)。
### 贡献
1. 1.**图形式化**。将阅读顺序视为 OCR 行上的度约束有向路径覆盖,在单前驱/单后继约束下实现多个不连续的阅读流。
2. 2.**无需训练的语义评分**。因果 LM 条件似然和 BERT 下一句预测的加权加性集成。我们还评估了句子嵌入余弦相似度,发现它并没有改善阅读顺序(第 7 节)。
3. 3.**基于遗憾的推断**。一种最大遗憾边选择算法,通过优先考虑机会成本高的决策来减少贪婪短视。
4. 4.**扩展评估**,涵盖合成、历史与公共基准布局。通过交织不同 Project Gutenberg 书籍¹¹¹https://www.gutenberg.org/ 创建的非凸拓扑“Glossa Ordinaria 布局”页面[12 (https://arxiv.org/html/2607.01018#bib.bib14)];来自 10 个历史源页面及其镜像和翻转变体的 **23 种 ALTO 页面几何**[5 (https://arxiv.org/html/2607.01018#bib.bib13)],这相比之前的小规模研究有显著扩展;以及 OmniDocBench[9 (https://arxiv.org/html/2607.01018#bib.bib16)] 的 140 页英文多列子集,用于在公共基准上进行直接比较。
5. 5.**多基线比较**。我们在相同的 OCR 行输入上针对经典递归 XY-cut[7 (https://arxiv.org/html/2607.01018#bib.bib1)](PaddleOCR PP-StructureV3)、LayoutReader[14 (https://arxiv.org/html/2607.01018#bib.bib9)](纯布局)和 LayoutReader-T(文本+布局)进行基准测试,并验证水平与垂直页面反射下的镜面不变性。
## 2 相关工作
阅读顺序推断处于页面布局分析与文档结构恢复的交汇点。尽管许多文档可以近似线性扫描,但视觉复杂的页面可能包含多个交错阅读流(旁注、并行评论),其中几何邻接不是顺序邻接的可靠代理。
### 2.1 几何启发式
早期的阅读顺序方法依赖空间规律性:投影轮廓和递归划分(XY-cut)[7 (https://arxiv.org/html/2607.01018#bib.bib1)]、最近邻聚类(Docstrum)[8 (https://arxiv.org/html/2607.01018#bib.bib2)]以及效率调优的 XY-cut 变体[6 (https://arxiv.org/html/2607.01018#bib.bib3)]。这些方法在曼哈顿布局上效果良好,但当流在空间上交错且区域边界非凸时(如许多历史手稿中),性能下降。我们使用 PaddleOCR 的 PP-StructureV3 流水线中实现的经典递归 XY-cut 作为几何基线(第 6 节),因此比较反映了标准、可引用的实现,而非重新实现。
### 2.2 基于学习与语义方法
近期方法学习将阅读顺序作为序列生成或布局实体上的成对关系预测,使用多模态输入和监督数据集[15 (https://arxiv.org/html/2607.01018#bib.bib8),14 (https://arxiv.org/html/2607.01018#bib.bib9),13 (https://arxiv.org/html/2607.01018#bib.bib10)]。LayoutReader[14 (https://arxiv.org/html/2607.01018#bib.bib9)] 在 ReadingBank(一个来自渲染 DOCX 文件的**词级**布局和阅读顺序语料库)上训练;我们评估了其纯布局和文本+布局(LayoutReader-T)配置,输入为我们的 OCR 行和 OmniDocBench 段落(第 6 节),其中词到行、词到段落的粒度不匹配成为一个具体限制。端到端多模态解析器(如 Dots.OCR 和 PaddleOCR-VL)在行粒度上操作,但将检测、识别和阅读顺序捆绑到一个流水线中,且不暴露其阅读顺序模块以供外部提供的框评估,因此目前无法进行干净的苹果对苹果比较。这类系统通常在分布内准确,但依赖标注的阅读顺序,并可能需要对罕见历史布局进行微调。在 NLP 中,句子排序和篇章连贯性使用局部连续性线索和全局优化[1 (https://arxiv.org/html/2607.01018#bib.bib11),4 (https://arxiv.org/html/2607.01018#bib.bib12)],但文档阅读顺序在三个方面不同:单元是 OCR 行(而非句子),问题受二维候选邻接约束,且通常需要多流输出(不连续路径集)而非单一排列。我们的方法无需训练,使用预训练语言模型作为局部语义预言机,并将它们与显式图推断结合,在度约束下进行。
### 2.3 阅读顺序表示与评估
阅读顺序可以是非线性或部分指定的,当不同系统之间的分割不同时,评估变得困难[2 (https://arxiv.org/html/2607.01018#bib.bib4)]。公共基准如 OmniDocBench[9 (https://arxiv.org/html/2607.01018#bib.bib16)] 涵盖了多样的现代文档(学术论文、财务报告、多列布局),并在文档组件或类似段落的区域上评估排序,而非 OCR 行。对于我们的环绕式非曼哈顿目标设置,区域分解本身不可靠:即使单个行框仍然可用,区域可能错误合并或分裂(类似于 Sayre 悖论的情况,即正确的区域排序需要正确的区域,但找到它们又依赖于阅读流)。因此,我们直接在 OCR 行和后续关系上评估我们的 23 页 ALTO 语料库,并在 OmniDocBench 的多列英文子集上以原生段落粒度补充评估(第 7.4 节)。图形式化对 (bbox, text) 元组进行操作,与单元大小无关,因此两种粒度均可使用相同模型处理。ALTO 和类似存档格式可以编码布局结构,并可选地包含排序,但复杂手稿中的阅读顺序经常缺失或不可靠,这促使自动推断。
## 3 问题形式化
我们假设一个 OCR 系统产生 \(N\) 个文本行。
### 3.1 候选转移图
我们构建一个有向候选图 \(G=(V,E_{\text{cand}})\),其中 \(V=\{1,\dots,N\}\)。边 \((u,v)\in E_{\text{cand}}\) 表示行 \(v\) 是行 \(u\) 的可行后继。候选生成控制运行时间和歧义性;我们使用宽松的“下一列”候选集来压力测试列间延续决策。
- 在人造网格布局中,每个节点属于一个离散列。对于每个节点 \(u\),将其连接到**所有**右侧下一列的节点。这产生一个密集候选集,其中仅凭几何信息无法确定哪个列间转移是正确延续。
- 在现实布局中,节点来自 OCR 文本边界框,我们使用边界框模拟相同的压力测试:对于每个行 \(u\),将其连接到所有在 \(u\) 下方的行(同列后继)以及所有左边缘位于 \(u\) 右边框右侧的行(下一列后继)。这个宽松的集合使得同列延续和环绕“下一列”转移都成为候选,因此在复杂页面几何中仅凭几何信息无法确定正确后继。
### 3.2 度约束与路径覆盖
每个流内的阅读顺序是一条有向路径:每个行最多有一个后继和一个前驱。我们寻找一个子集 \(E\subseteq E_{\text{cand}}\) 以最大化总分数:
\[
\max_{E\subseteq E_{\text{cand}}}\sum_{(u,v)\in E} S(u,v) \quad \text{s.t.} \quad \deg^{+}(u)\leq 1,\; \deg^{-}(v)\leq 1\; \forall u,v.
\] (1)
其中 \(S(u,v)\) 是边的语义连续性分数。仅凭度约束,最大化边集分解为不连续有向路径的集合和(通常)有向环。由于环不对应有效阅读顺序,我们的推断过程显式避免创建环,并返回一个无环路径覆盖,可能包含多个不连续流。
## 4 无需训练的语义边评分
对于每个候选边 \((u,v)\),我们使用预训练模型**无需微调**地计算语义连续性分数 \(S(u,v)\)。每个边的分数独立计算并缓存,将昂贵的模型推断与下游搜索算法分离。
### 4.1 因果语言模型条件似然
设一个因果语言模型(CLM)在固定分词器下定义标记对数似然 \(\log P_{\text{CLM}}(\cdot)\)。我们使用 EleutherAI/pythia-410M 实例化 CLM,并在推理模式下在 GPU 上计算所有 CLM 分数,无需微调。给定两个行片段 \(t_u\) 和 \(t_v\),我们评分 \(t_v\) 在给定 \(t_u\) 条件下的逐标记延续似然:
\[
s_{\text{clm}}(u,v) = \frac{1}{|t_v|} \log P_{\text{CLM}}(t_v \mid t_u),
\]
其中 \(|t_v|\) 表示 \(t_v\) 中的标记数。实际计算时,我们将标记序列 \([t_u; t_v]\) 拼接,运行一次前向传播,仅对属于 \(t_v\) 的标记位置(即遮蔽前缀 \(t_u\))的 log 概率求和[10 (https://arxiv.org/h相似文章
LFRAG:面向布局的多模态文档理解细粒度检索增强生成
LFRAG提出了一种面向布局的细粒度检索增强生成框架,该框架在多模态文档中从页面级检索转向块级检索,在新提出的LFDocQA基准上实现了最先进的性能,并将令牌数量减少了73%。
dots.ocr:单个视觉语言模型中的多语言文档布局解析
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。
@slimcat0101: 最近很多人问我:"既然端到端(E2E)文档模型变得如此强大,我们还需要布…
宣布 RT-DocLayout,这是世界上首个能够在真实文档中进行像素级多点多边形框的布局分析模型,已被 ECCV 2026 接收。论文指出,尽管端到端模型日益强大,布局分析仍然至关重要,并介绍了一个高效的 33M 参数模型,运行速度达 132.1 FPS。
大型语言模型中用于结构推理的视觉图支架
本文探讨了将视觉图思维导图用作LLMs的推理支架,发现即使没有直接答案提示,视觉引导仍然有效,而将图扁平化为文本则会失去优势。
GraphReAct:面向多步图推理的推理与行动
本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。