Jina-OCR-v1:采用推测解码与密集可验证奖励的高效文档解析

arXiv cs.CL 论文

摘要

Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。

arXiv:2609.03181v1 公告类型:新模型发布 摘要:我们推出 Jina-OCR-v1,这是一款专为低预算 GPU 设计的端到端文档解析模型。该模型结合了 DeepSeek-OCR 的压缩视觉编码器与 3B 混合专家解码器(每个词元激活约 570M 参数),并配备 FastMTP 推测解码头,通过在 K=3 个预测步骤中递归共享单个草稿模块实现高效推理。贪心验证确保解码过程无损。后训练阶段结合了指令对齐、针对复杂文档的鲁棒性微调,以及基于密集可验证奖励的 GRPO 训练——采用确定性公式、表格与结构化检查机制并给予部分分数奖励。训练数据混合了清洗后的公开语料与定向合成页面。在默认动态分辨率设置下,Jina-OCR-v1 在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,并在对比中达到最高的页面处理速度——每秒 2.57 页。在如 NVIDIA L4 等低预算 GPU 上,FastMTP 将解码速度相比贪心自回归解码提升了一倍。模型已公开发布于:https://huggingface.co/jinaai/jina-ocr-v1
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:55

# 基于推测解码与密集可验证奖励的高效文档解析  
来源:https://arxiv.org/html/2609.03181

## Jina-OCR-v1(https://huggingface.co/jinaai/jina-ocr-v1):基于推测解码与密集可验证奖励的高效文档解析模型  
Feng Wang所属机构:Emilia Garcia CasademontHan Xiao所属机构:Jina AI by Elastic所属机构:美国加利福尼亚州旧金山市新蒙哥马利街33号,邮编94105 邮箱:[[email protected]](mailto:)  

###### 摘要  
我们推出Jina-OCR-v1(https://huggingface.co/jinaai/jina-ocr-v1),这是一个为低预算GPU设计的端到端文档解析模型。它结合了DeepSeek-OCR的压缩视觉编码器和30亿参数混合专家解码器(每个词元激活约5.7亿参数),并搭载FastMTP推测解码头——通过单一草稿块在K=3预测步骤中递归共享。贪心验证实现了无损解码。后训练阶段结合了指令对齐、困难文档鲁棒性微调以及基于密集可验证奖励的GRPO优化:采用确定性公式、表格和结构检查机制,对部分正确的结果给予部分分数。训练数据混合了清洗后的公共语料与针对性生成的合成页面。在默认动态分辨率设置下,Jina-OCR-v1(https://huggingface.co/jinaai/jina-ocr-v1)在OmniDocBench v1.6上得分91.14,在olmOCR-Bench上得分83.4,并在对比中达到最高速度——每秒2.57页。在NVIDIA L4等低预算GPU上,FastMTP相比贪心自回归解码将解码速度提升一倍。模型已公开发布于:https://huggingface.co/jinaai/jina-ocr-v1。

## 1 引言  
基于视觉语言模型(VLMs)的端到端文档解析已成为主流范式(Wei et al., 2024;Nassar et al., 2025;Rednote HiLab, 2025;Wei et al., 2025),将版面分析、文本识别、公式转录和表格结构恢复整合至单一生成流程。其输出提供机器可读表示,适用于检索、定位和智能体工作流。但实际应用——尤其是在常见的低预算部署GPU上——仍受限于解码成本与后训练数据覆盖范围。  

长序列输出使解码成本高昂。通用VLMs(如Qwen2.5-VL-72B)每页使用数千视觉词元并严格采用自回归解码。DeepSeek-OCR已证明,压缩视觉编码器和紧凑型MoE解码器可大幅降低服务成本。我们沿用该架构,并针对残余的自回归瓶颈进行优化:OCR输出的局部结构特性使得验证器评估前能预先生成多个词元。  

后训练需兼顾监督可靠性与数据覆盖。公开标签可能包含退化循环或畸形结构,且公式与表格专用奖励仅适用于含对应元素的页面。同时,文档请求涵盖全页解析、元素级转录及不同格式规范。  

我们的核心设计选择为:  

- •**FastMTP解码**。我们在DeepSeek-OCR的压缩视觉30亿MoE骨干网上附加递归共享的FastMTP草稿块(K=3)。跨预测深度共享单一模块使草稿参数量恒定于K。  
- •**基于密集可验证奖励的后训练**。采用ReMax基线优化乘法GRPO奖励,涵盖内容、结构、单元测试、重复性和格式等多个维度。所有评分项均通过确定性代码对标参考结果进行评估,因此部分正确的页面可获得部分分数。集中包含可评分公式与表格的合成页面(JinaOCRSynth)提升了训练中公式与表格项的有效页面占比。  
- •**指令导向训练**。基于ReaderLM-v2,训练数据混合多种解析风格、元素级转录、图注生成、文档问答与关键信息提取任务,并动态生成指令与辅助定位示例。  

图1:专用OCR模型概览;蓝色标记本研究。(a) 视觉词元像素数(对数尺度)及实测值。(b) olmOCR-Bench页面吞吐量(页/秒,单卡A100,并发32)。(c) 基准测试总体得分与激活参数量(对数尺度)对比:上图为olmOCR-Bench,下图为OmniDocBench;实线连接帕累托最优系统,虚线延伸至坐标轴角点;未标注点对应表5、表6及表7中的其余系统。图1将Jina-OCR-v1置于共同决定部署成本的三轴上:视觉压缩率、页面吞吐量与单位激活参数准确率。  

图(a) 衡量视觉编码器对页面的压缩强度。有效图像块边长p代表单个视觉词元的空间范围,“视觉词元像素数”表示该词元对应的图像像素量。采用方形图像块的ViT(边长为p)每词元约输出p²像素,因此Qwen-VL系列及相关模型使用的28–32px编码器对应约780–1,000像素/词元。DeepEncoder则将4,096图像块映射的1024×1024全局视图压缩为256词元(p=64,约4,096像素/词元)。Jina-OCR-v1继承该编码器,因此同等分辨率页面的视觉词元表示大幅减少。  

图(b) 展示olmOCR-Bench页面吞吐量。视觉压缩并非唯一决定因素:DeepSeek-OCR虽与Jina-OCR-v1像素/词元密度相当,但生成页面更长,具体差异见第6.3节测量。  

图(c) 证明解析质量得以保持。Jina-OCR-v1每词元激活5.7亿解码器参数,在两个基准测试中均处于对应参数量下的准确率前沿,领先于规模大一个数量级的系统。在OmniDocBench上,它成为该前沿线上的最紧凑点。  

第2节回顾相关工作,第3节详述FastMTP架构,第4节说明训练数据,第5节描述后训练方案,第6节进行评估分析。  

## 2 相关工作  

#### 端到端文档解析  
Nougat首次实现端到端学术文档OCR,GOT-OCR2.0将其扩展至广泛的OCR-2.0任务集。近年系统包括dots.ocr、SmolDocling、olmOCR、MonkeyOCR与MonkeyOCRv2、MinerU、PaddleOCR-VL、GLM-OCR、Infinity-Parser,以及本研究的架构基础DeepSeek-OCR。该列表涵盖端到端系统及先运行PP-DocLayout等版面模型的两阶段流水线。  

#### 高效解码与多词元预测  
推测解码通过并行验证草稿词元实现加速。并行头预测多个词元的思想可追溯至块并行解码;Medusa将其复兴为冻结骨干网络上的独立草稿头,Hydra则使这些头具有顺序依赖性。前瞻解码则完全移除草稿模型。多词元预测作为训练目标由Gloeckle等人及DeepSeek-V3推广;EAGLE类方法在特征层进行草稿生成,而Samarin等人则直接基于接受率训练草稿头。FastMTP通过单一草稿块跨预测深度共享,保持草稿参数量恒定。GLM-OCR已将共享参数MTP应用于OCR,HunyuanOCR-1.5则采用DFlash块草稿技术。我们沿用共享块方案,并采用特征与分布对齐损失进行训练。  

#### 文档解析强化学习  
GRPO与DAPO已适配至基于可验证奖励的文档解析强化学习场景,使用编辑距离、TEDS及CDM等信号。文档元素的结构化特性使其成为RLVR的天然目标,因为参考转录可通过确定性评分实现,无需奖励模型或判别器。相较于监督微调,强化学习更不易引发灾难性遗忘,支持通过不同奖励对子任务进行专门优化。LightOnOCR与olmOCR项目采用单元测试式评估及基于文档训练的GRPO,Infinity-Parser2则在多任务奖励下联合训练八项任务。我们结合乘法奖励与单项下限、ReMax基线、显式重复惩罚,以及集中公式与表格结构的合成页面。  

## 3 模型架构  

Jina-OCR-v1沿用DeepSeek-OCR的编码器-解码器架构,并扩展多词元预测头。图2展示整体系统架构,表1总结继承骨干与新增FastMTP组件的规格。  

**文档页→局部区块→DeepEncoder→视觉编码器→MoE解码器(总计30亿·激活5.7亿)→Markdown→用户指令→共享草稿块→(x̂_{t+1}, x̂_{t+2}, x̂_{t+3})→验证K=3草稿→FastMTP→(256+100n)词元**  

图2:Jina-OCR-v1架构。DeepEncoder与MoE解码器继承自DeepSeek-OCR;页面生成1024×1024全局视图(256视觉词元)加n个局部区块(每区100词元)。FastMTP头通过单一共享草稿块递归提议K=3词元供验证器评估。  

表1:Jina-OCR-v1模型规格。DeepEncoder与MoE解码器继承自DeepSeek-OCR;FastMTP作为附加组件。  
DeepEncoder级联窗口注意力SAM编码器与全局注意力CLIP编码器,通过16倍卷积压缩器处理。在1024×1024分辨率下,将4,096全局图像块压缩为256词元,动态分辨率Gundam模式最多添加九个100词元的局部区块。解码器采用紧凑型DeepSeekMoE模型,每词元激活约5.7亿参数并输出Markdown。这些组件为FastMTP提供压缩视觉前缀与验证器;本节重点阐述新增草稿头。  

### 3.1 草稿头架构  
OCR输出具有强局部结构且近似确定性,使其成为理想的推测解码工作负载。我们采用FastMTP:单一草稿块B_θ递归应用于K=3步骤,使草稿参数量恒定于K。  

训练在序列位置与深度的二维网格上对齐递归深度。设x_p为序列位置p处的词元,e_p=E(x_p)为其嵌入,b_p为主解码器处理x_p后的后归一化状态。设u_p^(k)表示训练行p处递归深度k的草稿输出。共享头接收的状态为:  

a_p^{(1)} = b_p,  
a_p^{(k)} = u_{p-1}^{(k-1)}  (k>1),  
z_p^{(k)} = P([N_e(e_{p+1}); N_h(a_p^{(k)}])  
u_p^{(k)} = N_o(B_θ(z_p^{(k)}; pos=p)),  
ℓ_p^{(k)} = W_{lm}u_p^{(k)}。  

其中N_e与N_h为归一化层,P为线性投影,B_θ为共享密集草稿块。  
**在发布检查点中,这些组件对应于enorm、hnorm、eh_proj与mtp_block。**  
词元嵌入E、输出归一化N_o与LM头W_{lm}与主解码器参数绑定。

相似文章

ATH-MaaS/OvisOCR2

Hugging Face Models Trending

OvisOCR2 是一个紧凑的0.8B端到端模型,用于页面级文档解析,在OmniDocBench和PureDocBench基准测试中达到了最先进的性能。

OvisOCR2:一款有前景的0.8B本地文档解析器

Reddit r/LocalLLaMA

OvisOCR2是一款基于Qwen3.5-0.8B的新型0.8B端到端OCR模型,能够将整个文档页面直接转换为结构化Markdown,包括文本、表格、公式和阅读顺序。它在基准测试中取得了优异的成绩,并基于Apache 2.0协议发布,支持vLLM。

Unlimited OCR: 一次性长程解析

Hacker News Top

百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。