HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更优

Hugging Face Daily Papers 论文

摘要

HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。

我们推出HunyuanOCR-1.5,一款轻量级端到端OCR专用视觉语言模型。HunyuanOCR统一了文档解析、文本检测、信息提取、文本图像翻译和多图像文档理解于一个端到端VLM中。在HunyuanOCR-1.0的轻量级架构基础上,HunyuanOCR-1.5并未重新设计主干网络,而是系统性地提升了效率和能力。在效率方面,我们将DFlash适配到OCR解码,显著降低了密集文档、表格和公式等长结构化输出的延迟,同时保持了输出分布。借助DFlash,HunyuanOCR-1.5实现了6.37倍的Transformer推理加速和2.14倍的vLLM加速,在轻量级OCR VLM中提供了最快的推理速度。在能力方面,我们提出了Agentic Data Flow,一个智能体驱动的数据构建系统,将模型弱点转化为可执行的数据需求,并自主执行材料搜索、质量验证和流程开发。它显著提升了古文字OCR、细粒度图表解析、多图像文本中心问答、低资源多语言解析和文档幻觉评估等长尾能力。HunyuanOCR-1.5在OmniDocBench v1.6上位列顶级端到端OCR解决方案,并在这些长尾任务上取得了新的性能里程碑。结合升级的预训练和后训练方案,HunyuanOCR-1.5进一步扩展了在高分辨率、长上下文和多任务场景中的能力。实验证明了更快的推理速度、更广泛的OCR能力覆盖以及轻量级端到端模型的部署优势。我们将发布模型权重和训练代码,以支持未来的研究和实际OCR应用。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:53

论文页面 - HunyuanOCR-1.5:打造更快、更强的轻量级OCR视觉语言模型

来源:https://huggingface.co/papers/2607.04884 作者:

摘要

HunyuanOCR-1.5 是一个轻量级端到端视觉语言模型,通过 DFlash 提升效率,通过 Agentic Data Flow 增强能力,实现了快速推理和广泛的任务覆盖。

我们提出 HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5,一个轻量级端到端 OCR 专用视觉语言模型 (https://huggingface.co/papers?q=vision-language%20model)。HunyuanOCR (https://huggingface.co/papers?q=OCR) 将文档解析、文本定位、信息抽取、图文翻译和多图像文档理解统一在单个端到端 VLM 中。基于 HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.0 的轻量级架构,HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 并未重新设计骨干网络,而是系统地提升了效率和能力。在效率方面,我们将 DFlash (https://huggingface.co/papers?q=DFlash) 适配到 OCR (https://huggingface.co/papers?q=OCR) 解码过程,显著降低了密集文档、表格和公式等长结构化输出的延迟,同时保持输出分布不变。借助 DFlash (https://huggingface.co/papers?q=DFlash),HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 实现了 6.37 倍的 Transformer 推理加速 (https://huggingface.co/papers?q=inference%20speedup) 以及在 vLLM 下 2.14 倍的加速,成为轻量级 OCR (https://huggingface.co/papers?q=OCR) VLM 中推理速度最快的模型。在能力方面,我们提出了 Agentic Data Flow (https://huggingface.co/papers?q=Agentic%20Data%20Flow),一个 Agent 驱动的数据构建系统,将模型弱点转化为可执行的数据需求,并自主完成素材搜索、质量验证和流程开发。它显著提升了古文字 OCR (https://huggingface.co/papers?q=OCR)、细粒度图表和表格解析、多图像文本问答、低资源多语言解析以及文档幻觉评估等长尾能力。HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 在 OmniDocBench v1.6 上位列顶级端到端 OCR (https://huggingface.co/papers?q=OCR) 解决方案,同时在这些长尾任务上取得了新的性能里程碑。结合升级的预训练 (https://huggingface.co/papers?q=pretraining) 和后训练 (https://huggingface.co/papers?q=post-training) 方案,HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 进一步扩展了在高分辨率、长上下文和多任务场景下的能力。实验证明,该模型推理更快、OCR (https://huggingface.co/papers?q=OCR) 能力覆盖更广,并展现了轻量级端到端模型 (https://huggingface.co/papers?q=end-to-end%20model) 的部署优势。我们将发布模型权重和训练代码,以支持未来的研究和实际 OCR (https://huggingface.co/papers?q=OCR) 应用。

查看 arXiv 页面 (https://arxiv.org/abs/2607.04884) 查看 PDF (https://arxiv.org/pdf/2607.04884) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.04884)

在您的 Agent 中获取这篇论文:

hf papers read 2607\.04884

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 2

tencent/HunyuanOCR 图像-文本-文本 • 1B • 更新于 1 天前 • 505k • 764 (https://huggingface.co/tencent/HunyuanOCR)

Evan-613/HunyuanOCR 图像-文本-文本 • 1B • 更新于约 5 小时前 (https://huggingface.co/Evan-613/HunyuanOCR)

引用该论文的数据集 0

没有与该论文关联的数据集

请在数据集的 README.md 中引用 arxiv.org/abs/2607.04884,以便从此页面关联。

引用该论文的 Spaces 14

浏览引用该论文的 14 个 Spaces (https://huggingface.co/spaces?arxivIds=2607.04884)

包含该论文的收藏集 0

没有包含该论文的收藏集

请将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面关联。

相似文章

baidu/Unlimited-OCR

Hugging Face Models Trending

百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。

MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。