HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更优
摘要
HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。
查看缓存全文
缓存时间: 2026/07/09 07:53
论文页面 - HunyuanOCR-1.5:打造更快、更强的轻量级OCR视觉语言模型
来源:https://huggingface.co/papers/2607.04884 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
HunyuanOCR-1.5 是一个轻量级端到端视觉语言模型,通过 DFlash 提升效率,通过 Agentic Data Flow 增强能力,实现了快速推理和广泛的任务覆盖。
我们提出 HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5,一个轻量级端到端 OCR 专用视觉语言模型 (https://huggingface.co/papers?q=vision-language%20model)。HunyuanOCR (https://huggingface.co/papers?q=OCR) 将文档解析、文本定位、信息抽取、图文翻译和多图像文档理解统一在单个端到端 VLM 中。基于 HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.0 的轻量级架构,HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 并未重新设计骨干网络,而是系统地提升了效率和能力。在效率方面,我们将 DFlash (https://huggingface.co/papers?q=DFlash) 适配到 OCR (https://huggingface.co/papers?q=OCR) 解码过程,显著降低了密集文档、表格和公式等长结构化输出的延迟,同时保持输出分布不变。借助 DFlash (https://huggingface.co/papers?q=DFlash),HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 实现了 6.37 倍的 Transformer 推理加速 (https://huggingface.co/papers?q=inference%20speedup) 以及在 vLLM 下 2.14 倍的加速,成为轻量级 OCR (https://huggingface.co/papers?q=OCR) VLM 中推理速度最快的模型。在能力方面,我们提出了 Agentic Data Flow (https://huggingface.co/papers?q=Agentic%20Data%20Flow),一个 Agent 驱动的数据构建系统,将模型弱点转化为可执行的数据需求,并自主完成素材搜索、质量验证和流程开发。它显著提升了古文字 OCR (https://huggingface.co/papers?q=OCR)、细粒度图表和表格解析、多图像文本问答、低资源多语言解析以及文档幻觉评估等长尾能力。HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 在 OmniDocBench v1.6 上位列顶级端到端 OCR (https://huggingface.co/papers?q=OCR) 解决方案,同时在这些长尾任务上取得了新的性能里程碑。结合升级的预训练 (https://huggingface.co/papers?q=pretraining) 和后训练 (https://huggingface.co/papers?q=post-training) 方案,HunyuanOCR (https://huggingface.co/papers?q=OCR)-1.5 进一步扩展了在高分辨率、长上下文和多任务场景下的能力。实验证明,该模型推理更快、OCR (https://huggingface.co/papers?q=OCR) 能力覆盖更广,并展现了轻量级端到端模型 (https://huggingface.co/papers?q=end-to-end%20model) 的部署优势。我们将发布模型权重和训练代码,以支持未来的研究和实际 OCR (https://huggingface.co/papers?q=OCR) 应用。
查看 arXiv 页面 (https://arxiv.org/abs/2607.04884) 查看 PDF (https://arxiv.org/pdf/2607.04884) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.04884)
在您的 Agent 中获取这篇论文:
hf papers read 2607\.04884
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 2
tencent/HunyuanOCR 图像-文本-文本 • 1B • 更新于 1 天前 • 505k • 764 (https://huggingface.co/tencent/HunyuanOCR)
Evan-613/HunyuanOCR 图像-文本-文本 • 1B • 更新于约 5 小时前 (https://huggingface.co/Evan-613/HunyuanOCR)
引用该论文的数据集 0
没有与该论文关联的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2607.04884,以便从此页面关联。
引用该论文的 Spaces 14
浏览引用该论文的 14 个 Spaces (https://huggingface.co/spaces?arxivIds=2607.04884)
包含该论文的收藏集 0
没有包含该论文的收藏集
请将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面关联。
相似文章
@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
@PaddlePaddle: PP-OCRv6技术深度解析第一集:在大模型时代,轻量级OCR为何仍具有不可替代的价值?——PP…
PP-OCRv6是一个轻量级OCR模型(3450万参数),凭借其MetaFormer架构挑战大型VLM,在多种部署场景下提供高效的文本检测与识别能力。
Hugging Face 上的 PP-OCRv6:支持 50 种语言、参数规模从 1.5M 到 34.5M 的 OCR 模型
PP-OCRv6 是 PaddleOCR 通用 OCR 模型系列的最新版本,提供从 1.5M 到 34.5M 参数的三个档次,支持 50 种语言,并在准确率上较之前版本有显著提升。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。