Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能模型

Hugging Face Blog 模型

摘要

IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:13

Granite 4.0 3B Vision: 面向企业文档的紧凑型多模态智能

来源:https://huggingface.co/blog/ibm-granite/granite-4-vision 返回文章 (https://huggingface.co/blog)

今天我们很高兴宣布 Granite 4.0 3B Vision 的发布——这是一款面向企业文档理解的紧凑型视觉语言模型(VLM)。它专为从复杂文档、表单和结构化视觉内容中可靠地提取信息而设计。Granite 4.0 3B Vision 在以下能力方面表现卓越:

  • 表格提取:从文档图像中准确解析复杂表格结构(例如多行、多列等)
  • 图表理解:将图表和图形转换为结构化机器可读格式、摘要或可执行代码
  • 语义键值对(KVP)提取:识别并定位跨多种文档布局的语义关键字段对

该模型以 LoRA 适配器的形式发布,基于 Granite 4.0 Micro 这一稠密语言模型构建,将视觉和语言模块分离,便于纯文本回退和无缝集成到混合流水线中。它继续支持视觉语言任务,例如从图像生成详细自然语言描述(例如“详细描述这张图片“)。该模型可独立使用,也可与 Docling 配合使用,以增强文档处理流水线的深度视觉理解能力。

Granite 4.0 3B Vision 是如何构建的

Granite 4.0 3B Vision 的性能得益于三项关键投入:通过创新的代码引导数据增强方法构建的专用图表理解数据集、支持高细节视觉特征注入的 DeepStack 架构创新变体,以及保持模型企业部署实用性的模块化设计。

ChartNet:教会模型真正理解图表

图表对视觉语言模型(VLM)来说是一个挑战,因为理解图表需要联合推理视觉模式、数值数据和自然语言,而大多数 VLM 无法很好地处理这种组合,尤其是在需要空间精确性的情况下——例如从折线图中读取精确数值。为弥合这一差距,我们开发了 ChartNet:一个百万级规模的多模态数据集,专为图表解释和推理而构建,详细描述见我们即将发表的 CVPR 2026 论文

ChartNet 采用代码引导的合成流水线,生成 170 万个多样化的图表样本,涵盖 24 种图表类型和 6 种绘图库 [见图 1]。其独特之处在于每个样本包含五个对齐的组成部分——绘图代码、渲染图像、数据表格、自然语言摘要和问答对——为模型提供图表含义的深层跨模态视角,而非仅仅关注外观。该数据集还包含人工标注和真实世界子集,经过视觉保真度、语义准确性和多样性筛选。

这一训练资源使 VLM 从仅仅描述图表,转变为真正理解图表所编码的结构化信息——在不同模型规模、架构和任务上均带来稳定提升。

chartnet (1) 图 1:ChartNet 的合成数据生成流水线

DeepStack:更智能的视觉特征注入

大多数 VLM 在单一点将视觉信息注入语言模型,这迫使模型同时处理高层语义和细粒度空间细节。Granite 4.0 3B Vision 采用不同的方法,通过 DeepStack 注入:抽象视觉特征被路由到较早层进行语义理解,而高分辨率空间特征则被馈送到较晚层以保留细节。结果是模型既能理解文档中的内容,也能定位位置——这对于表格提取、图表理解和 KVP 解析等布局与内容同等重要的任务至关重要。完整技术细节请参见模型卡的模型架构部分。

模块化设计:一个模型,两种模式

Granite 4.0 3B Vision 以 LoRA 适配器的形式打包在 Granite 4.0 Micro 之上,而非独立模型。实际上,这意味着同一部署可同时服务多模态和纯文本工作负载,在不需要视觉时自动回退到基础模型。这使企业集成保持简洁,同时不牺牲性能。

性能表现

图表:在人工验证的 ChartNet 基准上使用 LLM-as-a-judge 评估,Granite 4.0 3B Vision 在所有评估模型中取得了最高的 Chart2Summary(86.4%)得分,包括显著更大的模型 [见图 2]。它在 Chart2CSV(62.1%)上也排名第二,仅次于 Qwen3.5-9B(63.4%),而后者规模是其两倍多。

image 图 2:Granite 4.0 3B Vision 在 chart2csv 和 chart2summary 上的性能,与同类视觉语言模型使用 LLM-as-a-judge 的比较

表格:我们在两种设置下评估表格提取:裁剪表格(独立区域)和整页文档(嵌入复杂布局中的表格)[见图 3]。基准套件包括 TableVQA-extract(裁剪表格图像)、OmniDocBench-tables(整页文档)和 PubTables-v2(裁剪和整页两种设置)。模型任务是以 HTML 格式提取表格,并使用 TEDS 评分,该指标同时捕捉结构和内容准确性。Granite 4.0 3B Vision 在各基准上均取得最强性能,在 PubTablesV2 裁剪(92.1)和整页(79.3)、OmniDocBench(64.0)和 TableVQA(88.1)得分上均领先所有评估模型。

Tables 图 3:Granite 4.0 3B Vision 在裁剪和整页基准(TableVQA-extract、PubTables-v2、OmniDocBench-tables)上的表格提取性能,以 TEDS 衡量

语义 KVPVAREX 是一个专为区分小型提取模型而设计的基准,包含 1777 份美国政府表单,涵盖从简单平面布局到复杂嵌套和表格结构的各种形式。模型使用精确匹配(EM)评估,这是一种严格的指标,要求模型提取的键值对与真实值完全匹配。Granite 4.0 3B Vision 在零样本设置下达到 85.5% 的 EM 准确率。

如何使用

Granite 4.0 3B Vision 可以作为独立的视觉信息提取引擎运行,也可以作为与 Docling 配合的全自动文档处理流水线的一部分。该模型旨在支持跨多种文档类型和视觉格式的可扩展、准确提取。

1. 独立图像理解

Granite 4.0 3B Vision 可以直接在单个图像上运行,这对于已有工作流、需要针对性视觉提取而无需修改上游系统的应用非常有用。这提供了与现有自动化工作流的轻松集成,适用于轻量级、特定任务的工具(例如表单解析器、图表分析器等)。

2. 与 Docling 集成的文档理解流水线

Granite 4.0 3B Vision 还可以与 Docling 无缝集成,支持完整的端到端文档理解。这种模式可以提供:

  • 多页 PDF 的大规模处理
  • 使用 Docling 自动检测、分割和裁剪图形、表格等视觉元素,并将清晰裁剪图重定向到 Granite Vision 模型进行细粒度提取
  • 更低的整体计算成本和更快的吞吐量
  • 更高的准确性、更可靠的提取,以及跨大型文档集合的显著效率提升

示例用例

  • 表单处理:使用 KVP 能力从发票、表单和收据中提取结构化字段,或使用 image2text 功能生成图形的自然语言描述(例如“详细描述这张图片“)。
  • 财务报告分析:使用 Docling 解析报告、检测图形并裁剪视觉元素。使用 Granite Vision 的 chart2csv、chart2code 能力处理图表,使用 tables_json 能力处理表格,将其转换为结构化、机器可读的数据,从而实现可操作的洞察。
  • 研究文档智能:利用 Docling 处理密集学术 PDF 的 OCR 和布局解析,并将提取的图形传递给 chart2summary、表格裁剪传递给 tables_html,使视觉内容与自由文本在单一流水线中可被发现。

立即体验

Granite 4.0 3B Vision 现已在 HuggingFace 上线,基于 Apache 2.0 许可证发布。完整的技术细节、训练方法和基准结果请参见模型卡。我们期待看到您用它构建的作品——欢迎在 社区 标签中分享您的反馈。

相似文章

Granite 4.1 LLMs:技术架构解析

Hugging Face Blog

本文详细介绍了 IBM Granite 4.1 大语言模型的技术架构与训练流程,涵盖预训练、SFT(监督微调)及 RL(强化学习)阶段。文章指出,该 8B 稠密模型在性能上超越了更大的 MoE(混合专家)模型,并提及模型以 Apache 2.0 许可证开源发布。

Granite 4.1 3B SVG 鹈鹕画廊

Simon Willison's Blog

IBM 在 Apache 2.0 许可下发布了 Granite 4.1 系列 LLM,Simon Willison 尝试使用该 3B 模型的 21 种不同量化变体生成骑自行车的鹈鹕 SVG 图像。