Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能模型
摘要
IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。
查看缓存全文
缓存时间: 2026/05/08 09:13
Granite 4.0 3B Vision: 面向企业文档的紧凑型多模态智能
来源:https://huggingface.co/blog/ibm-granite/granite-4-vision 返回文章 (https://huggingface.co/blog)
- Granite 4.0 3B Vision 是如何构建的
- ChartNet:教会模型真正理解图表
- DeepStack:更智能的视觉特征注入
- 模块化设计:一个模型,两种模式
- 性能表现
- 如何使用
- 立即体验
今天我们很高兴宣布 Granite 4.0 3B Vision 的发布——这是一款面向企业文档理解的紧凑型视觉语言模型(VLM)。它专为从复杂文档、表单和结构化视觉内容中可靠地提取信息而设计。Granite 4.0 3B Vision 在以下能力方面表现卓越:
- 表格提取:从文档图像中准确解析复杂表格结构(例如多行、多列等)
- 图表理解:将图表和图形转换为结构化机器可读格式、摘要或可执行代码
- 语义键值对(KVP)提取:识别并定位跨多种文档布局的语义关键字段对
该模型以 LoRA 适配器的形式发布,基于 Granite 4.0 Micro 这一稠密语言模型构建,将视觉和语言模块分离,便于纯文本回退和无缝集成到混合流水线中。它继续支持视觉语言任务,例如从图像生成详细自然语言描述(例如“详细描述这张图片“)。该模型可独立使用,也可与 Docling 配合使用,以增强文档处理流水线的深度视觉理解能力。
Granite 4.0 3B Vision 是如何构建的
Granite 4.0 3B Vision 的性能得益于三项关键投入:通过创新的代码引导数据增强方法构建的专用图表理解数据集、支持高细节视觉特征注入的 DeepStack 架构创新变体,以及保持模型企业部署实用性的模块化设计。
ChartNet:教会模型真正理解图表
图表对视觉语言模型(VLM)来说是一个挑战,因为理解图表需要联合推理视觉模式、数值数据和自然语言,而大多数 VLM 无法很好地处理这种组合,尤其是在需要空间精确性的情况下——例如从折线图中读取精确数值。为弥合这一差距,我们开发了 ChartNet:一个百万级规模的多模态数据集,专为图表解释和推理而构建,详细描述见我们即将发表的 CVPR 2026 论文。
ChartNet 采用代码引导的合成流水线,生成 170 万个多样化的图表样本,涵盖 24 种图表类型和 6 种绘图库 [见图 1]。其独特之处在于每个样本包含五个对齐的组成部分——绘图代码、渲染图像、数据表格、自然语言摘要和问答对——为模型提供图表含义的深层跨模态视角,而非仅仅关注外观。该数据集还包含人工标注和真实世界子集,经过视觉保真度、语义准确性和多样性筛选。
这一训练资源使 VLM 从仅仅描述图表,转变为真正理解图表所编码的结构化信息——在不同模型规模、架构和任务上均带来稳定提升。
图 1:ChartNet 的合成数据生成流水线
DeepStack:更智能的视觉特征注入
大多数 VLM 在单一点将视觉信息注入语言模型,这迫使模型同时处理高层语义和细粒度空间细节。Granite 4.0 3B Vision 采用不同的方法,通过 DeepStack 注入:抽象视觉特征被路由到较早层进行语义理解,而高分辨率空间特征则被馈送到较晚层以保留细节。结果是模型既能理解文档中的内容,也能定位位置——这对于表格提取、图表理解和 KVP 解析等布局与内容同等重要的任务至关重要。完整技术细节请参见模型卡的模型架构部分。
模块化设计:一个模型,两种模式
Granite 4.0 3B Vision 以 LoRA 适配器的形式打包在 Granite 4.0 Micro 之上,而非独立模型。实际上,这意味着同一部署可同时服务多模态和纯文本工作负载,在不需要视觉时自动回退到基础模型。这使企业集成保持简洁,同时不牺牲性能。
性能表现
图表:在人工验证的 ChartNet 基准上使用 LLM-as-a-judge 评估,Granite 4.0 3B Vision 在所有评估模型中取得了最高的 Chart2Summary(86.4%)得分,包括显著更大的模型 [见图 2]。它在 Chart2CSV(62.1%)上也排名第二,仅次于 Qwen3.5-9B(63.4%),而后者规模是其两倍多。
图 2:Granite 4.0 3B Vision 在 chart2csv 和 chart2summary 上的性能,与同类视觉语言模型使用 LLM-as-a-judge 的比较
表格:我们在两种设置下评估表格提取:裁剪表格(独立区域)和整页文档(嵌入复杂布局中的表格)[见图 3]。基准套件包括 TableVQA-extract(裁剪表格图像)、OmniDocBench-tables(整页文档)和 PubTables-v2(裁剪和整页两种设置)。模型任务是以 HTML 格式提取表格,并使用 TEDS 评分,该指标同时捕捉结构和内容准确性。Granite 4.0 3B Vision 在各基准上均取得最强性能,在 PubTablesV2 裁剪(92.1)和整页(79.3)、OmniDocBench(64.0)和 TableVQA(88.1)得分上均领先所有评估模型。
图 3:Granite 4.0 3B Vision 在裁剪和整页基准(TableVQA-extract、PubTables-v2、OmniDocBench-tables)上的表格提取性能,以 TEDS 衡量
语义 KVP:VAREX 是一个专为区分小型提取模型而设计的基准,包含 1777 份美国政府表单,涵盖从简单平面布局到复杂嵌套和表格结构的各种形式。模型使用精确匹配(EM)评估,这是一种严格的指标,要求模型提取的键值对与真实值完全匹配。Granite 4.0 3B Vision 在零样本设置下达到 85.5% 的 EM 准确率。
如何使用
Granite 4.0 3B Vision 可以作为独立的视觉信息提取引擎运行,也可以作为与 Docling 配合的全自动文档处理流水线的一部分。该模型旨在支持跨多种文档类型和视觉格式的可扩展、准确提取。
1. 独立图像理解
Granite 4.0 3B Vision 可以直接在单个图像上运行,这对于已有工作流、需要针对性视觉提取而无需修改上游系统的应用非常有用。这提供了与现有自动化工作流的轻松集成,适用于轻量级、特定任务的工具(例如表单解析器、图表分析器等)。
2. 与 Docling 集成的文档理解流水线
Granite 4.0 3B Vision 还可以与 Docling 无缝集成,支持完整的端到端文档理解。这种模式可以提供:
- 多页 PDF 的大规模处理
- 使用 Docling 自动检测、分割和裁剪图形、表格等视觉元素,并将清晰裁剪图重定向到 Granite Vision 模型进行细粒度提取
- 更低的整体计算成本和更快的吞吐量
- 更高的准确性、更可靠的提取,以及跨大型文档集合的显著效率提升
示例用例
- 表单处理:使用 KVP 能力从发票、表单和收据中提取结构化字段,或使用 image2text 功能生成图形的自然语言描述(例如“详细描述这张图片“)。
- 财务报告分析:使用 Docling 解析报告、检测图形并裁剪视觉元素。使用 Granite Vision 的 chart2csv、chart2code 能力处理图表,使用 tables_json 能力处理表格,将其转换为结构化、机器可读的数据,从而实现可操作的洞察。
- 研究文档智能:利用 Docling 处理密集学术 PDF 的 OCR 和布局解析,并将提取的图形传递给 chart2summary、表格裁剪传递给 tables_html,使视觉内容与自由文本在单一流水线中可被发现。
立即体验
Granite 4.0 3B Vision 现已在 HuggingFace 上线,基于 Apache 2.0 许可证发布。完整的技术细节、训练方法和基准结果请参见模型卡。我们期待看到您用它构建的作品——欢迎在 社区 标签中分享您的反馈。
相似文章
ibm-granite/granite-4.1-8b · Hugging Face
IBM 发布 Granite-4.1-8B:Apache 2.0 许可的 80 亿参数长上下文 Instruct 模型,工具调用与多语言能力全面升级。
Granite 4.1 LLMs:技术架构解析
本文详细介绍了 IBM Granite 4.1 大语言模型的技术架构与训练流程,涵盖预训练、SFT(监督微调)及 RL(强化学习)阶段。文章指出,该 8B 稠密模型在性能上超越了更大的 MoE(混合专家)模型,并提及模型以 Apache 2.0 许可证开源发布。
Granite 4.1 3B SVG 鹈鹕画廊
IBM 在 Apache 2.0 许可下发布了 Granite 4.1 系列 LLM,Simon Willison 尝试使用该 3B 模型的 21 种不同量化变体生成骑自行车的鹈鹕 SVG 图像。
Granite Embedding Multilingual R2:基于Apache 2.0的开源多语言嵌入模型,支持32K上下文——参数量低于1亿的检索质量最佳
IBM发布Granite Embedding Multilingual R2,这是一系列基于Apache 2.0的开源多语言嵌入模型,包含一个紧凑的97M参数模型,实现了参数量低于1亿的同类最佳检索质量,以及一个采用Matryoshka嵌入的311M参数模型,两者均支持32K上下文和200多种语言。
@jerryjliu0:ParseBench 是首个在完整企业文档中评测 VLM 图表理解能力的基准
ParseBench 首次把图表理解放进整份企业文档中评测视觉-语言模型,填补了以往仅针对孤立图表的基准空白。