多模态大语言模型真的理解低资源高棉文档吗?关于高棉文档视觉问答的一项初步研究
摘要
本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。
arXiv:2608.28635v1 公告类型:新
摘要:近期,多模态大语言模型(MLLMs)在文档理解、视觉问答和文本提取方面取得了进展。然而,它们在低资源、非拉丁语环境中的可靠性仍然不确定。高棉表单文档尤其具有挑战性,因为它们包含复杂的脚本形式、高棉语-英语混合字段,以及以柬埔寨瑞尔和美元计价的货币价值。用于高棉文档视觉问答的可用资源也有限。本文对开放MLLMs在高棉文档图像上的表现进行了初步诊断评估。我们从先前引入的KH-FUNSD集合中构建了一个评估子集,涵盖发票、收据、报价单和其他业务表单。该子集包括英语和高棉语的问题,答案保留了原始英语、高棉语、混合脚本或数字形式。本研究不引入完整的公共基准,而是检查现有模型的能力和故障模式。我们使用直接基于图像的提示评估了代表性的开放Qwen-VL模型,并比较了解析器辅助和外部OCR辅助配置与Qwen3-VL-8B。直接使用Qwen3-VL-8B优于较小的模型,总体准确率达到51.9%,尽管在高棉语脚本和混合脚本答案上的性能仍然有限。外部OCR产生了最强的结果,使用Tesseract达到61.9%,使用PaddleOCR达到61.6%。然而,高棉语脚本的答案仍然比英语和数字字段困难得多。结果表明,当前的MLLMs可以处理视觉清晰的英语和结构化数字内容,但可靠的原生高棉文档理解仍然是一个开放的挑战。
查看缓存全文
缓存时间: 2026/09/01 11:57
# 多模态大语言模型是否真正理解低资源高棉语文档?一项针对高棉文档视觉问答的试点研究 来源:https://arxiv.org/html/2608.28635 11institutetext:中国科学技术大学,中国合肥 230052 22institutetext:巴黎西岱大学,法国巴黎 75013 ###### 摘要 近期的多模态大语言模型(\(MLLMs\))在文档理解、视觉问答和文本提取方面取得了进展。然而,它们在低资源、非拉丁语环境下的可靠性仍不确定。高棉语表单文档因其包含复杂的文字形式、高棉语-英语混合字段以及同时使用柬埔寨瑞尔和美元的货币数值而带来特殊挑战。适用于高棉文档视觉问答(Document VQA)的现有资源也有限。本文对开源多模态大语言模型在高棉文档图像上的表现进行了试点性诊断评估。我们从先前引入的KH-FUNSD集合中构建了一个评估子集,涵盖发票、收据、报价单及其他商业表单。该子集包含英语和高棉语的问题,答案则保留其原始的英语、高棉语、混合文字或数字形式。本研究并非引入完整的公开基准,而是旨在考察现有模型的能力与失败模式。我们使用直接图像提示评估了代表性的开源通义千问视觉语言模型(Qwen-VL),并使用通义千问3视觉语言模型8B(Qwen3-VL-8B)比较了解析器辅助和外部OCR辅助的配置。直接使用Qwen3-VL-8B优于较小模型,总体准确率达到51.9%,尽管在高棉语和混合文字答案上的表现仍有限。使用外部OCR(Tesseract和PaddleOCR)产生了最强结果,分别达到61.9%和61.6%的准确率。然而,高棉语答案仍然比英语和数字字段困难得多。结果表明,当前的多模态大语言模型能够处理视觉清晰的英语和结构化数字内容,但可靠的原生高棉文档理解仍是一个开放挑战。 ## 1引言 多模态大语言模型(\(MLLMs\))越来越多地被用于文档理解任务,例如视觉问答、类似OCR的转录、信息提取、表单解读和布局感知推理。文档视觉问答(Document VQA 或 DocVQA)已成为文档智能的重要基准方向\[9 (https://arxiv.org/html/2608.28635#bib.bib1),1 (https://arxiv.org/html/2608.28635#bib.bib14),17 (https://arxiv.org/html/2608.28635#bib.bib12),10 (https://arxiv.org/html/2608.28635#bib.bib21)\]\。 近期的多模态大语言模型,包括通义千问视觉语言模型(Qwen-VL)\[3 (https://arxiv.org/html/2608.28635#bib.bib3)\]、通义千问2.5视觉语言模型(Qwen2.5-VL)\[5 (https://arxiv.org/html/2608.28635#bib.bib4)\]和通义千问3视觉语言模型(Qwen3-VL)\[4 (https://arxiv.org/html/2608.28635#bib.bib5)\]表明,视觉语言模型在文本丰富的图像理解、文档式问答和结构化信息提取方面的能力正日益增强。 参考标题图1:当前多模态大语言模型在高棉文档内容上的局限性,体现在两个任务中:(a) 高棉语OCR/文本提取,模型遗漏或损坏原生高棉字符;(b) 高棉文档图像生成,模型生成视觉上看似合理但包含伪高棉语或语言上无效文本的布局。然而,在主流文档基准上的强大进展并不必然意味着对低资源非拉丁文档的可靠理解。高棉语是一种低资源非拉丁语言,与英语、中文、日语和主要欧洲语言等高资源语言相比,其文档AI资源有限。高棉文具有视觉上复杂的特征,包括堆叠辅音、附元音、变音符号、密集的字符组合以及有限的明确单词分隔。这些特性使得文本识别变得困难,特别是在受模糊、低分辨率、透视失真、压缩伪影、光照不均以及手写或印章影响的现实世界文档中\[18 (https://arxiv.org/html/2608.28635#bib.bib18),7 (https://arxiv.org/html/2608.28635#bib.bib33),11 (https://arxiv.org/html/2608.28635#bib.bib34)\]\。对于不熟悉高棉文的读者,图1 (https://arxiv.org/html/2608.28635#S1.F1)中的裁剪示例和图2 (https://arxiv.org/html/2608.28635#S1.F2)中的文档示例说明了密集的原生文字文本、堆叠形式以及高棉语-英语混合字段,这些使该环境不同于拉丁文字文档视觉问答。 有趣的是,当前的多模态大语言模型可能在高棉文档任务中产生看似合理的输出,但在高棉文本提取或文档生成中仍存在严重错误,如图1 (https://arxiv.org/html/2608.28635#S1.F1)所示。这一观察激发了本研究。在类似OCR的提取中,模型可能遗漏单词、替换字符、误读数字或生成畸形的高棉语字符串。在文档生成中,模型可能创建视觉上看似合理的收据或表单布局,但产生伪高棉语或混合东南亚风格的无效语言文本。这些例子表明,视觉上的可信度并不必然意味着真正的高棉文档理解。 参考标题图2:现实世界的高棉商业文档呈现出混合语言和货币挑战:(a) 包含柬埔寨瑞尔货币的高棉内容;(b) 包含美元货币的高棉语-英语混合内容;(c) 列出柬埔寨瑞尔和美元数值的英语主导内容。这些例子说明了模型为何必须同时处理原生高棉文本、混合文字字段和货币基准。现实世界的高棉文档带来了超越原生文字识别的挑战。如图2 (https://arxiv.org/html/2608.28635#S1.F2)所示,柬埔寨的发票、收据、报价单和行政表单通常包含高棉语-英语混合内容。高棉语和英语并非总是分离成清晰的单语块;相反,它们可能出现在同一行、字段、表格、产品描述、公司抬头或地址中。货币的使用增加了另一层难度。柬埔寨商业文档可能使用柬埔寨瑞尔、美元或两者兼有。因此,模型必须读取数字值、识别关联字段,并将金额基准到正确的货币和文档语境中。 尽管存在这些挑战,高棉文档理解在当前的文档视觉问答研究中仍探索不足。现有基准推动了该领域的发展,但许多基准由高资源语言、相对干净的文档图像或未能完全代表低资源非拉丁环境的文档集合主导。仅在此类基准上评估多模态大语言模型可能会高估其泛化到代表性不足语言的真实世界多语文档的能力。 在本文中,我们呈现了一项仅针对高棉语的多模态大语言模型文档视觉问答试点诊断研究。我们的目标不是引入完整的基准或广泛的模型排行榜。相反,我们考察近期的开源多模态大语言模型是否能够可靠地回答选定的高棉商业文档图像上的问题,并分析其失败之处。我们设计了英语问题和高棉语问题两种设置,并保留答案的原始形式。这使我们能够分析模型在不同问题语言和答案类型下的行为,包括英语、高棉语、混合文字以及数字/日期/货币答案。 失败分析是实现这一目标的关键。在商业和财务文档工作流中,一个系统可能从整体准确性上看显得有用,但在高风险情况下仍然失败,例如姓名、原生高棉文字字段或货币金额。因此,研究失败案例可以阐明任务成功需要什么:不仅是看似合理的答案,还包括可靠的原生文字阅读、字段基准以及校准的OCR证据使用。 本文的主要贡献如下: - • 我们提出了针对低资源高棉文档视觉问答的多模态大语言模型性能的试点诊断研究。 - • 我们分析了英语问题和高棉语问题两种设置,同时保留答案的原始文字或格式。 - • 我们比较了直接提示、多模态大语言模型-解析器辅助提示以及外部OCR辅助提示。 - • 我们识别了涉及高棉文字识别、混合文字字段混淆、货币基准以及看似合理但无支持答案的失败模式。 ## 2相关工作 ### 2\.1文档视觉问答与用于文档理解的多模态大语言模型 视觉问答(VQA)作为一种通用视觉-语言任务被引入,模型回答关于图像的自然语言问题\[1 (https://arxiv.org/html/2608.28635#bib.bib14)\]\。文档视觉问答后来将这一设置扩展到文档图像,模型必须阅读文本、解读布局、识别表格或表单,并将答案基准到视觉结构化的内容中。与通用图像视觉问答不同,文档视觉问答需要类似OCR的阅读、布局理解和视觉推理之间的紧密交互。DocVQA数据集大规模引入了这一任务,问题定义在文档图像上,答案从文档内容中提取\[9 (https://arxiv.org/html/2608.28635#bib.bib1)\]\。后续工作将该设置扩展到文档集合,其中回答一个问题可能需要在提取答案之前检索相关文档\[15 (https://arxiv.org/html/2608.28635#bib.bib2)\]\。近期的工作也探索了文档视觉问答中的可解释性,例如学习证明模型答案的视觉证据图\[17 (https://arxiv.org/html/2608.28635#bib.bib12)\]\。 近期的多模态大语言模型在图像-文本理解和文档式推理方面表现出强劲进展。通义千问视觉语言模型引入了具有文本阅读和基准能力的视觉-语言模型系列\[3 (https://arxiv.org/html/2608.28635#bib.bib3)\]\。通义千问2.5视觉语言模型进一步强调视觉识别、文档解析、表单和表格的结构化提取以及动态分辨率处理\[5 (https://arxiv.org/html/2608.28635#bib.bib4)\]。通义千问3视觉语言模型扩展了这一系列,具有更强的多模态推理、扩展的OCR支持、长上下文能力以及适合实际开源模型评估的密集模型变体,如4B和8B\[4 (https://arxiv.org/html/2608.28635#bib.bib5)\]。 尽管取得了这些进展,文档理解仍然容易受到流畅但错误输出的影响。现有的文档视觉问答基准在评估文档理解系统方面发挥了重要作用,但许多仍由英语或其他高资源语言设置主导。强大的基准表现因此可能掩盖在低资源非拉丁文档上的弱点。 ### 2\.2OCR和解析器辅助文档视觉问答 许多文档理解流程在问答之前依赖于OCR或文档解析。早期的以文本为中心的视觉问答工作表明,OCR检测到的文本可以为回答文本丰富图像上的问题提供重要线索\[10 (https://arxiv.org/html/2608.28635#bib.bib21)\]\。在文档智能中,基于OCR的表示也被广泛用于结合识别的文本、布局位置和视觉特征。例如,LayoutLM和LayoutLMv2联合建模文本、布局和图像信息,用于视觉丰富的文档理解任务\[22 (https://arxiv.org/html/2608.28635#bib.bib22),21 (https://arxiv.org/html/2608.28635#bib.bib23)\]\。类似地,文档视觉问答将文档视觉问答表述为从文档图像回答自然语言问题,通常需要模型阅读文本并将答案基准到文档区域\[9 (https://arxiv.org/html/2608.28635#bib.bib1)\]\。 近期的多模态大语言模型可以直接处理文档图像,减少了对显式OCR流程的依赖。然而,直接的多模态大语言模型提示是否足以处理低资源非拉丁文字仍不清楚。解析器辅助提示提供了一种测试此问题的方法。模型首先从文档中生成文本证据或结构化字段,然后使用这些证据来回答问题。外部OCR辅助提示提供了另一种设置,其中专用OCR引擎提取的文本与图像和问题一起提供给多模态大语言模型。 ### 2\.3高棉文档理解 低资源文档理解仍然具有挑战性,因为许多语言缺乏大型标注数据集、强大的OCR系统、文档布局基准和预训练语言资源。对于非拉丁文字,问题因特定于文字的视觉结构(如变音符号、堆叠形式、字符整形和不规则间距)而进一步复杂化。这些问题在现实世界文档中变得更加严重,因为文本可能很小、模糊、扭曲、有印章、手写或与其他语言混合\[11 (https://arxiv.org/html/2608.28635#bib.bib34),8 (https://arxiv.org/html/2608.28635#bib.bib35),18 (https://arxiv.org/html/2608.28635#bib.bib18),19 (https://arxiv.org/html/2608.28635#bib.bib10)\]\。 高棉文档理解尤其代表性不足。先前的高棉OCR研究强调了诸如堆叠字符、变音符号、非均匀字符宽度、有限的单词分隔以及稀缺训练数据等挑战\[20 (https://arxiv.org/html/2608.28635#bib.bib32),11 (https://arxiv.org/html/2608.28635#bib.bib34)\]\。然而,大多数现有工作专注于OCR或场景文本识别,而非文档视觉问答——后者需要模型解读问题、定位相关字段、读取答案并保留正确的文字或数字格式。 现实世界的高棉商业文档还包含混合语言和货币丰富的内容。在柬埔寨,高棉语是官方语言,而英语常用于商业环境,其他语言如中文也可能出现在商业语境中\[6 (https://arxiv.org/html/2608.28635#bib.bib26),20 (https://arxiv.org/html/2608.28635#bib.bib32)\]\。更普遍地说,多语言社会通常涉及语码转换或混合语言使用\[16 (https://arxiv.org/html/2608.28635#bib.bib27),2 (https://arxiv.org/html/2608.28635#bib.bib28)\]\。因此,柬埔寨的发票、收据和报价单可能包含高棉语、英语或高棉语-英语混合字段。它们也可能包括柬埔寨瑞尔、美元或两者兼有,反映了柬埔寨高度美元化的经济\[13 (https://arxiv.org/html/2608.28635#bib.bib29),14 (https://arxiv.org/html/2608.28635#bib.bib30),12 (https://arxiv.org/html/2608.28635#bib.bib31)\]\。 ## 3试点高棉文档视觉问答数据集 表1:试点高棉文档视觉问答评估子集的统计信息。### 3\.1来源集合与范围 试点评估子集选自KH-FUNSD\[20 (https://arxiv.org/html/2608.28635#bib.bib32)\],这是一个先前引入的现实世界高棉商业和行政文档集合,包括发票、收据、报价单和其他表单。这些文档包含高棉语-英语混合文本、结构化字段、表格布局、公司信息、分项行、数字标识符、日期和货币数值。 我们仅将KH-FUNSD用作小型诊断文档视觉问答子集的来源,并非声称引入完整的公开高棉文档视觉问答基准。我们的目标是评估当前的多模态大语言模型是否能够可靠地回答关于低资源高棉文档的问题,并识别常见的失败模式。 该子集专注于发票、收据和报价单,因为它们包含重复出现的商业概念、结构化字段、混合语言内容和货币价值。它们也代表了实际的柬埔寨工作流程,其中文档理解可以支持信息提取、搜索和行政处理。 ### 3\.2问题与答案设计 对于每个文档图像,我们构建覆盖常见文档理解需求的问题-答案对,包括字段提取、
相似文章
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
KhatianDoc:一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败
本文介绍了KhatianDoc,一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败,揭示了当前模型在符号识别和文档问答等任务上的失败。
高棉语检索增强问答的语言模型比较研究
本文对电信领域高棉语检索增强问答中的嵌入模型和生成器后端进行了比较评估,发现BGE-M3在检索方面表现最佳,而生成器的优势因指标而异。
KSE-Web:针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析
本文介绍了KSE-Web,一项针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析研究。研究通过构建一个数据集,评估了BM25、稠密检索以及混合检索方法,发现BM25表现最佳,同时LLM查询扩展在柬埔寨语应用中存在局限性。
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。