KhatianDoc:一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败
摘要
本文介绍了KhatianDoc,一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败,揭示了当前模型在符号识别和文档问答等任务上的失败。
arXiv:2609.03597v1 公告类型:新
摘要:孟加拉国的土地所有权记录在Ana-Ganda-Kora-Kranti-Til中,这是一个基于16的位置分数系统,具有专用的Unicode字形,没有主流字体,且未被任何OCR管道或分词器覆盖。携带这些分数的亲笔记录,RS Khatians,是数百万地块的权威产权记录,也是民事诉讼的常见主题,但至今没有基准测试过机器是否能读取它们。我们引入KhatianDoc,这是一个四任务基准,基于107份来自孟加拉国Munshiganj的Vumi(土地)办公室的真实RS Khatian记录:符号识别、基数16到十进制转换、结构化字段提取和法律文档问答,包含1,634个问答对。真实数据由手工转录,经土地法律从业者验证至完全一致,并通过位置令牌进行匿名化,以保持多跳问题所需的参考区分。我们在固定的零样本协议下评估了六个多模态LLM(8B到72B+,开源和闭源)。五个问答类别,占我们分层数据集的39.3%,所有模型都返回零个正确答案;在算术任务上,每个输出数字的模型都比常数均值基线表现更差,精确匹配和近似匹配分数一致:这是去相关,而不是近似。审核我们自己的指标发现了两个相反方向的伪影:我们修正了一个拒绝评分错误,并在原始分数旁报告修正后的分数,同时指出一个夸大的元数据指标作为上界。KhatianDoc记录的不是性能差距,而是能力的缺失,为未来系统提供了经过验证的真实数据。代码和数据,包括部分图像发布,已公开提供。
查看缓存全文
缓存时间: 2026/09/04 06:02
# KhatianDoc:一个经人工验证的基准,用于诊断多模态LLM在孟加拉土地记录上的失效
来源:https://arxiv.org/html/2609.03597
\[ Path=\./, Extension=\.otf, UprightFont=\*\-regular, BoldFont=\*\-bold, ItalicFont=\*\-italic, BoldItalicFont=\*\-bolditalic \] \[ Path=\./, Extension=\.ttf, UprightFont=\*\-Regular, Script=Bengali, Scale=0\.98 \]
Tasmiad Hasan Arafat Zaman Ratul Sarker Sadman SaalimAffiliation:S\.M\. Shah Nawaz Hossain Khan Raiyan Ibne Reza Sumaiya Tabassum NimiAffiliation:North South University, Dhaka, BangladeshAffiliation:\{tasmiad\.hasan, arafat\.ratul, sarker\.saalim, nawaz\.hossain, raiyan\.reza, sumaiya\.nimi\}@northsouth\.edu
###### 摘要
孟加拉国的土地所有权记录在*Ana\-Ganda\-Kora\-Kranti\-Til*中,这是一个以16为基数的位值分数系统,具有专用Unicode字符,没有主流字体支持,也未被任何OCR管道或分词器覆盖。承载这些分数的手写记录——RS Khatian——是数百万地块的权威权属记录,也是民事诉讼的常见主题,但此前没有任何基准测试询问过机器能否阅读它们。我们引入了KhatianDoc,一个包含四项任务的基准,基于从孟加拉国蒙希甘杰区的Vumi(土地)办公室获取的107份真实RS Khatian记录构建:符号识别、16进制转十进制、结构化字段提取,以及基于1,634个问答对的法律文档问答。真值经人工转录,由土地法律从业者验证至完全一致,并通过保持多跳问答所需引用区别的位置化令牌进行了匿名化处理。我们在固定的零样本协议下评估了六个多模态LLM(参数从8B到72B+,包括开源和闭源模型)。五类问答,占分层测试集的39.3%,在*所有*模型中返回零正确答案;在算术任务上,每个输出数字的模型都比一个始终预测数据集均值的常数均值基线表现更差,且精确匹配和近似匹配分数吻合:这是去相关,而非近似。对我们自身指标的审计发现了两个方向相反的伪像:我们修正了一个拒绝评分错误并报告了修正后的分数与原始分数并列,同时将一个膨胀的元数据指标标记为上界。KhatianDoc记录的并非性能差距,而是一种能力的缺失,并为未来系统提供了经过验证的真值。代码和数据(包含脱敏后的图像发布)已公开。
关键词:孟加拉语NLP;法律文档理解;低资源基准;视觉语言模型;手写文档OCR;土地记录;16进制数字。
要点:
- •首个针对孟加拉语RS Khatian记录和Ana\-Ganda 16进制分数的基准。
- •六个多模态LLM在39.3%的法律问答中得零分:一个难以逾越的推理门槛。
- •每个模型在16进制算术任务上的表现均低于常数均值基线。
- •一项指标自审计修正了拒绝评分错误并标记了一个膨胀的指标。
- •使用经脱敏的公开图像发布进行位置化令牌匿名化。
参见标题
参见标题
图1:来自公开发布的KhatianDoc的两份记录。每份文档都是同一标准化RS表格的整页扫描,由手工填写。身份信息区域在发布前用不透明方框遮蔽:所有者姓名和地址(第1列)、表格和Khatian编号、地区/乌帕齐拉/穆扎标题,以及底部的官员印章和签名。*核心*任务评分的字段(份额列\\bnfontঅংশ、收入\\bnfontরাজস্ব、地块编号\\bnfontদাগ নং、土地类别\\bnfontজমির শ্রেণী,以及Ana\-Ganda面积条目)位于所有遮蔽区域之外,保持完整。落入遮蔽区域的第3任务元数据标题字段(Khatian和表格编号、地区、乌帕齐拉、穆扎)由单独的公开发布评分协议处理,该协议定义于§匿名化与图像发布。(https://arxiv.org/html/2609.03597#Sx2.SS0.SSS0.Px2)。## 1引言
从法律上讲,孟加拉国的土地所有权由*Ana\-Ganda\-Kora\-Kranti\-Til*定义,这是一个以16为基数的位值分数系统,由手工书写到称为RS Khatian的政府调查记录中。这些记录在财产纠纷中具有直接的法律效力(World Bank, 2024 (https://arxiv.org/html/2609.03597#bib.bib1))。它们是数百万地块的权属权威记录,然而它们几乎完全处于现代数字基础设施之外。Ana\-Ganda字符没有标准字体支持,没有OCR覆盖,也没有出现在我们所知的任何NLP分词器词汇表中。法律NLP社区已经为法院判决和合同构建了强大的系统(Chalkidis et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib3);Malik et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib2)),但没有任何系统能够同时应对一份Khatian文件呈现给读者的所有挑战:退化的手写表格、非十进制的位值数字系统,以及关于谁拥有什么的隐私敏感问题。
我们构建KhatianDoc是为了具体地衡量这一差距。它基于通过蒙希甘杰区Vumi办公室获得的107份真实RS Khatian记录,并将其组织成四个范围递增的任务:符号识别、16进制算术、结构化字段提取,以及基于1,634个问答对的法律文档问答。每个真值字段都由人工手写,然后由一位具有土地法经验的律师逐行检查;第二遍达到了在字符身份和十进制值上完全一致。当我们在一个固定的零样本协议下用六个多模态LLM对其进行测试时,我们没有发现部分能力的平滑曲线,而是发现了一个底线。五类问答,合计占评估集的39.3%,在所有测试的模型中返回零正确答案,并且在算术任务上,每个生成数字的模型都*高于*一个完全忽略其输入并始终猜测数据集均值的基线的错误率。在此过程中,将评分代码与其自身输出进行对比发现了两个伪像(一个通过常数和空值字段膨胀了元数据匹配指标,另一个因模型正确拒绝而惩罚模型),我们公开揭示并报告了这些问题。
我们的贡献有三方面。
- •基准。据我们所知,KhatianDoc是首个针对孟加拉语RS Khatian记录的基准,并且包含了首个机器可检查、经法律验证的Ana\-Ganda 16进制分数系统编码(§3 (https://arxiv.org/html/2609.03597#S3))。
- •诊断。对六个前沿多模态LLM的零样本评估记录了在复杂法律推理上的普遍失败,以及在非十进制算术上的低于基线的表现(§5 (https://arxiv.org/html/2609.03597#S5), §6 (https://arxiv.org/html/2609.03597#S6))。
- •方法。我们报告了可迁移的经验:一种修正了两个评估伪像的指标自审计,一种保持多跳问答可答性的隐私保护位置化令牌管道,以及一种针对提及真实人物记录的脱敏图像发布策略(§3 (https://arxiv.org/html/2609.03597#S3), §6 (https://arxiv.org/html/2609.03597#S6), §匿名化与图像发布。(https://arxiv.org/html/2609.03597#Sx2.SS0.SSS0.Px2))。
第2节 (https://arxiv.org/html/2609.03597#S2)将KhatianDoc置于先前工作背景中;§3 (https://arxiv.org/html/2609.03597#S3)描述其构建过程;§4 (https://arxiv.org/html/2609.03597#S4)确定了评估协议;§5 (https://arxiv.org/html/2609.03597#S5)–6 (https://arxiv.org/html/2609.03597#S6)报告了结果和失效分析。
## 2相关工作
#### 文档IE与法律DocVQA。
文档理解模型(Xu et al., 2020 (https://arxiv.org/html/2609.03597#bib.bib24);Huang et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib12);Kim et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib16);Mathew et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib20))及其训练语料库(Jaume et al., 2019 (https://arxiv.org/html/2609.03597#bib.bib15);Huang et al., 2019 (https://arxiv.org/html/2609.03597#bib.bib13);Park et al., 2019 (https://arxiv.org/html/2609.03597#bib.bib21);Pfitzmann et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib22))压倒性地假设表单是打字输入、拉丁文字的。法律领域基准(Chalkidis et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib3);Hendrycks et al., 2021a (https://arxiv.org/html/2609.03597#bib.bib10))处理的是干净的数字化文本。没有任何基准处理过其最重要数字字段用无字体、无OCR支持的16进制位值文字书写的文档,而这正是KhatianDoc的第1和第3任务所探测的情景。
#### 多语言和低资源法律NLP。
ILDC(Malik et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib2))、MultiEURLEX(Chalkidis et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib4))、IndicBERT(Doddapaneni et al., 2023 (https://arxiv.org/html/2609.03597#bib.bib7))和BanglaBERT(Bhattacharjee et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib14))都针对以10为基数的、打字输入的现代散文。RS Khatian是手写的、大量缩写的、表格化的,并且它们具有法律约束力的数值存在于我们检查过的每个分词器词汇表都缺失的数字系统中。这里的差距不是语言覆盖范围的问题,而是在文字和数字系统层面的不可见性。
#### 量化和符号推理。
GSM8K(Cobbe et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib6))、MATH(Hendrycks et al., 2021b (https://arxiv.org/html/2609.03597#bib.bib11))、MathVista(Lu et al., 2024 (https://arxiv.org/html/2609.03597#bib.bib19))、NumGLUE(Mishra et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib9))、FinQA(Chen et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib5))和LegalBench(Guha et al., 2023 (https://arxiv.org/html/2609.03597#bib.bib8))仅以10为基数测试算术。KhatianDoc的第2任务要求处理一种具有不同代数结构的计算(一个带有四个嵌套子单元的16进制位值分数),这是我们所知的任何推理基准都未曾实例化的。§5 (https://arxiv.org/html/2609.03597#S5)中的低于基线结果表明,正是这种结构性的新颖性,而不仅仅是难度,驱动了失败。
#### 隐私保护的法律AI。
标准去标识化将每个名称都压缩成一个通用标签(Lison et al., 2021 (https://arxiv.org/html/2609.03597#bib.bib18);Sweeney, 2002 (https://arxiv.org/html/2609.03597#bib.bib23);Li et al., 2022 (https://arxiv.org/html/2609.03597#bib.bib17))。对于多跳法律问答,这悄然破坏了任务:被同一\[NAME\]令牌替换的两方使得份额比较问题在结构上无法回答。KhatianDoc的位置化令牌管道(§3\.3 (https://arxiv.org/html/2609.03597#S3.SS3))保留了多跳推理所需的指称区别,这是我们以前在法律NLP基准中未曾见过的设计选择。
## 3 KhatianDoc基准
KhatianDoc基于真实的政府土地记录构建,并经过端到端验证,未使用任何自动化转录。本节涵盖文档如何获取、转录、匿名化以及切割成任务。§4 (https://arxiv.org/html/2609.03597#S4)描述了我们如何测试模型。
### 3\.1来源文档
该基准包含107份RS(修订调查)Khatian记录,通过孟加拉国蒙希甘杰区的Vumi (\\bnfontভূমি)办公室获得。每份记录都是一页打印的政府表格的整页扫描,由手工填写,记录了单个穆扎库玛丽亚(\\bnfontকুমারিয়া)的所有权、地块边界和继承份额分数。六份文档延续到第二页物理页面;我们将其保留为配对扫描(\_p1/\_p2)而不进行拼接,以便文档边界与办公室实际出具的文档相匹配。因为每份记录共享同一个颁发办公室、一个穆扎和一个标准化表格,所以该语料库隔离了一个单一、定义明确的行政文体:一种正在使用的法律文书,而非其合成模仿。图1 (https://arxiv.org/html/2609.03597#S0.F1)显示了发布版中的两个示例。
### 3\.2真值构建
KhatianDoc中的每个字段(元数据、表格行和Ana\-Ganda符号串)都是直接从扫描件手工转录的。在任何阶段都没有使用OCR系统,这是故意的。Ana\-Ganda Unicode范围(§3\.4 (https://arxiv.org/html/2609.03597#S3.SS4))没有可靠的字体或OCR支持,因此依靠自动化转录来构建真值,会恰好将基准旨在测量被测系统误差的部分引入。标注者对每份文档进行了第一遍转录;一位具有土地法专长的孟加拉律师随后独立审核了每份转录稿,进行了第二遍检查,特别注意分数字符串,因为其读取对记录的份额具有直接的法律权重。第二遍检查与校正后的转录稿在符号身份和十进制值上完全一致,其输出即为本文通篇使用的真值。语料库不大,但它是一个精选集:其中的每个值都由人类阅读了两次,其中一次是律师阅读的,没有任何值是机器猜测的。
### 3\.3隐私保护匿名化
RS Khatian是真实的法律文件,指名真实个体:所有者、其父或夫,以及地址前缀。转录后,我们将每个此类字段替换为位置化令牌(\[PERSON\_1\],\[PERSON\_2\], ...),在任务3的结构化记录中保持一致,并贯穿于任务4的问题、答案和证据片段管道。我们有意使用位置化而非通用令牌:任务4中的几个问题是多跳的,依赖于区分同一文件中的两个命名方,而单一扁平的\[NAME\]令牌会抹去这种区别,并使部分问答无法回答。结构性和法律字段(穆扎、Khatian编号、土地类别、份额分数)在*文本真值*中保持不变,因为匿名化它们会删除任务旨在测试的内容。发布的页面图像单独处理:它们还遮蔽了包含Khatian和表格编号以及地区/乌帕齐拉/穆扎标签的标题区域,因此图像发布和文本发布不会暴露相同的字段。我们在§匿名化与图像发布。(https://arxiv.org/html/2609.03597#Sx2.SS0.SSS0.Px2)中将这一分离明确为两级评分协议,因为这是公共产物和安全原件存在差异的地方。
### 3\.4Ana\-Ganda\-Kora\-Kranti\-Til系统
孟加拉国的所有权份额以16进制位值分数系统记录,称为Ana\-Ganda\-Kora\-Kranti\-Til (\\bnfontআনা\-\\bnfontগণ্ডা\-\\bnfontকড়া\-\\bnfontক্রান্তি\-\\bnfontতিল),而非十进制。基本单位是*Ana*:16个Ana构成一个完整地块,Ana值使用范围在U\+09F4–U\+09F9的专用Unicode字符书写。四个子单位(Ganda, Kora, Kranti, Til)将份额细化到单个Ana以下,其精度无法用任何普通的十进制分数直接表示(完整的转换规则和一个计算实例在附录B (https://arxiv.org/html/2609.03597#A2)中)。这是该国财产分割的现行法律标准,但它几乎完全处于主流数字排版之外:这些字符没有标准字体支持,并且我们测试的任何OCR管道都无法识别它们。据我们所知,KhatianDoc是首个将Ana\-Ganda值编码为机器可检查真值的数据集。
### 3\.5任务定义与统计
KhatianDoc有四个范围递增的任务,从孤立的字符到完整文档,总结在表1 (https://arxiv.org/html/2609.03597#S3.T1)中。
任务1(符号识别)配对了95个灰度裁剪区域相似文章
Khondo:孟加拉语表单文档包分割的多模态基准
介绍了 Khondo,这是首个针对孟加拉国政府表单文档包分割的基准。它是一个原生视觉、双语数据集,涵盖多种连接方案,对 MLLMs 的零样本评估表明,页面顺序重建仍然是一个关键的未解决问题。
MultiSoc-4D:用于诊断孟加拉语社交媒体封闭集大语言模型标注中指令诱导标签崩溃的基准
本文介绍了 MultiSoc-4D,这是一个用于诊断大语言模型在标注孟加拉语社交媒体数据时出现的指令诱导标签崩溃问题的基准测试。研究揭示,大语言模型系统性地倾向于使用默认标签,导致对仇恨言论和讽刺等少数类别的检测不足。
多模态大语言模型真的理解低资源高棉文档吗?关于高棉文档视觉问答的一项初步研究
本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。