如何从印度银行对账单PDF中提取交易表格?寻找开源/本地部署方案
摘要
作者正在开发一个信用承保AI代理,并寻求开源本地部署方法,从多样化的印度银行对账单PDF中提取结构化交易表格,面临布局变化的挑战,需要可靠的提取方法。
我在一家非银行金融公司(NBFC)工作,目前正在开发一个信用承保AI代理。流程中的第一步是从客户银行对账单PDF中提取结构化信息。这正是我目前卡住的地方。这些对账单可能来自不同的印度银行(HDFC、ICICI、SBI、Axis、Kotak等),每家银行的PDF布局可能完全不同。我需要可靠地提取如下信息:客户/账户信息——姓名、账号、IFSC、分行等。交易表格——日期、说明/描述、借方、贷方、余额。跨多行的交易行。表格标题在后续页面缺失的对账单。数字生成的PDF和扫描/图像PDF。理想情况下,解决方案应是与银行格式无关的。我尝试/考虑过的方法包括pdfplumber、表格提取库、OCR、基于正则表达式的解析和基于LLM的提取。我面临的最大问题是,即使文本被正确提取,列/行结构也会被打乱,尤其是因为许多银行PDF不包含真正的表格结构——它们本质上是位于不同坐标的文本。由于这是金融/客户数据,我强烈倾向于开源/本地部署解决方案,而不是将对账单发送到第三方API。对于任何构建过类似系统的人:什么方法最适合你?我特别感兴趣的是:你推荐的PDF解析/布局库;用于扫描对账单的OCR模型;开源视觉/文档AI模型;是否使用LLM/VLM进行语义列映射;如何处理不同银行格式,而不为每家银行编写完全独立的规则;检测交易行并将值映射到正确列的技术;如何验证提取的数据(例如,余额对账、借方/贷方检查、交易计数)。如果你专门处理过印度银行对账单,我真的很想听听你的架构、库/模型或经验教训。谢谢!
相似文章
BankStatementLab
BankStatementLab 是一款人工智能驱动的工具,可将银行对账单 PDF 转换为 Excel、CSV 或 JSON 格式。
如何从PDF中解析表格
关于从PDF中解析表格的建议:将PDF转换为PNG并使用Gemini 3.1 Pro配合low thinking模式,声称准确率达95%。其他工具如Extend、Reducto、Landing在此任务中表现不佳。
人工智能在欺诈性银行操作识别中的应用
本文研究了人工智能和机器学习算法在识别欺诈性银行交易中的应用,提出了预处理技术并比较了多种模型。人工神经网络和堆叠泛化方法取得了更高的AUC分数,最佳结果约为0.954。
@VikParuchuri:这是 lift(我们的开源提取模型)从一份杂乱的26页合同中提取结构化数据。
Vik Paruchuri 展示了 lift,一个能够从杂乱合同中提取结构化数据的开源提取模型。
一个非玩具型的AI代理工作流:寻找缺失的收据PDF
一个实用的AI代理工作流,通过导航供应商门户、处理登录和电子邮件验证,然后匹配并将收据附加到银行交易中,自动寻找缺失的收据PDF。