基于LLM的跨语言手写OCR自动机器学习:利用GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索
摘要
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。
arXiv:2607.15509v1 公告类型:交叉
摘要:我们提出了一种全自动闭环AutoML框架,利用GPT-5、GPT-4o和Claude Sonnet 4作为自主神经架构设计师,用于跨语言手写光学字符识别。每个大语言模型独立生成、训练、评估并基于先前试验的性能反馈迭代优化神经网络架构。该框架在阿拉伯语、波斯语和英语手写数据集上通过270次独立实验进行评估。它能够持续发现准确且计算高效的模型,无需手动架构设计、特定领域的预处理或超参数调优。生成的模型平均测试准确率超过93%,最高准确率达到98.1%,推理延迟在41至44毫秒之间。结果表明,大语言模型可以作为有效的AutoML代理进行神经架构搜索,从而实现跨语言的可扩展、适应文字且可重复的手写识别。
查看缓存全文
缓存时间: 2026/07/20 09:26
# LLM驱动的跨语言手写OCR自动机器学习:基于GPT-5、GPT-4o和Claude Sonnet 4的闭环神经架构搜索 来源:https://arxiv.org/html/2607.15509 ###### 摘要 跨越不同文字的手写文本识别一直是机器学习领域的持久挑战,因为每种语言和书写系统都引入了独特的视觉复杂性和要求。传统方法依赖于专家指导的模型设计和大量预处理,这使得高效扩展和适应新文字变得困难。在这项工作中,我们引入了一个完全自动化且跨语言的流水线,利用大型语言模型GPT-5、GPT-4o和Claude Sonnet 4,独立生成、评估和优化用于手写光学字符识别的神经网络架构。该过程无需人工干预、特定领域的预处理或人工选择模型,从而形成了一个完整的端到端自动化系统。 我们将此方法应用于阿拉伯语、英语和波斯语文字,每种文字代表了不同的字符形状和书写传统,并对每种语言进行了三十次独立试验。该流水线始终能发现高效且测试准确率高的模型,平均得分超过93%,同时还能保持满足实时应用需求的推理速度。值得注意的是,该系统能够自动探索广泛的神经架构,并自适应地选择适合每种文字独特要求的设计,而无需人类专家的任何明确指导。这些结果表明,大型语言模型可以超越语言处理范畴,充当机器学习系统的独立设计师。这为多语言手写文本识别提供了一个可扩展、与文字无关且完全自动化的解决方案,为OCR技术在许多语言和领域中的快速、自适应部署打开了大门。 ## 一、引言 将手写文本转换为数字格式对编辑、学生、档案管理员和研究人员等专业人士来说越来越重要。尽管人工智能取得了显著进步,但在阿拉伯语、英语和波斯语等多种文字中准确识别手写字符仍然是一个复杂挑战。这些语言具有独特的结构特征,包括复杂的笔画模式、变音符号以及个人之间书写风格的高度差异性。传统的光学字符识别(OCR)方法通常依赖手动设计的神经架构,如卷积网络或基于变换器的网络。虽然这些手工制作的模型取得了令人鼓舞的结果,但它们通常需要大量的专家干预来迭代调整网络层、调整超参数或重新设计模型组件。这个过程既耗时又容易导致结果不一致。因此,以往的工作往往优先考虑复杂的预处理技术,而不是直接解决架构改进问题。大型语言模型(LLM)的最新发展,特别是GPT-5、GPT-4o和Claude Sonnet 4,为自动化神经网络设计开辟了新领域。这些模型展示了先进的推理和代码生成能力,使它们能够充当架构发现的智能代理。受这一新兴能力的启发,我们提出了一个针对阿拉伯语、英语和波斯语手写文本识别的全自动化流水线,其中GPT-5、GPT-4o和Claude Sonnet 4被独立用作AI架构师,负责提出、改进和优化深度学习模型。 我们的流水线从原始手写图像数据和最少的增强开始。数据集特定的元数据,包括类别数量和图像尺寸,被用来提示GPT-5、GPT-4o和Claude Sonnet 4以结构化的JSON格式提出候选模型架构。这些架构包含了各种组件,包括卷积层、池化操作、归一化、丢弃以及可选的基于变换器的模块。然后,每个提出的模型在没有人类干预的情况下进行训练和评估。每次试验后,训练准确率、验证准确率和测试准确率等性能指标会被反馈回生成该架构的同一个LLM。这创建了一个闭环反馈回路,允许每个LLM根据先前的结果优化其后续提案。这种迭代的架构优化过程消除了手动超参数调整的需要,并显著加快了模型开发周期。虽然最近的研究已经利用LLM进行直接图像或文本分类,但它们作为自动化模型发现的生成代理的角色在很大程度上仍未被探索。据我们所知,我们的方法是首个将GPT-5、GPT-4o和Claude Sonnet 4应用于跨语言手写文本识别领域的闭环流水线进行架构生成的方法。 本研究的主要贡献总结如下: - •跨文字能力:我们引入了一个统一的框架,能够识别多种手写文字,包括阿拉伯语、英语和波斯语。每种语言都受益于量身定制的预处理和编码策略,以适应其特定的结构和视觉复杂性。 - •LLM驱动的模型发现:GPT-5、GPT-4o和Claude Sonnet 4被用作独立的架构生成器。通过将数据集特定的见解转化为可执行的模型配置,我们的方法完全消除了手动架构设计的需求。 - •自动化迭代优化:该系统在一个闭环反馈回路中运行,每个LLM接收逐次试验的结果,并使用它们来优化未来的架构提案。这个动态过程使得系统能够在连续迭代中收敛到更有效的解决方案。 - •透明度和可重复性:每次实验试验都经过严格记录,架构配置、训练日志和性能指标以结构化格式(如JSON和CSV)保存。这种设计确保了完全的可重复性,并促进了跨模型变体和LLM策略的有意义的比较。 通过将GPT-5、GPT-4o和Claude Sonnet 4转变为自主架构设计师,我们的框架显著简化了OCR模型开发,并推进了手写识别的自动机器学习能力。本文的其余部分组织如下:第2节讨论了多语言手写OCR的相关工作以及自动模型生成的最新趋势。第3节详细介绍了我们的方法论,包括架构提示、模型生成、训练流程和反馈循环。第4节展示了所有三种语言的实验结果,并对性能、参数效率和架构演变进行了分析。最后,第5节总结了论文并概述了未来研究的方向。 ## 二、相关工作 手写文本识别(HTR)的最新进展利用了深度学习和神经架构搜索(NAS),特别是针对阿拉伯语和波斯语等复杂文字。Qalam[1 (https://arxiv.org/html/2607.15509#bib.bib1)]集成了SwinV2视觉编码器和RoBERTa风格解码器来处理印刷体和手写体阿拉伯文本,突出了变换器在识别草书、上下文敏感特征方面的强大能力。对于波斯语和阿拉伯语,[2 (https://arxiv.org/html/2607.15509#bib.bib2)]使用了一种基于粒子群和联赛冠军算法优化的前馈网络集成方法,而[10 (https://arxiv.org/html/2607.15509#bib.bib10)]应用了具有数据增强的DenseNet和Xception,[11 (https://arxiv.org/html/2607.15509#bib.bib11)]引入了Bina(一种在合成数据上训练的CNN-BiRNN),[12 (https://arxiv.org/html/2607.15509#bib.bib12)]开发了一种无分割的CNN-RNN-CTC模型用于离线单词识别。更广泛的综述[5 (https://arxiv.org/html/2607.15509#bib.bib5),13 (https://arxiv.org/html/2607.15509#bib.bib13)]对HTR方法进行了分类,调查了数据集,并概述了诸如风格可变性、数据有限以及低资源语言覆盖等挑战。与OCR进展并行,大型语言模型已被探索用于NAS。GPT-NAS[3 (https://arxiv.org/html/2607.15509#bib.bib3)]将预训练的GPT与遗传算法相结合,用于在NAS-Bench-101上进行架构搜索,在CIFAR和ImageNet上取得了强劲结果,而GENIUS[4 (https://arxiv.org/html/2607.15509#bib.bib4)]提示GPT-4迭代生成和优化模型,以最少的领域专业知识媲美传统NAS。虽然先前的工作分别处理了复杂文字的OCR和LLM驱动的NAS,我们的方法通过将GPT-5、GPT-4o和Claude Sonnet 4用于一个跨阿拉伯语、英语和波斯语的闭环多语言OCR流水线,将两者统一起来,自动化了模型生成和优化两个过程。 ## 三、所提出的方法 见图注 图1:完全自动化的LLM驱动跨语言OCR架构搜索流水线。评估结果被反馈给LLM,LLM迭代优化模型设计,直到为每种文字发现最佳架构。我们的端到端自动机器学习(AutoML)流水线用于光学字符识别(OCR),围绕一个集成且迭代的循环展开,包含四个核心组件:(1) 数据收集和增强,(2) 大型语言模型(LLM)驱动的神经架构提案,(3) 自动模型训练和评估,以及 (4) 用于优化后续模型架构的持续性能反馈。通过系统地在多次试验中重复这个循环,我们的流水线自主地为每种目标手写文字(包括阿拉伯语、英语和波斯语)识别并利用最优的架构模式和超参数,无需人工干预。图1 (https://arxiv.org/html/2607.15509#S3.F1) 展示了所提出框架的架构。 ### III-A 数据收集和增强 我们使用EMNIST数据集[7 (https://arxiv.org/html/2607.15509#bib.bib7)]用于英语,SADRI数据集[8 (https://arxiv.org/html/2607.15509#bib.bib8)]用于波斯语,以及AHCD数据集[9 (https://arxiv.org/html/2607.15509#bib.bib9)]用于阿拉伯手写识别。对于每种文字,我们实现专门的数据加载器来收集原始手写图像及其对应标签。这些加载器将数据重塑为标准张量格式,并使用分层抽样将数据集划分为训练集、验证集和测试子集,以保持类别分布,并将10%的数据用于验证。为了在保证计算效率的同时增强模型的泛化能力,我们采用了轻量级的数据增强策略,并使用Keras的ImageDataGenerator在训练过程中直接引入随机旋转、水平垂直平移和缩放操作。这种方法在不施加显著计算开销的情况下丰富了训练集的多样性。 ### III-B LLM驱动的神经架构提案 在每次试验开始时,我们准备一个结构化的提示,其中包含基本的数据集细节,例如类别数量和图像尺寸,并且如果可用的话,还包括前一次迭代的性能指标(训练、验证和测试准确率)。我们将这些信息提供给GPT-5、GPT-4o和Claude Sonnet 4,它们会响应一个详细的JSON规范。该规范包括神经层的顺序结构,例如Conv2D、BatchNorm、MaxPooling、Dropout、Flatten、Dense,以及可选的混合Patch嵌入和变换器块。它还指定了超参数,如优化器选择、学习率、批次大小、训练轮数、早停耐心值和评估指标。使用JSON规范确保了确定性的解析,允许无缝自动地集成到后续的模型构建步骤中。 ### III-C 模型构建和训练 我们解析GPT-5、GPT-4o和Claude Sonnet 4以JSON格式返回的架构规范,并使用Keras自动将它们转换为完整的神经网络模型。每个规范定义了一系列层,包括卷积块、批归一化、池化、丢弃、展平和全连接层,最后以用于多类预测的softmax分类器结束。JSON格式还包含训练超参数,如学习率、优化器类型、批次大小和早停标准。我们的解析器既支持传统的基于CNN的结构,也支持更高级的混合架构。当指定时,系统通过自定义实现的PatchEmbedding和TransformerBlock层,构建包含视觉变换器组件的模型。这些模块支持基于投影的区块提取和空间令牌上的自注意力,从而能够探索超越空间卷积的令牌混合表示。每个模型使用分类交叉熵损失进行编译,并使用LLM生成的规范中指示的Adam或SGD优化器进行优化。 ### III-D 评估和指标收集 训练结束后,我们严格评估每个模型在其对应测试集上的表现,以确定最终的测试准确率。我们还记录了优化过程中观察到的最高训练和验证准确率。推理延迟通过使用单个样本输入进行重复前向传播来测量,以模拟实时预测性能。此外,我们记录了可训练参数的总数,作为模型复杂度的指标。所有收集的指标以及完整的JSON模型规范都被系统地记录在一个集中式CSV文件中。这确保了透明度,便于跨试验比较,并支持所有下游分析的可重复性。 ### III-E 持续自我改进的反馈循环 每次训练试验后,我们编制一个结构化的摘要,将关键性能指标(训练准确率、验证准确率和测试准确率)整合成一个简洁的JSON对象。此摘要作为反馈传递给后续的LLM提示,使模型能够评估其先前架构决策的有效性。语言模型利用这些信息在未来的提案中调整架构元素,如层类型、深度、宽度和超参数设置。这个反馈循环在多次试验中自动运行,允许LLM迭代地优化其对哪些配置能产生每种手写文字更好结果的理解。因此,系统收敛到能够在预测性能、推理效率和模型复杂度之间取得平衡的架构。 ## 四、评估 见图注 见图注 见图注 图2:Claude Sonnet 4在阿拉伯语、英语和波斯语的三十次试验中的参数数量和每样本推理时间。尽管模型大小变化很大,但延迟稳定在约41毫秒,这表明运行时成本更多由架构深度驱动,而非参数数量。 见图注 见图注 见图注 图3:Claude Sonnet 4在阿拉伯语、英语和波斯语的三十个生成模型上的训练和验证准确率。验证准确率紧跟训练准确率,差异通常在一到两个百分点以内,这表明了很强的泛化能力。 见图注 图4:Claude Sonnet 4在阿拉伯语、英语和波斯语的三十次每次试验中的测试准确率分布。
相似文章
论使用LLM处理专业术语:语料库的良好替代方案?
本研究评估了四款专有LLM(GPT-4o、GPT-5.2、Claude Sonnet 4.5、DeepSeek)在两个领域英译法的专业术语翻译,并比较了提示策略。结果显示Claude Sonnet 4.5表现最佳,但LLM目前尚无法取代专业语料库。
h2oGPT:让大语言模型民主化
本文介绍了 h2oGPT,这是一套开源的微调大语言模型,参数规模从 70 亿到 400 亿不等,旨在成为闭源 GPT 的真正开放替代方案,并提供 100% 私密的文档搜索功能。
通过LLM提示实现古典拉丁语命名实体识别的迁移学习
本文介绍了uOttawa团队在EvaLatin 2026古典拉丁语命名实体识别共享任务中使用的系统,通过商业LLM(Gemini 2.5 Pro和Claude Sonnet 4-5)的提示工程,在粗粒度和细粒度NER子任务中均获得第一名。
使用合成数据构建快速多语言OCR模型
NVIDIA推出Nemotron OCR v2,一个使用合成数据生成技术构建的快速多语言OCR模型。该模型通过采用统一的基于FOTS的架构,在检测、识别和关系组件之间实现特征复用,在单个A100 GPU上达到34.7页/秒的性能。
@shabnam_774: https://x.com/shabnam_774/status/2058517919760355729
本文提供了关于现代大型语言模型(如ChatGPT和Claude)从零开始构建的全面逐步解析,涵盖了数据收集、分词、Transformer架构、训练、对齐和部署。