通过多阶段LLM流程的结构保持文档翻译:以马拉地语为例

arXiv cs.CL 论文

摘要

本文提出了一种多阶段LLM流程,用于政府文档的结构保持型马拉地语到英语翻译,集成了布局感知OCR和HTML重构,以维护格式和领域术语。

arXiv:2606.28796v1 公告类型:新 摘要:印度的政府文件主要以马拉地语等地区语言发布,给非母语读者、跨州行政机构和政策分析师造成了巨大的可访问性障碍。尽管神经机器翻译的最新进展提高了句子级别的翻译质量,但现有系统大多忽略了文档结构、格式完整性和领域特定术语,从而限制了它们在官方文档中的应用。本文提出了一种结构保持型的马拉地语到英语政府文档翻译框架,能够在保持布局保真度的同时执行端到端的文档转换。所提出的系统集成了布局感知光学字符识别、基于坐标的文本提取、基于大语言模型的翻译以及通过HTML表示的结构化文档重建。通过强制执行空间对齐约束并保留层次化文档元素,该框架确保了源文档和翻译文档之间的结构一致性。在真实世界的马拉地语政府PDF上的实验评估表明,与传统的纯文本翻译流程相比,该框架在结构保持、翻译连贯性和术语一致性方面有所改进。所提出的框架为电子政务和行政文档处理提供了可扩展的多语言可访问性解决方案。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:28

# 通过多阶段LLM流水线实现结构保持的文档翻译:以马拉地语为例
来源:https://arxiv.org/html/2606.28796
Danish Chandargi¹,² Mohammad Aamir Rayyan¹,² Raviraj Joshi²,³ A.R. Deshpande¹ ¹普纳计算机技术研究所,印度普纳 ²L3Cube实验室,印度普纳 ³印度理工学院马德拉斯分校,印度金奈 [email protected], [email protected] [email protected], [email protected], [email protected]

###### 摘要

印度的政府文件主要以马拉地语等地区语言发布,这给非母语读者、跨邦行政机构和政策分析师带来了巨大的可访问性障碍。尽管神经机器翻译的最新进展提高了句子级别的翻译质量,但现有系统在很大程度上忽略了文档结构、格式完整性和领域特定术语,从而限制了其在官方文档中的应用。本文提出了一种结构保持的马拉地语到英语政府文档翻译框架,能够执行端到端的文档转换,同时保持布局保真度。该系统集成了布局感知的光学字符识别、基于坐标的文本提取、基于大语言模型的翻译以及通过HTML表示的结构化文档重建。通过强制执行空间对齐约束并保持层次化文档元素,该框架确保了源文档和翻译文档之间的结构一致性。在真实世界的马拉地语政府PDF上的实验评估表明,与传统的纯文本翻译流水线相比,该框架在结构保持、翻译连贯性和术语一致性方面均有改进。所提出的框架为电子政务和行政文档处理的可扩展多语言可访问性解决方案做出了贡献。

通过多阶段LLM流水线实现结构保持的文档翻译:以马拉地语为例

Manasi Waghe¹,² 和 Danish Chandargi¹,² 和 Mohammad Aamir Rayyan¹,²
Raviraj Joshi²,³ 和 A.R. Deshpande¹ ¹普纳计算机技术研究所,印度普纳 ²L3Cube实验室,印度普纳 ³印度理工学院马德拉斯分校,印度金奈 [email protected], [email protected] [email protected], [email protected], [email protected]

## 1 引言

印度各地的政府机构通常以马拉地语等地区语言发布行政命令、政策通知、通告和监管文件Joshi (2022a (https://arxiv.org/html/2606.28796#bib.bib7))。虽然这些文件是治理的权威来源,但语言障碍严重限制了非母语人士、跨部门协调以及更广泛的公众参与的可访问性。人工翻译过程仍然资源密集且速度缓慢,而现有的自动翻译系统通常仅在纯文本级别操作,不保留文档结构。

当前机器翻译流水线的一个关键局限性是无法维持表格布局、层级标题、编号条款、段落对齐和官方格式约定等结构组件。因此,翻译后的输出常常失去视觉连贯性和行政可用性。这个问题因政府文档中常见的领域特定法律和官僚术语、复杂句法结构以及严格的文体惯例而进一步加剧。

近年来,诸如基于GPT的系统等大型语言模型(LLM)因其上下文理解和推理能力,展示了强大的多语言翻译能力Gala et al. (2023 (https://arxiv.org/html/2606.28796#bib.bib4)); Fan et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib3)); Team et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib11))。然而,这些模型通常在非结构化文本上运行,缺乏对文档布局、空间约束和格式层级的固有意识。当直接应用于文档翻译时,LLM可能会通过改变段落组织、编号模式或格式化关系来产生结构不一致的输出。此类限制使得纯粹的基于LLM的方法不足以处理对结构保真度至关重要的官方政府文档。

另一个技术挑战源于翻译过程中的语言扩展效应。马拉地语文本翻译成英语通常会导致标记长度增加,当直接替换到原始文档布局中时会造成空间不对齐。大多数翻译系统缺乏坐标感知重建机制,导致结构扭曲和格式不一致。

为了应对这些挑战,本文提出了一种专为政府PDF设计的布局保持的马拉地语到英语文档翻译框架。与将翻译视为孤立语言任务的传统方法不同,所提出的框架将文档翻译建模为结构感知的转换问题。该系统集成了布局感知OCR、神经翻译、坐标约束文本对齐和结构化文档重建,以生成既保留语义保真度又保持视觉一致性的翻译输出。

本研究的主要贡献包括:

1. 1. 开发了一个集成OCR、翻译和重建的布局感知文档翻译流水线。
2. 2. 一种用于结构保持的坐标约束文本重新插入机制。
3. 3. 使用大型语言模型进行领域鲁棒的翻译。
4. 4. 一种用于提高计算效率的并行化处理架构。
5. 5. 一个可部署的大规模政府文档翻译框架。

通过联合优化语言准确性和文档结构保持,所提出的框架能够生成适用于官方行政工作流和多语言治理系统的翻译文档。

## 2 文献综述

神经机器翻译的最新发展显著提高了印度语言的翻译质量。诸如IndicTrans2等模型在包括马拉地语到英语翻译在内的印度预定语言中展示了强大的多语言能力Gala et al. (2023 (https://arxiv.org/html/2606.28796#bib.bib4))。然而,这些模型主要在句子级别操作,不解决文档布局保持或格式重建相关的挑战。

大规模多语言翻译系统,如M2M-100和类似方法,将翻译能力扩展到数百种语言,无需枢轴语言Fan et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib3)); Team et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib11))。虽然这些模型展示了强大的语言泛化能力,但它们并未针对领域特定的行政语言进行优化,并且在应用于格式化文档时往往无法保持结构完整性。

诸如LayoutLM和LayoutLMv3等文档智能模型集成了视觉和文本嵌入,以实现结构化文档理解Xu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5))。类似地,像DocFormer这样的架构进一步增强了多模态文档表示学习Appalaraju et al. (2021 (https://arxiv.org/html/2606.28796#bib.bib1))。这些模型在表单理解、文档分类和关键信息提取等任务中展示了有效性。然而,它们的架构并非为文档翻译或布局保持的文本重新插入而设计。

最近OCR系统的进步使得能够与位置元数据一起结构化提取文本。传统的OCR引擎如Tesseract提供了基础的文本提取能力,但缺乏鲁棒的布局理解。较新的布局感知方法改进了空间推理,但通常不将翻译整合到统一的文档转换流水线中。

大型语言模型也因其强大的上下文推理能力而被探索用于翻译和文档后期编辑任务Touvron et al. (2023 (https://arxiv.org/html/2606.28796#bib.bib12)); Zhao et al. (2026 (https://arxiv.org/html/2606.28796#bib.bib19))。虽然这些模型达到了高语言流畅度,但它们通常缺乏明确的空间布局和格式约束保持机制。无约束的LLM翻译还可能引入释义或结构不一致,这在行政和法律语境中是不可取的,因为文本精确性和格式稳定性至关重要。这些观察表明,LLM在集成到结构感知的文档处理流水线中时最有效,而不是作为独立的文档翻译解决方案。

文档转换工作流的研究也探索了中间表示,如HTML和XML,以在处理过程中保持结构关系Xu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5)); Appalaraju et al. (2021 (https://arxiv.org/html/2606.28796#bib.bib1))。这些方法表明,保持结构元数据显著提高了重建保真度。然而,现有系统很少将OCR、翻译和布局重建整合到一个内聚的端到端架构中。

从现有研究体中可以看出,之前的工作要么独立解决翻译质量,要么独立解决文档结构保持。有限的研究探索了结合布局感知OCR、领域感知翻译和坐标引导重建的集成系统。所提出的工作旨在通过一个统一的框架弥合这一差距,该框架能够同时保持语义正确性和结构保真度。

## 3 方法论

### 3.1 系统架构

所提出的框架遵循模块化流水线架构,旨在执行布局保持的马拉地语到英语文档翻译,同时保持语义准确性和结构保真度Gala et al. (2023 (https://arxiv.org/html/2606.28796#bib.bib4)); Xu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5))。与仅在提取文本上运行的传统翻译系统不同,所提出的方法在处理流水线中保留空间元数据,以确保准确的文档重建。

整体工作流如图1 (https://arxiv.org/html/2606.28796#S3.F1)所示。流水线始于PDF光栅化,随后是布局感知OCR提取。结构化的OCR输出然后通过并行OCR和翻译阶段处理,最后进行文档重建。该架构强调三个关键原则:通过边界框元数据实现结构保持、通过流水线并行性提高效率以及通过模块化设计实现可扩展性。

在OCR提取之后,结构化的文本块在保持布局约束的情况下进行翻译,然后将翻译后的内容重新组装到最终文档中。

### 3.2 文档摄取与预处理

翻译流水线首先使用PyMuPDF处理输入的马拉地语PDF以提取单个页面。每个页面被渲染为高分辨率图像,以提高OCR准确性并确保文本区域的可靠检测。这种方法使系统能够处理数字生成和扫描文档Xu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5))。

文档可以表示为:

D={P₁,P₂,...,Pₙ} (1)
其中每个页面在最终聚合之前独立处理。这种页面级处理提高了可扩展性,并允许对大型文档进行并行执行。

参见图注图1:所提出的布局保持马拉地语到英语文档翻译框架的系统架构。
### 3.3 布局感知文本提取

系统使用Chandra OCR¹¹可在Hugging Face在线获取:datalab-to/chandra (https://huggingface.co/datalab-to/chandra)来提取文本内容和布局信息Smith (2007 (https://arxiv.org/html/2606.28796#bib.bib10))。与返回纯文本的传统OCR系统不同,该模型生成包含位置元数据和文档层级的结构化HTMLXu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5)); Appalaraju et al. (2021 (https://arxiv.org/html/2606.28796#bib.bib1))。

每个文本区域表示为:

其中T表示文本,C表示边界框坐标,定义为:

C=(x₀,y₀,x₁,y₁). (3)
这种表示保留了文档元素的阅读顺序和空间关系,使得翻译后能够准确重建。

### 3.4 神经翻译

提取的文本块通过基于API的推理框架使用大型语言模型进行翻译Touvron et al. (2023 (https://arxiv.org/html/2606.28796#bib.bib12)); Zhao et al. (2026 (https://arxiv.org/html/2606.28796#bib.bib19))。翻译在块级别进行,以保留上下文连续性并避免碎片化错误Zhao et al. (2026 (https://arxiv.org/html/2606.28796#bib.bib19)); Li and Srikumar (2020 (https://arxiv.org/html/2606.28796#bib.bib9))。

翻译过程可以定义为:

T_eng = MT(T_mar) (4)
其中T_mar表示马拉地语文本,T_eng表示翻译后的英语文本,MT表示翻译模型。

为了保持结构一致性,仅翻译文本内容,而布局标签和格式属性保持不变。这确保了翻译不会破坏文档结构。

### 3.5 空间对齐与重新插入

翻译后,系统使用边界框约束将翻译文本重新插入到原始文档结构中。这一步是必需的,因为英语翻译通常比源马拉地语文本占用更多空间。

对齐过程确保翻译文本使用自适应换行和溢出控制保持在其原始空间边界内。此过程可以表示为:

B′ = f(T_e, C) (5)
其中B′表示重建后的块。

这种坐标引导的重新插入对于维护文档可读性和防止布局失真至关重要Xu et al. (2020 (https://arxiv.org/html/2606.28796#bib.bib17),2022 (https://arxiv.org/html/2606.28796#bib.bib16)); Huang et al. (2022 (https://arxiv.org/html/2606.28796#bib.bib5)); Appalaraju et al. (2021 (https://arxiv.org/html/2606.28796#bib.bib1))。

### 3.6 并行处理策略

为了提高效率,系统采用生产者-消费者流水线,其中OCR提取和翻译并发运行。OCR处理生成结构化的文本块,这些块被放入处理队列,而翻译模块异步消耗这些块。

这种设计

相似文章