标签
本文比较了微调后的MahaBERT模型与大型语言模型(Gemini、LLaMA-3.3-70B、Gemma)在马拉地语命名实体识别上的表现,发现专门的BERT模型显著优于这些大型语言模型,其F1分数为0.88–0.91,而后者仅为0.57–0.69。
本文提出了一种多阶段LLM流程,用于政府文档的结构保持型马拉地语到英语翻译,集成了布局感知OCR和HTML重构,以维护格式和领域术语。