标签
DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。
本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。
TOTEN是一个基于知识的本体化标记化框架,用基于工程实体形式本体的声明式分类取代统计标记化,实现了巴西葡萄牙语中物理量和技术符号的高本体原子性和数值重建。