Padamitra: 面向古典梵语的基于语境词汇表生成
摘要
本文介绍了面向古典梵语的基于语境词汇表生成,这一任务涉及从诗句-翻译对中恢复梵语短语并产生翻译驱动的含义。研究从印度教文本构建了一个基准,并评估了多种AI模型,发现指令微调能提升性能,而形态建模被确定为一个关键挑战。
arXiv:2608.25038v1 公告类型:新
摘要:我们介绍了基于语境的词汇表生成,这是一个结构化的任务,要求模型从诗句-翻译对中恢复语义上有意义的梵语短语并产生翻译驱动的含义,将传统的patha注释实践形式化为一个可评估的NLP目标。我们从Valmiki Ramayana和Srimad Bhagavatam构建了一个包含31,316个诗句-翻译-词汇表三元组的基准,并配有两个度量标准:用于短语恢复的Jaccard和用于语义一致性的含义忠实度。在Gemma-3n-E4B、Gemma-3-12B、Phi-4和Qwen3.5-9B的零样本、少样本和指令微调变体中,指令微调显著优于提示,而显式分割也带来了增益。错误分析发现,沙地和萨玛萨复合词的过度分割是主要的失败模式,表明形态建模是忠实梵语词汇分解的关键瓶颈。
查看缓存全文
缓存时间: 2026/08/27 09:14
# Padamitra:面向古典梵文的扎根词汇表生成 来源:https://arxiv.org/abs/2608.25038 查看PDF (https://arxiv.org/pdf/2608.25038) > 摘要:我们提出扎根词汇表生成这一结构化任务,要求模型从梵文偈颂-翻译对中恢复语义完整的梵文短语,并生成基于翻译的释义,将传统的"注疏"实践形式化为可评估的自然语言处理目标。我们构建了包含31,316个"偈颂-翻译-词汇表"三元组的基准数据集,素材来自《罗摩衍那》与《薄伽梵歌》,并配备两项评估指标:衡量短语召回率的Jaccard系数与衡量语义一致性的意义忠实度。通过对比Gemma-3n-E4B、Gemma-3-12B、Phi-4和Qwen3.5-9B在零样本、少样本及指令微调三种模式下的表现,发现指令微调显著优于提示学习,而显式分词能进一步提升效果。错误分析表明,对梵文复合词(sandhi与samasa)的过度分词是主要失败模式,这指向词法建模仍是实现忠实梵文词汇分解的关键瓶颈。 ## 提交历史 来自:Manoj Balaji Jagadeeshan \[查看邮件 (https://arxiv.org/show-email/a27a4631/2608.25038)\] **\[版本1\]**2026年8月25日 周二 18:27:28 UTC(378 KB)
相似文章
BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析
本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。
面向印地语系语言的视觉引导电影字幕翻译
本文针对资源匮乏的印地语系语言进行了一项关于视觉引导电影字幕翻译的案例研究,证明选择性视觉接地(visual grounding)在解决时间错位挑战的同时,能够有效提升翻译质量。
评估针对达罗毗荼语的专用单语模型与联合多语言因果模型
本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。
基于波你尼语法的印度语言处理基础
本文提出了一套基于波你尼语法的基准套件,旨在统一跨印度语言的处理,提高准确性、数据效率和可迁移性。
通过基于知识图谱的数据生成实现精确的文本到Cypher转换
本文提出了一种合成数据生成方法,用于微调小型LLM,将自然语言转换为属性图的Cypher查询,在实现本地部署和数据主权的同时,达到了与大型专有模型相竞争的性能。