classical-languages

Tag

Cards List
#classical-languages

BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

arXiv cs.CL · 18h ago Cached

This paper introduces BHARATI, a set of SentencePiece BPE tokenizers trained on a balanced multilingual corpus for classical Indian languages. Subword fertility analysis shows significant improvements in tokenization efficiency, reducing sequence length by up to 90% compared to baseline tokenizers, thereby enhancing effective context length for downstream language models.

0 favorites 0 likes
#classical-languages

PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

arXiv cs.CL · 2026-05-19 Cached

Introduces PaliBench, a multi-reference benchmark for Pali-to-English translation using independent translations from multiple scholars, and a reusable methodology for creating similar benchmarks for classical languages.

0 favorites 0 likes
← Back to home

Submit Feedback