linguistic-processing

Tag

Cards List
#linguistic-processing

SuTRA : Structurally-Unified Tokenization with Root Awareness

arXiv cs.CL · 2026-08-20 Cached

SuTRA is a morphology-aware tokenization algorithm that preserves akshara indivisibility for Indic languages, reducing morphological shattering and achieving improvements in machine translation metrics over standard BPE methods.

0 favorites 0 likes
← Back to home

Submit Feedback