tokenizer-agnostic

#tokenizer-agnostic

Cross-Tokenizer LLM Distillation through a Byte-Level Interface

Hugging Face Daily Papers ↗ · 2026-04-13 Cached

This paper proposes Byte-Level Distillation (BLD), a simple method for cross-tokenizer knowledge transfer in language models by operating at a shared byte-level interface, achieving competitive or superior performance compared to more complex existing approaches across 1B-8B parameter models.

0 favorites 0 likes

tokenizer-agnostic

Cross-Tokenizer LLM Distillation through a Byte-Level Interface

Submit Feedback