Tag
The paper introduces multi-byte prediction to speed up inference in byte-level language models by generating multiple bytes in parallel with minimal performance impact.