data-throughput

Tag

Cards List
#data-throughput

Efficient Pre-Training with Token Superposition

Hugging Face Daily Papers · 2026-05-07 Cached

Token-Superposition Training (TST) improves LLM pre-training efficiency by combining contiguous tokens into bags during a superposition phase with a multi-hot cross-entropy objective, achieving up to 2.5x reduction in training time without architectural changes.

0 favorites 0 likes
← Back to home

Submit Feedback