initialization-scale

Tag

Cards List
#initialization-scale

Small Initialization Matters for Large Language Models

arXiv cs.AI · 2026-06-17 Cached

This paper shows that reducing parameter initialization scale consistently improves pretraining of large language models, with the largest gains on reasoning-demanding tasks. It uncovers a critical initialization that balances reasoning and training, and proposes a simple γ-initialization rule.

0 favorites 0 likes
← Back to home

Submit Feedback