hardware-aware-optimization

Tag

Cards List
#hardware-aware-optimization

Parallax: Parameterized Local Linear Attention for Language Modeling

Hugging Face Daily Papers · 2026-05-27 Cached

Introduces Parallax, a parameterized local linear attention mechanism with hardware-aware optimization that improves LLM pretraining efficiency and performance, achieving Pareto improvements at 0.6B and 1.7B scales.

0 favorites 0 likes
← Back to home

Submit Feedback