hybrid-linear-attention

Tag

Cards List
#hybrid-linear-attention

Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation

Hugging Face Daily Papers · 2026-06-15 Cached

Taylor-Calibrate proposes a principled initialization method for hybrid linear attention models that significantly improves the efficiency of distilling pretrained Transformers into Gated DeltaNet students, achieving up to 88x improvement and reducing training tokens by 4.9x-9.2x.

0 favorites 0 likes
#hybrid-linear-attention

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

Hugging Face Daily Papers · 2026-06-09 Cached

This paper identifies that chain-of-thought supervised fine-tuning degrades long-context recall in hybrid linear-attention models by biasing attention gradients toward short-range patterns, and proposes QK-Restore, a training-free method that restores long-context recall while preserving reasoning performance.

0 favorites 0 likes
#hybrid-linear-attention

@songhan_mit: Explore SANA World Model, using hybrid linear attention, efficient and fast!

X AI KOLs Following · 2026-05-15

SANA World Model is a new AI model that uses hybrid linear attention for efficiency and speed.

0 favorites 0 likes
← Back to home

Submit Feedback