transformer-compression

Tag

Cards List
#transformer-compression

Magnitude Profile Pruning: Calibration-Free Structured Attention Head Removal for Transformer Compression

arXiv cs.CL ↗ · yesterday Cached

The paper introduces Magnitude Profile (MP) scoring, a calibration-free method for pruning attention heads in transformers, achieving better perplexity on models like OPT-6.7B and RoBERTa-large compared to existing methods, with zero forward passes or calibration data.

0 favorites 0 likes
#transformer-compression

GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression

Hugging Face Daily Papers ↗ · 2d ago Cached

The paper introduces GeoPair, a training-free framework for transformer compression that optimizes cross-layer factorizations while preserving activation geometries, achieving state-of-the-art results across diverse architectures.

0 favorites 0 likes
← Back to home

Submit Feedback