blockwise-scaling

Tag

Cards List
#blockwise-scaling

Quantizing Recursive Reasoning Models

arXiv cs.LG · 5d ago Cached

This paper studies quantization of recursive reasoning models where weight-tied blocks are reused, finding that per-tensor 4-bit quantization causes catastrophic drift but per-block scaling (e.g., MXInt4) restores accuracy, with deeper architectures being more sensitive.

0 favorites 0 likes
← Back to home

Submit Feedback