标签
KLQ is a training-free LLM quantization method that allocates bits per direction based on measured KL divergence, outperforming existing training-free rotation-based methods on W4A4KV4-bit settings for models like Llama 3.2 1B and Qwen 2.5.
提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。
AI股引领市场大规模抛售,抹去1.3万亿美元,引发关于AI泡沫是否正在破裂还是仅只是板块轮动和获利了结的争论。来自高盛、桥水和美银的分析师给出了截然不同的观点。
本文深入探讨了clang的libcxx中用于旋转操作的循环分解算法,解释了该算法如何通过计算最大公约数(gcd)来确定循环数量,从而实现最少的交换次数。
OSCAR是一种离线谱协方差感知旋转方法,用于2位KV缓存量化,该方法将量化与注意力协方差结构对齐,为长上下文LLM服务实现了高精度和高效率。
GoodfireAI发现,神经网络通过旋转形状进行数学运算,并在一个大语言模型中发现了一个旋转形状计算器,该计算器不仅用于数学。