标签
本文研究了对递归推理模型的量化,其中权重共享块被重复使用,发现每张量4位量化会导致灾难性漂移,但每块缩放(如MXInt4)能恢复准确性,且更深层的架构更为敏感。
ASGuard是一种基于机制的防御框架,通过电路分析识别脆弱的注意力头,并应用有针对性的激活缩放和微调,在保持模型能力的同时提高拒绝行为的鲁棒性,从而缓解针对LLM的越狱攻击。