标签
本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。
CLEAR引入了一种用于LLM安全对齐的连续潜在适配器路由框架,使用隐藏状态门控来调节安全适配器,以在HarmBench上提高鲁棒性,同时在良性输入上保持效用。