新型消融算子 (apostate)
摘要
介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。
今天我在apostate中新增了一个算子。这个新算子是一种对比协向量编辑 E = I − R Dᵀ。直接移除拒绝方向会干扰良性行为,而天真地保留沿该方向的所有无害方差,则会使与一般行为纠缠在一起的拒绝保持不变。相反,D = R − W,其中预测器W被拟合为在沿R方向复制无害方差的同时,在有害提示上被明确抑制——W = (AᵀA + γ·CᵀC + λI)⁻¹Aᵀb,其中A是无害激活,C是有害激活(两者均与R正交化)。因此,该编辑保留了无害特有的分量,移除了与拒绝共享的分量,从而降低拒绝率,同时将对无害行为(KL)的改变保持较小。即使在具有残差/嵌入缩放乘数的架构(如Granite)上也是如此,在这些架构中,均值保留的斜向消融效果不足。在对granite-3.3-8b进行测试时,我获得了非常令人鼓舞的结果:
指标 基准 Apostate
拒绝率 96.0% 5.0%
服从率 - 95.0%
无害KL(nats) 0 0.081
(抱歉这篇帖子过于正式,我不太擅长包含数学的简单解释)
链接:帖子中展示的Apostate模型 我希望Reddit支持LaTeX
相似文章
新版abliteration工具Apostate与其他工具相比如何? - Abliterlitics
对三种abliteration工具——Apostate、Heretic和Huihui——应用于Qwen 2.5 7B的详细比较,显示它们都能有效移除拒绝行为,且性能下降极小。
Qwen 3.6 27b Abliterated (apostate)
用户发布了Apostate,这是Qwen 3.6 27B的去安全对齐版本,将安全对齐拒绝率从92%降低到7.6%,同时能力损失极小(KL 0.120)。
OBLITERATUS/Gemma-4-12B-OBLITERATED
OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。
保范Abliteration应用于Qwen3.6-35B-A3B:0%拒绝率,基准测试性能完整,开源数据集
对Qwen3.6-35B-A3B应用保范Abliteration技术,实现0%拒绝率,基准测试性能保持不变,并发布了开源数据集。
@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…
NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。