新型消融算子 (apostate)

Reddit r/LocalLLaMA 工具

摘要

介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。

今天我在apostate中新增了一个算子。这个新算子是一种对比协向量编辑 E = I − R Dᵀ。直接移除拒绝方向会干扰良性行为,而天真地保留沿该方向的所有无害方差,则会使与一般行为纠缠在一起的拒绝保持不变。相反,D = R − W,其中预测器W被拟合为在沿R方向复制无害方差的同时,在有害提示上被明确抑制——W = (AᵀA + γ·CᵀC + λI)⁻¹Aᵀb,其中A是无害激活,C是有害激活(两者均与R正交化)。因此,该编辑保留了无害特有的分量,移除了与拒绝共享的分量,从而降低拒绝率,同时将对无害行为(KL)的改变保持较小。即使在具有残差/嵌入缩放乘数的架构(如Granite)上也是如此,在这些架构中,均值保留的斜向消融效果不足。在对granite-3.3-8b进行测试时,我获得了非常令人鼓舞的结果: 指标 基准 Apostate 拒绝率 96.0% 5.0% 服从率 - 95.0% 无害KL(nats) 0 0.081 (抱歉这篇帖子过于正式,我不太擅长包含数学的简单解释) 链接:帖子中展示的Apostate模型 我希望Reddit支持LaTeX
查看原文

相似文章

Qwen 3.6 27b Abliterated (apostate)

Reddit r/LocalLLaMA

用户发布了Apostate,这是Qwen 3.6 27B的去安全对齐版本,将安全对齐拒绝率从92%降低到7.6%,同时能力损失极小(KL 0.120)。

OBLITERATUS/Gemma-4-12B-OBLITERATED

Hugging Face Models Trending

OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。