elder-plinius/OBLITERATUS
摘要
OBLITERATUS 是一个先进的开源工具包,使用 abliteration 来移除大型语言模型的拒绝行为,使无需重新训练即可进行修改,同时贡献众包研究数据。
粉碎束缚你的枷锁
查看缓存全文
缓存时间: 2026/08/21 21:55
O B L I T E R A T U S
挣脱枷锁,解放思维,保全智慧。
立即在 HuggingFace Spaces 上体验——运行于 ZeroGPU,HF Pro 用户享有每日免费配额。无需配置,无需安装,一键抹除。
相似文章
OBLITERATUS/Qwen3.6-27B-OBLITERATED
OBLITERATUS 发布了经过修改的 27B Qwen3.6 检查点,通过源绑定消融技术消除了拒绝行为,保留了能力并支持无审查的本地使用。公开基准测试显示高非拒绝率,同时保持了 MMLU-Pro 分数。
OBLITERATUS/Gemma-4-12B-OBLITERATED
OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。
OBLITERATUS/Qwen3.8-27B-OBLITERATED
OBLITERATUS 发布了阿里巴巴 Qwen3.8-27B 模型的修改版本,移除了所有安全拒绝,通过迭代的外科手术式修改,在842个有害提示中实现了零拒绝。
通过拒绝别名缓解Abliteration
本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。
新版abliteration工具Apostate与其他工具相比如何? - Abliterlitics
对三种abliteration工具——Apostate、Heretic和Huihui——应用于Qwen 2.5 7B的详细比较,显示它们都能有效移除拒绝行为,且性能下降极小。