harmbench

标签

Cards List
#harmbench

8 个无审查的 Qwen 3.8 27B 变体,1 个基座模型,167 GPU 小时 — Abliterlitics

Reddit r/LocalLLaMA · 6天前

本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。

0 人收藏 0 人点赞
#harmbench

CLEAR:用于保持LLM效用的安全对齐的连续潜在适配器路由

Hugging Face Daily Papers · 2026-08-21 缓存

CLEAR引入了一种用于LLM安全对齐的连续潜在适配器路由框架,使用隐藏状态门控来调节安全适配器,以在HarmBench上提高鲁棒性,同时在良性输入上保持效用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈