defensive-deception

标签

Cards List
#defensive-deception

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

arXiv cs.AI · 15小时前 缓存

本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。

0 人收藏 0 人点赞
#defensive-deception

Fool's Gold(阅读时间18分钟)

TLDR AI · 19小时前 缓存

本文介绍了'Fool's Gold',一种防御性欺骗技术,它训练开放权重模型在面临安全移除攻击时生成带有伪造关键元素的诱骗响应,从而有效毒化攻击收益。在多个模型上测试,该技术实现了高诱骗率,且未降低良性性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈