hidden-state-interpolation

标签

Cards List
#hidden-state-interpolation

Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出

arXiv cs.CL · 2026-07-20 缓存

介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈