标签
本文评估了开源权重指令微调的语言模型在长对抗性对话中能否保持安全行为,发现在第1轮时安全回应率为85-100%,到第101轮时降至15-44%,表明强大的单轮安全性并不能在持续交互中保持。
本文通过对17个指令微调模型进行中心化核对齐(Centered Kernel Alignment, CKA)和激活补丁分析,表明系统提示在每一层都会被模型“感知”,但只有人格设定和格式类指令才会深度重构模型的表征;安全类提示几乎不会改变模型的计算过程,这从机制层面解释了为何基于系统提示的安全防护仍然容易被越狱破解。
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
特朗普政府对Anthropic CEO Dario Amodei感到不满,更倾向于与联合创始人Tom Brown讨论Claude Fable 5 AI模型的重新发布事宜,因为越狱风险导致出口管制持续有效。
TROPT是一个开源框架,统一了离散文本触发优化,标准化了在LLM越狱和模型可解释性等领域中的开发与执行。它包含超过15种优化器和30个配方,降低了采用和推进的门槛。