标签
诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。
EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。
本文介绍了Semantic Overlays,一种使用学习到的适配器为语言模型标注输入片段的技术,有效缓解提示注入攻击同时保持实用性。它在基准测试如SEP和TensorTrust上展示了强大的防御结果。
Thermo-FL是一个用于边缘设备上大语言模型的联邦LoRA微调框架,它利用设备温度来调节训练和传输,并结合一种鲁棒的聚合方法以抵御对抗性攻击,从而增强稳定性和性能。
本文介绍了多轮经认证鲁棒性(MTCR),一个通过组合方法和安全持久性提供更紧界限来认证大型语言模型针对多轮越狱攻击安全性的框架。
本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。
DiSCO是一种免训练的黑盒防御方法,用于文本到图像模型,通过分布引导的对比提示优化防止生成不安全内容(NSFW),显著降低攻击成功率。
本文提出了GraphRP,一种利用模型重编程的主动防御框架,用于保护GNN免受模型提取攻击,其采用结构感知门控机制,在降低对抗查询有效性的同时保持良性查询的效用。
本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。
来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。
本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。