adversarial-defense

标签

Cards List
#adversarial-defense

诱骗方向优化:针对LLM消融攻击的后置防御

arXiv cs.LG · 17小时前 缓存

诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。

0 人收藏 0 人点赞
#adversarial-defense

EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架

Hugging Face Daily Papers · 2026-09-05 缓存

EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。

0 人收藏 0 人点赞
#adversarial-defense

Semantic Overlays:利用超越令牌和转向向量的标注缓解提示注入攻击

arXiv cs.AI · 2026-08-26 缓存

本文介绍了Semantic Overlays,一种使用学习到的适配器为语言模型标注输入片段的技术,有效缓解提示注入攻击同时保持实用性。它在基准测试如SEP和TensorTrust上展示了强大的防御结果。

0 人收藏 0 人点赞
#adversarial-defense

Thermo-FL:面向边缘AI的热感知鲁棒联邦大语言模型微调

arXiv cs.LG · 2026-08-24 缓存

Thermo-FL是一个用于边缘设备上大语言模型的联邦LoRA微调框架,它利用设备温度来调节训练和传输,并结合一种鲁棒的聚合方法以抵御对抗性攻击,从而增强稳定性和性能。

0 人收藏 0 人点赞
#adversarial-defense

通过组合界限与安全持久性实现LLM安全的经认证多轮鲁棒性

arXiv cs.AI · 2026-08-24 缓存

本文介绍了多轮经认证鲁棒性(MTCR),一个通过组合方法和安全持久性提供更紧界限来认证大型语言模型针对多轮越狱攻击安全性的框架。

0 人收藏 0 人点赞
#adversarial-defense

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

arXiv cs.AI · 2026-08-19 缓存

本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。

0 人收藏 0 人点赞
#adversarial-defense

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

arXiv cs.AI · 2026-08-19 缓存

DiSCO是一种免训练的黑盒防御方法,用于文本到图像模型,通过分布引导的对比提示优化防止生成不安全内容(NSFW),显著降低攻击成功率。

0 人收藏 0 人点赞
#adversarial-defense

基于模型重编程的GNN模型提取防御

arXiv cs.LG · 2026-08-13 缓存

本文提出了GraphRP,一种利用模型重编程的主动防御框架,用于保护GNN免受模型提取攻击,其采用结构感知门控机制,在降低对抗查询有效性的同时保持良性查询的效用。

0 人收藏 0 人点赞
#adversarial-defense

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#adversarial-defense

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL · 2026-06-04 缓存

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。

0 人收藏 0 人点赞
#adversarial-defense

通过追踪重写保护语言模型免受未授权蒸馏

arXiv cs.CL · 2026-04-20 缓存

本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈