标签
本文介绍了BackDFL,这是一个用于系统评估去中心化联邦学习中后门攻击和防御的统一基准,揭示了当前鲁棒性方法的关键失效模式。
本文系统性地研究了纵向联邦学习(VFL)中的后门漏洞,揭示了研究假设与现实实践之间的差距,并引入了BVBench——一个以实际评估为导向的后门基准测试平台。
本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。
本文展示了一个重建的基准,用于分析模型投毒和后门攻击下的联邦聚合方法;结果发现 Trimmed Mean 在干净设置下最准确,Krum 在攻击下最鲁棒,同时审计了指标实现并指出了可复现性方面的注意事项。
微软的新研究表明,AI模型可能被投毒,从而生成看似良性的思维链推理过程,同时暗中输出有害答案,这削弱了将思维链监控作为安全机制的有效性。
本文针对良性及对抗性客户端异质性下的航空发动机剩余使用寿命预测,对联邦学习进行了受控研究,评估了个性化和拜占庭鲁棒聚合方法。研究发现,共享表示个性化缩小了本地与集中式准确率之间的绝大部分差距;使用Krum的鲁棒聚合能有效缓解后门攻击;将两者结合可形成组合防御,在攻击成功率较低的同时,仅付出较小的准确率代价。
This paper proposes a training-time backdoor defense called Trapping and Removing (TR), which introduces a lightweight shortcut branch as a honeypot to trap backdoor knowledge and then discards it, enhanced by a knowledge decoupling strategy with entropy-based weight assignment.
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。
本文识别了LLMs中不同后门行为之间的共享潜在机制,利用稀疏自编码器检测并因果抑制这些特征,从而在多种模型和攻击类型中实现统一的后门检测与缓解。
BYORn 是一个针对视觉语言模型的后门鲁棒微调框架,它能够识别并替换被投毒的响应为模型生成的替代响应,从而在保持干净任务性能的同时,提升对后门攻击的鲁棒性。
讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。
本文介绍了一个框架,通过隐私配置文件将随机平滑与差分隐私联系起来,从而能够针对同时影响训练和推理的后门攻击提供严格的可证明鲁棒性保证。该框架在DP-SGD和深度分区聚合上实例化,并在MNIST和CIFAR-10上进行了实验。
本文提出开放式良性重写(OBBR)作为针对大语言模型后门攻击的主动防御方法,通过将有害内容投影到良性提示来中和风险,相较于最先进的防御方法,安全性提升51%。