标签
本文介绍了 STAG,一个针对文本属性图上 Graph Foundation Models 的隐蔽后门攻击框架,协调图和文本触发器以规避检测并实现有效攻击。
本综述探讨了面向网络防御的大模型遗忘方法,引入了一个三级框架来区分行为抑制、表示级衰减和真正遗忘,并分析了基于梯度、基于影响和局部编辑的方法。
本文提出ADS-C,一种面向分类任务的反蒸馏防御方法。它可在证明保留top-1精度的同时,将学生模型性能降低高达29.7个百分点,且对教师模型实现零效用成本。
本文介绍了 AESOP,这是一种用于对抗性执行路径选择的框架,能够显著增加深度学习推理流水线中的浮点运算次数(FLOPs)和延迟,揭示了基于效率的新型漏洞。
本文讨论了针对机器学习模型的对抗攻击,并展示了梯度掩蔽(一种试图拒绝攻击者访问有用梯度的防御技术)为何从根本上是无效的。论文表明,攻击者可以通过训练能够模拟被防御模型行为的替代模型来绕过梯度掩蔽,最终使这一防御策略失效。