标签
本文引入了一种基于曲率的密码分析方法,通过黑盒查询提取Transformer中的隐藏前馈网络结构,实现高保真功能模型替代。
本文提出了GraphRP,一种利用模型重编程的主动防御框架,用于保护GNN免受模型提取攻击,其采用结构感知门控机制,在降低对抗查询有效性的同时保持良性查询的效用。
一篇研究论文,介绍了一种多阶段前向查询方法,用于密码分析提取孤立无偏置GLU前馈块权重,在Qwen、Llama和Gemma组件上展示了亚百分比的恢复精度,同时指出端到端模型API攻击仍未解决。
本文提出ADS-C,一种面向分类任务的反蒸馏防御方法。它可在证明保留top-1精度的同时,将学生模型性能降低高达29.7个百分点,且对教师模型实现零效用成本。
本文介绍了推理暴露提示(REP)方法,该方法利用代码格式的阴影模型演示,从大语言模型中引出隐藏的推理痕迹,表明接口级别的痕迹隐藏不足以阻止提取有用的推理信号。
本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。
有用户发现,从 Android 版 Google AI Edge Gallery 提取的 3.6 GB Gemma 4 e4b 模型,比 3.7 GB 的 Unsloth 版本和社区移植版表现更好,引发对谷歌是否暗藏优化的猜测。