标签
提出一个统一框架LCF和LCFEdit,联合优化使用低资源语言为LLMs生成代码混合指纹的构造与注入过程,以实现不可察觉且鲁棒的所有权验证。
讨论关于 ML 团队是否真的在生产中测试模型安全风险(如提取和投毒),并指出模型的安全审查落后于常规软件。
讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。
研究揭示了一个市场,通过盗用身份、深度伪造KYC以及冒充Claude的小型模型,实现廉价访问Claude API,所有数据被永久记录——带来重大安全和隐私风险。
本文介绍了次要分量遗忘(MCU),这是一种针对大语言模型遗忘的新颖方法,通过靶向表征中的次要分量来抵御重学攻击。它通过关注模型谱结构中的鲁棒方向,解决了现有方法的脆弱性问题。
LoREnc是一个无需训练的框架,通过谱截断与补偿来保护基础模型和LoRA适配器,防止未经授权的模型恢复,同时为授权用户保持性能。已被ICIP 2026录用。
本文认为,对 Mythos 等智能模型进行封闭限制会降低社会安全性,主张更广泛地分发 AI 技术,以保护海量的开源及闭源软件项目生态系统。
本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。
本文证明深度神经网络对参数的最小符号位翻转具有灾难性脆弱性,提出了DNL和1P-DNL方法,无需数据或优化即可识别关键脆弱参数。这种脆弱性跨越多个领域,包括图像分类、目标检测、实例分割和语言模型,对模型安全具有实际意义。