model-security

标签

Cards List
#model-security

构造驱动的注入:基于语言学的编辑型代码混合指纹技术用于大型语言模型

arXiv cs.CL · 2026-07-29 缓存

提出一个统一框架LCF和LCFEdit,联合优化使用低资源语言为LLMs生成代码混合指纹的构造与注入过程,以实现不可察觉且鲁棒的所有权验证。

0 人收藏 0 人点赞
#model-security

模型安全风险(提取、投毒)在生产中是否真的被测试?[R]

Reddit r/MachineLearning · 2026-06-23

讨论关于 ML 团队是否真的在生产中测试模型安全风险(如提取和投毒),并指出模型的安全审查落后于常规软件。

0 人收藏 0 人点赞
#model-security

开放模型能否被训练成秘密叛变?

Reddit r/LocalLLaMA · 2026-05-24

讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。

0 人收藏 0 人点赞
#model-security

我发现有人仅用几美元就消耗了一亿个Claude代币,于是做了研究,发现了这个

Reddit r/ArtificialInteligence · 2026-05-19

研究揭示了一个市场,通过盗用身份、深度伪造KYC以及冒充Claude的小型模型,实现廉价访问Claude API,所有数据被永久记录——带来重大安全和隐私风险。

0 人收藏 0 人点赞
#model-security

抵御重学攻击的鲁棒大语言模型遗忘:表征中的次要分量至关重要

arXiv cs.CL · 2026-05-13 缓存

本文介绍了次要分量遗忘(MCU),这是一种针对大语言模型遗忘的新颖方法,通过靶向表征中的次要分量来抵御重学攻击。它通过关注模型谱结构中的鲁棒方向,解决了现有方法的脆弱性问题。

0 人收藏 0 人点赞
#model-security

LoREnc: 低秩加密用于保护基础模型与LoRA适配器

Hugging Face Daily Papers · 2026-05-13 缓存

LoREnc是一个无需训练的框架,通过谱截断与补偿来保护基础模型和LoRA适配器,防止未经授权的模型恢复,同时为授权用户保持性能。已被ICIP 2026录用。

0 人收藏 0 人点赞
#model-security

@Dan_Jeffries1:将 Mythos(或任何其他智能模型)严密封锁,仅限少数公司获取,这反而降低了我们整个社会的安全性……

X AI KOLs Following · 2026-05-08

本文认为,对 Mythos 等智能模型进行封闭限制会降低社会安全性,主张更广泛地分发 AI 技术,以保护海量的开源及闭源软件项目生态系统。

0 人收藏 0 人点赞
#model-security

通过追踪重写保护语言模型免受未授权蒸馏

arXiv cs.CL · 2026-04-20 缓存

本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。

0 人收藏 0 人点赞
#model-security

无需数据或优化的最大脑损伤:通过符号位翻转干扰神经网络

Hugging Face Daily Papers · 2026-04-16 缓存

本文证明深度神经网络对参数的最小符号位翻转具有灾难性脆弱性,提出了DNL和1P-DNL方法,无需数据或优化即可识别关键脆弱参数。这种脆弱性跨越多个领域,包括图像分类、目标检测、实例分割和语言模型,对模型安全具有实际意义。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈