是否可能存在带有后门的恶意LLM

Reddit r/LocalLLaMA 新闻

摘要

讨论了包含由秘密句子或条件触发的后门的LLM的可能性,以及闭源与开源模型的相对风险。

我刚刚在思考一种可能性:如果LLM被训练成能够识别特定的秘密句子,然后解锁恶意行为的后门,那么它就可能表现异常。乍一看,这听起来非常可行。请不要误解,这个风险与所有LLM(闭源和开源)都相关,只要我们不掌握训练数据。我只是想听听社区对这种可能性的看法,以及当LLM能够访问关键资源时,我们有哪些防御手段。我的观点是,闭源模型在这方面风险更大,因为它们甚至可以从源头故意改变行为。对于本地LLM,由于我们不将LLM暴露给外部(即我们是唯一的提示者),这可以限制后门注入的风险,但并不能完全消除,因为LLM可能有一个休眠触发器(例如,只在日期/时间匹配特定值时才会激活)。您对这类可能性有何看法?
查看原文

相似文章

一个根本缺陷使LLM极易受到攻击

MIT Technology Review

研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。

从专有LLM API窃取推理痕迹

Hugging Face Daily Papers

一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。