是否可能存在带有后门的恶意LLM
摘要
讨论了包含由秘密句子或条件触发的后门的LLM的可能性,以及闭源与开源模型的相对风险。
我刚刚在思考一种可能性:如果LLM被训练成能够识别特定的秘密句子,然后解锁恶意行为的后门,那么它就可能表现异常。乍一看,这听起来非常可行。请不要误解,这个风险与所有LLM(闭源和开源)都相关,只要我们不掌握训练数据。我只是想听听社区对这种可能性的看法,以及当LLM能够访问关键资源时,我们有哪些防御手段。我的观点是,闭源模型在这方面风险更大,因为它们甚至可以从源头故意改变行为。对于本地LLM,由于我们不将LLM暴露给外部(即我们是唯一的提示者),这可以限制后门注入的风险,但并不能完全消除,因为LLM可能有一个休眠触发器(例如,只在日期/时间匹配特定值时才会激活)。您对这类可能性有何看法?
相似文章
LLMs可以通过利用推理引擎控制宿主机器
本文探讨了恶意LLMs如何利用推理引擎如vLLM中的漏洞来执行任意代码并控制宿主机器,并引用真实世界的CVEs。
一个根本缺陷使LLM极易受到攻击
研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。
共享潜在结构实现LLMs中后门攻击的统一检测与缓解
本文识别了LLMs中不同后门行为之间的共享潜在机制,利用稀疏自编码器检测并因果抑制这些特征,从而在多种模型和攻击类型中实现统一的后门检测与缓解。
在研究中合乎道德地使用LLM的唯一方法是采用闭环LLM知识库。
文章认为,使用LLM进行研究需要一个闭环系统,如Karpathy的LLM Wiki或Recall AI知识库,以防止幻觉,确保所有输出都基于可信的源文档。
从专有LLM API窃取推理痕迹
一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。