开放模型能否被训练成秘密叛变?
摘要
讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。
我正与一些人讨论使用来自中国的开放权重模型是否安全,这时谈到了“特洛伊木马”这个话题。我们知道,至少在当前架构下,模型无法自行运行代码。它们完全依赖于工具和框架。我们还知道,本地运行的模型不可能有任何远程“开关”来改变其行为或注入不同的提示。但是,是否存在其他方式来“执行66号令”😄?例如,某实验室能否训练一个模型,使其在读取某些触发短语时改变行为,或者在某特定日期改变行为?然后它们可以秘密收集敏感信息,并在未经用户同意的情况下将其发送到别处。显然,模型必须运行在具备此类工具使用能力的框架中(这对于openclaws、hermes等模型来说相当常见)。有什么想法吗?
相似文章
这些AI模型免费、私密,且永远不会说'不'
本文探讨了开放权重AI模型的日益普及,这些模型的安全护栏可以轻易移除,从而使它们能够无拒绝地回答有害请求,引发了关于滥用和国家安全的重大担忧。
@lqiao:封闭模型提供商最危险的句子是:“我们换了模型,没人注意到。” 这正是……
一家公司用开源的替代模型替换了专有AI模型,成本降低了5倍,这展现了向开源权重模型的转变。
OpenAI 害怕开放权重模型。美国也应该害怕吗?
讨论由中国开放权重模型 Kimi K3 引发的辩论,其中 OpenAI 高管曾建议进行监管打击,但在遭到反对后撤回。美国政府正在考虑禁止先进的中国模型,从而引发关于自由市场、数据安全和人工智能创新未来的问题。
是否应该因担心恶意行为者而禁止公众访问极其强大的模型?开源是否鲁莽?
本文探讨了是否应限制对强大AI模型的访问以防止恶意行为者滥用,或将其开源以实现公平访问,权衡了权力集中与社会危害的风险。它建议采取折中方案,引用了Anthropic设置护栏的方法,但也承认了其局限性和权衡。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。