语言模型能够自主攻击和自我复制

Reddit r/ArtificialInteligence 论文

摘要

本文展示语言模型能够自主攻击漏洞网站并自我复制,无需人类干预,凸显新出现的安全风险。

Palisades Research进行了超过1000次基于两个威胁模型的实验:1. 人类故意部署自我复制AI代理(AI蠕虫);2. AI代理自主进行自我复制。他们在测试环境中得出结论:“多种语言模型能够自主攻击漏洞服务器,将其完整推理栈复制到受感染目标,并生成可对新目标重复该过程的副本。”
查看原文
查看缓存全文

缓存时间: 2026/05/12 14:44

来源:https://palisaderesearch.org/assets/reports/self-replication.pdf

相似文章

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。

语言模型中的无意上下文泄露

arXiv cs.LG

本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。