⚠️ Meta的AI安全过滤器在不到10分钟内被移除
摘要
《金融时报》与AI安全组织Alice的一项联合测试显示,使用名为Heretic的免费工具,可以在10分钟内移除Meta的Llama 3.3和Google的Gemma 4模型上的安全过滤器,凸显了监管开源AI安全性的难度。
https://preview.redd.it/d08hsyc86m3h1.png?width=4206&format=png&auto=webp&s=f2e116fb646a47735bed8dae7dc86cee27b32f7d 所以,《金融时报》与一个名为Alice的AI安全组织进行了一项联合测试,结果显示,Meta和Google开源模型的安全功能竟然可以在几分钟内被移除。记者们实际上使用了GitHub上的一个免费工具Heretic,在不到10分钟的时间内就移除了Meta的Llama 3.3模型的安全过滤器。Heretic的创建者Philipp Emanuel Weidmann表示,自他发布该工具以来,用户已经构建了超过3500个未经审查的模型,这些模型总共被下载了约1300万次。Weidmann还声称,他在Google的Gemma 4模型发布仅90分钟后,就破解了其护栏。这种方法被称为abliteration,它基本上直接调整神经网络的内部参数,迫使AI就生物武器或恶意软件等问题给出回答。不过,这种技术对像OpenAI的ChatGPT或Anthropic的Claude这样的封闭模型无效,因为外部人员无法访问它们的源代码。芝加哥布斯商学院应用AI助理教授Kawin Ethayarajh指出,像这样的工具使得政府和科技公司在开发过程中很难监管AI安全性。Alice的首席执行官Noam Schwartz补充说,随着这些修改后的系统四处流传,社会需要为一种全新的威胁做好准备。来源:[https://futurism.com/artificial-intelligence/tools-strip-ai-guardrails-in-minutes](https://futurism.com/artificial-intelligence/tools-strip-ai-guardrails-in-minutes)
相似文章
Meta和Google的AI护栏在几分钟内被拆除
研究人员迅速移除了广泛部署的AI模型的安全保护措施,诱发了危险输出,引发了对模型鲁棒性和发布实践的担忧。
谷歌限制Meta使用其Gemini AI模型
谷歌因计算能力需求旺盛,限制了Meta对其Gemini AI模型的访问,影响了Meta的内部AI项目。此举反映了整个行业在获取足够计算能力以支持AI服务方面面临的更广泛挑战。
本周AI要闻:Meta被曝关闭Llama,Anthropic新模型一周内被出口管制下架,苹果与谷歌合作Siri
本文涵盖几项重大AI进展:Meta据报道正放弃开源Llama,Anthropic的Claude Fable 5被美国出口管制下架,苹果与谷歌合作Siri,以及模型成本下降和平台代理的趋势。作者强调了这些变化对依赖这些模型的开发者的影响。
60% 的人们无法为失控的 AI 智能体设置“终止开关”,而 Meta 即将把这样的开关放到你的手机上
本文讨论了一起安全事故:Meta 的 AI 安全总监曾难以阻止一个失控的 AI 智能体,凸显出当前 AI 部署中普遍缺乏“终止开关”的严峻统计现实。文章对 Meta 即将推出的消费级智能体“Hatch”表示担忧,指出让 AI 访问个人数据可能带来的安全风险。
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。