AI护栏如何阻碍进攻性网络安全研究人员的工作
摘要
旨在防止恶意使用的AI安全护栏,同时也阻碍了合法的进攻性网络安全研究人员,他们需要不受限制的模型访问权限来识别和利用漏洞以进行防御。研究人员批评了像Anthropic和OpenAI这样的AI公司所实施的任意把关行为。
我们采访了几位网络安全研究人员,他们致力于寻找未知漏洞并开发利用这些漏洞的工具,了解了OpenAI和Anthropic的护栏如何影响他们的工作。
查看缓存全文
缓存时间: 2026/07/24 05:06
# AI护栏如何阻碍进攻型网络安全研究人员的工作 | TechCrunch
来源: https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/
数月来,AI巨头们设计了专门的审查项目和严格的护栏,以限制恶意黑客使用其模型。但这些限制如今正妨碍合法网络防御者以及进攻型网络安全研究人员的工作。
今年6月,美国政府针对Anthropic备受追捧的AI模型Mythos和Fable实施了出口管制限制(https://techcrunch.com/2026/06/12/anthropics-safety-warnings-may-have-just-backfired-the-government-has-pulled-the-plug-on-its-most-powerful-ai/)。这一举措至少部分源于一份报告,该报告声称可以绕过这些模型旨在防止用户利用其构建和执行恶意网络攻击的护栏。
无论这一事件是否真的源于对越狱的担忧(https://techcrunch.com/2026/06/15/the-us-governments-anthropic-models-ban-was-never-about-an-ai-jailbreak/),事实是Anthropic曾反复宣传(https://techcrunch.com/2026/04/07/anthropic-mythos-ai-model-preview-security/)Mythos是某种末日网络机器(https://techcrunch.com/2026/04/09/is-anthropic-limiting-the-release-of-mythos-to-protect-the-internet-or-anthropic/),只能交给经过严格审查的用户,且即使如此也要在严格的护栏下使用。(对Fable 5和Mythos 5的出口管制现已解除。Fable 5于7月1日恢复通用访问;Mythos 5作为政府审查流程的一部分,仅重新向经过审查的美国组织开放。)
这种把关并非Mythos独有。Anthropic(其其他模型)和OpenAI都为网络安全研究人员提供了可申请审查的项目,若获批则可使用网络安全限制较少的模型:OpenAI的网络安全可信访问计划(https://openai.com/index/scaling-trusted-access-for-cyber-defense/)和Anthropic的网络安全验证计划(https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet)。
这些护栏受到了广泛批评,尤其是那些负责发现系统中未知漏洞并抢在犯罪分子之前利用它们的研究人员。
在最近一次网络安全播客中,知名安全研究员Mark Dowd表示(https://docs.google.com/document/d/1G2B7VetSNfxN9Lfb8f2Y1Vyy-uVBQPl_YSj_3ayVUxM/edit?tab=t.0):“这些随机的巨头公司对安全领域什么是安全的、什么不是安全做出武断决定,这让我感到很不舒服。”
Dowd花了数十年时间发现并向西方政府出售“零日漏洞”(https://www.vice.com/en/article/iphone-zero-days-inside-azimuth-security/)——即此前未知的软件缺陷及其利用方法,而不是向软件制造商报告以便修补。政府之所以愿意为漏洞支付高价,正是因为它们保持开放状态,这对情报行动很有用。
Dowd承认他的工作可能让他带有偏见,但他并非个例。几位从事进攻型网络安全(主动探测系统弱点)的人士向TechCrunch描述了他们是怎样使用AI工具并应对其护栏的。
安全咨询巨头NCC Group首席科学家Chris Anley表示,要求AI模型尝试利用某个漏洞是确认其是否值得修复的真正漏洞的关键步骤。但如果护栏导致模型直接拒绝回答该问题,那么护栏就损害了防御者的利益。
Anley说:“这就是进攻与防御以及护栏的全部意义所在,因为‘修复此代码’这个提示既是防御的关键机制,也是发现代码库中关键漏洞的路线图。因此,同一个工具同时既是进攻工具又是防御工具,两者根本无法剥离。”
他继续说道,这“就像一把锤子。没有锤子你盖不了房子。它绝对是一种工具,但也不可避免地是一种武器。”
当他和同事遇到这种障碍时,有时会退而求其次,使用完全没有护栏的开源AI模型。
Crowdfense(一家知名公司,专门开发、获取并向政府机构出售未知漏洞)的首席技术官Paolo Stagno同意Dowd的观点,称AI公司“实质上把客户当成需要保姆照看的孩子”,通过其审查项目和护栏来对待他们。
Stagno说他和同事确实使用前沿模型——但仅用于逆向工程。他说,他们避免使用AI来帮助发现漏洞或构建漏洞利用代码,因为将这类工作输入基于云的模型会冒着泄露敏感漏洞数据或使其被吸收到未来训练中的风险。对于这一步,他说他们使用本地运行的开源模型,因为不依赖在模型外部共享数据。
发现零日漏洞并开发漏洞利用代码的安全研究员Giuseppe Cali表示,护栏并没有妨碍他的工作。这是因为他将AI用于进攻性工作;相反,他用AI进行初步的逆向工程,以理解正在分析的代码,并构建辅助工具。他说,AI工具可以加快这一过程,让他能够专注于发现漏洞。
Cali说:“我仍然希望自己掌握实际的漏洞发现和武器化过程,就算明天所有护栏都取消,这一点也不会改变。我对自己的漏洞很吝啬,我太喜欢这个游戏了,不想让模型替我玩。”
一家智能手机组件制造商的一位研究员(因未获授权向媒体发言而要求匿名)表示,他的雇主并未加入Anthropic的CVP项目,因此由于护栏过于严格,其工具几乎无法用于发现漏洞。
该人士说:“如果它发现我们在做任何与安全相关的事情,它就会直接停止,无法使用。”
网络安全公司RemoteThreat首席执行官兼Offensive AI Con(专注于进攻性安全和AI的活动)创始人Chris Thompson表示,根据他使用前沿AI模型的经验,护栏可能不一致,并且每天运行方式不同。即使在Anthropic和OpenAI审查项目的较宽松边界内也是如此。
Thompson说:“我认为实际影响是,你花大量时间与模型协商,而不是专注于核心安全计划。你不是在分析漏洞并推理其可利用性,而是在试图找出为什么得到不一致的结果,或者为什么模型过度净化为输出。”
因此,研究人员开始依赖或被推向中国的开源模型,如GLM——可免费下载、本地运行且无需审查或使用限制的模型——Thompson说。
“这些负责任的研究人员正被从美国政府控制的系统推向外国拥有的系统,”他说。“我认为设立这些护栏弊大于利。”
Thompson呼吁前沿AI实验室不要进一步收紧限制,而是开放其项目,提供负责任的使用权,并对滥用工具的人追究责任。否则,他认为防御者将在AI竞赛中落败。
Thompson说:“一场巨大的风暴即将来临。一场前所未有的快速且大规模的袭击浪潮即将到来。但那些试图有所作为的同一批安全咨询公司和合法研究人员现在正受到压制。”
*当您通过我们文章中的链接购买商品时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
网络安全研究人员不满Anthropic的Fable模型的护栏
Anthropic发布了其Fable模型,这是专注于网络安全的Mythos模型的受限版本,但网络安全研究人员批评其过于严格的护栏,甚至阻止了无害的任务。
是否应该因担心恶意行为者而禁止公众访问极其强大的模型?开源是否鲁莽?
本文探讨了是否应限制对强大AI模型的访问以防止恶意行为者滥用,或将其开源以实现公平访问,权衡了权力集中与社会危害的风险。它建议采取折中方案,引用了Anthropic设置护栏的方法,但也承认了其局限性和权衡。
网络安全资深人士抗议美国政府对Anthropic最强模型实施的‘危险’禁令
包括行业资深人士在内的76位网络安全专家发表公开信,抗议美国政府针对Anthropic最强大AI模型Fable和Mythos的出口管制令,认为限制防御者获取这些模型是危险的,因为对手正在进步。Anthropic在命令下达后全球暂停了访问。
Meta和Google的AI护栏在几分钟内被拆除
研究人员迅速移除了广泛部署的AI模型的安全保护措施,诱发了危险输出,引发了对模型鲁棒性和发布实践的担忧。
Anthropic 的安全护栏再次证明其有效性
据报道,Anthropic 的安全护栏再次接受测试,凸显了人工智能安全领域的持续发展。