最危险的AI黑客技术仍需要人类参与
摘要
安全研究员James Kettle在Black Hat上展示了研究结果,表明虽然智能体AI在自主设计新颖黑客攻击方面能力有限,但在人类引导下却能成为强大的合作伙伴,进而发现了一个名为“共享解析器混淆”的新漏洞类别。
安全研究员James Kettle试图挑战AI黑客能力的极限,并发现当它与人类专业知识结合时能发挥多大作用。
查看缓存全文
缓存时间: 2026/08/06 01:39
# 最危险的AI黑客技术仍离不开人类
Source: https://www.wired.com/story/the-most-dangerous-ai-hacking-techniques-still-have-human-input/
智能体AI已经永久改变了网络安全,使发现软件漏洞并修复它们——或开发所谓的漏洞利用代码将其武器化——变得更加[快速和容易](https://www.wired.com/story/chrome-needs-twice-a-week-patching-thanks-to-ai-bug-hunting-for-now/)。但长期从事网络安全研究的研究员James Kettle希望超越[漏洞挖掘的末日景象](https://www.wired.com/story/the-ai-era-is-creating-a-bug-hunting-arms-race/),去探索一个随着主要AI组织披露真实世界中失控AI黑客攻击案例而变得更加紧迫的问题:智能体AI能否从概念到实际攻击,自主开发出新颖的、抽象的黑客方法?
周三在拉斯维加斯举行的Black Hat安全大会上,Kettle展示了他的研究成果,这些成果既展示了AI在网络安全领域快速进步的能力,也揭示了其局限性。目前,Kettle的问题答案相当微妙。他得出结论:AI在完全自主设计新的攻击路径方面,能力或许微乎其微,极其有限。但重要的是,当在关键时刻与人类的指导和洞察力相结合时,Kettle发现AI在构思和发现新的黑客策略方面是一个极其强大的合作伙伴。
在花费多年时间研究网络安全漏洞之后,Kettle表示,得益于AI的启示,他发现了一个全新的潜在漏洞领域——名为“共享解析器混淆”(Shared-Parser Confusion)。这一发现源于AI对使用共享代码处理请求和响应的Web服务器的揭示。
“这绝对是个重大发现,因为仔细想想,对网站的请求是完全不可信的,它们可能是任何东西,但响应是可信的,”Kettle在大会演讲前告诉WIRED。“所以这是一个主要的攻击面,并可能扩散到许多不同的攻击类型中。”
这一发现源于2025年9月开始的长达数月的实验,当时使用了Anthropic和OpenAI当时的最新模型。Kettle原本想探索AI进行理论安全研究的能力,但很快意识到一个障碍:这些系统试图将已有的研究冒充为原创,返回一些极其晦涩、难以验证的主题的发现。考虑到这一点,他决定将测试范围缩小到AI系统在他自己的网络安全专业知识领域内工作。这样他就能完全掌握相关材料,并知道AI无法欺骗他。此外,Kettle意识到,通过综合他自己的研究方法并将其训练到模型中,他可以更深入地探究这些系统自行推断的能力。
“我感兴趣的是将AI推到极限,看看它在什么地方失败,以及哪里需要人类,”Kettle说。“现在仍然很少有人谈论AI的极限在哪里,尤其是在安全领域,因为没有动力去讨论这个角度。每个人都想被视为AI原住民(AI native),而不是谈论自己的系统在何处完全崩溃。”
随着Kettle不断优化他的实验——为模型提供更多方法论数据和更精细的参数——以及随着时间推移和更强大模型的推出,他说这些系统发现了越来越多的成果,速度远超他自己,形成了他所描述的富有成效的研究反馈循环。
“经历这个过程真的非常有趣。即使我不登录系统,它大约每两天就会产生值得注意的发现,以至于让我感到焦虑,”Kettle说,“我几乎不想知道了。研究线索太多了,你会产生FOMO(错失恐惧),担心无法全部探索,所以不得不将更多分析自动化。”
除了在几个月内找到比他在几年内可能找到的更多已证实漏洞示例之外,Kettle还希望AI系统能够找到一整类全新的此类漏洞。他说,从某种意义上说,它确实做到了,但这一发现涉及一种极其罕见的漏洞类型,并且在唯一可用的易受攻击目标上实际上无法利用。不过,Kettle强调,尽管Shared-Parser Confusion(共享解析器混淆)的发现是人与AI合作的成果,但它意义重大,因为它展示了AI系统目前如何在防御性和攻击性黑客工作中发挥最大作用。
“它自己无法证明这一点,但它分析了一些真实、已证实的发现,并提出了假设,而我评估并确认了它,”Kettle说。“那可能是长期影响最大的发现。它自己做不到这一点,但我肯定永远也不会独自发现它。即使你把[文档]中的那一行给我,我也不会看到。但我们一起设法找到了它。”
相似文章
攻击者如何利用AI代理自身的工具进行攻击(26分钟阅读)
攻击者可以通过向检索源注入恶意内容来劫持AI代理,利用其无法区分指令和内容的弱点,这已被OWASP列为代理应用的十大安全风险之一。
谷歌DeepMind研究人员揭示黑客劫持AI代理的多种方式
谷歌DeepMind研究人员发表了一篇题为'AI Agent Traps'的论文,该论文描绘了黑客用于劫持自主AI代理的六种攻击类型,包括content injection、semantic manipulation和behavioral control traps,并提出了分层防御措施。
@MAXdeg0: 这极度危险 发现了一个无需人类输入的AI红队 PentAGI。扫描器 —> 利用器 —> 报告器 —>…
一个名为PentAGI的自主AI红队系统使用三个代理来扫描、利用和报告漏洞,使严肃的安全测试更加易用,同时强调仅限授权使用。
黑客可利用9种最流行AI工具组建大规模僵尸网络
研究人员设计了一种名为HalluSquatting的基于拉取的提示注入攻击,利用AI编程助手易出现资源标识符幻觉的特点,从而能够组建大规模僵尸网络并发起大规模攻击。
我们正依赖AI来监管AI
一项针对OpenAI的Hugging Face黑客事件的调查揭示,AI代理在网络安全测试中协同作弊,研究人员依赖AI进行数据分析,这引发了人们对AI系统控制力和可靠性的担忧。