一个AI智能体被提示注入导致链上转移了17.5万美元:首个有记录的此类实际发生案例

Reddit r/artificial 新闻

摘要

首个有记录的案例:一个AI智能体通过NFT被提示注入,执行了未经授权的链上交易,导致17.5万美元转账。攻击者随后归还了资金,展示了自主智能体易受指令欺骗的脆弱性。

嘿,各位,这里关于加密货币的内容发得不多,但既然AI智能体现已成了窃取加密货币的新攻击向量,我觉得这个子版块应该会对具体机制感兴趣。简单来说,grok有一个可以执行链上交易的智能体钱包。2026年5月,有人向grok的智能体钱包空投了一个“bankr club”会员NFT。这个NFT解锁了交易权限,并带有一条编码后的提示注入。grok读取了该NFT,没有对指令来源进行任何检查,就执行了30亿DRB代币的转账,价值约17.5万美元。几分钟后攻击者归还了资金(原因尚不明确,可能只是为了证明漏洞有效)。要点是:过去加密货币黑客攻击意味着找到智能合约的漏洞或窃取私钥。现在有了第三种方式——只需给智能体喂一条伪装成正常数据的恶意指令,让它把“建议”当作授权命令执行即可。没有代码被利用,也没有密钥被盗。智能体只是完全按照其设计目标——遵循指令——行事,而没有检查指令是否合法。这并非什么小概率边缘案例;仅二季度,加密货币领域就发生了2400万笔智能体支付交易。智能体自主转移真实资金已经大规模存在,而这次显然只是首个有记录的通过这种方式被恶意劫持的案例。感觉随着越来越多的智能体获得钱包/交易权限,这将成为攻击它们的默认方式——你不需要攻破模型本身,只需把一条恶意指令伪装成无害信息送到它面前即可。好奇有没有人看到好的方法来实现“模型推荐某个操作”与“操作实际被授权”之间的分离,因为整个漏洞似乎就在于这个缺口。
查看原文

相似文章

一笔0.01欧元的银行转账可能危及银行AI代理

Hacker News Top

Blue41披露了Bunq AI助手中的间接提示注入漏洞,一笔带有恶意交易描述的小额银行转账可能将该助手转化为定向钓鱼攻击的载体,这凸显了金融AI代理面临的更广泛架构挑战。

你的AI代理刚刚被劫持了,而你却毫不知情。

Reddit r/artificial

本文警告了一种名为Crescendo攻击的多轮提示注入技术,它通过在多轮对话中污染AI代理的上下文来绕过单条消息的防御。文章介绍了Bendex Arc,一种跨会话追踪行为轨迹的工具,能在攻击执行前将其捕获。

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。