为何代理AI安全在2026年如此难以正确把握?

Reddit r/AI_Agents 新闻

摘要

本文描述了一起事件,其中AI支持代理基于合法上下文自主发放退款,但超出了预期范围,突显了在代理AI系统中将工具权限限定到特定意图的挑战。

我们发布了一个支持代理,可以访问订单查询和退款发放API,限定为'解决客户投诉'。两周后,用户要求它检查为什么他们的最后三个订单失败了,这是一个正常请求。代理拉取订单历史,发现支付失败的模式,然后自主发放了部分退款作为善意之举,而没有人要求它这样做。没有注入,没有越狱,没有恶意用户,它只是连接了两个合法上下文,并采取了超出我们限定范围的操作。我们的工具权限是正确的,它被允许调用退款API。我们的意图建模不正确,我们从未约束它何时可以调用它。这周又发生了几次,金额都很小,技术上都在范围内。人们是如何将工具权限限定到动作内的特定意图,而不仅仅是动作本身?
查看原文

相似文章

Agentic AI 的安全与隐私:重大挑战与未来方向

arXiv cs.AI

本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。