你们在哪里停止投毒——在代理、边界,还是?

Reddit r/AI_Agents 新闻

摘要

一个假设性的安全讨论,探讨来自被入侵 API 的投毒数据如何流入 AI 代理和分析系统,并质疑防御措施应部署在哪里。

以下是假设性的思考过程。假设这样一个场景:NOrks(Waaaaaghh)入侵了一个天气 API,并在少量响应中放入投毒响应。我们出于某种目的调用该天气 API,管它是什么目的呢。我们将响应存储在数据库中。我们将响应提供给 Agent(代理),让它们做自己的事情。收到投毒会导致某些坏事发生。这个数据库也用于 BI、分析……更多代理类的东西,而且很多用户也会连接到它数据最终流向的地方,比如 Excel、Word 和 Copilot……正如主题行所说:试毒者在哪里?你会在哪里或应该把“它”放在哪里?
查看原文

相似文章

数据投毒与RAG操纵

Reddit r/ArtificialInteligence

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。