我们一直在谈论让智能体更聪明,却很少谈论如何让它们安全地处理数据

Reddit r/artificial 新闻

摘要

文章认为,AI智能体的安全性过于关注指令遵循,而对数据访问治理关注不足,并强调Agentic Data Protocol是将策略置于基础设施中的早期尝试。

这一直让我感到困扰。我们现在有很多用于构建AI智能体的框架。MCP用于工具访问,函数调用已成为各大模型的标准能力,你可以在大约20分钟内构建一个能查询数据库和调用API的智能体。但围绕智能体的安全讨论大多是关于“不要说坏话”和“遵循指令”。没有人真正讨论当你的智能体访问了不该访问的数据、运行一个消耗500美元计算资源的查询、或因幻觉关联而自信地返回错误结果时会发生什么。当前的做法基本上是:在系统提示中放入规则(“只查询这些表”)、使用只读数据库用户、寄希望于最好的结果。选项1不可靠,因为模型并不总是遵循指令,尤其是在复杂的多步骤任务中。选项2可以防止灾难,但无法防止糟糕的结果。选项3不是一种策略。我认为真正的问题是,面向智能体的数据治理还不存在这样一个层。我们有身份验证(这个智能体是谁),我们某种程度上也有授权(它能访问什么),但我们没有任何东西来回答“这个具体的数据请求是否合理,并且在当前上下文中是否应该被允许”。有一些早期尝试在解决这个问题。我觉得概念上最有趣的是Agentic Data Protocol,一个开源规范,在智能体和数据系统之间放置了一个策略引擎。其理念是策略应属于基础设施,而不是提示词。他们称之为“数据管理程序”(data hypervisor)。它出自Apache Gravitino(数据目录项目)背后的同一团队。不过提前说明,它非常早期。项目仍然很小,今年早些时候才发布,参考实现是最低限度的。我不建议任何人明天就去部署它。但它的框架引起了我的共鸣:我们需要协议级别的智能体数据访问治理,而不是提示词级别的痴心妄想。另外值得注意的是,它旨在补充MCP,而不是取代MCP。MCP处理工具调用,它处理数据访问策略。不同层。真的很想知道大家的想法。这是一个需要专门协议来解决的真正问题,还是可以通过更好的提示词和传统的访问控制来解决?另外,如果有人知道其他正在解决这个具体问题的项目,我很想听听。
查看原文

相似文章

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。

AI代理需要安全层才能获得企业信任

Reddit r/AI_Agents

本文介绍了一种针对AI代理的护栏平台,该平台提供控制层,用于阻止恶意提示、幻觉、危险操作和成本激增,从而在企业环境中实现安全的自主AI。

数据投毒与RAG操纵

Reddit r/ArtificialInteligence

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。