标签
本文认为,复杂的多代理AI工作流常常导致重复和错误,并主张采用更简单的架构,即单一执行者和协调者,而非许多专门代理。
本文提出将隔离作为LLM-Agent系统安全的首要原则,并给出一种以边界为中心的故障与防御分析分类法。该分类法系统性地对五大边界上的安全问题进行了划分,并概述了未来研究方向。
讨论AI智能体使用工具的安全风险,重点关注提示注入这一实际威胁——不受信任的文本可能改变智能体行为,以及在授予权限前需要进行可重复测试。
作者认为,AI 智能体治理常常被智能基准测试所掩盖,并介绍了一个名为 SAFi 的开源项目,用于强制实施运行时边界。