代理规则必须存在于操作发生的地方
摘要
本文主张,人工智能代理的安全规则应作为硬性工作流约束和权限来实现,而非仅依赖提示词指令。文章强调对于敏感或不可逆的操作,需要明确的检查、审批和日志记录。
我认为“代理规则”正成为工作流设计的一部分,而不仅仅是提示词设计。写下“未经批准不得发送”是有益的。但如果代理可以访问工具,更关键的问题是:这条规则在何处落地生效?代理是否缺乏发送权限?工作流在执行外部操作前是否会暂停?它是否展示了将要影响的内容?是否留下了记录?敏感案例是否会路由至审查环节?对于低风险的个人草稿,书面规则可能已足够。但对于外部的、敏感的、不可逆的、公开的或涉及状态变更的操作,我希望规则转化为权限、停止条件、审批触发器、检查点、日志或审查步骤。否则,规则在很大程度上依赖于模型是否能记住它,以及人类能否在事后发现问题。对于真正的代理工作流来说,这显得过于薄弱。
相似文章
智能体安全应成为运行时契约
本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。
当智能体可以触发物理动作时,安全边界应设在何处?
本文讨论了能够触发物理硬件动作的AI智能体的安全考量,主张设置独立的权限层来控制状态变更操作。
AI代理不仅需要更好的推理能力,还需要更好的停止规则。
AI代理需要更好的停止规则,而不仅仅是推理能力,才能在实际工作流程中值得信赖——这些场景中,不完整的数据、不可逆的操作以及高风险都需要知道何时不应采取行动。
@dabit3: 现在智能体可以行动了,我们需要问:它们何时运行,可以接触什么,工作如何被检查,以及它们获得什么上下文……
作者提出将自动化工程作为一门学科,用于设计触发器、护栏和成功检查,使AI智能体能够安全可靠地运行,无需持续的人类监督。
智能体安全可能始于枯燥的权限设计
讨论了枯燥的权限设计作为确保AI代理安全的基础要素的重要性。