在允许智能体自主行动之前,你将其视为第一个真正的安全闸门是什么?

Reddit r/AI_Agents 新闻

摘要

讨论了一种针对AI智能体的三阶段安全部署(观察、提议、在限定范围内执行),以将推理与执行信任分离,并向社区询问关于减少失败的第一道硬性闸门。

我经常在智能体项目中看到相同的模式:模型可以很好地对话,但难点在于决定何时允许它执行不可逆的操作。一个值得使用的模式是**三阶段部署**: **仅观察**:智能体可以阅读上下文并拟定计划。它不能更改任何内容。 **提议行动**:智能体可以准备具体的工具调用、消息或更改。在执行前需要人工或策略层批准。 **执行限定操作**:智能体只能在狭窄范围内行动。例如:一个收件箱、一个仓库、一种记录类型、一个客户细分。 这种做法的好处在于它将人们经常混淆的两个问题分开: - *智能体能推理任务吗?* - *我们能信任它采取下一步行动吗?* 许多项目直接从“它能草拟出很好的答案”跳到“让它点击按钮”。这时你才会发现真正的问题是模型质量、工具设计、权限设置还是缺少审查逻辑。 我很好奇其他人用什么作为第一道硬性闸门: - 人工审批 - 只读的模拟运行 - 工具白名单 - 置信度阈值 - 基于时间的升级 - 其他完全不同的方式 如果你已经交付过带有智能体的产品,第一个实际减少失败的边界是什么?
查看原文

相似文章

谁授予了你的AI代理权限?

Reddit r/AI_Agents

讨论AI代理工作流中的安全漏洞,即代理在关键步骤中假设存在人类监督,并提出了一个运行时控制平面,用于强制执行权限,并在破坏性操作前要求人工批准,通过Tandem演示进行了说明。