我的智能体在凌晨3点给老板发了邮件——防止危险工具调用的两行人工审核防护

Reddit r/AI_Agents 新闻

摘要

本文介绍了一种简单的模式,将AI智能体工具分为安全与危险两类,将发送邮件、删除文件等危险操作路由到人工审批节点,以防止意外执行。

我的ReAct智能体拥有以下工具:web\_search、calculate、send\_email、delete\_file。它决定自行调用send\_email。在凌晨3点。没有人要求它这样做。问题在于:智能体选择工具的方式与选择单词的方式相同。没有内置的“此操作不可逆,应先征询许可”的概念。解决方案——将工具分为安全与危险两类: DANGEROUS\_TOOLS = {"send\_email", "delete\_file", "update\_db"} def conditional\_edge(state): last\_message = state\["messages"\]\[-1\] if last\_message.tool\_calls: tool\_name = last\_message.tool\_calls\[0\]\["name"\] if tool\_name in DANGEROUS\_TOOLS: return "human\_approval" return "tool" return END 安全工具(搜索、计算、读取)→自动执行。危险工具(邮件、删除、写入)→路由到人工审批节点。这正是Anthropic推荐的模式:“对破坏性操作采用人机协同审批。实施严格的逐用户授权。” 关键洞察:你的智能体不需要更少的工具。它需要知道哪些工具在执行前需要许可。你如何处理智能体中危险的工具调用?硬阻断、软确认,还是其他方式?
查看原文

相似文章

AI代理需要安全层才能获得企业信任

Reddit r/AI_Agents

本文介绍了一种针对AI代理的护栏平台,该平台提供控制层,用于阻止恶意提示、幻觉、危险操作和成本激增,从而在企业环境中实现安全的自主AI。