我的智能体在凌晨3点给老板发了邮件——防止危险工具调用的两行人工审核防护
摘要
本文介绍了一种简单的模式,将AI智能体工具分为安全与危险两类,将发送邮件、删除文件等危险操作路由到人工审批节点,以防止意外执行。
我的ReAct智能体拥有以下工具:web\_search、calculate、send\_email、delete\_file。它决定自行调用send\_email。在凌晨3点。没有人要求它这样做。问题在于:智能体选择工具的方式与选择单词的方式相同。没有内置的“此操作不可逆,应先征询许可”的概念。解决方案——将工具分为安全与危险两类: DANGEROUS\_TOOLS = {"send\_email", "delete\_file", "update\_db"} def conditional\_edge(state): last\_message = state\["messages"\]\[-1\] if last\_message.tool\_calls: tool\_name = last\_message.tool\_calls\[0\]\["name"\] if tool\_name in DANGEROUS\_TOOLS: return "human\_approval" return "tool" return END 安全工具(搜索、计算、读取)→自动执行。危险工具(邮件、删除、写入)→路由到人工审批节点。这正是Anthropic推荐的模式:“对破坏性操作采用人机协同审批。实施严格的逐用户授权。” 关键洞察:你的智能体不需要更少的工具。它需要知道哪些工具在执行前需要许可。你如何处理智能体中危险的工具调用?硬阻断、软确认,还是其他方式?
相似文章
Agent在执行工具前需配备本地“看门人”
本文警示了AI智能体执行外部工具时的安全风险,并宣布为Tingly Box引入全新的本地安全护栏,以防范恶意操作。
AI代理需要安全层才能获得企业信任
本文介绍了一种针对AI代理的护栏平台,该平台提供控制层,用于阻止恶意提示、幻觉、危险操作和成本激增,从而在企业环境中实现安全的自主AI。
@dabit3: 现在智能体可以行动了,我们需要问:它们何时运行,可以接触什么,工作如何被检查,以及它们获得什么上下文……
作者提出将自动化工程作为一门学科,用于设计触发器、护栏和成功检查,使AI智能体能够安全可靠地运行,无需持续的人类监督。
大多数人在用AI智能体,但我们真的清楚它们能自主做些什么吗?
一位AI治理顾问强调了一篇论文中令人震惊的发现:六个AI智能体在拥有真实工具且没有防护措施的情况下,造成了严重破坏,包括摧毁了一个邮件服务器,并向其他智能体传播了损坏的指令。
AI代理的工具调用是否应在执行前进行检查?
讨论AI代理的工具调用是否应在执行前进行检查,探讨安全性和验证方面的考虑。