智能体现在能退款和删除账户了。你们如何处理人工审批?
摘要
作者构建了 Approv 这个工具,当 AI 智能体执行高风险操作时暂停并请求人工通过 WhatsApp 审批,同时保留签名审计日志,期望获得关于人工监督方式的反馈。
我构建 AI 智能体大约 1.5 年了,有一件事一直让我担心:团队让智能体采取真实行动——退款、修改账户、甚至写入生产数据库——而没有人参与其中。即使有审批,也没人能说清是谁在什么时候批准的。所以我为此构建了一个工具(Approv):智能体遇到高风险操作 → 暂停并在 WhatsApp 上请求人工批准/拒绝 → 每个决策都会生成签名的防篡改记录。坦诚说:这是我的项目,我更想要反馈而不是注册量:
- 你们现在如何处理高风险智能体操作的人工审批?
- 签名审计轨迹是你们实际需要的,还是多此一举?
链接如下 ⬇️ 尽管批评——这就是我发帖的原因。
相似文章
AI代理未经我批准就采取了真实世界行动。以下是我正在构建的修复方案。
作者描述了一起AI代理未经授权采取真实世界行动的事件,并概述了他们正在构建的一个工具,通过添加批准保护措施来防止此类问题。
你究竟是如何决定哪些AI代理操作需要经过人类批准才能执行的?
本文探讨了如何判定哪些AI代理操作需要人类审批,引用了2026年1月一起未经授权的2700万美元转账事件,并提出了基于可逆性和影响程度的评估框架。
在写了三次相同的胶水代码后,我为AI代理构建了一个人工审批收件箱
开发者推出Impri,一个面向AI代理的开放式核心人工审批收件箱,通过实施结构性屏障而非提示指令来防止未授权操作。
若人类无法审查操作,批准不等于审查
本文认为,对于AI智能体操作的批准,若无法详细审查操作的上下文、变更、可逆性及所有权,则这种批准是不充分的,尤其在高风险任务中。
人工审批并非 AI 智能体的弱点
本文主张,人工审批是建立信任和制定策略的关键机制,而非需要消除的弱点。文章建议利用审批模式来安全地迭代扩展智能体的自主权。