你实际上是如何为AI代理构建审批门的?我确信大多数都只是形同虚设

Reddit r/AI_Agents 新闻

摘要

作者认为,许多针对AI代理的人工审批门效果不佳,如同虚设;并提出了一个框架,用于设计能够真正捕捉错误的有意义的审查机制。

我一直在构建代理,标准做法是“确保人在任何风险操作前进行审批”。于是,我们加上一个“批准?”步骤,就宣称安全了。但我不信任这一点,而且当我查看一些研究时,计划审批减少了风险操作,但人类仍然只能在大约9%到26%的情况下捕捉到单个不良行为。这就像Claude不停弹出“你批准吗?”800次,直到人们干脆一直按住“是”键。这根本行不通。更有意义的问题是:人类能否及时捕捉到这个错误?如果不能,审查就只是橡皮图章——更好的做法是预防(可逆、沙盒化、限制爆炸半径),而不是设置门禁。我围绕这一点写了一个框架——给每个动作分级,匹配控制措施,设计审查时机,并测试它是否真的能捕捉错误。有一个20秒的交互式评分器,如果你想在自己的动作上试试。欢迎在评论中分享链接。你们是如何决定哪些操作需要门禁,哪些可以自主运行的?更重要的是,你们是如何构建这些审批门的?
查看原文

相似文章

若人类无法审查操作,批准不等于审查

Reddit r/AI_Agents

本文认为,对于AI智能体操作的批准,若无法详细审查操作的上下文、变更、可逆性及所有权,则这种批准是不充分的,尤其在高风险任务中。

人工审批对于生产级智能体来说过于模糊

Reddit r/AI_Agents

文章认为,智能体系统中的人机协同应从模糊的审批转向明确的、可审计的、每步签署的决策记录,包含详细证据、数据载荷、幂等键、回滚路径和职责归属。文章强调了批准黑箱故事而非具体操作的危险性。

人工审批并非 AI 智能体的弱点

Reddit r/AI_Agents

本文主张,人工审批是建立信任和制定策略的关键机制,而非需要消除的弱点。文章建议利用审批模式来安全地迭代扩展智能体的自主权。