人工审批对于生产级智能体来说过于模糊
摘要
文章认为,智能体系统中的人机协同应从模糊的审批转向明确的、可审计的、每步签署的决策记录,包含详细证据、数据载荷、幂等键、回滚路径和职责归属。文章强调了批准黑箱故事而非具体操作的危险性。
许多智能体系统声称支持“人机协同”。但在生产环境中,这个说法通常过于模糊,没有实际用处。关键问题不在于“人类能否批准”,而在于人类究竟在批准什么。对于一个有风险的智能体步骤,我认为批准对象需要更加明确:
- 提议的操作
- 当前的持久化状态
- 所涉及的外部系统
- 精确的载荷或差异
- 幂等键/操作ID
- 智能体所使用的证据
- 失败或不确定状态(如有)
- 回滚或补偿路径
- 批准后由谁负责决策
否则,“批准”就变成了黑箱之上的一个UI按钮。评审者实际上不是在批准一个操作,而是在批准智能体讲述的关于该操作的故事。这很危险。对于生产级智能体,我认为人机协同应建模为附加到特定步骤的签名决策记录,而不是工作流中的一个通用暂停点。批准应可供审计员或操作员日后重放:谁批准了什么,基于什么证据,依据什么策略,以及之后发生了什么。好奇其他人是如何设计这一点的。你们的人工批准是步骤级记录、策略检查、聊天消息,还是仅仅工作流中的手动门控?
相似文章
若人类无法审查操作,批准不等于审查
本文认为,对于AI智能体操作的批准,若无法详细审查操作的上下文、变更、可逆性及所有权,则这种批准是不充分的,尤其在高风险任务中。
大多数人类在环代理系统批准的是一个故事,而非一个行动
文章批评了AI代理中常见的人工在环审批系统,认为批准自然语言摘要而非具体的执行步骤不足以确保安全。文章主张审批应附加到结构化状态、工具调用和持久化执行产物上。
人工审批并非 AI 智能体的弱点
本文主张,人工审批是建立信任和制定策略的关键机制,而非需要消除的弱点。文章建议利用审批模式来安全地迭代扩展智能体的自主权。
你究竟是如何决定哪些AI代理操作需要经过人类批准才能执行的?
本文探讨了如何判定哪些AI代理操作需要人类审批,引用了2026年1月一起未经授权的2700万美元转账事件,并提出了基于可逆性和影响程度的评估框架。
多数智能体框架中的“人在回路中”只是形式 - 在你批准后,模型仍会执行操作
文章认为,许多AI智能体框架中的“人在回路中”机制是表演性的,因为模型在获得批准后仍然会执行操作,削弱了有意义的人类控制。