大多数人类在环代理系统批准的是一个故事,而非一个行动
摘要
文章批评了AI代理中常见的人工在环审批系统,认为批准自然语言摘要而非具体的执行步骤不足以确保安全。文章主张审批应附加到结构化状态、工具调用和持久化执行产物上。
我不断看到人类在环被描述为生产环境中代理的安全层。通常的流程很简单:代理提出一个行动,人类审查摘要,点击批准,代理继续执行。但我认为薄弱之处在于被批准的对象。如果人类只批准代理的自然语言解释,那么系统仍然信任代理能正确描述自己的行动。这比询问模型是否安全好不了多少。对于生产工作流,批准应该附加到具体的执行步骤上,而不是整个代理。批准对象可能需要当前状态快照、确切的工具调用或副作用、证据引用、策略版本、预期的外部变更、幂等键或收据、回滚路径以及批准人。否则,“人类已批准”会变成一个在仪表盘上看起来不错但出事后难以辩护的复选框。我反复回到的问题是:人类批准应该是一个用户交互时刻,还是一个持久的执行产物?对于在生产环境中运行代理的团队,你们的人类在环审批是绑定到结构化状态和工具调用,还是仍然主要批准生成的摘要?
相似文章
在我的组织构建了一个完整的 HITL 系统
作者分享了为企业级 agent 平台构建 human-in-the-loop 审批系统的经验,强调审批步骤必须是一个真正的阻塞暂停,参数可编辑,并且拒绝/编辑结果应是一等公民,同时询问其他人如何构建 agent 暂停机制。
人工审批对于生产级智能体来说过于模糊
文章认为,智能体系统中的人机协同应从模糊的审批转向明确的、可审计的、每步签署的决策记录,包含详细证据、数据载荷、幂等键、回滚路径和职责归属。文章强调了批准黑箱故事而非具体操作的危险性。
若人类无法审查操作,批准不等于审查
本文认为,对于AI智能体操作的批准,若无法详细审查操作的上下文、变更、可逆性及所有权,则这种批准是不充分的,尤其在高风险任务中。
多数智能体框架中的“人在回路中”只是形式 - 在你批准后,模型仍会执行操作
文章认为,许多AI智能体框架中的“人在回路中”机制是表演性的,因为模型在获得批准后仍然会执行操作,削弱了有意义的人类控制。
“人在回路中”除非我们定义被批准的内容,否则毫无意义
讨论在AI代理工作流中,如果被批准的操作与实际执行的操作不同,人工批准就可能毫无意义,敦促在批准与最终行动之间建立更严格的绑定。