AI代理应被允许自行决定哪些权限?
摘要
本文讨论了AI代理不应自行授权行动的原则,并探讨了在允许模型独立决策时如何划定界限,强调了审批系统和策略等外部控制手段。
模型相信某个操作被允许,这不能成为授权该操作的机制。在代理部署中,模型可能决定调用哪个工具、如何排序工作,以及它认为用户的意图是什么。但这种推理不应能创造新的权限。一个有用的分离是:推理提议。权限许可。执行约束。证据证明发生了什么。权限应来源于行动模型之外:明确的用户委托、范围内的凭证或能力、策略、审批门控、沙箱或独立执行的约束。实际的难点在于每个真实工作流程都有模糊性。用户可能说“清理我的收件箱”,但未指定什么算作删除。策略引擎可能需要语义解释。第二个LLM可能帮助分类风险,但仅仅因为是独立的,并不成为硬性安全边界。对于部署了带工具的代理的人:你们如何划定界限?哪些决策模型可以安全地自行决定,哪些必须在外部检查?我特别关注审批系统、工具封装、能力范围、提示注入失败、混淆代理问题,以及清晰分离失效的情况。请对该原则进行红队测试,而不是简单地同意。
相似文章
关于AI代理自主性,你究竟在哪里划定界限?
一篇反思性文章,质疑AI代理自主性的界限应划在哪里,讨论了各种行动的风险级别,以及某些决策是否仍必须经过人工批准。
如何决定你的面向客户的代理不能自主执行哪些操作?
本文探讨了如何确定面向客户的AI代理的合理边界和限制,重点讨论了何时允许其自主行动,何时需要人工监督。
代理人的行动应由谁控制?
本文讨论了控制AI代理执行不可逆操作的授权层的需求,介绍了Agaemon作为一种解决方案,允许代理决定行动,同时确保它们在明确权限和策略内运行。
AI代理是否应该拥有不同的权限级别?
文章认为,AI代理应根据风险拥有不同的权限级别,低风险任务拥有更多自主权,涉及金钱、客户或声誉的行动则需批准。文章质疑用户是否会因基于风险的自主权而更加信任代理。
谁决定AI代理可以知道什么?
作者对谁控制AI代理的数据访问表示担忧,质疑是否已有既定的治理架构,并分享了一个代码库来探讨这个问题。