AI代理应被允许自行决定哪些权限?

Reddit r/AI_Agents 新闻

摘要

本文讨论了AI代理不应自行授权行动的原则,并探讨了在允许模型独立决策时如何划定界限,强调了审批系统和策略等外部控制手段。

模型相信某个操作被允许,这不能成为授权该操作的机制。在代理部署中,模型可能决定调用哪个工具、如何排序工作,以及它认为用户的意图是什么。但这种推理不应能创造新的权限。一个有用的分离是:推理提议。权限许可。执行约束。证据证明发生了什么。权限应来源于行动模型之外:明确的用户委托、范围内的凭证或能力、策略、审批门控、沙箱或独立执行的约束。实际的难点在于每个真实工作流程都有模糊性。用户可能说“清理我的收件箱”,但未指定什么算作删除。策略引擎可能需要语义解释。第二个LLM可能帮助分类风险,但仅仅因为是独立的,并不成为硬性安全边界。对于部署了带工具的代理的人:你们如何划定界限?哪些决策模型可以安全地自行决定,哪些必须在外部检查?我特别关注审批系统、工具封装、能力范围、提示注入失败、混淆代理问题,以及清晰分离失效的情况。请对该原则进行红队测试,而不是简单地同意。
查看原文

相似文章

代理人的行动应由谁控制?

Reddit r/AI_Agents

本文讨论了控制AI代理执行不可逆操作的授权层的需求,介绍了Agaemon作为一种解决方案,允许代理决定行动,同时确保它们在明确权限和策略内运行。

AI代理是否应该拥有不同的权限级别?

Reddit r/ArtificialInteligence

文章认为,AI代理应根据风险拥有不同的权限级别,低风险任务拥有更多自主权,涉及金钱、客户或声誉的行动则需批准。文章质疑用户是否会因基于风险的自主权而更加信任代理。

谁决定AI代理可以知道什么?

Reddit r/AI_Agents

作者对谁控制AI代理的数据访问表示担忧,质疑是否已有既定的治理架构,并分享了一个代码库来探讨这个问题。