自主智能体之下应该是什么?(Autonomy Kernel假说)

Reddit r/AI_Agents 论文

摘要

关于'Autonomy Kernel'层的提议,它将授权与智能体推理分离,允许限定范围、可撤销的权限和审计,类似于操作系统内核。

当前,智能体就是安全边界。它持有API密钥,决定调用哪些工具,如果在运行中途出错,就没有可靠的方式阻止它。授权、审计和撤销在每个项目中都被(糟糕地)重新实现。这是一个假说:智能体下方应该有一个层,就像操作系统内核位于不受信任的程序之下。不是产品或框架,而是一个开放标准,许多实现可以以此为靶向,就像不同操作系统实现同一套系统调用契约一样。目前只是一个书面提案,没有代码。 三个空间,而不是两个: * **用户空间:** 主体(人类或所有者)。持有所有授权。 * **智能体空间:** 智能体进行推理并提出行动。不受信任,本身不持有任何授权。 * **内核空间:** 身份、授权检查、系统调用门、审计日志。 **一条规则:** 智能体提议,内核授权,系统调用执行,审计日志记录。 每次授权都有范围和有效期,主体可以在行动中途撤销或硬性停止任何操作。 大多数工具将智能体视为受信任的用户空间代码。但它不是。它是概率性的且容易受到提示注入,因此它应该拥有自己不受信任的空间。 这种分离是我尚未看到作为可移植契约被记录下来的部分,而不是嵌入到某个供应商的产品中。 所以,对于任何赋予智能体真实授权的人来说,问题是:什么被破坏了,而这一方案却未能捕捉到?
查看原文

相似文章

我认为AI代理将需要一个操作层

Reddit r/artificial

作者认为,随着AI代理变得越来越自主,需要一个治理层来实现控制、可观测性和可审计性,并介绍了Bendex Arc作为解决方案,其组件包括Arc Gate、Arc Replay、Arc Approve和Arc Memory。

人工智能最小自主性理论

arXiv cs.AI

本文提出了一种最小自主性理论,作为针对自主性人工智能系统的最小特权原则的泛化,定义了组合影响半径和智能体影响图,以检测授权组合和跨域能力组合。