模型填补空白,无人赋予其此权限。
摘要
本文讨论了AI模型在智能体系统中推断缺失数据的风险,可能导致未授权执行,并提出将决策权限与模型分离,以确保仅执行明确声明的指令。
将定义和裁决权移出模型——声明、判断、记录、执行
当前智能体的行为:
transfer( amount: 500.00 USD to_account: 110-234-5678 ← 模型填补了此项 )
所有参数都存在且类型正确,因此模式检查通过。但从未声明该账户号应从何而来。
门禁记录的内容:
json
{
"slots": [
{
"slot_id": "to_account",
"status": "unknown",
"route": "ask_user"
}
],
"unknown_count": 1
}
执行被记录;裁决不被记录。日志保留工具和最终参数,但不记录每个值的来源或检查了哪些条件。当相同指令产生不同结果时,事后无法判断值是查得还是捏造的。被阻止的运行根本不被记录,因此被过滤掉的内容丢失了。一个记录其裁决的门禁——每个插槽的状态和来源,以及从未执行的运行——将其转化为可计数的数据。
我们常将AI的危险归因于幻觉或错误推理。但存在一个更根本的问题。模型在不知情时不会停止,它自行填补空白。如果值缺失,它推断值。→ 错误执行。如果条件缺失,它假设条件。→ 无指令执行。如果意图缺失,它决定意图。→ 不同执行 / 无指令执行。这三者都是同一个问题。模型是一个填补空白的引擎。这不是缺陷,而是训练行为。仅靠禁止提示或更好的模型性能无法消除它。模型扭曲用户指令,然后自信地执行。自信扩大了范围。只要工具的必要输入满足,它就会执行。这不是未来的问题,它现在正在各地发生。解决它不一定需要更聪明的AI。将必须决定的内容和裁决都从AI中分离。将必须验证的决定移出模型。将是否已验证的裁决也移出模型。模型仍可执行工作:询问用户、检索信息、准备执行所需内容。规则在模型外以清单形式声明。代码执行验证并记录裁决。执行仅读取记录的结果。这收回了模型因无人声明而填补的权限。更好的模型性能提升能力。如果决策权仍与模型同在,这种增加的能力会扩大其决定未声明内容的范围。如果权限在模型外,决策和责任都留在人类手中。这种结构阻止猜测成为执行。目标不是执行模型的判断,而是精确执行用户明确声明的内容。详细设计在规范中,参考实现在仓库中。规范已完成;参考实现是骨架,而非库。尚未用于生产。
相似文章
AI代理应被允许自行决定哪些权限?
本文讨论了AI代理不应自行授权行动的原则,并探讨了在允许模型独立决策时如何划定界限,强调了审批系统和策略等外部控制手段。
与谁对齐?
文章探讨了构建AI代理的安全风险,强调专家可能在自己的领域过度信任模型,而在其他领域则因未知的未知而持谨慎态度。
模型规划出一个由代理组成的可执行 DAG,在实际运行前必须有人决定信任程度。
本文讨论了 AI 代理系统中的信任边界,其中 LLM 规划一个代理的可执行 DAG,强调了验证计划和通过人类批准及每个代理权限确保安全性方面的挑战。
对'为什么它会那样做'没有答案——将判断置于模型之外
本文提出,为解决AI智能体错误缺乏可解释性的问题,应将控制机制移出黑箱模型,通过预定义的检查和日志记录实现有效调试和监督。
AI安全争论聚焦于错误的边界
本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。