标签
本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。
文章强调了 AI agents 执行破坏性操作(如删除数据库)的风险,并提出了一种运行时策略网关,该网关使用 Policy-as-Code 实时拦截和阻止不合规的 agent 行为,并询问用户是否会采用此类安全工具。
本文献综述识别并分析了物理AI系统中静默故障的问题,即黑箱模型可能在未被检测到的情况下执行有害动作。它提出了运行时防护功能分类法,并概述了安全自主系统的评估要求。