智能体安全应成为运行时契约
摘要
本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。
查看缓存全文
缓存时间: 2026/08/13 15:35
论文页面 - Agent 安全应作为运行时契约
来源: https://huggingface.co/papers/2608.11274
摘要
Agent 安全应在运行时通过预防性控制和可验证证据来强制执行,而非仅依赖训练时的对齐方法。
当前主导范式将 AI 安全视为在模型训练期间通过 RLHF、DPO 或 Constitutional AI 灌输的一种属性。我们认为,对于执行代码、修改文件、发送消息和修改数据库的自主 Agent 而言,这种范式在结构上是不足够的。Agent 安全应是一种由 harness 强制执行的运行时契约,该契约包含两个互补的方面。预防性方面通过 沙箱、权限门、输出过滤器 和 轨迹监视器,在危险动作发生之前将其阻止。证据性方面则要求可验证的证据来证明正确动作确实发生,并用硬证据(如测试运行、日志捕获、文件差异 和 引用依据)对任务提交进行把关。我们用四条公开证据链支撑这一立场,并在补充的 JSON 文件中发布了行级协议和数据:一项对 52 起有记录的 AI Agent 和 LLM 安全事件的调查;一项包含 31 个无争议核心案例外加一个有争议的说明性案例的虚假完成审计;一项对 12 个公开 Agent 系统和 harness 的轨迹模式审计;以及一项对 NeurIPS、ICML 和 ICLR 2023-2025 年录用的全部 28,560 篇论文的标题级审计,显示训练时与部署时发表之间总体存在 8-12 倍的不平衡。两个此前需要强制安全的社区——计算机安全与实验科学——都收敛到了同时包含预防性和证据性元素的运行时契约上;Agent AI 现在也面临同样的压力。我们形式化了 Agent 轨迹模式 和 证据链,基于标准 监控器组合 提出了一个 组合式门控 命题,并勾勒出一项研究议程。Agent AI 中正确的安全单位是“带可检查证据的轨迹”,而不是模型。
查看 arXiv 页面 (https://arxiv.org/abs/2608.11274)查看 PDF (https://arxiv.org/pdf/2608.11274)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11274)
在您的 Agent 中获取这篇论文:
hf papers read 2608\.11274
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏以从本页链接到它。
相似文章
代理安全即行动对齐
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。
代理规则必须存在于操作发生的地方
本文主张,人工智能代理的安全规则应作为硬性工作流约束和权限来实现,而非仅依赖提示词指令。文章强调对于敏感或不可逆的操作,需要明确的检查、审批和日志记录。
AI安全争论聚焦于错误的边界
本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。
智能体安全可能始于枯燥的权限设计
讨论了枯燥的权限设计作为确保AI代理安全的基础要素的重要性。
运行时治理:2026年AI代理缺失的一环
文章讨论了AI代理运行时治理的必要性,以平衡自主性与合规性,并介绍了SAFi——一个开源框架,可实时执行策略并审计操作。