智能体安全应成为运行时契约

Hugging Face Daily Papers 论文

摘要

本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。

主流范式将AI安全视为一种在模型训练期间通过RLHF、DPO或Constitutional AI灌输的属性。我们认为,对于执行代码、修改文件、发送消息和更改数据库的自主智能体而言,这种范式在结构上是不充分的。智能体安全应当是由运行框架(harness)强制执行的运行时契约,该契约包含两个互补的方面。预防性方面在危险动作发生之前通过沙箱、权限门、输出过滤器和轨迹监控器将其阻止。证据性方面则要求可验证的证据证明好的动作确实发生,并以测试运行、日志捕获、文件差异和引用溯源等硬证据作为任务提交的门槛。我们基于四条公开证据线来支撑这一立场,并在补充JSON文件中提供了逐行协议和数据:一项对52起有记录的AI智能体和LLM安全事件的调查;一项包含31个无争议核心案例外加一个争议性说明性案例的虚假完成审计;一项对12个公开智能体系统和运行框架的轨迹模式审计;以及一项对NeurIPS、ICML和ICLR 2023-2025年收录的全部28,560篇论文进行的标题级审计,结果显示训练时与部署时出版物之间存在8-12倍的合并失衡。两个先前需要强制执行安全的领域——计算机安全和实验科学——都收敛于同时包含预防性和证据性元素的运行时契约;智能体AI现在也面临同样的压力。我们形式化了智能体轨迹模式(Agent Trajectory Schema)和证据链(Evidence Chain),提出了一个基于标准监控器组合的组合式门控命题,并概述了一个研究议程。在智能体AI中,正确的安全单元是带有可检查证据的轨迹,而不是模型本身。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:35

论文页面 - Agent 安全应作为运行时契约

来源: https://huggingface.co/papers/2608.11274

摘要

Agent 安全应在运行时通过预防性控制和可验证证据来强制执行,而非仅依赖训练时的对齐方法。

当前主导范式将 AI 安全视为在模型训练期间通过 RLHFDPOConstitutional AI 灌输的一种属性。我们认为,对于执行代码、修改文件、发送消息和修改数据库的自主 Agent 而言,这种范式在结构上是不足够的。Agent 安全应是一种由 harness 强制执行的运行时契约,该契约包含两个互补的方面。预防性方面通过 沙箱权限门输出过滤器轨迹监视器,在危险动作发生之前将其阻止。证据性方面则要求可验证的证据来证明正确动作确实发生,并用硬证据(如测试运行、日志捕获、文件差异引用依据)对任务提交进行把关。我们用四条公开证据链支撑这一立场,并在补充的 JSON 文件中发布了行级协议和数据:一项对 52 起有记录的 AI Agent 和 LLM 安全事件的调查;一项包含 31 个无争议核心案例外加一个有争议的说明性案例的虚假完成审计;一项对 12 个公开 Agent 系统和 harness 的轨迹模式审计;以及一项对 NeurIPS、ICML 和 ICLR 2023-2025 年录用的全部 28,560 篇论文的标题级审计,显示训练时与部署时发表之间总体存在 8-12 倍的不平衡。两个此前需要强制安全的社区——计算机安全与实验科学——都收敛到了同时包含预防性和证据性元素的运行时契约上;Agent AI 现在也面临同样的压力。我们形式化了 Agent 轨迹模式证据链,基于标准 监控器组合 提出了一个 组合式门控 命题,并勾勒出一项研究议程。Agent AI 中正确的安全单位是“带可检查证据的轨迹”,而不是模型。

查看 arXiv 页面 (https://arxiv.org/abs/2608.11274)查看 PDF (https://arxiv.org/pdf/2608.11274)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11274)

在您的 Agent 中获取这篇论文:

hf papers read 2608\.11274

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.11274 以从本页链接到它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏以从本页链接到它。

相似文章

代理安全即行动对齐

arXiv cs.AI

本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。

代理规则必须存在于操作发生的地方

Reddit r/AI_Agents

本文主张,人工智能代理的安全规则应作为硬性工作流约束和权限来实现,而非仅依赖提示词指令。文章强调对于敏感或不可逆的操作,需要明确的检查、审批和日志记录。

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。