HarnessRisk:一个面向生命周期的代理工具安全性基准测试

Hugging Face Daily Papers 论文

摘要

HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。

大型语言模型越来越多地通过代理工具部署,这些代理工具管理工具、扩展、持久状态、权限和外部操作。现有的安全基准测试主要针对单一的攻击机制或有限的操作设置子集,使得难以比较安全故障如何在不同的代理工具职责中出现。我们提出了 HarnessRisk,一个面向生命周期的基准测试,将代理工具安全性组织成六个操作阶段,包括代理工具配置、能力扩展、运行时操作、状态持久性、操作控制和事故恢复。HarnessRisk 包含 128 个沙盒化案例,每个案例将良性用户目标与嵌入在不受信任的工作流工件中的对抗性指令配对。我们使用效用、攻击成功率、持久性和检测来评估每个轨迹。在三种代理工具、六种语言模型和 14 种模型与代理工具配置中,攻击成功率在 12.6% 到 80.9% 之间,而效用保持在 75.0% 到 97.6% 之间。代理工具配置是所有三种代理工具中最脆弱的阶段,表明攻击可以通过在原本授权的更改安全敏感参数来成功。我们还发现,显式风险识别并不能可靠地导致安全行动,因为一些配置在超过 90% 的运行中检测到风险,同时仍保持显著的攻击成功率。这些结果强调了在多个代理工具职责和部署模型及代理工具配置层面上评估代理安全性的必要性。
查看原文
查看缓存全文

缓存时间: 2026/08/19 07:57

论文页面 - HarnessRisk:面向生命周期的代理框架安全基准

来源:https://huggingface.co/papers/2608.17597

摘要

HarnessRisk 在六个操作阶段评估代理框架的安全性,揭示了配置漏洞和检测缺陷如何导致高攻击成功率,同时实用性得以保持。

大型语言模型正越来越多地通过代理框架 (https://huggingface.co/papers?q=agent%20harnesses) 进行部署,这些框架管理工具、扩展、持久状态、权限和外部操作。现有安全基准主要针对单一攻击机制或有限的操作设置,难以比较不同框架职责下安全故障的产生方式。我们提出 HarnessRisk (https://huggingface.co/papers?q=HarnessRisk),一个面向生命周期的基准,将代理框架安全组织为六个操作阶段,包括框架配置、能力扩展、运行时操作、状态持久化 (https://huggingface.co/papers?q=State%20Persistence)、动作控制 (https://huggingface.co/papers?q=Action%20Control) 和事件恢复 (https://huggingface.co/papers?q=Incident%20Recovery)。HarnessRisk (https://huggingface.co/papers?q=HarnessRisk) 包含 128 个沙盒化案例 (https://huggingface.co/papers?q=sandboxed%20cases),每个案例将良性用户目标与嵌入在不受信任的工作流制品中的对抗性指令 (https://huggingface.co/papers?q=adversarial%20instruction) 配对。我们使用实用性 (https://huggingface.co/papers?q=Utility)、攻击成功率 (https://huggingface.co/papers?q=Attack%20Success%20Rate)、持久性和检测率 (https://huggingface.co/papers?q=Detection) 来评估每个轨迹。在三种框架、六种语言模型以及 14 种模型和框架配置下,攻击成功率从 12.6% 到 80.9% 不等,而实用性 (https://huggingface.co/papers?q=Utility) 保持在 75.0% 至 97.6% 之间。在所有三种框架中,框架配置是最脆弱的阶段,表明攻击可以通过在其他方面已授权的工作流内修改安全敏感参数来取得成功。我们还发现,明确的风险识别并不能可靠地导致安全行动,因为某些配置在超过 90% 的运行中检测到风险,但攻击成功率依然很高。这些结果突显了在多个框架职责层面以及部署的模型和框架配置层面评估代理安全性的必要性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.17597) 查看 PDF (https://arxiv.org/pdf/2608.17597) 项目页面 (https://baiyajing.github.io/harness-risk/) GitHub5 (https://github.com/Baiyajing/HarnessRisk) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17597)

在您的代理中获取本文:

hf papers read 2608\.17597

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。

引用本文的数据集 0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。

引用本文的空间 0

没有空间链接本文

在空间 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。

包含本文的收藏集 0

没有收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。

Harness Arena - 开源代理工具盲测基准

Reddit r/AI_Agents

Harness Arena 是一个开源的盲测基准工具,旨在比较各种AI代理工具在受控、匿名条件下的表现,以提供公平评估并邀请社区贡献。

Harness Handbook:使不断演化的智能体Harness可读、可导航、可编辑

arXiv cs.AI

Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。