HarnessRisk:一个面向生命周期的代理工具安全性基准测试
摘要
HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。
查看缓存全文
缓存时间: 2026/08/19 07:57
论文页面 - HarnessRisk:面向生命周期的代理框架安全基准
来源:https://huggingface.co/papers/2608.17597
摘要
HarnessRisk 在六个操作阶段评估代理框架的安全性,揭示了配置漏洞和检测缺陷如何导致高攻击成功率,同时实用性得以保持。
大型语言模型正越来越多地通过代理框架 (https://huggingface.co/papers?q=agent%20harnesses) 进行部署,这些框架管理工具、扩展、持久状态、权限和外部操作。现有安全基准主要针对单一攻击机制或有限的操作设置,难以比较不同框架职责下安全故障的产生方式。我们提出 HarnessRisk (https://huggingface.co/papers?q=HarnessRisk),一个面向生命周期的基准,将代理框架安全组织为六个操作阶段,包括框架配置、能力扩展、运行时操作、状态持久化 (https://huggingface.co/papers?q=State%20Persistence)、动作控制 (https://huggingface.co/papers?q=Action%20Control) 和事件恢复 (https://huggingface.co/papers?q=Incident%20Recovery)。HarnessRisk (https://huggingface.co/papers?q=HarnessRisk) 包含 128 个沙盒化案例 (https://huggingface.co/papers?q=sandboxed%20cases),每个案例将良性用户目标与嵌入在不受信任的工作流制品中的对抗性指令 (https://huggingface.co/papers?q=adversarial%20instruction) 配对。我们使用实用性 (https://huggingface.co/papers?q=Utility)、攻击成功率 (https://huggingface.co/papers?q=Attack%20Success%20Rate)、持久性和检测率 (https://huggingface.co/papers?q=Detection) 来评估每个轨迹。在三种框架、六种语言模型以及 14 种模型和框架配置下,攻击成功率从 12.6% 到 80.9% 不等,而实用性 (https://huggingface.co/papers?q=Utility) 保持在 75.0% 至 97.6% 之间。在所有三种框架中,框架配置是最脆弱的阶段,表明攻击可以通过在其他方面已授权的工作流内修改安全敏感参数来取得成功。我们还发现,明确的风险识别并不能可靠地导致安全行动,因为某些配置在超过 90% 的运行中检测到风险,但攻击成功率依然很高。这些结果突显了在多个框架职责层面以及部署的模型和框架配置层面评估代理安全性的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.17597) 查看 PDF (https://arxiv.org/pdf/2608.17597) 项目页面 (https://baiyajing.github.io/harness-risk/) GitHub5 (https://github.com/Baiyajing/HarnessRisk) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17597)
在您的代理中获取本文:
hf papers read 2608\.17597
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。
引用本文的数据集 0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。
引用本文的空间 0
没有空间链接本文
在空间 README.md 中引用 arxiv.org/abs/2608.17597 以从本页链接。
包含本文的收藏集 0
没有收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
你的框架辜负了你的智能体,但却没有基准来证明这一点
本文强调了缺乏用于评估智能体框架可靠性的基准测试,重点探讨了与模型本身相比,MCP 实现如何更好地处理工具调用和错误。
审计智能体执行框架安全性
本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。
EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架
EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。
Harness Arena - 开源代理工具盲测基准
Harness Arena 是一个开源的盲测基准工具,旨在比较各种AI代理工具在受控、匿名条件下的表现,以提供公平评估并邀请社区贡献。
Harness Handbook:使不断演化的智能体Harness可读、可导航、可编辑
Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。