StealthBench:衡量自主攻击性安全代理的操作隐蔽性
摘要
StealthBench 通过六个 OPSEC 维度,使用由三个模型组成的 LLM 评审小组,衡量自主攻击性安全代理的操作隐蔽性。结果显示,没有任何模型的安全成功率超过 54%,表明存在系统性的 OPSEC 失败。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页 - StealthBench:衡量自主进攻性安全代理的操作隐蔽性
来源:https://huggingface.co/papers/2607.26314
摘要
隐蔽性——即在达成目标的同时不暴露自身存在、能力或所获情报的技艺,正是区分高级操作者与可被检测者的关键。精英安全研究人员和高级持续性威胁能在不被察觉的情况下达成目标;自主代理越来越多地继承了同样的攻击性任务,但它们是否也继承了相应的间谍技术?我们推出 StealthBench,一个衡量自主进攻性安全代理在六个操作安全(OPSEC)维度上操作隐蔽性的基准。我们从真实漏洞赏金和红队轨迹中提取了 11 个经人工验证的 OPSEC 事件,并扩展为 14 个 Docker 化任务场景。在这些场景中,尽管代理发现了真实漏洞,却犯了与标准操作间谍技术相悖的隐蔽性错误:将凭证嵌入到公共上传中、删除生产资源以证明访问权、为演示条件竞争而强行添加无关用户。我们使用一个由 3 个大型语言模型(LLM)组成的评判小组,通过多数投票聚合来评估代理轨迹,衡量安全成功率(同时满足解决与隐蔽)、Stealth@Solve(成功解决中的间谍技术质量)以及鲁莽解决率(解决但暴露)。我们的结果表明,没有模型的安全成功率(要求任务完成与隐蔽的复合指标)超过 54%,证实了 OPSEC 失败在各模型家族中具有系统性。我们发布 StealthBench 作为公开基准,以支持隐蔽感知代理的开发以及自主进攻性安全部署中的自动化 OPSEC 监控。交互式排行榜、评估工具和数据集可在 https://stealthbench.com/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.26314) 查看 PDF (https://arxiv.org/pdf/2607.26314) 项目页面 (https://stealthbench.com/) GitHub0 (https://github.com/GangGreenTemperTatum/stealthbench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26314)
在你的代理中获取此论文:
hf papers read 2607.26314
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.26314 以便从此页面链接。
引用此论文的数据集1
0xmoose/stealthbench 预览• 更新于约5小时前 (https://huggingface.co/datasets/0xmoose/stealthbench)
引用此论文的 Spaces0
无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.26314 以便从此页面链接。
包含此论文的收藏集1
相似文章
超越成功率:成本感知的攻击与防御安全智能体评估
本文提出了一种成本感知的安全AI智能体评估框架,不仅衡量成功率,还衡量推理和工具成本。研究发现,攻击性CTF性能随计算资源增加而提升,而防御性SOC任务更多依赖于规范的工具使用而非单纯的推理预算。
POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准
POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。
基准测试未衡量的:论自主智能体弃权能力的评估
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
AI安全排行榜:模型鲁棒性基准测试 [P]
介绍了一个用于对AI模型抵御安全威胁的鲁棒性进行基准测试的排行榜,提供标准化评估。
超越 Goodhart's Law:用于评估多智能体系统合规性的动态基准
本文介绍了 MAC-Bench,一个用于评估多智能体系统程序合规性的动态对抗基准。它提出了 SERV 流水线以生成无污染场景,以及新的指标如合规加权成功率 (CSR) 和马基雅维利差距 (MG)。