超越成功率:成本感知的攻击与防御安全智能体评估
摘要
本文提出了一种成本感知的安全AI智能体评估框架,不仅衡量成功率,还衡量推理和工具成本。研究发现,攻击性CTF性能随计算资源增加而提升,而防御性SOC任务更多依赖于规范的工具使用而非单纯的推理预算。
查看缓存全文
缓存时间: 2026/07/21 01:28
论文页面 - 超越成功率:攻防安全代理的代价感知评估
来源:https://huggingface.co/papers/2607.15263
摘要
安全代理评估通常在高推理预算下衡量其峰值攻击能力,重点考察漏洞发现、利用开发、渗透测试和CTF完成情况。这类衡量指标虽有价值但并不全面:在运营安全场景中,每一次推理步骤、工具调用、遥测查询和丰富化请求都会消耗预算。本文通过成本-成功双重视角,对基于语言模型的安全代理进行了评估,涵盖进攻性Cybench挑战和防御性Splunk BOTSv1调查挑战。我们不再仅报告最佳成功率,而是在固定成本水平下对比各模型,并按推理开销与工具开销分解性能表现。研究结果显示出红队与蓝队任务迥异的扩展规律。进攻性CTF性能随测试时计算量的增加而提升,且扩展后的开源权重模型能接近前沿专有系统的水平,同时保持成本竞争力。防御性SOC调查的扩展方式则不同:成功更依赖于规范的工具使用、遥测导航和选择性丰富化,而非仅凭原始推理预算。我们认为,安全代理基准测试应在任务成功之外衡量经济效率和运营适配度。代价感知、SOC原生的评估方式能更清晰地揭示哪些模型在当前具有实际可用性,以及防御代理仍需要在哪些方面取得改进。我们在交互式网站https://evals.frontier.security/上展示了我们的结果。
查看arXiv页面(https://arxiv.org/abs/2607.15263)查看PDF(https://arxiv.org/pdf/2607.15263)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.15263)
在您的代理中获取这篇论文:
hf papers read 2607\.15263
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。
引用此论文的数据集0
尚无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。
引用此论文的Space0
尚无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。
包含此论文的收藏集0
尚无收藏集包含此论文
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中以将其链接至此页面。
相似文章
我测试了AI代理修复真实安全漏洞。以下是我的发现。
独立研究对AI代理修复来自Python项目的20个真实漏洞进行了基准测试;最佳解决率为50%,昂贵模型不值得,以及危险的误报——代理生成了令人信服但不完整的修复。
从受控到真实世界:面向实际环境的渗透测试智能体评估
本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。
AI Agent智能工具 - 事件调试与成本突增检测
构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。
StealthBench:衡量自主攻击性安全代理的操作隐蔽性
StealthBench 通过六个 OPSEC 维度,使用由三个模型组成的 LLM 评审小组,衡量自主攻击性安全代理的操作隐蔽性。结果显示,没有任何模型的安全成功率超过 54%,表明存在系统性的 OPSEC 失败。
)
Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。