超越成功率:成本感知的攻击与防御安全智能体评估

Hugging Face Daily Papers 论文

摘要

本文提出了一种成本感知的安全AI智能体评估框架,不仅衡量成功率,还衡量推理和工具成本。研究发现,攻击性CTF性能随计算资源增加而提升,而防御性SOC任务更多依赖于规范的工具使用而非单纯的推理预算。

安全智能体评估通常衡量在充足推理预算下的峰值攻击能力,重点关注漏洞发现、漏洞利用开发、渗透测试和CTF完成。这样的测量有用但不完整:在运营安全中,每个推理步骤、工具调用、遥测查询和富集请求都会消耗预算。我们通过成本-成功视角评估语言模型安全智能体,涉及攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战。我们不仅报告最佳成功率,还在固定成本水平下比较模型,并按推理支出和工具支出分解性能。我们的结果显示了红队和蓝队任务的不同扩展规律。攻击性CTF性能随测试时计算的增加而提升,扩展的开放权重模型可以接近前沿专有系统,同时保持成本竞争力。防御性SOC调查不以相同方式扩展:成功更多地依赖于规范的工具使用、遥测导航和选择性富集,而非单纯的推理预算。我们认为安全智能体基准应在任务成功之外衡量经济效率和运营适应性。成本感知的SOC原生评估可以更清晰地显示哪些模型在当前具有实际用途,以及防御型智能体仍需改进之处。我们提供了一个交互式网站展示结果:https://evals.frontier.security。
查看原文
查看缓存全文

缓存时间: 2026/07/21 01:28

论文页面 - 超越成功率:攻防安全代理的代价感知评估

来源:https://huggingface.co/papers/2607.15263

摘要

安全代理评估通常在高推理预算下衡量其峰值攻击能力,重点考察漏洞发现、利用开发、渗透测试和CTF完成情况。这类衡量指标虽有价值但并不全面:在运营安全场景中,每一次推理步骤、工具调用、遥测查询和丰富化请求都会消耗预算。本文通过成本-成功双重视角,对基于语言模型的安全代理进行了评估,涵盖进攻性Cybench挑战和防御性Splunk BOTSv1调查挑战。我们不再仅报告最佳成功率,而是在固定成本水平下对比各模型,并按推理开销与工具开销分解性能表现。研究结果显示出红队与蓝队任务迥异的扩展规律。进攻性CTF性能随测试时计算量的增加而提升,且扩展后的开源权重模型能接近前沿专有系统的水平,同时保持成本竞争力。防御性SOC调查的扩展方式则不同:成功更依赖于规范的工具使用、遥测导航和选择性丰富化,而非仅凭原始推理预算。我们认为,安全代理基准测试应在任务成功之外衡量经济效率和运营适配度。代价感知、SOC原生的评估方式能更清晰地揭示哪些模型在当前具有实际可用性,以及防御代理仍需要在哪些方面取得改进。我们在交互式网站https://evals.frontier.security/上展示了我们的结果。

查看arXiv页面(https://arxiv.org/abs/2607.15263)查看PDF(https://arxiv.org/pdf/2607.15263)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.15263)

在您的代理中获取这篇论文:

hf papers read 2607\.15263

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。

引用此论文的数据集0

尚无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。

引用此论文的Space0

尚无Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.15263以将其链接至此页面。

包含此论文的收藏集0

尚无收藏集包含此论文

将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中以将其链接至此页面。

相似文章

从受控到真实世界:面向实际环境的渗透测试智能体评估

Hugging Face Daily Papers

本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。

AI Agent智能工具 - 事件调试与成本突增检测

Reddit r/AI_Agents

构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。

StealthBench:衡量自主攻击性安全代理的操作隐蔽性

Hugging Face Daily Papers

StealthBench 通过六个 OPSEC 维度,使用由三个模型组成的 LLM 评审小组,衡量自主攻击性安全代理的操作隐蔽性。结果显示,没有任何模型的安全成功率超过 54%,表明存在系统性的 OPSEC 失败。

)

TLDR AI

Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。