SecRespond:面向真实世界入侵后事件响应的AI智能体基准评测

Hugging Face Daily Papers 论文

摘要

介绍SecRespond,这是首个利用取证磁盘快照和告警来评估大语言模型智能体在入侵后事件响应任务中表现的基准。实验表明,智能体在主动调查和全面修复方面存在困难。

大语言模型(LLM)智能体正越来越多地被应用于真实安全运维中,能够访问主机工件和命令行界面(CLI),因此对其安全能力进行全面评估至关重要。然而,现有的网络安全基准主要关注入侵前的场景,即智能体在攻击发生前被置于一个干净、理想化的环境中。这导致入侵后场景的研究尚不充分。为填补这一空白,我们提出了SecRespond,这是首个针对入侵后事件响应工作流评估LLM智能体的基准。给定一个受感染主机的取证磁盘快照,以及主机安全产品报告的告警、漏洞扫描和基线检查结果,智能体需生成关于入侵、基线风险和漏洞风险的取证报告,并制定修复计划。我们在10个网络靶场上实例化了该任务,每个靶场由不同的受感染云主机构建,涵盖4种入口点类型、21种ATT&CK技术和5种操作系统。我们在OpenCode智能体框架上评估了23个前沿LLM。实验结果表明,尽管当前智能体能够可靠地发现告警暴露的问题,但它们在主动调查磁盘中的静默入侵以及生成全面、已验证的修复计划方面仍存在困难,没有任何模型能在单个靶场上实现完全检测与修复。这揭示了构建面向真实世界事件响应的智能体所面临的根本瓶颈。该基准已公开于 https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:47

论文页面 - SecRespond:评估AI代理在真实世界后入侵事件响应中的表现

来源:https://huggingface.co/papers/2607.26791 发布于 7月29日

·

提交者 https://huggingface.co/bcol

boli (https://huggingface.co/bcol) 于7月30日

摘要

大型语言模型(LLM)代理越来越多地被应用于真实世界的安全运维中,它们能够访问主机工件和命令行界面(CLI),这使得全面评估其安全能力变得至关重要。然而,现有的网络安全基准测试主要关注入侵前场景,即代理在攻击发生前被置于一个干净且理想化的环境中。这导致入侵后场景仍未得到充分探索。为了填补这一空白,我们引入了SecRespond,这是第一个用于评估LLM代理在入侵后事件响应工作流中的基准测试。给定一个被入侵主机的取证磁盘快照,以及主机安全产品报告的告警、漏洞扫描和基线检查结果,代理需要生成关于入侵、基线风险和漏洞风险的取证报告,以及一个修复计划。我们在10个网络靶场上实例化了这个任务,每个靶场由不同的被入侵云主机构建而成,涵盖4种入口点类型、21种ATT&CK技术和5种操作系统。我们在OpenCode代理框架上评估了23个前沿LLM。实验结果表明,尽管当前代理能够可靠地发现告警暴露的问题,但它们难以主动调查磁盘以发现静默入侵,也难以生成全面且经过验证的修复计划,没有任何模型能在任何单个靶场上实现完全的检测和修复。这揭示了构建用于真实世界事件响应的代理时的一个根本瓶颈。该基准测试公开于 https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond。

查看 arXiv 页面 (https://arxiv.org/abs/2607.26791) 查看 PDF (https://arxiv.org/pdf/2607.26791) 项目页面 (https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26791)

引用本论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.26791 即可从此页面链接。

引用本论文的数据集1

Alibaba-NLP/SecRespond 大约4小时前更新 (https://huggingface.co/datasets/Alibaba-NLP/SecRespond)

引用本论文的空间0

没有空间链接到此论文

在空间 README.md 中引用 arxiv.org/abs/2607.26791 即可从此页面链接。

包含本论文的收藏1

相似文章

事件响应面临从检测到行动的难题

Reddit r/AI_Agents

文章指出,事件响应中的主要瓶颈不是执行时间,而是从检测到行动的差距,并探讨了AI辅助的SRE工具如何发展以关联信号、识别根本原因并建议或触发修复。

从受控到真实世界:面向实际环境的渗透测试智能体评估

Hugging Face Daily Papers

本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。