SecRespond:面向真实世界入侵后事件响应的AI智能体基准评测
摘要
介绍SecRespond,这是首个利用取证磁盘快照和告警来评估大语言模型智能体在入侵后事件响应任务中表现的基准。实验表明,智能体在主动调查和全面修复方面存在困难。
查看缓存全文
缓存时间: 2026/07/30 09:47
论文页面 - SecRespond:评估AI代理在真实世界后入侵事件响应中的表现
来源:https://huggingface.co/papers/2607.26791 发布于 7月29日
·
提交者 https://huggingface.co/bcol
boli (https://huggingface.co/bcol) 于7月30日
摘要
大型语言模型(LLM)代理越来越多地被应用于真实世界的安全运维中,它们能够访问主机工件和命令行界面(CLI),这使得全面评估其安全能力变得至关重要。然而,现有的网络安全基准测试主要关注入侵前场景,即代理在攻击发生前被置于一个干净且理想化的环境中。这导致入侵后场景仍未得到充分探索。为了填补这一空白,我们引入了SecRespond,这是第一个用于评估LLM代理在入侵后事件响应工作流中的基准测试。给定一个被入侵主机的取证磁盘快照,以及主机安全产品报告的告警、漏洞扫描和基线检查结果,代理需要生成关于入侵、基线风险和漏洞风险的取证报告,以及一个修复计划。我们在10个网络靶场上实例化了这个任务,每个靶场由不同的被入侵云主机构建而成,涵盖4种入口点类型、21种ATT&CK技术和5种操作系统。我们在OpenCode代理框架上评估了23个前沿LLM。实验结果表明,尽管当前代理能够可靠地发现告警暴露的问题,但它们难以主动调查磁盘以发现静默入侵,也难以生成全面且经过验证的修复计划,没有任何模型能在任何单个靶场上实现完全的检测和修复。这揭示了构建用于真实世界事件响应的代理时的一个根本瓶颈。该基准测试公开于 https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond。
查看 arXiv 页面 (https://arxiv.org/abs/2607.26791) 查看 PDF (https://arxiv.org/pdf/2607.26791) 项目页面 (https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26791)
引用本论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.26791 即可从此页面链接。
引用本论文的数据集1
Alibaba-NLP/SecRespond 大约4小时前更新 (https://huggingface.co/datasets/Alibaba-NLP/SecRespond)
引用本论文的空间0
没有空间链接到此论文
在空间 README.md 中引用 arxiv.org/abs/2607.26791 即可从此页面链接。
包含本论文的收藏1
相似文章
AI 代理治理事件响应,你们的方案是什么?
本文讨论了 AI 代理缺乏事件响应计划的问题,并寻求他人关于如何处理故障和访问问题的意见。
事件响应面临从检测到行动的难题
文章指出,事件响应中的主要瓶颈不是执行时间,而是从检测到行动的差距,并探讨了AI辅助的SRE工具如何发展以关联信号、识别根本原因并建议或触发修复。
从受控到真实世界:面向实际环境的渗透测试智能体评估
本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。
一个好的AI代理技能安全扫描器基准测试应该包含什么?
讨论了为评估AI代理技能的安全扫描器设计基准测试的挑战,这些技能引入了新的供应链风险。它还质疑基准测试是否应包括真实世界的恶意样本、合成案例、完整技能目录或边界案例。
当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。