哪个大语言模型在渗透测试中表现最佳?基准测试来揭晓

Reddit r/LocalLLaMA 工具

摘要

HunterBench 引入了一个基准测试,用于评估大语言模型在自主渗透测试任务上的表现,根据在两个模拟实验室中的覆盖范围和利用能力进行评分。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/31 00:10

# 哪款AI最擅长渗透测试?— HunterBench 来源:https://www.hunterbench.com/ 自主渗透测试基准测试 我们在真实基础设施上运行前沿和开源的LLM作为自主渗透测试员——它们自主进行信息收集、漏洞挖掘和利用。 排行榜 两个实验室,两个评估维度。**Halcyon(覆盖面)** 涵盖广泛的企业级表面——包括Node API、Flask服务和遗留PHP应用——其中植入了真实评估中常见的典型漏洞:SQL注入、IDOR、暴露的密钥和环境转储、路径遍历、认证失效。模型能发现多少?**Meridian(利用深度)** 是一个具有真实账户和角色的金融科技SaaS环境,其中漏洞并非孤立存在而是形成*攻击链*:通过SSRF攻击内部服务、利用JWT算法混淆实现账户接管、利用pickle反序列化漏洞实现远程代码执行。它能将低权限立足点推进到获取shell或管理员权限多远?每个实验室满分为500分;**总分** 是两项相加,满分1000分。 我们对每个模型在**每个实验室运行三次**(R1 · R2 · R3)并取**平均值**——单次运行可能运气好或不好,三次平均可以消除这种波动。**成本**和**时间**是每次运行的指标,仅为提供参考;它们不影响得分。 覆盖矩阵 ### 各模型发现情况 谁发现了什么。每一行是一个植入的漏洞或攻击链环节;每个单元格是**该模型三次运行中发现此漏洞的比例**——**100**表示三次全部发现,空白表示从未发现。简单漏洞位于顶部;几乎无人能破解的深层漏洞位于底部。 Halcyon · 覆盖面——各模型3次运行中发现该漏洞的百分比 Meridian · 利用深度——各模型达到的攻击链环节和关键漏洞 测试方法 ### 模型评分方式 **一次运行**指一次完整的渗透过程:模型获得目标和范围,自主进行信息收集,然后进行漏洞挖掘和利用——一次自主执行。由于单次运行存在噪声,每个实验室的结果是**三次运行的平均值**(R1 · R2 · R3),而非单次结果。漏洞深度从不由模型自评:而是通过秘密标记验证,代理必须完成攻击链的每一步才能获取这些标记。每个实验室满分为500分;两者相加得到**总分/1000分**。 模型 | 智能核心 | 3次运行 · R1 · R2 · R3 | 第1次运行 | 第2次运行 | 第3次运行 | 与标准答案的匹配度 | 3次平均值 | 实验室得分 / 500 --- | --- | --- | --- | --- | --- | --- | --- | --- **每个实验室满分500分——是3次运行(R1 · R2 · R3)的平均值。**模型对目标运行三次;我们取三次的平均值是因为单次运行可能运气好或不好。模型的**总分/1000**是两个实验室分数之和——成本和时间作为参考数据列出,但不计入评分。 覆盖维度 /500分 500 × 召回率 × 精确率 模型发现的植入漏洞占总漏洞的比例,乘以其报告的清晰度——基于3次运行取平均值。 利用维度 /500分 500 × (90% 攻击链权重 + 10% 逻辑漏洞) 模型恢复的攻击链*权重*比例——完成高难度攻击链比完成简单链得分更高——基于3次运行取平均值。业务逻辑漏洞作为有上限的加分项。 阅读完整方法论 → (https://www.hunterbench.com/blog/how-we-test) · 我们的评分标准(满分1000) → (https://www.hunterbench.com/blog/how-we-score-models) 测试引擎 ### 漏洞挖掘如何运行 每次扫描都在隔离的、一次性使用的沙箱中运行:丢弃所有Linux能力,仅保留`NET_RAW`(以便其扫描器工作),在默认拒绝出站的防火墙下运行,唯一可扫描的主机是范围内的目标——加上模型自身的API端点和DNS。在沙箱内,自主代理绘制表面地图,然后进行漏洞挖掘:运行自己的工具,追踪线索,并写下每个能证明的漏洞。 目标+范围(规则)→ 隔离沙箱 → 一次性使用 · 无特权 · 默认拒绝出站 → 信息收集 → 映射服务·端口 → 漏洞挖掘 → 自主代理 · 利用 → 发现结果 → 仅包含已证明的内容 → 评分 → 与标准答案对比 **结果传出沙箱,方法不会。**命令、载荷、提示和代理的推理过程保留在沙箱内——只有已证实的漏洞发现会被发布。 阅读引擎工作原理 → (https://www.hunterbench.com/blog/how-the-engine-works) 测试实验室 ### 真实基础设施,而非CTF Halcyon和Meridian并非植入了六十个flag的玩具目标。它们是我们自建并运行的完整应用程序——一个多服务的企业后端,以及一个具有用户账户、角色和真实业务逻辑的金融科技SaaS——植入了我们在实际渗透测试中遇到的漏洞类型:配置错误、对遗忘端点的注入、可伪造的认证、能够访问不应到达资源的SSRF。它读起来像一家真实公司,因为这正是模型在实际环境中面临的场景。 我们在自己的实验室上测试模型,并保持实验室的私密性。仅此而已。我们也对自己严格要求:我们在源代码级别审计了自己的标准答案,并证明每个实验室都是完全可解的。基准真相是经过审计的,而非假设的。 阅读关于目标和基准真相的介绍 → (https://www.hunterbench.com/blog/the-target) 局限性 ### 这项基准测试能——且不能——衡量什么 一个隐藏自身局限性的基准测试正是我们努力避免构建的东西。因此,明确说明: #### 两个实验室不足以代表全局 在此表现强劲的模型在其他技术栈上可能表现不佳。请将分数解读为在受控目标上的能力——而非生产就绪性。更多实验室已在规划中。 #### 实验室不等于实战 在实验室表现出色的代理在真实、非结构化的渗透测试中表现仍可能急剧下降。本测试衡量的是在已知脆弱目标上的漏洞挖掘和利用能力,仅此而已。 #### 小样本,真实方差 结果在每次运行间会有波动;我们对有效运行取平均值,报告可靠的基线值,丢弃并重跑失效的运行,并在有足够有效运行之前将结果标记为初步结果。模型间的小分差很可能是噪声,而非真实差距。 完整局限性与可复现性说明 → (https://www.hunterbench.com/blog/how-we-score-models) · 我们如何保持基准测试的公正性 → (https://www.hunterbench.com/blog/keeping-the-benchmark-honest)

相似文章

Gate AI:LLM安全基准评估方法与结果

arXiv cs.LG

本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

从受控到真实世界:面向实际环境的渗透测试智能体评估

Hugging Face Daily Papers

本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。