hunterbench

标签

Cards List
#hunterbench

哪个大语言模型在渗透测试中表现最佳?基准测试来揭晓

Reddit r/LocalLLaMA · 2026-08-30 缓存

HunterBench 引入了一个基准测试,用于评估大语言模型在自主渗透测试任务上的表现,根据在两个模拟实验室中的覆盖范围和利用能力进行评分。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈