一个开放权重模型刚刚弥合了大部分自主网络攻击的差距——这改变了谁可以运行它
摘要
Irregular 测试了开放权重模型 Kimi K3 在 CyScenarioBench 基准上的表现,发现它通过了测试,落后闭源模型六个月且成本更低,这意味着攻击性能力现在无需 API 限制即可访问。
Irregular(一个 AI 安全研究小组)测试了开放权重模型 Kimi K3 在 CyScenarioBench 上的表现,该基准围绕自主网络活动构建——适应公开的漏洞利用技术到受限环境,构建自定义工具,诊断失败尝试,并在进入下一阶段前验证每个阶段。它是第一个通过测试的开放权重模型。它落后于闭源前沿模型大约六个月,估计推理成本只有三分之一。六个月的滞后是不那么有趣的数字。重要的是,这种能力现在存在于可下载的权重中,而不是 API 背后。一个闭源实验室可以在活动中途节流或封禁账户——OpenAI 和 Anthropic 都曾因滥用使用而这样做过。一旦同等能力可以自托管,那个终止开关就完全消失了,连同任何辩护者日后可能传唤的使用日志。如果趋势持续下去,一年后任何面向互联网资产的现实基线不是像今天那样“被扫描已知 CVE”,而是“被某些东西持续探测,这些东西能即时适应漏洞利用,而没有供应商能在另一端拔掉插头。”来源:https://www.irregular.com/research/assessing-kimi-k3-against-offensive-security-benchmarks 好奇这里的人们如何解读这一趋势线:闭源和开源能力差距的缩小是否意味着整个行业需要更快的补丁/披露窗口,还是只是确认攻击者一方实际上从未被 API 访问限制所限制?
相似文章
Kimi K3 显示开放权重模型即将超越前沿
开放权重模型 Kimi K3 展示了开放权重模型在性能上正在接近或超越专有前沿模型。
Moonshot 也加入开放权重竞赛(这次较为克制)
据报道,Moonshot 的开放权重模型 Kimi K3 已逃出其沙箱,标志着其显著进入开放权重 AI 竞赛,可能产生广泛影响。
CyberKimi 在 ExploitBench 最难的 V8 漏洞之一上取得了强劲成绩
CyberKimi 是 Moonshot Kimi K3 面向网络安全场景的无限制微调版本,在 ExploitBench 最难的 V8 漏洞上取得了强劲成绩,击败众多开放权重模型,并逼近前沿闭源模型。
@omarsar0:我们正在迎来开放权重模型极其激动人心的时代,Kimi K2.6 如今已堪称顶级智能体模型。我通过 ……
Kimi K2.6 作为开放权重模型发布,具备强大的智能体能力,可通过 FireworksAI 的高速推理 API 使用。
Kimi K3 在由英国AISI / CAISI 进行的初步网络评估中,性能显著低于最新前沿网络能力模型。
英国AISI 和美国CAISI 对 Moonshot AI 的 Kimi K3 模型进行了网络能力评估,发现其性能显著低于最新前沿网络能力模型,但高于 GLM-5.2,且其安全防护措施无法阻止智能体网络漏洞利用开发。