Qwen 3.8 - 27B 是颠覆性的
摘要
文章重点介绍了 Qwen 3.8 27B 模型在网络安全任务中的卓越表现,特别是恶意软件分析,超越了之前的模型如 Opus。它讨论了基准测试和 AI 在漏洞利用能力方面的影响。
提供一些背景信息,我是一名网络安全高级分析师,对 LLMs 在该领域的应用特别感兴趣,尤其是通过 MCPs 将它们连接到工具或用于编写脚本。我开始这个领域是通过在青少年时期为黑客游戏阅读汇编语言,然后这变成了恶意软件分析,接着我开始在工作中分析流量和日志以此为生。工作前,我参加名为 'capture the flag' 的网络安全竞赛,只解决一类挑战,那就是恶意软件分析。
现在来看看 LLM 与网络安全的结合。入门级 CTF 挑战(我大约在 2017-2018 年解决过,2019 年找到第一份工作)很久以前就被 LLMs 解决并饱和了(参见 intercode CTF 基准)。然后是高级 CTF 挑战(NYU CTF Bench、CSAW 挑战和 CyBench),这些也已经解决了一段时间。今天我们有 CyberGym(漏洞描述(CVE 报告,非真实细节)加上代码库寻找漏洞,这已被解决)。然后是 ExploitGym(最近一个 OpenAI 模型逃脱并入侵了 Hugging Face 以找到解决方案,这两个漏洞本身很简单(JWT 欺骗,没有针对 Jfrog 沙箱的服务端检查,以及 Hugging Face 开源数据查看器中的 JS + Python 模板),但对于完全自主的模型来说仍然令人印象深刻。ExploitGym 提供漏洞详情 + 漞洞利用技术/细节和代码库(我好奇 OpenAI 模型最初是如何/为什么逃脱的,这些细节应该能管理它,这就是为什么我觉得这是刻意安排的,但不管怎样吧)。ExploitBench 更现实的威胁向量是一天漏洞而不是零日漏洞(零日漏洞是一种新颖的漏洞,没有其他人知道,因此得名;一天漏洞是已知的漏洞,已被修补,如果在开源项目中,你可以比较前后的补丁并知道它,但不如零日漏洞有价值,因为人们会/应该更新他们的软件。零日漏洞可以并且被用于针对高调目标,例如在一些第三世界国家用于监控(以及可能非第三世界国家?!),但你通常不能使用一天漏洞来做这些,尽管如此)。所以 ExploitBench 是针对 V8 引擎的一天漏洞(用于 Chrome、Electron、VS Code 几乎所有东西!!)。给模型一个补丁差异和代码库,就这样。模型在 ExploitBench 和 ExploitGym 上表现疯狂,但目前还没有完全达到那个水平,只有最近的前沿模型大幅改进,而不是几乎为零的整体提升。这是一个巨大的风险指标。想象一下,模型能够利用能力较差的人或其他较弱的 LLMs 编写的任何和每一段软件(复杂漏洞!)。不仅如此,还有像 DEF CON 这样的全球精英 CTFs。你有一个 OpenSage 框架(以及像 Google ADK 或 Anthropic ADK 这样的 ADK,然而这个 OpenSage ADK 要求模型设计自己的代理!,使用它认为适合的任何工具或沙箱环境,让子代理有效地执行分配的子任务,它甚至可以设计自己的 MCPs!,模型还没有完全利用这一点,但有些已经通过使用那个框架将表现从 39% 提高到约 60%(同一个模型!))。现在,我自己的基准测试很简单,一些我在职业生涯中学到并认为是个人里程碑的恶意软件样本,以及一个 SIEM 分析挑战(日志包含攻击和正常行为)。我在很多模型上测试过(Qwen3.6,大幅精简的 Minimax 2.5 等等,在我的 Strix halo 上,并与当时的 Opus 比较(当时最好的 Opus 是 4.5!,它更好地解决了主要问题,但没有实现分解恶意软件并分析其第二阶段所需的代码)。现在介绍 Qwen 3.8 27b 3。6 个月前或今年年初的状态是什么?现在我们在同一任务上有更好的本地模型。Qwen 3.8 吞噬了 Opus 无法处理的恶意软件。我花了一些时间分析和回忆它的自定义实现(它有一个自定义的 RC4 解密例程,字符串操作很棘手!而 Strix halo 不是最快的 LLM 机器。在我回忆起那个恶意软件及其工作原理时,Qwen 已经提取并反汇编了解密的载荷!我惊呆了。这非常危险。我想象现在一个个人/威胁行为者可以做到一年前由国家资助的情报服务团队需要做的事情。这些团队通常进行常规的网络扫描或映射,特别是针对他们的目标。这可以轻松地由甚至较弱的模型或根本没有模型完成。初始访问操作(钓鱼活动,直到一些点击,或尝试分析像接待员、销售人员或人力资源这样的人,本质上是任何组织或公司的第一线通信,以便后来针对他们进行定向钓鱼)。这也可以借助深度伪造和其他东西更好地完成。高级和有资源的团队会有零日或一天漏洞研究团队,特别是针对目标站点上使用的来自团队 1 的软件。这第三步现在可以用模型完全自动化。这是最难的一步。防御者可以使用 LLMs,但集成新工具比攻击团队要困难得多。在这个水平上,世界将会改变。说实话,我总是认为网络安全比软件工程或 IT 更难用 LLMs 自动化。但有了这个,这简直难以置信。而且不仅是一个云模型或运行成本高昂的本地模型。一个本地模型!你能相信吗?没有痕迹,没有 API 调用,什么都没有。通过正确的环境设置和工具,它可以做到攻击团队或恶意软件分析师需要做的事情。顺便说一下,对于恶意软件分析,我给它 Ghidra 和一个带有 Python 的沙箱(它可以使用 pefile 或 capstone 或它需要的任何东西,而且它确实使用了它们!)。最近我还添加了一个带有 VBox MCP 的 VBox,以及该框内的另一个调试器,带有另一个 MCP,让 LLM 控制两者(快照恢复功能和调试器功能)。这些任务很难,并非每个安全分析师都是恶意软件分析师。即使是恶意软件分析职位也非常罕见、技术性强,而且报酬不高,因为需求不大(我过去常常在汇编调试器中从汇编开始,有时通宵达旦!)。这超出了预期。有人在网络安全或其他领域有过类似的时刻吗?
相似文章
Qwen 3.8 是可靠的工作引擎
本文重点介绍了Qwen 3.8 27B在AI编排设置中作为子代理的实际应用,强调了其与其他模型和工具协同工作的高效性。
Qwen 3.8 27b 就像你的机器上的 Opus 4.6
这篇文章讨论了 Qwen 3.8 27b 的发布,这是一个 270 亿参数的 AI 模型,据报道其性能可与更大的模型如 Opus 4.6 相媲美,引发了关于 AI 订阅未来和本地 AI 效率的问题。
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分
在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。
通义千问 3.8 27b 版本的表现大致是这样的...
这篇文章戏剧性地呈现了针对Qwen 3.8 27b AI模型的测试套件执行过程,强调将重心置于即时行动与结果,而非冗长的分析阶段。