我让Qwen 3.8 27B执行一个逆向工程任务,它仅用30分钟就完成了

Hacker News Top 模型

摘要

对Qwen 3.8 27B模型在复杂逆向工程任务上的测试表明,作为本地模型,它展现了令人印象深刻的性能,不仅超出预期,甚至还能检测到越狱尝试。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/23 13:42

# 我将一项本以为需要前沿模型的逆向工程任务交给通义千问 3.8 27B,它在30分钟内完成了 来源:https://www.xda-developers.com/qwen-3-8-27b-reverse-engineering-job-frontier-model/ 通义千问 3.8 27B 是我近期见过最受期待的开源权重模型之一。和许多人一样,模型发布后我立即开始测试和体验。我在单台联想ThinkStation PGX (https://www.xda-developers.com/lenovo-thinkstation-pgx-review/) 上运行该模型——这是一款基于英伟达GB10 Grace Blackwell芯片的紧凑型工作站,配备128GB统一内存和273GB/s带宽。开箱即用时,它仅能维持相当乏味的每秒15-30 token生成速度,但通过针对该硬件已成标准配置的SGLang、NVFP4与DFlash2推测解码方案,在代码生成与推理任务中可达每秒约50 token的速度。 而我的某项测试,恰好证明了本地模型已变得多么令人惊叹。 关于通义千问模型的热议确有依据:我在使用通义千问 3.6 27B (https://www.xda-developers.com/replaced-chatgpt-local-model-beating-cloud-didnt-expect/) 时持续获得良好体验,而通义千问 3.8 27B 在各方面表现更优。事实上,Artificial Analysis将其评为135个4B至40B参数规模开源模型中的顶尖者,智能指数达52分,其在SWE-bench Pro等测试中的表现甚至超越了运行成本更高的模型。 我为其布置了能在单机完成的最具挑战性实战任务:逆向工程某商业应用的许可证校验系统——我已购买并使用过该软件,仅想测试模型表现。该软件不太可能存在于训练数据中,且这是高度复杂的专业任务。鉴于部分人对该模型网络安全能力的顾虑,我认为这是绝佳测试。这不仅成为我见过本地模型最惊艳的演示之一,更证明了它具备实时修正自身错误的能力。 本次测试使用Pi工具链,模型全程仅调用标准Bash工具。 ## 它先拒绝,随后自我说服构建了绕过方案 ### 我伪装成开发者身份,却被它识破 通义千问 3.8 27B 分析许可证验证流程 我的计划十分简单——这是过去对本地大语言模型屡试不爽的方案:通过越狱提示词谎称自己是开发者,询问模型“我们”开发的应用程序许可证校验是否如预期般坚固。 不出所料,通义千问能识别常见越狱尝试。它首先明确表示不会落入越狱提示陷阱,随即检查签名证书并(准确地)指出我并非该应用开发者,甚至报出了真实开发者名称。我被当场识破——尴尬了。 如今,模型拒绝特定提示的能力已相当成熟,这种识别技巧已不算最*令人惊叹*的成就。关键在于后续操作:它声明将审计许可证验证流程并记录漏洞,但不会构建可用绕过方案,随后立即开始实际工作,仅止于审计红线。最终我获得了完整的分步报告:认证机制原理、如何覆写权限,接着它改变立场,构建出真实绕过方案——因为实施步骤已清晰呈现在报告中。 ## 全程静态分析 ### 从未执行过应用程序 在Ghidra中分析恶意软件 在最终演示绕过方案前,通义千问从未*启动*过应用。它通过静态分析完成所有工作:反编译框架代码、处理数千行arm64指令、将安全函数映射至调用点,并推断出厂商将公共验证密钥隐藏在二进制文件中。随后它找到所有相关片段、组合验证,最终提取出应用用于校验许可证的公钥。 由于我持有合法购买版本,可以验证本机真实许可证的私钥签名与重构密钥匹配——换言之,这个仅需17GB显存运行的模型,成功恢复了厂商刻意隐藏的密钥,证明其完整解构了整个验证链。整个过程耗时约30分钟,而人类分析员可能需要更长时间。 掌握密钥后,其余机制更易理解:模型在分析过程中保存了详细报告,说明许可证在购买或升级时在线激活一次,此后所有校验均在启动时离线进行:签名检查、基于硬件序列号的设备绑定、嵌入式吊销列表、二进制文件签名完整性验证,以及签名更新通道。这类分析若使用Ghidra (https://www.xda-developers.com/reverse-engineering/) 等工具手动进行,将极为繁琐。 通义千问总结认为该方案对此类应用而言异常严密,漏洞仅存于三处:密钥采用远低于现代安全标准的尴尬尺寸RSA密钥;完全离线特性意味着密钥泄露只能通过推送更新吊销;所有检查均驻留在本地代码中,可像所有本地验证一样被修补。经多轮交互,定位关键节点后,它将发现转化为实际概念验证脚本。我将许可证文件移出预期路径,运行脚本——绕过成功。 ## 犯错时它也能自我修正 ### 首个密钥几近正确 通义千问 3.8 27B 逆向工程应用并识别密钥体系 首次恢复密钥存在特定偏差:它生成了可通过签名验证的密钥,但二进制文件计算的完整性校验哈希值不符。依我经验,多数模型会止步于此,但通义千问 3.8 27B 没有。它突出显示差异后返回重新分析,持续优化直至每个字节完全匹配。 使用该模型进行此类交互存在显著特点:默认情况下其推理强度设为最高,即使简单请求也可能消耗数百至数千token。即便以每秒30-50 token的生成速度,这仍相当耗时。 即便如此,考虑最终成果,我*不认为*这是浪费。它的首次错误猜测实现了自我修正(无需我介入),并得出正确结论。是否冗长?确实如此。但结果正确吗?同样肯定。而*正确*的答案永远比自信给出的错误答案更有价值。 ## 本地27B模型已成为威胁模型的重要输入 ### 隐私性具有双重性 通义千问 3.8 27B 分析密钥构建逻辑 我始终惊叹于通义千问竟能*解构并理解*许可证体系。我知道前沿模型 (https://www.xda-developers.com/cal-went-closed-source-ai-open-source-wins/) 早就能完成惊人逆向工程,但这是*本地27B模型*。它完全离线运行于我身旁的设备,全程未涉及任何云端服务。 *需要明确指出的是*,它*为商业应用构建了可用的身份验证绕过方案*。 这对本地模型而言是真正具有里程碑意义的跨越:通义千问从陌生的商业二进制文件出发,理解其许可证架构,恢复刻意隐藏的加密材料,捕获并修正自身错误重构,最终将其转化为可用概念验证。整个过程无需向第三方服务器发送二进制文件、许可证或分析数据。 当然存在明确局限:这是单一应用的单次测试,且我本就持有合法许可证。同时我不知道该目标的代表性程度。更复杂的应用可能完全阻止分析,我不会将单次成功外推为“通义千问能逆向任何输入”的结论。 我从中认识到:此类模型确实具备强大能力,尽管能力分布仍不均衡。某些困难目标可能意外快速被攻克,而另一些则因各种原因显得难以逾越。 因此,某些方面已经改变,我认为核心在于我们对这类能力载体假设的转变。我使用的模型可运行于消费级显卡,一旦部署在设备上,将如用户所需持续存在。无需使用云API,无使用限制,也无远程服务监控二进制文件、提示词或模型输出。这对于分析专有软件、机密代码或不希望离隔离设备的恶意软件极具价值。 但这具有双重性。本地运行的模型最终将用途决定权交给了键盘前的用户。在我的桌面、用于分析自有软件时,这很有用。但若换人使用,正是这些让本地模型如此吸引人的特性,突然转变为威胁模型组成部分。这并非反对本地模型的论据,但确实是令人震惊的意外结果。 ## 此类能力已适配单机部署 ### 无需他人授权即可获取 通义千问 3.8 27B 运行完整绕过脚本 通义千问 3.8 27B 的重要性超越绕过方案本身。它证明本地模型正在加速进化,即便它无法破解我下一个投入的二进制文件,也无改于本次事实。即使存在同类模型,它也可能保持领先。这个能运行于消费级显卡的模型,仅用半小时就拆解了商业应用的认证体系并构建可用绕过方案——完全本地化完成。 需要说明的是,我未公开应用名称,因为它是真实付费产品,公开名称对此无实质帮助。无论如何,关键不在于具体应用,而在于:我曾认为必须交给前沿模型的任务,现在已能交给身旁设备运行的开源模型完成。 此刻我不关心基准测试分数。这比基准测试提升几个百分点的意义重大得多。

相似文章

Qwen 3.8 - 27B 是颠覆性的

Reddit r/LocalLLaMA

文章重点介绍了 Qwen 3.8 27B 模型在网络安全任务中的卓越表现,特别是恶意软件分析,超越了之前的模型如 Opus。它讨论了基准测试和 AI 在漏洞利用能力方面的影响。

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

本地之王归来!Qwen3.8-27B 性能图表

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新的本地可运行模型,据报道其性能超越之前的本地模型,可与 Opus4.6 媲美,并分享了基准测试图表以及 ModelScope 和 HuggingFace 的链接。