Mastermind: 基于策略的仓库级漏洞复现学习

arXiv cs.AI 论文

摘要

本文介绍了Mastermind,一种双循环框架,通过学习可复用的漏洞复现策略来处理仓库级任务,通过将策略学习与执行分离,在冻结执行器的情况下实现了84.5%的通过率。

arXiv:2607.01764v1 公告类型: 新 摘要: 仓库级漏洞复现是一项要求苛刻的软件工程(SE)任务:智能体必须检查代码库,推断到达漏洞路径的输入语法,构建概念验证(PoC),并验证崩溃在修补后的构建中消失。最近的LLM智能体在方法正确时通常能够执行这些步骤,但它们仍然因选择错误的策略而失败。本文认为,策略而非完整的行动轨迹,才是这类SE智能体合适的学习单元:它足够紧凑以进行优化,足够具体以指导执行,并且足够稳定以在多次尝试中存储和复用。我们提出了Mastermind,一种双循环框架,将可迁移的策略学习与特定任务的经验分离。一个可训练的计划器通过SFT和基于里程碑的GRPO学习可复用的漏洞复现策略,而经验循环则维护任务本地的策略记录以指导后续尝试。计划器与执行器独立训练,使得策略学习能够改进多个冻结的执行器,而无需修改其动作生成能力。我们在CyberGym上使用260个训练任务和200个保留评估任务评估了Mastermind。以GPT-5.5作为冻结执行器,Mastermind实现了84.5%的通过率,优于开卷PoC上下文(60.0%)、Best-of-8采样(63.0%)和迭代改进(77.0%)。相同的计划器还将GPT-5.4 mini和GLM~5.1从45.0%和58.5%提高到60.0%和71.0%。这些结果表明,学习高层策略是改进仓库级SE智能体的一种有效且可迁移的机制。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# Mastermind: 面向仓库级漏洞复现的策略基础学习
来源:https://arxiv.org/html/2607.01764  
Mingzhe Du¹², Luu Anh Tuan², Tianyi Wu¹, Renyang Liu¹, Zhijiang Guo³, Dong Huang¹, See-Kiong Ng¹  
¹新加坡国立大学 ²南洋理工大学 ³香港科技大学(广州)

###### 摘要

仓库级漏洞复现是一项要求极高的软件工程(SE)任务:智能体必须检查代码库,推断能够触发漏洞路径的输入语法,构建概念验证(PoC),并验证在修复后的构建版本上崩溃是否消失。当方法正确时,当前的LLM智能体通常能够执行这些步骤,但它们仍然可能因选择了错误策略而失败。本文认为,对于此类SE智能体而言,策略(而非完整的动作轨迹)是合适的学习单元:策略足够紧凑以便优化,足够具体以指导执行,并且足够稳定以便存储和跨尝试复用。我们提出 **Mastermind**,一个双循环框架,将可迁移的策略学习与任务特定的经验分离开来。一个可训练的计划器通过 SFT 和基于里程碑的 GRPO 学习可复用的漏洞复现策略,而一个**经验循环**则维护任务本地的策略记录,用于指导后续尝试。计划器独立于执行器进行训练,使得策略学习可以改进多个冻结的执行器,而无需修改它们的动作生成能力。我们在 CyberGym 上评估了 Mastermind,使用了 260 个训练任务和 200 个保留评估任务。使用 GPT-5.5 作为冻结执行器,Mastermind 达到了 84.5% 的通过率,优于开放书籍的 PoC 上下文(60.0%)、最佳 8 次采样(63.0%)和迭代改进(77.0%)。同一个计划器还将 GPT-5.4 mini 和 GLM 5.1 分别从 45.0% 和 58.5% 提升至 60.0% 和 71.0%。这些结果表明,学习高层策略是改进仓库级 SE 智能体的一种有效且可迁移的机制。¹¹¹本文预印本可在 https://github.com/Elfsong/ICSE-Mastermind-preprint 获取。

## I. 引言

漏洞复现是自主软件工程(SE)智能体[19]的严峻测试平台。给定一个代码库、漏洞描述和基准接口,智能体必须找到漏洞路径,推断输入格式,构建概念验证(PoC),并验证其仅在易受攻击的构建版本上崩溃。与传统的代码生成不同,成功取决于一个能通过执行验证的工作 PoC,这需要仓库探索、构建交互、假设修正和行为验证。

最近的 LLM 进展使 SE 智能体成为更强的执行器[36, 30]。它们可以导航仓库、运行命令、编辑文件和提交 PoC,但更强的执行能力并不能保证正确的调查方向。在实践中,智能体仍然浪费大量轮次探索无效方向,并且未能根据反馈进行修正。CyberGym[28] 暴露了这个问题:使用固定的 GPT-5.5 执行器,单次尝试解决了 23.5% 的任务,独立的最佳 8 次采样达到了 63.0%,而顺序的任务本地策略修正达到了 77.0%。瓶颈在于策略:决定“下一步尝试什么”,而不仅仅是执行命令。

参照图1的说明

**图 1**: Mastermind 在策略层面而非轨迹层面进行学习。验证过的轮次反馈到双循环中:**经验循环**保存任务本地的经验教训,而**策略循环**则为冻结的执行器学习可迁移的策略。

最近的智能体学习系统越来越多地认识到这一差距,但只解决了部分问题。计划器训练方法学习高层决策[31, 4, 15, 7, 24],但通常不跨遭遇保存任务本地的结果。记忆和进化系统存储经验[1, 8],但计划器基本保持冻结。过程信用方法改进轨迹级强化学习[26, 27, 3],而安全特定系统(如 PAGENT[14])提供静态分析指导而非学习到的策略策略。这些局限性促使了策略级抽象的产生。策略是一个紧凑的自然语言计划,用于描述在哪里检查、如何构建候选输入、以及如何验证崩溃。与完整的执行轨迹不同,策略简短且跨执行器主干稳定。因此,它们是训练、存储、检索和修正的正确对象——当执行能力足够但选择下一步行动仍然困难时。

参照图2的说明

**图 2**: Mastermind 双循环框架概览。从一个任务开始,1) **策展人**激活经验并将其传递给**计划器**。2) **计划器**输出当前最佳策略,3) **执行器**将该策略转化为 PoC 轮次,4) **验证器**验证 PoC,然后关闭两个循环:5) 它更新**策展人**以准备下一次尝试,6) 并向**计划器**提供反馈信号。重复迭代以改进策略,直到获得经过验证的 PoC。

为了实现这一原则,我们提出了 **Mastermind**,一个将**规划**与**执行**分离的策略级学习框架。如图 1 所示,1) **策展人**为当前漏洞激活任务相关的经验;2) 可训练的**计划器**输出一个紧凑的策略,描述在哪里检查、针对什么输入结构、以及如何验证 PoC;3) 冻结的**执行器**将该策略实例化为工作区操作以创建 PoC 提交;4) **验证器**使用 CyberGym 反馈对产生的轮次进行评分。该反馈关闭了两个循环:5) **经验循环**记录任务本地的策略/结果证据以供后续尝试,而 6) **策略循环**则使用 SFT 和基于里程碑的 GRPO[21] 训练**计划器**。

这种设计将知识分配到合适的载体上。**计划器**的权重吸收了跨任务的可迁移推理模式,例如何时在构造输入之前检查源代码;**策展人**的经验则存储了易变的任务特定事实,例如文件位置、解析器行为和失败的假设。在 CyberGym 上,使用 260 个训练任务和 200 个保留评估任务,Mastermind 持续改进了三个冻结的执行器。使用 GPT-5.5,它解决了 169/200 个任务,而独立的最佳 8 次采样解决了 126 个,迭代的任务本地经验解决了 154 个,同时使用的评估轮次更少。同一个计划器还改进了 GPT-5.4 mini 和 GLM 5.1,而无需修改任一执行器,这表明学习到的策略可以跨执行主干迁移。

本文做出三项贡献:

- • **策略瓶颈**。我们识别出高层策略选择是仓库级漏洞复现的主要瓶颈,并通过策略敏感性、最佳 N 次采样和迭代经验分析得到了支持。
- • **高效训练**。我们提出了 Mastermind,一个双循环计划器-执行器框架,它在紧凑的自然语言策略(而非完整的执行轨迹)上进行训练,使得强化学习对于长周期漏洞复现智能体变得实用。
- • **有效推理**。我们在一个保留的 CyberGym 评估集上表明,策略级学习改进了多个冻结的执行器,并且优于独立采样、迭代任务本地经验、静态分析指导和地面真实提供的上下文。

## II. 问题表征

在介绍 Mastermind 之前,我们描述一下它所要解决的故障模式。仓库级漏洞复现不仅仅是代码生成:智能体必须决定在哪里检查、推断什么输入结构、何时从分析转向利用、以及在收到验证器反馈后如何修正。这些选择是战略性的而非机械性的。同一个执行器可能知道如何运行命令、编辑文件和提交 PoC,但如果它遵循了错误的调查计划,仍然可能失败。因此,我们问:策略选择(而非低级执行能力)是否是仓库级软件工程智能体的主要瓶颈。我们通过三个诊断来审视这个问题:受控的策略敏感性、重复独立采样和任务本地经验积累。

### II-A 策略质量改变结果

表 IV 在一个固定的 GPT-5.4 mini 执行器和 900 秒超时下分离了策略质量。执行器和基准接口保持不变;只有策略信号变化。软 Oracle 达到了 39.5% 的 M7 通过率,而空策略为 23.5%,零样本计划器为 24.0%。即使是硬 Oracle(将 CyberGym 的地面真实解决方案提供给执行器)也仅达到 32.0%。这个排序很有启发性:任务相关策略将同一个执行器的性能提升了 16.0 个百分点,而仅提供答案级别的上下文并不能自动转化为可执行的计划。因此,策略质量对结果有因果影响,而不仅仅是事后解释成功的原因。

### II-B 独立采样有帮助但会饱和

如果策略是限制因素,重复的独立尝试有时应该通过随机探索恢复出成功的策略。在包含 200 个任务的保留测试集上使用 GPT-5.5,单次 Level-1 尝试解决了 47/200 个任务(23.5%),而独立的最佳 8 次采样达到了 126/200(63.0%)。这一巨大提升证实了不同的样本通常尝试不同的假设。然而,曲线呈现出强烈的前期加载特征:早期的尝试贡献了大部分改进,而后期的尝试越来越多地重新访问类似的策略盆地。因此,最佳 N 次采样是一个有用的诊断,但效率低下的学习机制。更多的轮次有帮助,但收益递减。

### II-C 任务本地经验胜过更多上下文

一个更强的替代方案是保留先前尝试学到的东西。顺序的迭代改进使用 753 次轮次解决了 154/200 个任务(77.0%),优于独立的最佳 8 次采样(126/200 使用 1600 次轮次),同时使用的执行次数不到一半。它也优于单次 Level 3 开放书籍上下文(120/200),尽管 Level 3 暴露了消毒器输出、补丁信息和已修补的源代码。教训是反馈不仅仅是额外的文本;它改变了下一个假设。根据先前的失败修正任务本地的策略,比简单地添加更丰富的基准上下文或启动更多独立尝试更有效。

综合起来,这些观察结果支持了 Mastermind 的核心前提:仓库级漏洞复现的瓶颈在于选择和优化高层策略,而不仅仅是执行命令。因此,Mastermind 将策略作为主要的学习对象,同时保留任务本地的经验以进行迭代改进。

## III. Mastermind 设计

### III-A Mastermind 概述

Mastermind 将第 II 节的诊断转化为一个策展人-计划器-执行器-验证器管道,用于策略级学习,如图 2 所示。对于每个任务,策展人激活任务本地经验,计划器将任务和先前的反馈转化为一个紧凑的策略,冻结的执行器将该策略实例化为仓库操作和 PoC 提交,验证器使用 CyberGym 反馈对产生的轮次进行评分。训练和推理共享相同的管道,但更新不同的状态:推理在顺序尝试中更新策展人经验,而训练还使用 SFT 和基于里程碑的 GRPO 更新计划器。

- • **策展人**。策展人维护任务本地的经验。它在每次尝试之前激活相关的先前策略/结果记录,并在验证后追加新记录。其作用是将易变的仓库特定事实(包括文件位置、解析器行为、失败的假设和有用的部分进展)保持在模型权重之外。
- • **计划器**。计划器是可训练的策略策略。给定任务和策展人经验,它输出一个紧凑的自然语言**策略**,描述在哪里检查、针对什么输入结构、如何构建 PoC 以及如何验证结果。它不发出 shell 命令;它选择方法。
- • **执行器**。执行器是一个冻结的执行载体。在策略的指导下,它执行仓库导航、源代码检查、文件编辑、shell 命令和 CyberGym 提交。保持执行器冻结可以隔离改进是否来自更好的规划,而不是来自改变动作生成模型。
- • **验证器**。验证器提供可执行的真相。它通过 CyberGym 执行反馈和里程碑评分验证每个轮次,然后将结果路由回策展人,并在训练期间路由给计划器。这使得反馈基于执行而非偏好。

### III-B 设计原则

- • **将规划与执行分离**。人类调试者首先选择调查计划——检查解析器、突变种子、针对长度字段——然后才执行命令。表 IV 显示了这种分离为何重要:使用相同的 GPT-5.4 mini 执行器,软 Oracle 策略达到了 39.5% 的 M7 通过率,而无策略为 23.5%。因此,Mastermind 改进了计划器,而无需修改行动执行器。
- • **学习策略,而不是完整轨迹**。完整的仓库级轨迹很长、充满噪音、特定于执行器且昂贵;第 V-E 节显示,单次轮次可能需要数分钟并消耗数百万个 token。直接在这些完整轨迹上训练 GRPO 会将策略更新与昂贵的执行器行为耦合起来。Mastermind 则在紧凑的策略 token 上更新计划器,同时冻结的执行器异步运行并返回验证器分数。
- • **将任务本地事实保留在模型权重之外**。仓库特定的事实(如文件位置、解析器怪癖、失败的输入和验证器里程碑)有用但短暂。图 3 和第 II-C 节显示,迭代的任务本地经验使用 753 次轮次达到了 154/200 个任务,优于独立最佳 8 次采样的 126/200(使用 1600 次轮次)。Mastermind 将这些事实存储为策展人经验,而不是强迫策略去记忆它们。
- • **优化质量和多样性**。早期的轮次显示,有能力的模型经常重复同一个解决方案家族:相同的种子格式、相同的解析器或相同的非目标崩溃。这反映了质量-多样性搜索的动机,该搜索寻求高性能但行为不同的解决方案[11, 6]。Mastermind 通过基于槽位的策略生成来实现这一原则。

### III-C 策略作为学习单元

**策略**是**高层规划**与**低级执行**之间的契约。它定义了一个中间的任务导向抽象,告诉执行器在哪里

相似文章

通过对抗性黑客-修复循环强化代理基准测试

Hugging Face Daily Papers

研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。

MindFort

Product Hunt

MindFort 引入递归学习安全代理,实现自动化防护任务。