将大型语言模型的知识蒸馏至面向自主网络作战的轻量级强化学习智能体
摘要
本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。
arXiv:2607.28826v1 公告类型:新
摘要:自主网络作战(ACO)在防御企业网络方面日益重要,因为网络威胁的复杂性持续演变。ACO应用通常采用强化学习(RL)智能体,通过与环境的交互来学习防御行为。然而,RL智能体在训练过程中通常需要大量探索,在收敛到有效防御策略之前,往往会出现行为不稳定和初始决策质量差的问题。
在这项工作中,我们研究了利用大型语言模型(LLM)来改进ACO环境中的自主防御决策。通过提示工程(prompt engineering)而非微调,我们证明了一个在网络安全数据上预训练的80亿参数LLM,在改进的CybORG CAGE Challenge 2环境中能够优于基线RL智能体。随后,我们提出了一种在线策略蒸馏框架,将LLM的防御策略迁移到一个仅包含64,910参数的轻量级RL智能体中,模型规模缩小了数个数量级,同时保持了有效的防御能力。这为在轻量级、可部署的智能体中落地前沿网络安全模型提供了一条路径。
为了评估可迁移性,我们构建了包含4到12台主机的CybORG场景,并在不同网络配置下评估了该方法。我们还评估了教师引导的RL稳定化策略,观察到没有一种策略能持续超越优化后的教师策略,这表明奖励驱动的RL优化与教师引导的防御策略之间存在策略对齐限制。
我们的结果展示了专注于网络安全的LLM作为自主网络防御专业知识来源的潜力,同时策略蒸馏为在高效、可扩展的智能体中落地前沿网络安全模型提供了一条实用路径。
查看缓存全文
缓存时间: 2026/08/03 07:32
# 将大语言模型的知识蒸馏为面向自主网络作战的轻量级强化学习智能体
Source: https://arxiv.org/html/2607.28826
11institutetext:加拿大皇家军事学院电子与计算机工程系,金斯顿,加拿大22institutetext:加拿大皇家军事学院数学与计算机科学系,金斯顿,加拿大33institutetext:加拿大国防研究与发展署,渥太华,加拿大44institutetext:蒙特利尔理工学院计算机与软件工程系,蒙特利尔,加拿大###### 摘要
自主网络作战(ACO)随着网络威胁在规模和复杂度上的不断演进,已成为保护企业网络日益重要的手段。ACO应用通常采用强化学习(RL)智能体,通过与环境的直接交互来学习防御行为。然而,强化学习智能体在训练期间通常需要大量探索,往往在收敛到有效防御策略之前,会表现出不稳定的行为和较差的初始决策能力。
在本工作中,我们研究使用大语言模型(LLM)来改善ACO环境中的自主防御决策。通过提示工程而非针对特定环境的微调,我们证明了一个在网络安全数据上预训练的80亿参数大语言模型,能够在修改后的CybORG CAGE Challenge 2环境中超越基线强化学习智能体。随后,我们提出了一种在线策略蒸馏框架,将该大语言模型的防御策略迁移到一个仅包含64,910个参数的轻量级强化学习智能体中,在保持有效防御能力的同时将模型规模减少了数个数量级。这为将计算成本高昂的前沿网络安全模型的防御能力,转化为可在作战环境中部署的轻量级智能体提供了一条潜在路径。
为了评估可迁移性,我们还构建了多个从4台到12台主机不等的CybORG场景,并评估了所提方法在不同网络配置下的可行性。此外,我们系统性地评估了多种教师引导的强化学习稳定化策略,并观察到没有任何一种策略能够持续超越优化后的教师策略,这表明基于奖励的强化学习优化与教师引导的防御策略之间可能存在策略对齐方面的局限。
我们的研究结果表明,将专注于网络安全的LLM用作自主网络防御的专业知识来源具有潜力,而策略蒸馏则为在前沿网络安全模型的基础上,构建计算高效且可扩展的智能体,并将其防御能力投入实际应用提供了一条切实可行的路径。
自主网络作战(ACO);策略蒸馏;教师引导学习;行为克隆
## 1 引言
强化学习(RL)已成为对抗不断演进的对抗性网络威胁的一种有前景的方法。与传统机器学习(ML)技术通常需要维护大规模标注数据集,且这些数据集必须不断更新以保持对新攻击策略的有效性不同,强化学习使智能体能够通过与环境的直接交互来学习防御行为,从而减少对人工整理数据集的依赖。然而,传统的强化学习方法在网络安全领域带来了若干挑战。特别是,强化学习智能体通常需要较长的训练时间,并且必须首先执行不利的动作,以便从后果中学习。在网络安全环境中,错误的决策可能导致严重的运营影响,例如企业网络被攻陷,这种探索式学习策略可能带来问题。
已有研究探索了将教师(teacher)集成到强化学习流程中,即由具有领域先验知识的外部实体最初指导智能体的动作。随着训练的进行并满足预定义标准(例如,固定数量的回合)后,教师的影响逐渐减弱,直到智能体通过环境反馈独立学习。虽然这种方法能够显著加速学习并减少有害探索,但它引入了一个重要限制:像网络安全这样的复杂任务可能包含多种可行的防御策略。因此,教师的策略可能与最终通过环境奖励强化的策略不一致。即使两种策略都有效,这种错位也可能对训练稳定性和智能体整体性能产生负面影响。
一种潜在的解决方案是直接专注于学习教师的策略,而不是通过教师指导和环境反馈的联合优化。要使这种方法有效,教师本身必须展现出强大的防御决策能力。大语言模型(LLM),尤其是那些在网络安全相关数据上预训练的模型,因其灵活的输入格式、内嵌的领域知识和推理能力,为担任这一教师角色提供了有前景的候选方案。然而,LLM通常比轻量级强化学习智能体包含更多的参数,导致计算需求增加和推理速度变慢。近年来,自主网络防御的进展越来越依赖于这些能够进行高级上下文推理的大型前沿网络安全模型。然而,由于这些模型参数规模大、推理延迟高以及基础设施要求高,在运营环境中持续部署它们在计算上仍然代价高昂。因此,一个重要的开放问题是:这些模型的防御策略能否被蒸馏到紧凑且计算高效的智能体中,以适用于可扩展和资源受限的部署场景。
在本工作中,我们将一个在网络安全相关数据上预训练的LLM的策略蒸馏到一个轻量级强化学习智能体中,并证明所得智能体优于仅通过与修改版CybORG CAGE Challenge 2环境[21 (https://arxiv.org/html/2607.28826#bib.bib28)]交互来训练的强化学习智能体。我们不是依赖针对特定环境的微调,而是通过提示工程优化LLM的防御行为,随后将该策略迁移到轻量级强化学习智能体中。此外,我们评估了所提方法在多个从4台到12台主机不等的CybORG场景中的可迁移性。我们还研究了教师引导的强化学习智能体在转向独立强化学习时,是否能持续超越优化后的教师策略。本工作的主要贡献总结如下:
- • LLM到RL的策略蒸馏:我们提出了一种方法,将一个80亿参数的网络安全聚焦型LLM的知识高效蒸馏到一个仅64,910个参数的轻量级强化学习智能体中,同时保持相当的防御性能。
- • 跨网络拓扑的可迁移性评估:我们构建了多个模拟网络环境,并在不同的CybORG场景中评估了所提方法的可迁移性。
- • 教师引导的强化学习稳定化分析:我们系统性地评估了多种教师引导的强化学习稳定化策略,并证明没有任何一种策略能够持续超越优化后的教师策略,凸显了基于奖励的防御策略与教师驱动的防御策略之间可能存在的策略对齐局限。
本文的其余部分组织如下:第2节 (https://arxiv.org/html/2607.28826#S2) 讨论了ACO、强化学习和教师引导学习方法的相关工作。第3节 (https://arxiv.org/html/2607.28826#S3) 介绍了实施所提解决方案的方法。第4节 (https://arxiv.org/html/2607.28826#S4) 评估了所提方法在多个CybORG环境中的性能和可迁移性。最后,第5节 (https://arxiv.org/html/2607.28826#S5) 对全文进行总结并讨论未来的研究方向。
为支持可复现性,源代码、配置、提示词和实验设置可在随附的GitHub仓库中获取:https://github.com/Poly-AIvsAI/LLMDistillationACO。
## 2 相关工作
在本节中,我们讨论了ACO、教师引导强化学习、知识蒸馏和LLM方面的已有工作。然后,我们综合研究结果以论证所提方法的合理性,并指出本工作所解决的研究空白。
### 2.1 ACO与强化学习
研究人员越来越多地探索将强化学习应用于ACO,在这种应用中,智能体通过与各自环境的直接交互来学习防御策略[19 (https://arxiv.org/html/2607.28826#bib.bib26)]。要使强化学习在网络安全领域有效,环境既要真实地模拟网络作战,又要提供有意义的信号,使智能体能够收敛到有效策略。CybORG满足了这些要求,它提供了一个网络安全环境,可以训练蓝色智能体来防御模拟的企业网络[3 (https://arxiv.org/html/2607.28826#bib.bib19),8 (https://arxiv.org/html/2607.28826#bib.bib29)]。
已有工作,例如Palmer等人、Wiebe等人和McDonald等人进行的研究,证明了在CybORG环境中训练强化学习智能体的可行性[13 (https://arxiv.org/html/2607.28826#bib.bib11),27 (https://arxiv.org/html/2607.28826#bib.bib12),11 (https://arxiv.org/html/2607.28826#bib.bib13)]。然而,这些方法通常在没有先验领域知识的情况下初始化智能体,要求它们完全通过环境探索来学习。因此,智能体通常表现出较差的初始性能,并且在收敛到有效防御策略之前需要大量的训练时间。在网络安全领域,错误的动作可能对安全态势产生不利影响,这种探索式学习过程可能直接阻碍ACO的实际应用。
### 2.2 教师引导的强化学习
教师引导的强化学习已成为缓解从零开始学习所固有的局限性的有前景方法。一种常见策略是使用教师模型来指导学生的早期学习过程,然后随着时间的推移逐渐减少教师的影响。例如,M. Pfeiffer等人提出使用教师生成标注数据集来训练学生,然后再过渡到传统的强化学习训练[14 (https://arxiv.org/html/2607.28826#bib.bib22)]。更近期的工作将教师的指导直接整合到强化学习环境中,采用了奖励塑形、特征空间修改、动作指导和辅助损失信号等方法,而不是通过分离的预训练阶段[4 (https://arxiv.org/html/2607.28826#bib.bib24),26 (https://arxiv.org/html/2607.28826#bib.bib23),20 (https://arxiv.org/html/2607.28826#bib.bib1)]。
这些方法表明,教师指导可以加速收敛并改善智能体的初始性能。然而,它们仍然依赖环境奖励作为主要优化目标。在网络安全等复杂领域中,可能存在多种可行的防御策略来实现有利结果。因此,教师的策略可能与最终通过环境反馈强化的策略不一致。即使两种策略都有效,这种不匹配也可能要求学生在后期训练阶段部分地忘记教师指导,从而可能破坏学习稳定性并降低教师引导训练的有效性。
### 2.3 知识蒸馏
缓解可能的教师策略错位的一种潜在方法是直接从教师那里推导学生的训练,而不是通过环境奖励进行联合优化。这一概念本身并不新颖,此前已在多个领域通过多种形式的知识蒸馏和模仿学习进行了探索[16 (https://arxiv.org/html/2607.28826#bib.bib2),15 (https://arxiv.org/html/2607.28826#bib.bib3),28 (https://arxiv.org/html/2607.28826#bib.bib4),1 (https://arxiv.org/html/2607.28826#bib.bib5)]。先前的研究,如Agarwal等人和Pozzi等人的工作,表明复杂的教师模型可以有效地将知识迁移到更小、计算效率更高的学生模型中[1 (https://arxiv.org/html/2607.28826#bib.bib5),15 (https://arxiv.org/html/2607.28826#bib.bib3)]。
然而,这些方法通常不关注与动态强化学习环境的在线交互。这提供了一个机会来研究:在与网络安全环境主动交互的过程中,是否能直接从教师策略而非环境奖励信号中获取学习信号来进行策略蒸馏。在这种范式下,环境继续提供状态转移和观察,而教师则充当监督指导的主要来源。
由于学生不再直接针对环境奖励进行优化,整个方法的有效性在很大程度上取决于教师策略的质量和一致性。因此,教师必须展现出强大的防御决策能力,理想情况下无需广泛的针对特定环境的微调。
### 2.4 大语言模型(LLM)
LLM在网络安全领域展现了显著的前景,因为它们能够识别文本中的复杂模式并生成与上下文相关的响应[6 (https://arxiv.org/html/2607.28826#bib.bib8),2 (https://arxiv.org/html/2607.28826#bib.bib9),9 (https://arxiv.org/html/2607.28826#bib.bib10)]。其庞大的参数规模和广泛的预训练使它们能够编码大量的领域知识,使其成为在复杂网络安全环境中担任教师的有前景的候选者。
然而,在运营环境中直接部署LLM存在若干挑战。其庞大的模型规模需要大量的计算资源,且通常会增加推理时间,这些限制在时间敏感的网络安全环境中尤其成问题。这促使我们研究是否可以将LLM的能力蒸馏到一个显著更小、更高效的强化学习智能体中,同时保持强大的防御性能。
据我们所知,目前没有现有的LLM专门针对CybORG环境进行训练。一种可能的解决方案是遵循先前的教师引导强化学习方法,即通用LLM最初指导训练,然后智能体过渡到直接从环境奖励中学习[20 (https://arxiv.org/html/2607.28826#bib.bib1),22 (https://arxiv.org/html/2607.28826#bib.bib6)]。然而,这可能会重新引入前面讨论过的策略对齐挑战。另一种选择是直接针对CybORG对LLM进行微调;然而,这一过程计算成本高昂,并且在快速演变的网络安全环境中难以扩展。
提示工程提供了一种计算效率高的微调替代方案,其中底层模型参数保持不变,而输入提示词经过优化,以使模型更好地与目标环境对齐[10 (https://arxiv.org/html/2607.28826#bib.bib15)]。已有工作已经证明,提示工程可以在不修改模型参数的情况下显著提高LLM的性能[18 (https://arxiv.org/html/2607.28826#bib.bib7)]。例如,Son等人使用检索增强生成(RAG)将Llama3的TruthfulQA性能从3.2 BLEU提高到13.65 BLEU,相对提升了323%[18 (https://arxiv.org/html/2607.28826#bib.bib7)]。
### 2.5 讨论
先前的工作表明,教师引导的强化学习可以加速学生学习,但由于基于奖励的优化与教师策略之间的潜在错位,可能会受到限制。知识蒸馏提供了一种替代方案,可以直接从教师策略中学习,而不依赖环境奖励。然而,这种方法在动态强化学习环境中的在线应用尚未得到充分探索。LLM凭借其广泛的领域知识和推理能力,为这一教师角色提供了有前景的候选方案,但其计算成本使其不适合直接部署。
这引出了我们的研究问题:我们能否将网络安全聚焦型LLM的防御策略提炼到一个轻量级强化学习智能体中,使其在动态网络环境中保持强大的防御性能?在本文中,我们通过在修改后的CybORG CAGE Challenge 2环境中采用策略蒸馏框架来回答这个问题,其中教师策略通过提示工程而非针对特定环境的微调来优化。通过在多个网络拓扑上评估该方法,我们研究了其对不同网络配置的可迁移性。我们还评估了教师引导的强化学习稳定化策略能否持续超越优化的教师策略,从而更深入地理解教师驱动的防御策略与奖励驱动的强化学习之间的对齐动态。
## 3 方法
在本节中,我们首先描述用于评估所提方法的CybORG环境。然后,我们介绍用于指导LLM策略的提示工程方法、用于将LLM策略蒸馏到轻量级智能体中的策略蒸馏框架,以及用于评估教师引导策略稳定化收益的多种策略。最后,我们描述实验中使用的评估指标。
### 3.1 CybORG环境
CybORG是一个开源平台,用于在模拟企业网络环境中训练和评估自主网络防御智能体[3 (https://arxiv.org/html/2607.28826#bib.bib19)]。我们使用修改版的CAGE Challenge 2环境,这也是最近ACO研究中的常见基准[13 (https://arxiv.org/html/2607.28826#bib.bib11),24 (https://arxiv.org/html/2607.28826#bib.bib25),11 (https://arxiv.org/html/2607.28826#bib.bib13)]。在此环境中,红色智能体(攻击者)试图在蓝色智能体(防御者)保护企业网络的同时,获得网络内部主机的访问权限。每个回合由一系列步骤组成,在此期间,蓝色智能体观察网络状态,选择动作,并接收奖励信号。红色智能体使用一组固定的攻击动作,为模拟攻击提供一致且可重复的基准。该环境包括受感染的用户主机和服务器,以及一个包含网络流量分析和审计日志的用户日志服务器。
CAGE Challenge 2的奖励函数由环境在每一步提供,并针对多个成功标准进行衡量:机密性、可用性和受损主机数量。在每一步中,奖励定义为包含可用性、机密性和受损主机数量分量的总和。该奖励指导蓝色智能体防御网络攻击。为了在此环境中进行有效的强化学习,智能体必须在离散动作空间中做出决策,该空间包含多种动作类型,例如移除恶意软件、恢复受损主机以及分析网络流量等。
我们的实验在修改后的CAGE Challenge 2变体上进行,该变体不允许红色智能体在步骤4之前采取动作,从而为蓝色智能体提供最初的防御准备窗口。基线智能体使用近端策略优化(PPO)[17 (https://arxiv.org/html/2607.28826#bib.bib16)]和循环神经网络(RNN)[5 (https://arxiv.org/html/2607.28826#bib.bib20)]来训练,利用环境观察和奖励来学习策略。更多实现细节将在后文介绍。该环境在前一步动作尚未完成之前,禁止蓝色智能体采取动作;这一约束体现了操作的现实性,即每个动作占用一个时间步,而多个动作不能在同一个时间步内同时执行。
### 3.2 Large Language Model as Teacher
我们使用了一个具有80亿参数的指令微调LLM,该模型在网络安全相关数据上进行了预训练,能够对网络事件进行上下文感知推理。该模型提供了推理、规划和安全导向决策所需的能力,同时相较于更大的前沿模型,在计算上更为可行。经过初步实验,我们选择不使用更小的模型(例如2B或更小),因为它们在模拟网络环境中提供准确防御响应方面表现出的推理能力不足。
我们没有针对CybORG环境对LLM进行微调,而是提出使用提示工程来优化其策略,以生成有效的防御动作。我们开发了一个系统提示词,它将模型框定为自主网络防御智能体,并指定其动作空间、观察空间、防御目标,并为其决策提供相关的历史上下文。该提示词的结构使得LLM能够处理用结构化文本表示的观察结果,并生成格式化为合法动作标识符的动作。我们评估了两种提示策略:(1) 基于纯文本的提示,(2) 基于代码风格的提示,后者以类似于编程语言语法的方式格式化上下文。这使我们能够评估不同的提示策略如何影响LLM在CybORG环境中的防御能力。我们发现基于代码风格的提示在模拟环境中产生了更稳定和有效的动作。有关提示的更多细节,请参见附录A。
### 3.3 Policy Distillation Framework
我们提出了一种在线策略蒸馏框架,用于将LLM教师的知识迁移到轻量级强化学习智能体中。与传统的强化学习不同,传统强化学习智能体通过最大化环境奖励来学习,而我们的框架训练学生智能体直接模仿教师的动作选择。
在此框架中,学生智能体在每个时间步接收环境观察结果,并根据其当前策略选择一个动作。在同一时间步,LLM教师接收相同的观察结果(以文本形式格式化),并输出一个动作。然后,学生和教师的动作被送入一个交叉熵损失函数,该函数鼓励学生的动作概率分布与教师的动作选择对齐。然后将计算出的梯度应用于学生策略。至关重要的是,学生和教师都接收相同的状态观察,但学生通过轻量级神经网络处理这些观察结果,而教师则通过原始文本提示处理这些观察结果。
形式上,对于给定的状态$s_t$,学生输出动作概率分布$\pi_{\theta}(a_t | s_t)$,其中$\theta$是学生网络的参数。教师从提示中生成一个动作$a_t^{teacher}$。然后,训练损失为:
$$ \mathcal{L} = CE(\pi_{\theta}(s_t), a_t^{teacher}) $$
其中$CE$是交叉熵损失。在这个框架下,学生从环境状态映射到动作,而不直接依赖于环境奖励。这使学生能够从教师的专业知识中学习,而不是在预训练阶段进行广泛的探索。这种方法的优点在于,学生不需要任何预训练或手工生成的专家数据集,而是直接从LLM教师的输出中学习。
在部署期间,学生智能体在一个标准的强化学习循环中与环境交互,生成自己的动作序列,而不依赖于教师或环境的奖励信号。然而,在这种部署范式中,学生不会获得环境的奖励,因此不进行传统的强化学习优化。相反,学生的行为完全由训练期间从教师策略中学到的知识驱动。
重要的是,尽管学生通过模仿教师进行训练,但它也可以在不访问LLM教师的情况下部署,从而减少了运行时的计算开销。这使得所提出的方法特别适合需要快速决策和低计算资源的场景,例如实时网络防御。
### 3.4 Teacher-Guided Stabilization Strategies
为了评估教师引导的强化学习策略是否能持续优于教师策略本身,我们设计了多种稳定化策略,将教师指导与传统的强化学习优化相结合:
- **始终教师引导**:学生在整个训练过程中始终受到教师指导。学生优化一个将模仿损失与环境奖励相结合的联合损失函数。环境奖励和教师指导在每个训练步骤中都被使用。
- **线性退火型教师引导**:在训练早期,教师指导占主导地位,随着训练的进行,其影响逐渐减小。具体来说,教师损失在每个回合中被赋予更高的权重,然后在训练过程中逐渐减少。我们使用线性退火调度,在前N个回合中,权重从1.0下降到0.5,随后在剩余训练中保持0.5。这使得智能体最初能够从教师那里学习,逐渐转向更多的环境奖励优化。
- **阈值型教师引导**:教师指导与基于环境奖励的优化相结合,但教师损失仅在前N个回合中活跃。在N个回合之后,教师损失被完全移除,学生仅通过环境奖励进行训练。
表1总结了这些策略,包括教师损失使用、教师权重的调度方法以及优化目标。
**表1:** 教师引导的稳定化策略概述。
| 策略名称 | 教师损失 | 教师权重 | 优化目标 |
|-----------|-----------|--------------------------|-----------------------|
| 基准(无教师) | 无 | N/A | 仅环境奖励 |
| 始终教师引导 | 是 | 固定 | 环境奖励与模仿损失的加权和 |
| 线性退火型教师引导 | 是 | 从1.0退火至0.5 | 环境奖励与模仿损失的加权和 |
| 阈值型教师引导 | 前N个回合使用 | 固定 | 在前N个回合中,环境奖励与模仿损失的加权和;此后仅环境奖励 |
### 3.5 Evaluation Metrics
为了评估所提出的蒸馏框架的性能,我们在训练过程中和训练后评估了以下指标:
- **平均回合奖励**:蓝色智能体在回合中获得的平均累积奖励,由环境提供。
- **平均熵**:学生智能体动作分布的平均熵,衡量其决策的确定性。
- **平均动作方差**:每个回合中学生智能体动作选择的方差,表示其行为的一致性。
- **回合长度**:每个回合的持续时间(步数),表示对抗的持续时间和智能体维持防御态势的能力。
对于LLM教师的评估,我们直接使用其在模拟环境中的平均表现,衡量其在多个回合中的平均奖励。
### 3.6 Implementation Details
**学生架构。** 学生是一个轻量级循环神经网络(RNN)策略,具有两个全连接层(每层128个单元)和一个门控循环单元(GRU)层(隐藏维度为32)。我们对观察结果进行归一化,并使用ReLU激活函数。该策略输出一个分类分布,其维度与环境中合法动作的数量相匹配。总参数量为64,910。
**学生优化器。** 学生智能体使用Adam优化器[7 (https://arxiv.org/html/2607.28826#bib.bib17)]进行训练,学习率为$3 \times 10^{-4}$,并使用标准的信息熵正则化来维持探索。
**教师提示生成。** 在每个时间步,我们从环境状态生成一个提示,描述当前观察结果、可用的动作以及最近的网络活动历史。该提示以代码风格格式化,使用类似JSON的结构,并附带预定义的动作选项库。相关提示模板见附录A。
**训练过程。** 学生智能体在多轮训练中进行训练,每轮由若干任务组成,每个任务在环境重置时开始。在每个任务中,学生智能体与环境交互,选择符合其动作空间的动作,同时从教师那里接收监督信号。学生网络使用合成损失函数进行更新,该函数结合了教师的交叉熵损失和轻度的熵正则化。
**教师引导强化学习实验设置。** 对于涉及环境奖励和教师指导的稳定化策略实验,我们使用了以下超参数:优势估计的折扣因子$\gamma = 0.99$,广义优势估计(GAE)参数$\lambda = 0.95$,熵系数为0.01,裁剪系数为0.2。对于所有实验,策略网络使用一个包含128个隐藏单元的两层MLP和一个隐藏维度为32的GRU层。所有实验共进行100轮训练,每轮包含5个任务。
**推理。** 在推理过程中,学生策略以标准方式运行,从其策略分布中采样动作,而不访问教师或环境奖励。
## 4 实验与结果
在本节中,我们介绍了用于评估所提方法的实验。我们首先描述实验设置,然后给出结果。我们评估了三种配置:(1) 基线强化学习智能体的性能,作为比较基准;(2) 优化后的LLM教师的性能;(3) 通过所提出的策略蒸馏框架训练的学生智能体的性能。此外,我们评估了学生智能体在多个网络拓扑中的可迁移性,并评估了几种教师引导的强化学习稳定化策略的性能。
### 4.1 实验设置
我们使用修改后的CybORG CAGE Challenge 2环境,在4主机和12主机两种配置下进行评估。4主机配置由以下主机组成:用户主机、用户服务器、企业服务器和用户日志服务器。12主机配置除了上述主机外,还包括3个用户主机、3个用户服务器、1个企业服务器和1个用户日志服务器。两种配置的奖励函数相同。此外,我们构建了两个额外的模拟网络拓扑,以评估所提方法的可迁移性:一个8主机配置(4个用户主机、2个用户服务器、1个企业服务器和1个用户日志服务器)和一个10主机配置(5个用户主机、3个用户服务器、1个企业服务器和1个用户日志服务器)。每个配置中,红色智能体以不同的攻击路径和策略运行,以模拟真实的攻击行为。
基线智能体使用与第3.6节所述相同的网络架构进行训练,并使用PPO优化器进行环境奖励最大化。LLM教师使用提示工程进行评估,不进行微调,使用与第3.2节所述的教师提示一致。学生智能体通过所提出的策略蒸馏框架进行训练,确保教师和学生之间公平的比较。
对于所有实验,我们报告了平均回合奖励、平均熵、平均动作方差和回合长度。我们使用5个不同随机种子进行实验,并报告均值和标准差。
### 4.2 4主机配置下的性能
我们首先评估了所提方法在修改后的CAGE Challenge 2环境中、4主机配置下的性能。
**LLM教师策略。** 优化后的LLM教师在不进行微调的情况下,在环境中直接评估时,实现了平均奖励为$194.4 \pm 11.5$。这表明,通过提示工程,一个经过网络安全预训练的LLM可以在不针对特定环境进行训练的情况下,生成有效的防御策略。
**基线强化学习智能体。** 使用PPO训练的基线强化学习智能体在环境中实现了平均奖励为$167.2 \pm 10.8$。这是预期的表现,因为智能体是在没有任何先验知识的情况下从零开始训练的。
**策略蒸馏学生。** 将LLM教师的知识蒸馏到轻量级学生智能体后,学生实现了平均奖励为$212.3 \pm 9.2$,不仅超过了基线强化学习智能体,还超过了LLM教师本身。这一结果令人惊讶但却是积极的,因为学生智能体通过模仿教师的动作分布进行学习,可能平滑了教师策略中的噪声或次优决策。另一个可能的原因是学生智能体是在整个训练过程中通过教师与环境交互产生的动作分布进行训练的,这使其能够从教师的成功和失败中学习,并提炼出一个更稳健的防御策略。
图1显示了训练期间的奖励曲线。基线强化学习智能体在早期回合中表现出较低的奖励,但随着训练进展逐渐改善。相比之下,学生智能体在训练的早期就表现出高奖励,得益于教师的指导。
### 4.3 跨网络拓扑的可迁移性
为了评估所提方法在不同网络规模下的鲁棒性,我们在4、8、10和12主机配置下评估了学生智能体的性能。表2总结了跨配置的性能指标。
**表2:** 不同网络配置下的性能对比。
| 配置 | LLM教师奖励 | 基线RL奖励 | 学生奖励 |
|-----------|-------------------|-------------------|------------------|
| 4主机 | $194.4 \pm 11.5$ | $167.2 \pm 10.8$ | $212.3 \pm 9.2$ |
| 8主机 | $183.6 \pm 9.4$ | $151.8 \pm 12.1$ | $205.7 \pm 11.0$ |
| 10主机 | $176.2 \pm 10.2$ | $143.4 \pm 14.3$ | $192.4 \pm 12.6$ |
| 12主机 | $152.7 \pm 13.8$ | $121.5 \pm 11.9$ | $174.8 \pm 14.1$ |
在所有配置中,通过策略蒸馏训练的学生智能体均持续优于基线和LLM教师。这些结果表明,所提出的蒸馏方法可以很好地泛化到不同的网络规模,且学生智能体的性能并不会显著下降,尽管环境复杂性增加。值得注意的是,学生智能体在4主机和8主机配置中实现了最高的奖励,而在12主机配置中性能有所下降,这可能是由于环境维度的增加和更长的攻击链,使防御任务更加困难。
### 4.4 Teacher-Guided Stabilization Strategies的性能
在本节中,我们评估了3.4节中描述的教师引导稳定化策略,以确定它们在转向独立强化学习时能否持续优于优化的教师策略。我们在4主机的CAGE Challenge 2环境中评估了这些策略。
**始终教师引导**:在此配置中,学生通过结合环境奖励和教师模仿损失的加权损失进行训练,教师权重在整个训练过程中保持固定。正如表3所示,使用此策略训练的学生获得的平均奖励为$196.5 \pm 10.4$,与LLM教师的表现($194.4$)相当,但略低于纯蒸馏学生($212.3$)。这表明,持续结合环境奖励并不会显著提升超过纯蒸馏的性能,并且可能导致学生策略偏向于将教师的指导与环境奖励信号进行折扣。
**线性退火型教师引导**:在此配置中,教师权重在前50个回合中从1.0线性退火到0.5。此策略获得的平均奖励为$188.3 \pm 12.7$。这低于始终教师引导和纯蒸馏策略。这可能是由于教师权重的逐步减少导致学习过程不稳定,学生难以在教师的策略和环境奖励之间取得平衡,最终导致了次优策略。
**阈值型教师引导**:在此配置中,教师损失在前50个回合中活跃,然后完全移除。此策略获得的平均奖励为$165.1 \pm 13.5$,与基线强化学习智能体($167.2$)相当。这可能是由于在教师损失被移除后,学生无法保持从教师那里学到的行为,并且它的性能在没有持续监督的情况下下降。这表明,仅在初始阶段进行教师引导可能不足以在复杂的网络安全环境中提供持久的收益。
**表3:** 不同稳定化策略在4主机配置下的性能对比。
| 策略 | 平均奖励(均值±标准差) | 推理所需的模型大小 |
|-------------------------|-------------------------------|----------------------|
| 基线强化学习(无教师) | $167.2 \pm 10.8$ | 64,910 |
| 始终教师引导 | $196.5 \pm 10.4$ | 64,910 |
| 线性退火型教师引导 | $188.3 \pm 12.7$ | 64,910 |
| 阈值型教师引导 | $165.1 \pm 13.5$ | 64,910 |
| 纯蒸馏(所提方法) | $212.3 \pm 9.2$ | 64,910 |
| LLM教师 | $194.4 \pm 11.5$ | 8B |
我们观察到,没有一种教师引导的强化学习稳定化策略能够持续超越纯蒸馏方法和优化的教师策略。这些结果表明,将教师的指导与环境奖励相结合,可能由于策略对齐的局限性而产生次优结果。相反,直接蒸馏教师策略到学生智能体中,通过完全绕过环境奖励优化,可以获得更稳健的性能。这一发现与我们在第2.2节中的讨论一致,即教师策略和环境奖励之间的潜在错位可能会限制教师引导强化学习的有效性。
### 4.5 消融研究
为了进一步分析我们方法的贡献,我们进行了消融研究,以评估在不同学生架构设置和提示策略下的性能。
**学生架构设置。** 我们评估了两个学生架构变体:(1) 一个没有循环层的MLP策略,仅使用两个全连接层(每层128个单元);(2) 一个更大的GRU策略,具有256个隐藏单元。如表4所示,这两个变体在奖励方面都没有显著优于我们的主要GRU策略,这证实了我们的轻量级架构选择是合适的。
**表4:** 不同学生架构设置下的性能。
| 学生架构 | 平均奖励(均值±标准差) |
|----------------------------------|-------------------------------|
| MLP(2 × 128) | $209.8 \pm 10.1$ |
| GRU(隐藏维度32,2 × 128 FC) | $212.3 \pm 9.2$ |
| GRU(隐藏维度256,2 × 128 FC) | $211.1 \pm 10.7$ |
**提示策略。** 我们比较了两种提示策略的效果:(1) 纯文本提示,将观察结果表示为自然语言句子;(2) 代码风格提示,将观察结果格式化为类似JSON的结构,并附带预定义的动作选项库。如表5所示,代码风格提示在教师奖励中实现了显著更高的性能,表明结构化的提示格式促成了更有效和一致的决策。
**表5:** 不同提示策略下的教师性能。
| 提示策略 | 平均奖励(均值±标准差) |
|-----------------|-------------------------------|
| 纯文本 | $173.4 \pm 13.2$ |
| 代码风格 | $194.4 \pm 11.5$ |
这些发现表明,提示设计的选择可以显著影响LLM教师在与模拟网络安全环境交互时的防御能力,进而影响蒸馏学生的性能。
### 4.6 讨论
我们的结果表明,所提出的策略蒸馏框架成功地将网络安全聚焦型LLM的知识转移到了一个轻量级强化学习智能体中,且性能优于基线强化学习智能体和LLM教师。学生智能体在各种网络拓扑中表现出一致的优越性,证明该方法具有可扩展性。教师引导的强化学习稳定化策略并未优于纯蒸馏方法,这强调了策略对齐挑战的重要性。即,教师的策略可能与环境的奖励信号不一致,直接蒸馏这种策略能产生比在环境中联合优化更好、更稳定的结果。
这些结果具有实际意义。它们表明,部署轻量级学生智能体可以在计算资源有限的环境中提供高水平的自主网络防御,且与直接使用LLM教师相比,推理成本更低、延迟更短。这为在实时网络防御系统中部署复杂网络安全模型的知识提供了一条实用途径。
然而,我们的研究存在局限性。首先,我们仅使用了基于网络安全预训练数据的单个LLM。评估其他模型可以进一步验证所提出方法的普适性。其次,我们使用了修改后的CAGE Challenge 2环境,其攻击模式和奖励结构与原始略有不同,这可能限制了与使用原始环境的已有工作的直接可比性。第三,我们的评估是在模拟环境中进行的,实际网络操作的复杂性可能不完全反映我们的结果。
## 5 结论与未来工作
在本文中,我们提出了一种在线策略蒸馏框架,将网络安全聚焦型LLM的策略提炼为轻量级强化学习智能体,用于自主网络防御。我们的方法在模拟CybORG环境中优于传统的强化学习基线,且学生智能体在各种网络拓扑中持续表现出优越的性能。我们还评估了多种教师引导的强化学习稳定化策略,并观察到没有一种策略能比直接蒸馏教师策略更有效。这突显了在复杂网络安全环境中,教师策略与奖励驱动对策之间的错位所带来的挑战。
未来工作有几个方向。首先,评估更广泛的LLM,包括规模更大或针对不同网络安全数据集进行微调的模型,可以评估该方法的普适性。其次,探索更先进的学生架构,如Transformer,可能会提高蒸馏效果的效率。第三,将LLM整合到更复杂的多智能体ACO环境中,例如那些涉及蓝方和红方之间的通信或协作的ACO环境,可以扩展该方法的适用性。第四,使用更真实的模拟或仿真环境,整合实际的网络流量和攻击数据,可以验证我们的结果在更真实操作条件下的稳健性。最后,在真实网络环境中部署所提出的框架,可以为其实用性和局限性提供宝贵的见解。
## 致谢
作者感谢加拿大国防研究与发展署(DRDC)对这项研究的支持。
## 参考文献
可参见 arxiv 论文页面上的原始参考文献列表。
## 附录A 提示模板
在本附录中,我们提供了用于将LLM作为CybORG环境中的相似文章
面向可扩展多任务强化学习的大决策模型
本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
Connect the Dots:通过强化学习训练LLM以具备跨域泛化能力的长期生命周期智能体
本文介绍了Connect the Dots(CoD),这是一个通过强化学习训练LLM的框架,用于培养长期生命周期智能体的元能力,实现持续学习和跨域泛化。
释放大型语言模型的潜力:实现实时、企业级部署的蓝图
这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。