通过扩展假说评估无标签代理学习框架的能力
摘要
本文提出了一种基于扩展假说的框架,用于评估网络安全中的代理学习框架,无需标签基准,通过师生模型代理性能改进。
arXiv:2608.13608v1 Announce Type: new
摘要:代理'持续学习框架',即通过配对LLM与检索或记忆以从反馈中改进而无需重新训练的系统,在网络安全中显示出日益增长的价值。但其价值通常通过在有标签基准上的增益来衡量,这种方法在运营安全环境中往往失效。基准标签稀缺、过时且不具代表性,因此从业者通常无法判断给定框架是否有帮助或两个框架中哪个更适合他们的任务。传统的LLM作为裁判提供的信号很少,因为它不比它评估的代理更强,而蒸馏在稀缺、零散和有偏的标签上不可靠。
我们提出了一种基于扩展假说的框架,用于端到端评估学习框架,无需标签基准。一个更强的教师模型为一个较小的、带有持续学习框架的学生提供稀疏采样的纠正。我们通过学生随时间向教师收敛的程度来评分一个框架。跨安全任务、模型系列和框架设计,我们表明相对于教师的改进与相对于保留金标准的改进相关,验证了在没有标签时教师相对提升作为真正框架提升的代理。我们进一步表明,同等能力模型之间的LLM作为裁判没有产生可用信号。这些结果表明,当人类提供相同类型的稀疏、高精度纠正时,教师大小的模型可以通过相同的框架得到改进。
查看缓存全文
缓存时间: 2026/08/17 09:43
# 无标签环境下通过扩展假说评估智能体学习框架能力 来源:https://arxiv.org/html/2608.13608 ###### 摘要 智能体"持续学习框架"——即将大语言模型与检索或记忆系统配对,无需重新训练即可通过反馈进行改进的系统——在网络安全领域展现出日益增长的价值。但其价值传统上通过有标签基准测试的提升来衡量,这种方法在实际安全环境中常常失效。基准标签稀缺、过时且采样缺乏代表性,因此从业者往往无法判断某个框架是否有效,或两个框架中哪个更适合其任务。传统的大语言模型评判方式提供的信号有限,因为其能力不比被评估的智能体更强,且在使用稀缺、零散且有偏的标签时蒸馏方法并不可靠。 我们提出一个基于扩展假说的框架,用于在没有标签基准的情况下端到端评估学习框架。更强大的教师模型为配备持续学习框架的较小学生模型提供稀疏采样修正。我们通过评估学生模型随时间推移向教师模型收敛的程度来为框架评分。在不同安全任务、模型系列和框架设计中,我们发现相对于教师的改进与相对于留出式黄金标准的改进具有相关性,这验证了在无标签情况下,相对教师提升可作为框架实际效能的代理指标。我们还进一步表明,同等能力模型间的大语言模型评判方式无法产生可用信号。这些结果表明,当人类提供同等类型的稀疏高精度修正时,教师规模的模型可通过相同框架实现改进。 ††卷号:299††年份:2025††研讨会:应用机器学习信息安全会议 ###### 关键词 学习框架、智能体测试、有限标签 ## 1引言 智能体框架已成为增强基于大语言模型系统以应对实际任务的标准方式。特别是在安全任务中,由于攻击者变化极其迅速,"持续学习框架"尤其具有吸引力。本文中,我们将"持续学习框架"定义为:包裹大语言模型并随时间接收修正,以试图持续提升大语言模型性能/个性化程度的系统。配备能快速适应新型攻击框架的大语言模型将是理想防御工具。然而,正是这种适应性使得这些框架难以评估,尤其是在实际安全环境中。传统方法是通过并行基准测试,对原始大语言模型、大语言模型加2-3种不同框架进行评分,并比较其在有标签数据集上的表现。但在许多实际安全场景中,缺乏足够的标签以获得清晰信号,且这些标签往往偏向模型在最难问题上犯的错误。 例如,Sublime Security拥有名为ASA(自主安全分析师简称)的AI智能体,负责分析邮件以判断其是恶意、良性、灰邮件还是垃圾邮件。该智能体配备工具和准则用于判定邮件结论并报告决策原因。对大多数客户而言,该智能体自主运行,每日拦截数千封邮件。只有当ASA出错并造成重大影响或显见后果的事件时,才会收到客户反馈。这意味着修正和反馈产生稀少、零散但精度高。此外,当ASA判断正确时几乎从不产生反馈。更糟的是,只有客户明确分享的邮件才能送达Sublime,使得本就稀疏的信号进一步缩减。因此,要构建一个从人类反馈中持续修正和个性化ASA的框架,我们必须找到一种无需显式标注基准集来评估框架价值的方法。 传统的持续学习优化和测量工具在此场景下均告失效。第一种工具是大语言模型评判:通过询问第二个大语言模型哪个输出更好,来评分有无框架模型的性能差异。但实际安全系统往往已运行最先进模型,因此没有更强模型可充当评判者。此外,正如我们所展示的,同等级评判者无法识别超越其自身基线的性能。第二种工具是蒸馏:通过微调或轻量级适配器(如LoRA)将人类修正烘焙至模型权重中。但我们拥有的修正数据太少、太零散且格式不规则,无法进行微调。因此我们面临困境:必须在几乎不使用标签数据的情况下构建学习框架并判断其有效性。 本文提出一种无需标签衡量此类学习框架的新框架。该框架依赖教师模型和学生模型,其中教师在特定评估任务上显著优于学生。无标签情况下,此类配对难以直接识别。我们通过扩展假说解决此问题:从同一模型家族中选取一大多一小组件,要求两者为任务的大规模无标签样本集标注。随后寻找两者间的显著分歧。在两者频繁分歧处,扩展假说使我们有理由相信较大模型比小模型更常正确,因为它们同属一家族且主要差异在于规模。这使我们能够在从未观测到真实标签的情况下,指定较大模型为教师、较小模型为学生。 接着我们将学生置于持续学习框架中,生成模型称为学生*。使用教师预测作为伪标签,我们为学生*提供稀疏修正,并在教师同样已伪标签的留出集上测量学生与学生*的性能差异。如果框架在此纯伪标签环境下带来性能提升,我们将其视为证据:当获得真实人类标签的稀疏修正时,具有类似教师能力的模型通过相同框架将获得可比收益。 我们在拥有标签数据的情况下通过比较学习框架(使用较小大语言模型学生模型,由较大大语言模型教师模型训练)与相对于正确标签黄金标准的改进来说明此效用。我们证明在不同安全任务、模型家族和框架中,相对于教师的性能改进与相对于黄金标签数据集的改进具有相关性。相比之下,同等强度大语言模型评判者无法识别优于其自身基线的预测,因此不是评估基础模型改进的可行策略。 ## 2相关工作 ### 2.1AI安全评估 即使不涉及AI,安全评估也可能十分困难。数据通常专有且标签稀缺,其过时速度几乎与创建速度同样快。再考虑到评估复杂学习框架和智能体的难度,这种组合可能近乎无解。 已有针对特定任务的智能体评估,在数据虽未公开但可与人类在相同任务上的结果进行比较的情况下,例如6(https://arxiv.org/html/2608.13608#bib.bib23)评估智能体编写检测规则的检测率和规则质量,以及7(https://arxiv.org/html/2608.13608#bib.bib22)通过语义比较评估其与人类编写代码的质量。 在网络安全研究界,为构建更强大基准付出了大量努力。Phishfuzzer20(https://arxiv.org/html/2608.13608#bib.bib25)创建逼真的钓鱼邮件,AthenaBench2(https://arxiv.org/html/2608.13608#bib.bib1)是CTIBench3(https://arxiv.org/html/2608.13608#bib.bib13)的扩展,利用实时网络威胁情报数据源(如MITRE ATT&CK和NVD API)持续生成新兴基准样本,确保模型针对新出现漏洞进行评估。AttackSeqBench12(https://arxiv.org/html/2608.13608#bib.bib14)围绕CTI领域的多步推理任务设置评估。SIABENCH11(https://arxiv.org/html/2608.13608#bib.bib21)提供数据集和分析框架用于评估网络安全事件分析。CORTEX23(https://arxiv.org/html/2608.13608#bib.bib5)应用类似技术提供分步分析师操作及工具输出,以评估多智能体告警分类工作流。最后,CyberGym22(https://arxiv.org/html/2608.13608#bib.bib3)提出一个开放的大规模基准,包含来自188个软件项目的1507个真实世界漏洞,旨在解决静态、小规模网络安全评估的局限。尽管这些努力对AI安全领域是重大进步,但必须注意威胁格局具有对抗性且不断演变。因此,针对静态时间点攻击校准的基准几乎肯定不会反映未来的攻击面,从而在实际应用中过时。 所有基准的艰苦工作仍使许多场景面临标签有限(或至少最新标签有限)的状况,且需测试学习框架是否正确学习。例如,大量AI安全运营中心场景标签有限且标签与数据快速演变,但测试此类系统及其学习能力对其效用仍至关重要。此外,9(https://arxiv.org/html/2608.13608#bib.bib24)调研用于测试大语言模型攻击安全性的测试平台和指标,表明测试平台和整体系统对评估结果至关重要,这表明我们需要在原生上下文中使用原生数据端到端测试学习框架,而非仅使用固定测试示例集。 ### 2.2智能体框架评估 评估智能体框架比评估底层模型更具挑战性。与标准语言模型基准不同,智能体在动态交互环境中运行,单个留出测试集无法涵盖所有相关行为,14(https://arxiv.org/html/2608.13608#bib.bib9).24(https://arxiv.org/html/2608.13608#bib.bib10)将评估挑战分为五个视角:规划和工具使用等核心智能体能力、特定应用基准、通用智能体评估、基准设计维度以及面向开发者的框架。他们识别出所有五个领域持续存在的差距,特别是在成本效益、安全性和跨任务鲁棒性方面24(https://arxiv.org/html/2608.13608#bib.bib10)。随着任务长度和复杂度增加,这些差距愈发明显。可靠性日益依赖于支撑基础设施,包括记忆存储、编排循环和检索管道,而不仅仅是模型权重4(https://arxiv.org/html/2608.13608#bib.bib2)。这种情况导致混杂问题:有标签测试集上的任务准确率反映了模型和框架的综合性能,难以隔离框架的具体贡献,也难以预测随着标签及其可用性随时间推移准确率将如何演变。 为减少对昂贵标注数据的依赖,LETToT15(https://arxiv.org/html/2608.13608#bib.bib11)论文研究者利用专家推理链规划或评估的逻辑步骤。同样,GEPA1(https://arxiv.org/html/2608.13608#bib.bib15)使用大语言模型评判者作为真实标签的代理。然而,这些努力都隐含假设参考信号足够可信,可作为"黄金"标签的替代。我们的框架使该假设显式化,并尝试通过将前沿模型指定为教师来经验性地验证。如果学生框架开始反映教师预测,我们可以说框架在不严格要求真实标签的情况下增加了价值。这不同于Hinton10(https://arxiv.org/html/2608.13608#bib.bib4)等经典蒸馏方法,后者将蒸馏微调基于教师输出,直接烘焙至模型权重中,因而不可检查。我们的方法旨在让反思模型为师生每次分歧编写自然语言课程。在推理时,可通过检索与当前推理需求主题相似的先前课程并将其注入学生提示来实现;模型权重从不被修改。 ### 2.3智能体记忆评估 大多智能体学习和记忆由检索增强生成驱动,该技术通过在推理过程中检索外部上下文来快速适应改进模型行为。此方法在对抗环境盛行的网络安全领域尤为有益。防御平台必须应对不断演变的攻击模式和本地分析师反馈,这使保持训练周期更新复杂化。 智能体记忆系统在此概念上扩展,将过去的错误、反馈和修正存储为可重用的课程或记忆。先前研究如Reflexion17(https://arxiv.org/html/2608.13608#bib.bib6)、MemPrompt13(https://arxiv.org/html/2608.13608#bib.bib7)、Learning to Repair18(https://arxiv.org/html/2608.13608#bib.bib12)和MemoryBank26(https://arxiv.org/html/2608.13608#bib.bib8)展示了这种更广泛方法:系统通过结构化课程检索迭代优化未来行为,而非更新模型权重。在此框架下,有效课程应既阐明误分类原因,又改进智能体后续表现。此功能支持捕获分析师修正并检索用于结构语义相似的邮件。 在安全领域,分类任务不同于传统检索增强生成应用。传统系统通常假设大多数检索上下文支持决策,因此优化前k片段排名。相比之下,安全分类场景常需要弃权,因为并非每个实例都有相关课程。在此类情况下返回前k结果可能降低效能并引入退化。因此,记忆系统应实现绝对相关性阈值,而非仅依赖相对排名。评估应关注修正是否被保留并有效应用于未来案例。从某邮件衍生的课程应改进对未在初始课程创建期间出现的第二封语义相似邮件的处理性能。 检索增强生成和基于记忆系统的评估文献强调有限指标集。传统信息检索评估使用Precision@k、Recall@k、平均倒数排名和NDCG@k等指标评估检索器,量化相关文档出现在排名列表顶部附近的频率。这些指标广泛应用于BEIR19(https://arxiv.org/html/2608.13608#bib.bib16)和TREC21(https://arxiv.org/html/2608.13608#bib.bib17)基准。RAGAS8(https://arxiv.org/html/2608.13608#bib.bib18)扩展此评估,通过上下文召回和上下文相关性评估检索增强生成输出,评估检索上下文是否提供支撑决策所需材料。
相似文章
从模型扩展到系统扩展:在自主AI中扩展架构框架
本文认为,推进自主AI需要扩展围绕基础模型的系统架构,重点关注可审计、模块化和可验证的组件。作者介绍了参考架构框架CheetahClaws,并概述了上下文管理、可信内存和动态技能路由方面的瓶颈。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
不是能力问题:LLM智能体层级间的控制敏感度是非单调的
本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。
重新思考智能体工具框架进化的评估
本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。