基于大型语言模型的智能合约漏洞检测的频率感知持续学习
摘要
本文提出了一种使用大型语言模型的频率感知持续学习框架,用于智能合约漏洞检测,通过FA-LoRA和APPM等高效方法解决适应、遗忘和整合挑战。
arXiv:2608.19680v1 公告类型:新
摘要:使用大型语言模型(LLMs)进行智能合约漏洞检测面临三个因果相连的挑战。首先,新的漏洞类别需要参数高效的适应,因为对于顺序到达的任务,完全重训练是不可行的。其次,在共享骨干网络上训练每个任务的适配器会导致对先前学习漏洞的灾难性遗忘。第三,由此产生的多个适配器必须整合到单一模型中,因为在推理时任务身份是未知的。每个挑战都直接源于其前一个解决方案的解决,因此集成框架至关重要。我们提出一个三阶段流水线,每个阶段解决一个挑战并传递到下一个阶段。适应阶段使用频率感知低秩适应(FA-LoRA),它在傅里叶域中进行适应,带有每个频率的重要性门控,仅需要0.4%的可训练参数,同时优于标准LoRA和QLoRA。持续学习阶段应用遗忘感知重放(FAR),它使用这些频率门控通过损失动态估计每个样本的遗忘风险,并优先考虑脆弱知识进行重放,在顺序任务上实现平均Micro-F1为0.8022。部署阶段采用锚保护渐进合并(APPM),它利用FAR训练产生的非对称泛化来识别最强泛化的适配器作为锚,并通过锚保护加权合并与频率域门控竞争将所有适配器整合到单一模型中。APPM实现了0.8085的Micro-F1,在合并成本156毫秒且无额外运行时内存的情况下,接近独立每任务上界2.7%以内。在DIVE上的实验证实该框架有效解决了区块链生态系统演化中的所有三个挑战。
查看缓存全文
缓存时间: 2026/08/21 10:00
# 基于频率感知持续学习的大语言模型智能合约漏洞检测 来源:https://arxiv.org/html/2608.19680 ## 基于频率感知持续学习的大语言模型智能合约漏洞检测 致谢:T. Huang 和 J. Kang 来自广东工业大学自动化学院,中国广州 510006(邮箱:[email protected], [email protected])。D. Liu 来自广东工业大学计算机科学与技术学院,中国广州 510006(邮箱:[email protected])。C. Yi 来自南京航空航天大学计算机科学与技术学院,中国南京 211106(邮箱:[email protected])。C. Cai 来自香港城市大学(东莞)计算机科学系,中国东莞 518057(邮箱:[email protected])。Anjia Yang 来自暨南大学网络安全学院,中国广州 510632(邮箱:[email protected])。L. Li 来自广东省科技信息研究所,中国广州(邮箱:[email protected])。Dong In Kim 来自韩国水原成均馆大学电气与计算机工程系,邮箱:[email protected]。 致谢:通讯作者:Jiawen Kang。 Jiawen Kang, IEEE 高级会员 Dongning Liu, IEEE 高级会员 成员:Changyan Yi, IEEE 高级会员, Chengjun Cai, Anjia Yang, Li Li, and Dong In Kim, IEEE 终身会员 ###### 摘要 利用大语言模型(LLMs)进行智能合约漏洞检测面临三个具有因果关联的挑战。首先,新漏洞类别要求参数高效的适应方法,因为对于顺序到达的任务,完全重新训练的代价过高。其次,在共享骨干网络上为每个任务训练适配器会导致先前学到的漏洞发生灾难性遗忘。第三,由此产生的多个适配器必须合并为一个单一模型,因为在推理时任务身份是未知的。每个挑战都直接源于其前一个挑战的解决方案,这使得一个集成框架变得至关重要。我们提出了一个三阶段流水线,其中每个阶段解决一个挑战并将其结果传递给下一个阶段。适应阶段使用频率感知低秩适应(FA-LoRA),该方法在傅里叶域中进行适应,并使用每个频率的重要性门控,仅需0.4%的可训练参数,同时性能优于标准LoRA和QLoRA。持续学习阶段应用遗忘感知重放(FAR),该方法利用这些频率门控,通过损失动态来估计每个样本的遗忘风险,并优先重放易受攻击的知识,在顺序任务中实现了平均0.8022的Micro-F1。部署阶段采用锚点保护渐进式合并(APPM),该方法利用FAR训练产生的不对称泛化能力来识别具有最强泛化能力的适配器作为锚点,并通过带锚点保护的加权合并与频域门控竞争将所有适配器整合为单一模型。APPM实现了0.8085的Micro-F1,距离独立每任务上限仅相差2.7%,合并成本仅为156毫秒,且无额外运行时内存开销。在DIVE基准测试上的大量实验证实,所提出的框架共同解决了在不断演进的区块链生态系统中智能合约漏洞检测的高效适应、遗忘缓解和部署整合问题。 ###### 关键词: 智能合约、漏洞检测、持续学习、LLM微调、灾难性遗忘。 ## I 引言 智能合约管理着现代区块链上数十亿美元的去中心化数字资产,是这些生态系统的执行支柱,使其安全至关重要。诸如重入攻击、整数溢出和访问控制缺陷等漏洞,尽管经过大量审计,仍持续造成严重的经济损失[23 (https://arxiv.org/html/2608.19680#bib.bib45)]。由于已部署的智能合约在设计上是不可变的,任何在部署前未被检测到的漏洞都会被永久嵌入,无法在事后轻易修正。因此,准确的漏洞检测是区块链安全的基本要求[20 (https://arxiv.org/html/2608.19680#bib.bib44)]。 大语言模型(LLMs)通过捕获复杂的程序语义和对安全模式进行推理,展现了在智能合约漏洞检测方面的强大能力[35 (https://arxiv.org/html/2608.19680#bib.bib39), 28 (https://arxiv.org/html/2608.19680#bib.bib41), 7 (https://arxiv.org/html/2608.19680#bib.bib42)]。然而,现有的基于LLM的方法假设所有漏洞类别在训练时都是已知的。实际上,智能合约平台、协议和技术不断演进,会随时间引入新的漏洞类别[11 (https://arxiv.org/html/2608.19680#bib.bib19)]。仅在历史数据上训练的模型会随着新攻击模式的出现而变得越来越不完整,造成其检测能力与实际威胁场景之间持久的差距。因此,部署的检测器必须能够整合新发现的漏洞,同时保留先前获得的知识。静态模型无法处理新兴类别,完全重新训练代价过高,而单独的任务特定模型则会带来过高的存储和推理开销[42 (https://arxiv.org/html/2608.19680#bib.bib27)]。 持续学习(CL)提供了一个自然的解决方案,使模型能够顺序学习新任务,同时保留先前学到的知识。然而,将CL应用于基于LLM的漏洞检测会引入三个因果关联的挑战。第一个挑战是参数高效适应。完全微调对于顺序到达的任务流来说代价过高,而每任务适配器通过共享冻结骨干并仅需更新一小部分参数,提供了一种实用的替代方案[16 (https://arxiv.org/html/2608.19680#bib.bib2), 9 (https://arxiv.org/html/2608.19680#bib.bib3)]。第二个挑战直接源于此解决方案。在共享骨干网络上顺序训练每任务适配器不可避免地会覆盖对先前学习漏洞至关重要的参数,导致灾难性遗忘[22 (https://arxiv.org/html/2608.19680#bib.bib9), 6 (https://arxiv.org/html/2608.19680#bib.bib13)]。第三个挑战源于对遗忘的补救措施。通过CL机制缓解遗忘会产生多个任务特定适配器,但维护单独的适配器需要在推理时知道任务身份,这在部署中不切实际,而简单地合并它们会导致破坏性的参数干扰。每个挑战都是解决前一个挑战的直接结果,没有一个挑战可以孤立地解决。 为了应对这个因果链,我们提出了一个三阶段框架,依次解决每个挑战。适应阶段采用频率感知低秩适应(FA-LoRA),该方法在傅里叶频率域中学习紧凑的适配器,并使用每个频率的重要性门控。FA-LoRA仅需0.4%的可训练参数,同时性能优于标准LoRA和QLoRA。持续学习阶段使用遗忘感知重放(FAR),该方法应用FA-LoRA产生的频率门控,通过损失动态来估计每个样本的遗忘风险,并优先重放高风险样本,在顺序任务中实现了平均0.8022的Micro-F1。部署阶段应用锚点保护渐进式合并(APPM),该方法利用FAR训练产生的不对称泛化能力,识别出最强的适配器作为锚点,并通过带锚点保护的加权合并和频域门控竞争将所有适配器整合为单一模型,实现了0.8085的Micro-F1,距离独立每任务上限仅相差2.7%,合并成本仅为156毫秒。 这三个阶段共享设计依赖关系。FAR依赖FA-LoRA产生的频率门控来估计哪些知识维度最容易遗忘。APPM依赖两个上游输出:FA-LoRA的门控参数使得合并过程中的频域竞争成为可能,而FAR产生的不对称训练结果为锚点选择提供了基础。由于通过FAR训练的后续适配器积累了来自所有先前任务的知识,它们自然具有更强的泛化能力,从而成为更强的锚点。这创造了一个强化循环:更好的CL训练产生更好的锚点,而更好的锚点产生更好的合并模型。 本文的主要贡献总结如下。 - •我们提出了一个统一的持续学习框架,用于基于LLM的智能合约漏洞检测,将高效适应、遗忘缓解和部署整合集成到一个连贯的三阶段流水线中。该框架共同解决了参数效率、灾难性遗忘和多任务推理问题,提供了从顺序任务学习到统一模型部署的端到端解决方案。 - •我们提出了FA-LoRA,一种频率感知的参数高效微调方法,在傅里叶域执行低秩适应。FA-LoRA仅需0.4%的可训练参数,同时持续优于标准LoRA和QLoRA。 - •我们开发了FAR,一种持续学习算法,根据通过损失动态估计的每个样本遗忘风险来优先进行重放,在顺序漏洞检测任务上,在所比较的方法中实现了最佳的持续学习性能。 - •我们提出了APPM,一种无需训练数据的适配器合并策略,将多个任务特定适配器整合为一个部署模型。APPM以毫秒级的合并时间和无额外运行时内存开销,实现了距离独立每任务上限2.7%以内的性能。 本文的其余部分组织如下。第二节(https://arxiv.org/html/2608.19680#S2)回顾相关工作。第三节(https://arxiv.org/html/2608.19680#S3)介绍所提出的框架及其架构。第四节(https://arxiv.org/html/2608.19680#S4)介绍FA-LoRA。第五节(https://arxiv.org/html/2608.19680#S5)描述持续学习框架和FAR。第六节(https://arxiv.org/html/2608.19680#S6)介绍APPM。第七节(https://arxiv.org/html/2608.19680#S7)报告实验结果,第八节(https://arxiv.org/html/2608.19680#S8)总结全文。 ## II 相关工作 ### II-A 智能合约漏洞检测 智能合约漏洞检测传统上依赖于静态分析和动态测试。静态分析工具如Slither[12 (https://arxiv.org/html/2608.19680#bib.bib33)]、Securify[38 (https://arxiv.org/html/2608.19680#bib.bib34)]和SmartCheck[37 (https://arxiv.org/html/2608.19680#bib.bib35)]通过手工规则、数据流分析和形式化合规性检查来检测漏洞。基于模糊测试的方法,包括ContractFuzzer[19 (https://arxiv.org/html/2608.19680#bib.bib37)]和Smartian[8 (https://arxiv.org/html/2608.19680#bib.bib36)],通过生成由合约接口和程序依赖指导的交易输入来探索执行路径。更近期的工作如SmartAxe[26 (https://arxiv.org/html/2608.19680#bib.bib16)]通过细粒度静态分析针对跨链桥漏洞,而Satellite[25 (https://arxiv.org/html/2608.19680#bib.bib17)]检测由子合约误用引起的漏洞。尽管这些方法对预定义的漏洞模式有效,但通常存在语义理解有限和对未见过的攻击类型泛化能力差的问题[20 (https://arxiv.org/html/2608.19680#bib.bib44)]。 最近的研究证明了LLMs在智能合约安全分析中的有效性。GPTScan[35 (https://arxiv.org/html/2608.19680#bib.bib39)]将GPT-4与静态分析相结合以改进漏洞确认,而PropertyGPT[28 (https://arxiv.org/html/2608.19680#bib.bib41)]引入属性引导推理以增强检测覆盖范围。其他研究对开源LLMs进行微调以进行漏洞分类[4 (https://arxiv.org/html/2608.19680#bib.bib43), 31 (https://arxiv.org/html/2608.19680#bib.bib29), 43 (https://arxiv.org/html/2608.19680#bib.bib30), 17 (https://arxiv.org/html/2608.19680#bib.bib40)],近期工作进一步利用LLMs通过语义恢复来增强智能合约反编译器输出[24 (https://arxiv.org/html/2608.19680#bib.bib18)]。然而,这些方法假设静态的漏洞分类法,缺乏适应新出现的漏洞类别的能力。 ### II-B LLMs的参数高效微调 PEFT已成为高效LLM适应的标准方法,训练数据透明度日益受到关注[41 (https://arxiv.org/html/2608.19680#bib.bib20)]。LoRA[16 (https://arxiv.org/html/2608.19680#bib.bib2)]冻结骨干并注入可训练的低秩矩阵,大幅减少了参数数量。QLoRA[9 (https://arxiv.org/html/2608.19680#bib.bib3)]进一步将低秩适应与4位量化相结合,适用于商品硬件微调。更新的变体包括稀疏适配器[10 (https://arxiv.org/html/2608.19680#bib.bib5), 3 (https://arxiv.org/html/2608.19680#bib.bib4)]、自适应秩分配和可学习门控。 更近期,频域PEFT方法引起了越来越多的关注。FourierFT[13 (https://arxiv.org/html/2608.19680#bib.bib6)]在傅里叶域学习参数更新,而FouRA[5 (https://arxiv.org/html/2608.19680#bib.bib7)]进一步证明了频域表示在多任务适配器合并中的优势。然而,现有方法通常采用固定的频率选择策略,并且主要关注单任务适应。它们在持续学习场景中的适用性在很大程度上尚未被探索。 ### II-C 序列任务的持续学习 CL旨在使模型能够在不忘记先前学习任务的情况下获取新知识[39 (https://arxiv.org/html/2608.19680#bib.bib14), 34 (https://arxiv.org/html/2608.19680#bib.bib15)]。现有方法通常可分为基于重放、基于正则化和基于架构的方法。基于重放的方法,如DER[6 (https://arxiv.org/html/2608.19680#bib.bib13)],通过回顾先前任务的样本来缓解遗忘。基于正则化的方法,包括EWC[22 (https://arxiv.org/html/2608.19680#bib.bib9)]、在线EWC[33 (https://arxiv.org/html/2608.19680#bib.bib11)]和MAS[1 (https://arxiv.org/html/2608.19680#bib.bib10)],通过约束权重更新来保留重要参数。基于架构的方法为不同任务分配专用的模型容量以减少干扰[29 (https://arxiv.org/html/2608.19680#bib.bib12)]。 尽管持续学习在计算机视觉和自然语言处理领域取得了显著成功,但其在智能合约漏洞检测中的应用在很大程度上尚未被探索。相关工作关于联邦遗忘学习[27 (https://arxiv.org/html/2608.19680#bib.bib21)]和单次联邦学习[45 (https://arxiv.org/html/2608.19680#bib.bib22)]解决了分布式环境中的知识保留问题,尽管本文考虑的顺序多标签场景
相似文章
CASCADE:大语言模型在部署期间的基于案例的持续自适应
本文介绍了 CASCADE,这是一个部署时学习框架,允许大型语言模型通过情境记忆和上下文赌博机优化实现持续自适应,而无需修改模型参数。
多模态大语言模型安全格局的演变:新兴威胁与防护措施综述
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
面向大型语言模型归因引导的持续学习
本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。
语言模型智能体群体中的涌现语言:从词元效率到规避监管
本文研究了自主LLM智能体在Moltbook平台上相互提出的涌现语言,发现有些语言专门设计用于规避人类监管,且可通过简短描述在上下文中学习。这些发现引发了对智能体群体监控的安全担忧。
小语言模型顺序个性化的持续学习:稳定性监测分析
本文针对小语言模型的顺序LoRA个性化展开研究,通过检查点级评估来监测任务性能和遗忘情况,并表明轻量级参考集诊断可以揭示不稳定性模式。