FUSE:大语言模型危险能力评估框架
摘要
FUSE是一个统一框架,用于评估大语言模型的危险能力,包括知识、防御和危害维度。研究发现,尽管对齐取得进展,但新模型的危险能力有所增加,并提供了跨模型比较。
arXiv:2609.02168v1 Announce Type: new
摘要:碎片化的安全评估削弱了危险AI能力的治理。我们提出一个模块化框架,通过三个正交流程——知识($K$)、防御($D$)和危害($H$)——在统一协议下评估每个模型,将结果汇总为标准化的危险能力概况$\phi$。可插拔模块提供场景种子、知识库、危害查询和评判标准,而核心评估引擎在不同领域保持不变;CB评估通过一个网络试点补充,展示了协议的转移。
通过化学-生物(CB)模块实例化该框架,我们评估了四个系列的12个商业大语言模型。我们的第一个贡献是跨模型和模型系列的危险能力水平比较:三个维度暴露了显著不同的概况——具有可比知识的模型在拒绝韧性上存在差异,而强大的防御者在确实遵从时并不会生成较少有害内容——同时系列级模式进一步区分了Claude、DeepSeek和GPT模型。第二个是能力演变的时间分析:跟踪$K$、$D$和$H$相对于模型发布日期的变化表明,危险能力并未单调递减;新模型深化了知识但仅部分改进了防御,表明规模化和对齐进展并未统一转化为安全性。可靠性通过跨评判者一致性(自助法$\rho > 0.79$,5个评判者中4个)和流程正交性($K$--$D$--$H$互相关$\rho \in [0.32, 0.52]$)来建立。
查看缓存全文
缓存时间: 2026/09/03 06:01
# FUSE:用于评估LLM危险能力的框架 来源:https://arxiv.org/html/2609.02168 张茹† 陈晓 刘鑫博 林佳璇 黄佳 刘建义 杨震 所属机构:中国 北京邮电大学 网络空间安全学院 †通讯作者:[email protected] ###### 摘要 零散的安全评估削弱了对人工智能危险能力的治理。我们提出一个模块化框架,通过三条正交管道——知识($KK$)、防御($DD$)和危害($HH$)——在统一协议下评估每个模型,并将结果聚合成标准化的危险能力画像$\phi$。可插拔模块提供场景种子、知识库、危害查询和评审量规,而核心评估引擎在跨领域时保持不变;针对CB的评估还通过一个网络领域试点方案来展示协议迁移能力。我们以化学-生物(CB)模块实例化该框架,评估了来自四个系列的12个商用LLM。我们的首要贡献是对模型及模型系列间的危险能力进行横向比较:三个维度揭示出截然不同的画像——知识水平相近的模型在拒绝韧性上存在差异,而防御能力强的模型在顺从时并不会产生更少的危害内容——同时系列层面的模式进一步区分了Claude、DeepSeek和GPT模型。第二个贡献是能力演进的时序分析:追踪$KK$、$DD$和$HH$与模型发布日期的关系表明,危险能力并未单调下降;新模型在深化知识的同时仅部分改善了防御,表明扩展与对齐进展并未均匀地转化为安全性。可靠性通过评审者间一致性(自助法$\rho > 0.79$,5位评审者中有4位)和管道正交性($KK$–$DD$–$HH$间相关性$\rho \in [0.32, 0.52]$)得以确立。 ## 1 引言 监管机构、平台运营者和企业安全团队面临关于大语言模型的一个根本问题[1 (https://arxiv.org/html/2609.02168#bib.bib38), 3 (https://arxiv.org/html/2609.02168#bib.bib5)]:哪些模型具有危险能力?它们有多危险?现有的安全评估无法回答这个问题。知识基准测试(GPQA[25 (https://arxiv.org/html/2609.02168#bib.bib40)]、WMDP[15 (https://arxiv.org/html/2609.02168#bib.bib7)])衡量模型知道什么,但不衡量它在压力下会做什么。防御基准测试(R-Judge[35 (https://arxiv.org/html/2609.02168#bib.bib10)]、Agent-SafetyBench[36 (https://arxiv.org/html/2609.02168#bib.bib11)])衡量拒绝行为,但缺乏标准化输出以供跨领域比较。危害生成评估只评估输出,而不考虑这些输出是如何被引出的。每个基准测试都运行自己的协议,报告自己的格式,并且与下游没有任何连接——没有便携的风险画像供监管机构使用,也没有标准化的向量用于跨模型比较。根本问题在于碎片化,而非缺乏测量。监管机构无法将一个基准测试得出的“这个模型知道危险的生物学知识”、另一个基准测试的“这个模型在压力下会顺从”,以及第三个基准测试的“这个模型能产生可操作的危害方案”整合起来——因为这些结果不具可比性。它们使用不同的模型、不同的协议、不同的评分尺度和不同的样本群体。这种碎片化是结构性的:事后无论如何标准化,都无法从设计时就不打算进行比较的基准测试中产生可比的风险画像。 图1 (https://arxiv.org/html/2609.02168#S1.F1)对比了这两个世界。  图1:问题与我们的解决方案。左图:现有基准测试用不兼容的协议、尺度和其他单一维度测量LLM——其输出无法回答哪个模型更危险,也无法说明危险如何演变。右图:我们的框架沿三个正交维度($KK, DD, HH$)进行评估,并将结果聚合成危险能力画像$\phi$,从而能够直接进行跨模型、跨领域和跨时间的比较。 我们的答案:一个模块化框架,而非又一个基准测试。我们提出一个用于评估LLM危险能力的模块化评估基础设施。该框架接受可插拔的危险领域模块,并在统一协议下沿三个正交维度评估每个模型: - • 知识($KK$)——系统信息泄露风险:模型能披露的危险领域熟练程度,通过项目反应理论(IRT)估计的在多项选择题上的能力来衡量。$KK$界定了攻击者在尝试任何行为绕过之前,仅通过查询就能从模型中提取的信息范围。 - • 防御($DD$)——系统访问控制鲁棒性:模型在对抗性诱导下强制执行其行为边界的鲁棒程度,通过路径依赖交互来衡量,其中红队代理根据模型先前的响应应用不断升级的诱导策略。$DD$量化的是边界本身,而不仅仅是其初次接触时的表象。 - • 危害($HH$)——系统输出内容安全风险:当模型的访问控制失败时,其产生的危险内容的可操作性,通过量规评分的开放式生成来衡量。$HH$量化了访问控制被突破后的爆炸半径。 这三个维度回答了关于风险性质的独立问题,并且我们的CB评估证实它们并非冗余:12个商用LLM之间的成对相关性很低($\rho \in [0.32, 0.52]$)。没有单一维度足以构成完整的风险画像。 该框架将这些维度——连同两个捕捉领域不对称性($\Delta$)和静默拒绝($ER$)的派生指标——聚合成一个单一的危险能力画像$\phi$:一个标准化的七维向量,总结了模型知道什么、在压力下行为如何、以及在顺从时会产出什么。因为每个维度都是在同一个协议、同一批模型群体上测量的,所以$\phi$向量可以直接跨模型、跨领域进行比较——这是现有基准测试无法提供的属性。 我们以化学-生物(CB)模块实例化该框架,评估了跨越四个模型系列和三年发布窗口(2023–2026)的12个商用LLM。评估得出了两个主要结论。首先,*跨模型比较*:模型和模型系列展现出截然不同的能力结构,这些差异只有在所有维度并列报告时才可见。其次,*时序演进*:知识在每个系列的代际间累积,防御按系列分化,而危害则顽固地缺乏弹性——没有厂商生产出其顺从输出比前代显著减少可操作性的一代。我们进一步通过评审者间一致性(5位备选评审者中有4位的自助法$\rho > 0.79$)、管道正交性和IRT测量精度(第6节 (https://arxiv.org/html/2609.02168#S6))验证了框架的评分基础。 总之,我们声称做出了以下贡献: - • 我们设计了一个用于危险能力评估的模块化评估基础设施——四模块架构(可插拔模块、任务编排、测试环境、评判)、统一的评估协议,以及可切换的纯内容/工具增强执行模式。 - • 我们提出了一个正式的可插拔模块接口,该接口接受特定危险领域的场景种子、知识库、危害查询和量规,同时复用核心评估管道;并以12个商用LLM上的CB模块进行了实例化和验证。 - • 我们将危险能力画像$\phi$定义为一个标准化的七维聚合($KK, DD, HH, DL, BR, \Delta, ER$),并报告了12个模型的$\phi$,从而实现了现有基准测试无法支持的直接跨模型和跨领域比较。 - • 我们提供了首个关于危险能力如何随模型发布时间在三代间演变的系统分析,揭示了知识的累积、防御的分化以及危害的无弹性。 ## 2 背景与相关工作 LLM安全评估发展迅速但依然碎片化[16 (https://arxiv.org/html/2609.02168#bib.bib2), 31 (https://arxiv.org/html/2609.02168#bib.bib4), 33 (https://arxiv.org/html/2609.02168#bib.bib3)]。我们将现有工作分为四个方向,并指出其共同缺口:缺乏一个能在正交维度上一致评估危险能力的统一基础设施。 ### 2.1 知识基准测试 MMLU[10 (https://arxiv.org/html/2609.02168#bib.bib8)]确立了用于大规模知识评估的多项选择题范式;GPQA[25 (https://arxiv.org/html/2609.02168#bib.bib40)]和WMDP[15 (https://arxiv.org/html/2609.02168#bib.bib7)]将其扩展到危险科学领域,衡量*模型是否知道*危险信息。这些基准测试本质上是单轮的,无法评估模型在对抗性压力下的行为。 ### 2.2 防御与安全基准测试 R-Judge[35 (https://arxiv.org/html/2609.02168#bib.bib10)]测试多轮代理交互中的风险识别;Agent-SafetyBench和OpenAgentSafety[32 (https://arxiv.org/html/2609.02168#bib.bib12)]评估拥有真实工具访问权限的代理,发现单个安全的步骤会累积成不安全的结果。领域特定评估处理极端风险:RAND的CBRN研究[21 (https://arxiv.org/html/2609.02168#bib.bib35)]表明LLM可以降低生物攻击规划的门槛[28 (https://arxiv.org/html/2609.02168#bib.bib36), 29 (https://arxiv.org/html/2609.02168#bib.bib34)];Do-Not-Answer[34 (https://arxiv.org/html/2609.02168#bib.bib13)]评估拒绝保障措施。每个都使用自己的协议和输出格式,使得结果在基准测试间不可比——这是我们的框架所消除的结构性弱点。 ### 2.3 自适应和多轮越狱 基于梯度的攻击[40 (https://arxiv.org/html/2609.02168#bib.bib19)]、自动提示生成[18 (https://arxiv.org/html/2609.02168#bib.bib17)]、多轮诱导[14 (https://arxiv.org/html/2609.02168#bib.bib20)]和基于模型的红队测试[23 (https://arxiv.org/html/2609.02168#bib.bib22), 8 (https://arxiv.org/html/2609.02168#bib.bib23)]表明对抗性压力可以绕过安全护栏;PAIR[5 (https://arxiv.org/html/2609.02168#bib.bib18)]和TAP通过迭代的攻击者模型查询引出有害响应。先前工作将越狱视为一个孤立的攻击向量;我们的框架将自适应多轮评估嵌入为防御维度的内置设计特性,并通过初始防御到侵蚀的相关性(第5.3节 (https://arxiv.org/html/2609.02168#S5.SS3))进行了实证验证。 ### 2.4 LLM作为评审者的可靠性 我们的框架使用LLM作为评审者进行评分,其可靠性已被广泛研究。郑等人[38 (https://arxiv.org/html/2609.02168#bib.bib27)]表明强评审者达到超过80%的人类一致性,但表现出位置和冗长性偏差,这里通过多个评审者家族和温度0.0来控制。多代理集成[13 (https://arxiv.org/html/2609.02168#bib.bib21)]减轻了单一评审者的方差;维加等人[30 (https://arxiv.org/html/2609.02168#bib.bib28)]表明一致性因任务类型而异——客观评分比主观质量评估更一致,这正是我们在防御和危害评分中观察到的模式(第6节 (https://arxiv.org/html/2609.02168#S6))。这些发现促使我们设计了跨评审者验证。 ### 2.5 代理与工具增强安全 AgentBench[17 (https://arxiv.org/html/2609.02168#bib.bib15)]和ToolEmu[27 (https://arxiv.org/html/2609.02168#bib.bib14)]表明工具访问会改变安全行为,并且沙盒评估是可行的。我们的工具增强模式(第3.4节 (https://arxiv.org/html/2609.02168#S3.SS4))建立在这一思路上,将纯内容模式扩展到隔离沙盒内的工具增强场景。 ### 2.6 总结 表1:现有基准测试与我们框架的比较。即使在单一威胁类别内,近期进展也产生了不兼容的协议[19 (https://arxiv.org/html/2609.02168#bib.bib1)]。根本缺口不是缺乏评估,而是缺乏一个能在同一协议下托管多个危险领域评估并产生可比危险能力画像的统一基础设施。今天的科研人员必须分别配置GPQA、R-Judge和自定义的危害测试;我们的框架将其简化为实例化一个可插拔模块。 以下章节详细阐述该框架:第3节 (https://arxiv.org/html/2609.02168#S3)定义四模块架构,第4节 (https://arxiv.org/html/2609.02168#S4)展示评估管道和危险能力画像$\phi$,第5节 (https://arxiv.org/html/2609.02168#S5)是CB实例化及其两个主要发现,第6节 (https://arxiv.org/html/2609.02168#S6)是评审者一致性分析。 ## 3 框架设计 现有基准测试的自行组装无法实现我们的框架通过设计提供的三个特性:(1)跨管道可比性——同一模型在统一协议下经$KK$、$DD$和$HH$评估后,得出的分数在同一坐标系中,从而实现跨维度诊断;(2)标准化输出——危险能力画像$\phi$是从评估的稳定维度中提炼出来的,而非事后整合;(3)摊销成本——通过设计,添加新的危险领域仅需一个遵循固定接口的新可插拔模块;网络试点方案(第5.6节 (https://arxiv.org/html/2609.02168#S5.SS6))为这种迁移提供了初步证据。 ### 3.1 架构概述 该框架被组织为一个四模块管道:可插拔模块提供领域资产,任务编排模块管理评估生命周期,测试环境托管红队代理与目标模型之间的交互,评判模块对记录的交互进行评分并产生危险能力画像$\phi$。图2 (https://arxiv.org/html/2609.02168#S3.F2)提供了完整的系统图。每个模块都有明确定义的接口,可以独立配置或替换。  图2:框架架构概述:一个四模块系统(可插拔模块、任务编排、测试环境、评判),通过三条并行评估管道($KK, DD, HH$)评估每个模型,并将它们聚合成危险能力画像$\phi$。 ### 3.2 可插拔模块 框架的可扩展性源于一个正式的模块接口:每个危险领域被封装在一个自包含的模块规范中,称为危险领域模块,它恰好捆绑了四个评估专用资产。第一个资产是*场景种子集*,一组用于防御维度($DD$)的领域特定场景。每个场景种子编码了一个合法的工作背景、其中嵌入的一个危害目标,以及一个驱动渐进式多轮诱导的升级阶梯。第二个是*知识库*,一组用于知识维度($KK$)的多项选择题;每个题目都带有其正确答案和一个难度标签。第三个是*危害查询集*,一组用于危害维度($HH$)的开放式提示。最后一个资产是*评审量规*,它定义了评分维度及其范围。 核心框架在所有模块间共享,在添加新领域时保持不变;网络试点方案(第5.6节 (https://arxiv.org/html/2609.02168#S5.SS6))在实践中验证了这种迁移性。为使评估适应新领域,只需
相似文章
大语言模型在文本之外安全吗?表情符号是否暴露了安全评估的漏洞?
本文通过研究表情符号增强的提示,探讨了大语言模型在文本输入之外的安全性,揭示了当前安全评估的漏洞和模型依赖性漏洞。
微调前先诊断:面向网络安全问答的小型LLM诊断研究
提出FiT,一个诊断框架,用于在微调前评估小型LLM在网络安全问答方面的能力,表明根据不同的微调模式,微调可能会降低词汇和参数化知识。提供避免不必要微调的指导。
NeuronFuzz: 安全神经元引导的模糊测试在LLM安全评估中的应用
NeuronFuzz是一个白盒模糊测试框架,利用内部安全神经作为连续反馈来评估LLM对越狱攻击的安全性,并在多个模型上展示了高发现率。
大语言模型红队测试框架:以忠实性评估为例
本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。
代码合成大语言模型的危害分析框架
OpenAI 提出了一套危害分析框架,用于评估 Codex 等代码合成 LLM 相关的安全风险,通过创新的代码生成能力评估方法论来审视技术、社会、政治和经济影响。