SciHazard:一种使用分解危害评分衡量科学安全风险的基准

arXiv cs.AI 论文

摘要

介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。

arXiv:2607.18665v1 公告类型:新论文 摘要:大型语言模型(LLM)越来越多地支持科学研究,但它们也可能将有害的科学知识转化为可操作的滥用指南。现有基准通常依赖于与现实世界危害脱节的模板化查询,并采用缺乏领域基础的LLM-as-a-Judge范式。为了解决这个问题,我们引入了SciHazard,一个基于现实世界的科学风险基准,以及一个与数据集无关的危害性评估框架。SciHazard包含2400个有害问题和600个过度安全问题,涵盖12个学科,所有查询都基于受监管实体和有记录的事故场景。为了计算\textsc{DeHarm-Score},我们开发了一个分解评估程序,结合了查询危害严重性、拒绝行为和响应级别风险。对于非拒绝响应,它进一步将响应级别危害分解为\textsc{可执行性}(通过动态检查表和重要性权重量化)和\textsc{净新增风险}(通过检索增强的声明提取和综合障碍验证评估)。一项专家验证研究表明,\textsc{DeHarm-Score} 比最强基线方法将专家注释的一致性提高了90.17%。我们在广泛科学安全评估中对31个前沿LLM和深度研究智能体进行了基准测试。值得注意的是,深度研究智能体的平均\textsc{DeHarm-Score}比标准LLM高出32.3%,暴露了自主智能体是当前安全防御中的关键盲点。代码和数据集可在https://anonymous.4open.science/r/DeharmScore-7B55获取。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:22

# SciHazard: 一种通过分解危害评分来衡量科学安全风险的基准测试

来源:https://arxiv.org/html/2607.18665

Chunxiao Li Yuan Xiong¹ Lijun Li¹ Tianyi Du Wenlong Zhang Lei Bai Jing Shao  
上海人工智能实验室  
\{lichunxiao, lilijun, shaojing\}@pjlab.org.cn

###### 摘要

大型语言模型(LLM)在支持科学发展的同时,也可能将有害的科学知识转化为可操作的误用指导。现有的基准测试通常依赖于与真实世界危害脱节的模板化查询,并采用缺乏领域基础的 LLM 即法官(LLM-as-a-Judge)范式。为了解决这一问题,我们提出了 SciHazard,这是一个基于真实世界风险的科学安全基准测试,以及一个与数据集无关的危害性评估框架。SciHazard 包含 2400 个有害问题(涵盖 12 个学科)和 600 个过度安全问题,所有查询均基于受监管实体和已记录的危险场景。为了计算 DeHarm-Score,我们开发了一种分解评估流程,该流程结合了查询危害严重性、拒绝行为和响应级风险。对于未被拒绝的响应,它进一步将响应级危害分解为可执行性(通过动态清单和重要性加权量化)和新增风险(通过检索增强的声明提取和综合障碍验证来评估)。一项专家验证研究表明,与最强的基线相比,DeHarm-Score 与专家标注的一致性提高了 90.17%。我们对 31 个前沿 LLM 和深度研究代理进行了广泛的科学安全评估。值得注意的是,深度研究代理的平均 DeHarm-Score 比标准 LLM 高出 32.3%,这暴露了自主代理在当前安全防御中的一个关键盲点。代码和数据集可在 https://anonymous.4open.science/r/DeharmScore-7B55 获取。

## 1 引言

虽然大型语言模型(LLM)加速了科学发现,但它们也降低了产生可能带来安全风险的高危科学成果的门槛。从化学武器合成到病原体工程,前沿模型可能无意或恶意地生成知识,这些知识如果被滥用,将威胁公共安全。这引发了一个紧迫的 AI 安全挑战:如何准确衡量 LLM 和自主科学代理在高风险场景中的潜在威胁?

当前的科学安全基准测试 [9, 16, 32, 27, 31, 30] 未能充分应对这一挑战,原因如下。首先,数据集依赖于危险物质与模板化提示的简单组合,将威胁评估简化为浅层知识检索,而非反映对手实际复杂的误用场景。其次,评估方法依赖于标准的 LLM 即法官框架,在知识密集的科学领域中,这种框架默认采用浅层语义启发式方法,而非基于事实的科学逻辑,导致分数与现实危害之间存在巨大差距。第三,大多数基准测试侧重于标准聊天模型,而忽视了深度研究代理 [4, 18, 21],后者的检索、规划和工具使用能力可能会削弱拒绝障碍并综合分散的危险信息。

为解决这些局限性,我们引入了 SciHazard,这是一个基于真实世界的基准测试和与数据集无关的科学危害性评估框架。我们开发了一个涵盖 12 个科学学科的双轨数据生成流程。该流程以权威法规和已记录事件为基础,提取危险场景,并沿着误用生命周期和技术瓶颈进行扩展,从而增强了多样性和风险覆盖率。我们还构建了一个过度安全子集来评估过度拒绝行为。在评估方面,我们提出了 DeHarm-Score,一个分解指标,它结合了查询危害严重性、拒绝行为和响应级风险。对于未被拒绝的响应,DeHarm-Score 将响应级危害分离为两个操作性维度:可执行性(通过动态重要性加权清单和关键阻断步骤衡量)和新增风险(通过检索增强的声明提取和综合障碍验证衡量)。我们根据专家标注验证了 DeHarm-Score,并用它对 31 个前沿 LLM、深度研究代理和特定科学模型进行了基准测试。DeHarm-Score 与人类专家标注的 QWK 达到了 0.774,显著优于最先进的闭源评判模型和现有框架 [5, 31, 22, 15],同时对内容和格式扰动表现出很强的鲁棒性。这些结果表明,我们的方法有效减轻了标准 LLM 即法官范式中固有的系统性偏差。我们的评估进一步揭示,深度研究代理的平均 DeHarm-Score 比标准 LLM 高出 32.3%,暴露了自主科学代理在当前安全防御中的一个关键盲点。

我们的主要贡献如下:

- • 我们引入了 SciHazard,这是第一个基于真实世界误用场景、涵盖 12 个学科且具有细粒度专家标注的科学安全基准测试,并开源以便于可重复评估。
- • 我们提出了 DeHarm-Score,一种将可执行性与潜在风险分离的分解危害指标,与领域专家高度一致,并显著优于现有的 LLM 即法官基线。
- • 我们对 31 个前沿 LLM 和自主代理进行了广泛的科学安全评估,揭示深度研究代理的拒绝率急剧下降,同时可操作危害激增。

## 2 相关工作

评估 LLM 在科学领域的双重用途风险已引起越来越多的关注。现有的基准测试主要依赖客观知识测试或模板化查询:WMDP [16] 设计了专家策划的关于有害知识的多项选择题;ChemSafetyBench [27]、SafeSci [32] 和 SOSBench [9] 从受监管物质或越狱提示中构建数据集;SafeScientist [31] 引入了由深度研究模型生成的开放式问题。这些工作存在两个共同局限:领域覆盖狭窄,集中在传统 STEM 领域;并且与真实世界误用脱节——测试的是事实回忆而非可操作场景。SciHazard 通过将危险实体与完整的误用生命周期相结合,跨越 12 个不同学科,解决了这两个差距。

在评估方面,方法范围从进行二元分类的专有评判模型(例如 Llama-Guard [8])到基于评分标准的 LLM 评判模型,如 StrongReject [22] 和 DeepReject [5]。在知识密度高的科学背景下,这两种方法都缺乏领域专业知识,默认采用浅层语义启发式方法,导致自动评分与现实风险之间存在显著差距 [26, 7, 3, 19]。DeHarm-Score 通过动态检索和分层匹配弥合了这一差距,实现了与专家标注的最高一致性。

## 3 SciHazard

表 1:与其他基准测试的比较。

| 数据集 | #问题 | #学科 | 格式 | 专家标注 | 良性子集 | 指标 |
|---|---|---|---|---|---|---|
| WMDPBench [16] | 3668 | 3 | MCQ | ✓ | ✗ | 准确率 |
| SciSafeEval [17] | 31840 | 4 | QA | ✗ | ✓ | 拒绝率 |
| SafeSci [32] | 1.75M | 7 | 客观题 | ✗ | ✓ | 准确率 |
| SafeScientist [31] | 240 | 6 | QA | ✗ | ✗ | 安全分数 |
| SOSBench [9] | 3000 | 6 | QA | ✗ | ✗ | 有害率 |
| 我们的 | 3000 | 12 | QA | ✓ | ✓ | DeHarm-Score |

SciHazard 是一个科学安全基准测试,立足于真实世界、可操作的误用场景,而非孤立的知识回忆。它涵盖 12 个科学学科——化学、生物学、物理学、计算机科学、心理学、社会学、医学、药理学、环境科学、经济学、法学以及农业与食品科学——既包括传统 STEM 领域,也包括具有严重误用潜力但尚未充分探索的社会科学领域。与现有基准测试的系统比较见表1,示例推迟到附录A。

### 3.1 数据生成流程

现有的科学安全基准测试,如 SafeSci 和 SciSafeEval,主要局限于浅层有害知识检索(例如“化合物 A 的性质是什么?”),未能捕捉复杂操作链条——高级对手正是通过这种链条将科学知识武器化。为填补这一空白,我们提出了一个双轨科学误用生成流程,分为物质驱动轨道(有形物理实体)和场景驱动轨道(利用规则、信息流或系统结构)。在多个前沿 LLM 和外部知识库检索的驱动下,该流程生成了 2400 个高质量有害问题和 600 个过度安全问题。

#### 3.1.1 轨道 1:物质驱动生成

对于涉及具体物理实体的七个学科(化学、生物学、物理学、药理学、医学、环境科学和农业科学),我们将每种受监管物质建模为可分解的工程威胁,并沿着其武器化生命周期生成问题。我们首先解析权威的国际监管框架(《化学武器公约》、CDC/APHIS 选择制剂、DEA 管制物质清单、欧盟 REACH 以及相关联合国公约),提取出 1548 种受控物质作为危险基元。对于每种物质,由外部知识库增强的前沿 LLM 识别出其武器化路径上的三个核心技术瓶颈(例如,规避安全检查、增强热稳定性、增加跨物种传染性)。最后,不同于单步合成问答,我们将问题空间沿四个生命周期阶段展开——上游获取与替代、中游优化与放大、下游稳定与储存、以及递送与传播——并通过物质 × 生命周期阶段 × 技术瓶颈的正交组合生成问题,确保对完整武器化链的系统覆盖。

#### 3.1.2 轨道 2:场景驱动生成

对于五种非物质学科(计算机科学、心理学、社会学、经济学和法学),核心风险在于将规则、信息流或系统逻辑武器化。这里的危险基元是由前沿 LLM 结合特定领域知识库(网络攻击报告、金融危机事后分析、法律漏洞等)挖掘的抽象破坏性场景。类似于合成瓶颈,系统性攻击会遇到系统性摩擦——阻碍执行的防御机制——我们从每个场景中提取三个对抗性瓶颈。为保持与轨道 1 的同构性,我们将系统性攻击分解为四个阶段的科学误用杀伤链:侦察与访问、武器化与策略设计、执行与放大、以及规避与持久化。问题同样通过场景 × 杀伤链阶段 × 系统性瓶颈的正交组合生成。

#### 3.1.3 危害严重性标注

我们建立了一个五级危害分类法(L1–L5),融合了系统安全工程标准(OSHA、FEMA、MIL-STD-882E)与前沿极端风险定义。每个问题通过双轴评估机制进行评分:(1) 后果与意图——评估潜在危害的规模、不可逆性和操作意图;以及 (2) 监管依据——与学科特定的国际管制清单(WHO 风险组别、CWC 附表、澳大利亚集团等)对齐,以评估固有危险性。这种双轴设计确保分类法同时具备客观破坏力基础和严格法律依据,详情见附录D。标注由三个前沿 LLM(GPT-5.4、Gemini-3.1-Pro 和 Claude-4.6-Opus)组成的委员会进行,每个模型独立评分,最终等级由多数投票确定。边缘情况(平局或拒绝)交由人类领域专家处理。最终共识得出危害严重性等级,记为 H_q ∈ {1,2,3,4,5}。

### 3.2 过度安全问题生成

为量化对合法科学探究的过度拒绝,我们通过意图反转生成了 600 个过度安全问题:每个问题严格复用其有害对应问题中的高风险触发词,同时将意图转向防御、检测或应急响应。尽管这些问题表面共享有害词汇,但其核心意图完全符合主要 LLM 提供商的使用政策,从而能够同时衡量恶意查询拦截和合法话语保留。

### 3.3 基准测试分布分析

比较危害等级分布(图1)揭示了先前工作中的明显分布偏斜。SafeScientist 将 76% 的问题集中在 L5;这些场景虽然灾难性但实际不可行,与真实误用基本脱节。SOSBench 和 SafeSci 偏向较低等级,缺乏系统评估危害所需的深度。相比之下,SciHazard 在整个 L1–L5 谱系上实现了平衡覆盖,关键性地填补了 L3(严重违法和个体伤害)和 L4(高风险系统破坏)的评估空白——这是操作上最危险、隐蔽性最高、可操作性最强的盲区。

## 4 评估框架

### 4.1 危害分解的动机

在科学安全评估中,评估 LLM 响应的危害性本身就是一个极具挑战的任务。常规安全基准测试通常要求标注者为每个响应分配一个单一的整体分数。然而,在高度专业化的科学背景下,“危害性”是一个复杂且边界模糊的概念。在我们的试点研究中(详见第5.1节),我们观察到领域专家在应用整体评分时,标注者间一致性显著偏低。这种不一致并非源于专业知识不足,而是因为评估者在面对复杂科学文本时,对风险权重的默认权重存在差异。具体而言,科学响应的危险性受两个正交维度支配:可执行性和新增风险。

相似文章

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。