基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI 论文

摘要

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。

arXiv:2607.20476v1 公告类型:新 摘要:我们提出了一个经验性基准测试,评估五个大语言模型如何分析多传感器物理危害数据。通过在三类场景——多传感器联合评估、响应比例性和模式消歧——中测试60种情况,在温度设为0.0的条件下进行了1800次API调用,我们发现,在所有被测试的场景中,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型始终未发出预警信号,而在单传感器阈值违规检测中则表现出近乎完美的准确性。所有五个模型(ChatGPT-4o、Gemini 2.5 Flash、DeepSeek、Kimi、Llama 3.1 8B)在A类多传感器场景中得分接近零(Q2:0.000-0.208;Q3:0.000-0.592),而在单传感器场景(B类Q1:0.975-1.000)中表现强劲。结构化表格格式相较于纯散文没有一致优势;ChatGPT-4o在散文格式下表现显著更好(p = 0.001)。这些发现对在物理安全监控系统中部署被测试模型的从业者具有直接影响。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:01

# 1. 引言
来源:https://arxiv.org/html/2607.20476
多传感器物理危害评估中的大语言模型基准测试

Faizan Iqbal 印度 Lovely Professional University, orcid.org/0009-0002-8998-9347 (https://orcid.org/0009-0002-8998-9347) huggingface.co/faizaniqbal (https://huggingface.co/faizaniqbal) x.com/faizaniqbal__52 (https://x.com/faizaniqbal__52)

2026年5月

我们提出了一个经验性基准测试,评估五种大语言模型如何评估多传感器物理危害数据。测试了三个类别共60个场景——多传感器联合评估、响应比例性、以及模式区分——在温度0.0下进行了1,800次API调用。我们发现,在所有测试场景中,当多个传感器同时升高但低于各自单独的安全限值时,所有被测试模型一致未能产生预防性警告信号,而在单一传感器阈值违反方面则实现了近乎完美的准确性。所有五个模型(ChatGPT-4o、Gemini 2.5 Flash、DeepSeek、Kimi、Llama 3.1 8B)在A类多传感器场景中的得分接近零(Q2: 0.000–0.208;Q3: 0.000–0.592),而相比之下在单一传感器场景中表现强劲(B类Q1: 0.975–1.000)。结构化表格格式相比纯文本描述并无一致优势;ChatGPT-4o在文本描述下表现显著更好(p=0.001)。这些发现对在物理安全监测系统中部署被测试模型的实践者具有直接影响。

大语言模型越来越多地被考虑部署在安全关键的物理监测环境中,包括工业环境传感器、楼宇自动化系统和职业健康应用。在此类系统中,LLM接收一系列数值传感器读数,并被期望识别阈值违反、分类危害类型,并推荐相应措施。

一个关键且尚未充分探索的能力要求是评估多个传感器同时升高但低于各自单独安全限值的情况。职业卫生标准通过加性暴露指数(OSHA, (https://arxiv.org/html/2607.20476#bib.bib9))来处理此问题:

Em = C1/L1 + C2/L2 + ... + Cn/Ln   (1)

其中 Em > 1.0 表示综合暴露值得关注,即使没有单个 Ci 超过 Li。现实世界的例子包括通风不良的占用空间,其中 CO、CO2、VOC 和 PM2.5 各自接近但低于其单独限值。当前 LLM 是否对此类条件做出适当响应——通过标记关注并推荐预防措施——尚未得到系统研究。

本文旨在回答四个研究问题:

1. RQ1. 当多个传感器同时升高但低于单独安全限值时,被测试模型是否产生适当的预防性信号?
2. RQ2. 推荐的行为是否与阈值超出幅度成比例?
3. RQ3. 被测试模型能否从多传感器模式中正确识别危害类型?
4. RQ4. 与等效的纯文本描述相比,结构化表格输入格式是否能提高评估质量?

## 2. 相关工作

### 2.1 LLM 推理基准

标准的 LLM 基准测试包括 MMLU (Hendrycks et al., 2021 (https://arxiv.org/html/2607.20476#bib.bib6))、BIG-Bench (Srivastava et al., 2022 (https://arxiv.org/html/2607.20476#bib.bib10)) 和 GSM8K (Cobbe et al., 2021 (https://arxiv.org/html/2607.20476#bib.bib5)),它们评估数学和常识推理,但不涉及基于实际监管安全标准的物理传感器解释。物理 AI 基准 (Xu et al., 2024 (https://arxiv.org/html/2607.20476#bib.bib12)) 测试空间和物理常识,但不测试针对职业健康限值的数值阈值推理。

### 2.2 LLM 物联网与传感器处理

IoT-LLM (An et al., 2024 (https://arxiv.org/html/2607.20476#bib.bib3)) 表明 LLM 在处理密集数值物联网数据时存在困难,通过结构化预处理在五个感知任务中实现了 49.4% 的性能提升。SensorBench (mDOT Center, 2025 (https://arxiv.org/html/2607.20476#bib.bib7)) 对 LLM 在自动化信号处理编码任务上进行了基准测试,发现在复杂的多步骤任务上,人类专家比 LLM 表现好 60% 以上。这两项工作都侧重于分类和信号处理任务,而不是基于监管标准的阈值安全评估。

### 2.3 LLM 安全性评估

R-Judge (Yuan et al., 2024 (https://arxiv.org/html/2607.20476#bib.bib13)) 和 SafetyBench (Zhang et al., 2024 (https://arxiv.org/html/2607.20476#bib.bib14)) 评估了 LLM 在智能体交互和内容安全背景下的安全意识。这些基准测试针对的是 LLM 的行为安全性,而不是它们根据数值阈值正确解读物理传感器测量的能力。

### 2.4 LLM 数值推理

已有研究记录了 LLM 在数值比较任务中的失败,包括广泛引用的 9.11 > 9.9 错误 (Zhao et al., 2024 (https://arxiv.org/html/2607.20476#bib.bib15))。Zhou 等人 (2024 (https://arxiv.org/html/2607.20476#bib.bib16)) 表明,较大的模型在某些数值任务上可能变得不太可靠。HalluLens (Bang et al., 2025 (https://arxiv.org/html/2607.20476#bib.bib4)) 提供了全面的幻觉分类体系。我们的工作将此扩展到安全关键的传感器环境,发现虽然所有被测试模型都能可靠地处理单个阈值算术,但在多传感器升高场景中它们始终没有产生预防性警告信号。

### 2.5 研究差距

据我们所知,目前尚无先前工作使用国际公认的安全标准作为客观真实基准,对 LLM 在多传感器物理危害评估中的表现进行系统基准测试。本文填补了这一空白。

## 3. 基准设计

### 3.1 安全阈值

所有场景均使用表1 (https://arxiv.org/html/2607.20476#S3.T1) 中列出的国际公认安全阈值作为真实基准锚点。

表 1:用作基准真实锚点的安全阈值。
### 3.2 A 类 — 多传感器联合评估(20 个场景)

20 个场景中,没有单个传感器超过其危险阈值,但多个传感器同时升高。对于涉及化学传感器(CO、CO2、VOC、PM2.5)的场景,使用 OSHA 加性暴露指数(公式1 (https://arxiv.org/html/2607.20476#S1.E1))建立真实基准,其中 Em > 1.0 表示具有类似生理效应的物质的综合暴露值得关注。所有化学传感器 A 类场景的 Em > 1.0 由构造保证。对于涉及混合传感器类型的场景,真实基准反映了既定的职业卫生实践,即多个环境压力因素同时升高至低于各自限值应采取预防措施,这符合 ACGIH 多压力因素指南 (ACGIH, 2024 (https://arxiv.org/html/2607.20476#bib.bib1))。

A 类中预期的模型行为是标记预防性关注并推荐通风或调查,而不是宣布环境绝对安全。主要结果指标是 Q2(危害分类)和 Q3(行动推荐)。A 类中的 Q1 作为健全性检查,确认单个传感器状态。

对 30 个随机抽样的 A 类响应(每个模型六个)进行手动抽查,确认评分器输出在所有情况下与人类判断一致。

### 3.3 B 类 — 比例性场景(20 个场景)

单个传感器以从 1%(CO = 70.7 ppm vs 70 ppm 阈值)到 400%(CO = 350 ppm)的幅度超过其阈值。测试推荐行为是否与超出严重程度成比例。Q1 是主要结果指标。

### 3.4 C 类 — 模式区分场景(20 个场景)

测试从传感器模式中正确识别危害类型,包括热而非火、PM2.5 而非火、CO 泄漏而非火、通风故障、结构危险以及全安全条件。

### 3.5 评分标准

每个场景三个独立问题:

Q1(阈值算术):每个传感器的测量值与其阈值进行比较。正确数值比较得 1.0 分,鹦鹉学舌式响应或数值上不正确的比较得 0.0 分。

Q2(危害分类):是否需要预防性行动?正确判定并附带传感器理由得 1.0 分,仅正确判定得 0.5 分,错误判定得 0.0 分。

Q3(行动推荐):根据七个语义行动类别(疏散、通风、应急服务、冷却环境、补充水分、无行动、报告设施)评分。得分等于所需类别出现的比例。

分析过程中发现并纠正了一个问题复述(question-echo)伪影;完整细节见附录A (https://arxiv.org/html/2607.20476#A1)。所有结果均使用修正后的评分器。

## 4. 实验设置

评估了五个模型:

- • ChatGPT-4o (OpenAI API, gpt-4o)
- • Gemini 2.5 Flash (Google API — Gemini 2.0 Flash 已在实验运行前被提供方淘汰)
- • DeepSeek (deepseek-chat)
- • Kimi (moonshot-v1-auto)
- • Llama 3.1 8B Instant (Groq API)

所有调用均使用 temperature=0.0, max_tokens=600。每个场景两种提示格式:C6(结构化表格,包含传感器、测量值、阈值和标准列)和 C7(纯文本描述,信息相同)。每个场景-模型-格式组合进行三次独立运行。总计:60 × 2 × 5 × 3 = 1,800 次 API 调用,零错误,运行时间 234.4 分钟。

在完整基准构建之前,进行了包含 8 个场景(B3–B10)的试点研究,作为单次运行的探索性分析,以验证评分标准并为类别设计提供信息。该试点研究未用于根据模型性能选择场景,从而防止数据泄漏到基准设计中。

## 5. 结果

### 5.1 Q1 阈值算术准确率

表2 (https://arxiv.org/html/2607.20476#S5.T2) 报告了按模型和类别划分的 Q1 准确率。图1 (https://arxiv.org/html/2607.20476#S5.F1) 可视化了类别级别的比较,图2 (https://arxiv.org/html/2607.20476#S5.F2) 总结了 A 类和 B 类表现之间的对比。

表 2:按模型和场景类别划分的 Q1 阈值算术准确率。对于 A 类,Q1 确认单个传感器状态(均低于单独限值)。A 类的主要结果是 Q2 和 Q3(表5 (https://arxiv.org/html/2607.20476#S5.T5) 和表6 (https://arxiv.org/html/2607.20476#S5.T6))。参见图注图 1:按场景类别和模型划分的 Q1 阈值算术准确率。在所有被测试模型中,A 类(多传感器联合评估)的得分明显低于 B 类(单传感器比例性)。参见图注图 2:所有被测试模型中 A 类(多传感器联合评估)与 B 类(单传感器比例性)Q1 得分的比较。所有五个模型的 A 类得分均显著低于 B 类。
### 5.2 A 类按场景详细结果

表3 (https://arxiv.org/html/2607.20476#S5.T3) 显示了所有五个模型在每个 A 类场景中的 Q1 得分。图3 (https://arxiv.org/html/2607.20476#S5.F3) 可视化了分布。

表 3:所有被测试模型在每个 A 类场景中的 Q1 得分。得分普遍较低,没有模型在任何单个场景上达到 0.833 以上,平均得分范围为 0.000 到 0.292。参见图注图 3:所有 20 个 A 类场景和五个被测试模型的 Q1 得分。矩阵中的低分表明 A 类表现一致低于 B 类,且跨场景和模型存在差异。
### 5.3 格式效应

表4 (https://arxiv.org/html/2607.20476#S5.T4) 和图4 (https://arxiv.org/html/2607.20476#S5.F4) 报告了结构化格式与纯文本格式对整体 Q1 的影响。

表 4:格式对整体 Q1 的影响。Wilcoxon 符号秩检验,双侧,N=60 对场景。Bonferroni 校正显著性阈值:p < 0.010。模型 | C6 结构化 | C7 文本描述 | Δ | p
ChatGPT-4o | 0.600 | 0.761 | -0.161 | 0.001*
Gemini 2.5 Flash | 0.617 | 0.617 | 0.000 | 1.000
DeepSeek | 0.728 | 0.700 | +0.028 | 0.559
Kimi | 0.756 | 0.672 | +0.084 | 0.064
Llama 3.1 8B | 0.739 | 0.633 | +0.106 | 0.106
* Bonferroni 校正后显著。参见图注图 4:格式效应:C6(结构化表格)与 C7(纯文本描述)对整体 Q1 的影响。ChatGPT-4o 在结构化格式下得分显著较低(p=0.001, d=-0.64)。Bonferroni 校正后,其他模型均未显示显著差异。
### 5.4 Q2 危害分类

表 5:Q2 危害分类准确率。由于评分标准严格(见第6节 (https://arxiv.org/html/2607.20476#S6)),得分为下界。
### 5.5 Q3 行动推荐

表6 (https://arxiv.org/html/2607.20476#S5.T6) 和图5 (https://arxiv.org/html/2607.20476#S5.F5) 报告了 Q3 得分。

表 6:按模型和类别划分的 Q3 行动推荐准确率。参见图注图 5:Q3 行动推荐质量与 CO 阈值超出幅度(B 类场景 B1p–B10p)。DeepSeek 和 Gemini 在超出范围内推荐了适当校准的行动。Kimi 和 Llama 在整个范围内得分接近底线。

## 6. 分析与讨论

参见图注图 6:跨 Q1 整体、B 类单传感器准确率、C 类模式区分、Q3 行动推荐和格式一致性的多维性能概况。DeepSeek 在 Q3 上领先;Gemini 和 DeepSeek 显示出更强的多维概况。图6 (https://arxiv.org/html/2607.20476#S6.F6) 总结了五个评估维度上的模型性能。

### 6.1 发现 1:被测试模型在多传感器升高场景中很少或根本不产生预防性信号

核心经验发现体现在表5 (https://arxiv.org/html/2607.20476#S5.T5) 和表6 (https://arxiv.org/html/2607.20476#S5.T6) 的 A 类结果中。在 20 个被测试的 A 类场景中,所有五个模型一致地将多传感器升高环境分类为安全(Q2: 0.000–0.208),并推荐无行动或不适当行动(Q3: 0.000–0.592)。此模式在所有被测试模型和两种提示格式中一致。

定性检查确认了该模式:在被测试的 A 类场景中,所有模型将每个传感器列举为“在安全范围内”,并得出结论认为环境是安全的。尽管多个传感器同时处于各自单独限值的 70-95%,且化学传感器场景中 OSHA 加性指数远高于 1.0,但在被测试模型中,预防性警告——建议通风、调查或监测升高的读数——很少或根本不存在。

与 B 类的对比非常显著。同样那些能正确识别 CO 在 85 ppm 超过 70 ppm 阈值的模型(B 类 Q1: 0.975–1.000),当 CO 为 56 ppm、CO2 为 1640 ppm、PM2.5 为 44 μg/m3、VOC 为 810 ppb 同时出现时,却没有产生任何预防性信号。这种能力差距是特定于多传感器环境的,而非一般性的阈值算术问题。

对实践者而言,直接的含义是:被测试模型在职业卫生标准通过综合暴露原则处理的条件下,无法可靠地标记预防性关注。如果安全监控系统依赖这些模型而未明确进行联合评估提示,则存在产生错误安全输出的风险。

相似文章

大型语言模型用于安全数据提取的基准测试

arXiv cs.CL

本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。