等离子体诊断模型中传感器鲁棒性的基准测试:基于TokaMark的系统评估

Hugging Face Daily Papers 论文

摘要

本文利用TokaMark数据集,首次对等离子体诊断机器学习模型进行了系统鲁棒性基准测试,评估了六种传感器故障场景下的架构性能,并引入了用于跨架构比较的鲁棒性分数。

托卡马克聚变装置的等离子体诊断模型几乎总是在干净、完整的传感器数据上进行评估。然而在实践中,聚变诊断经常出现故障:采集系统启动延迟、单个传感器失灵,且信号丢失恰好在等离子体破裂临近时集中发生。我们利用包含11,573次MAST放电的TokaMark数据集,首次对等离子体诊断机器学习进行了系统鲁棒性基准测试,评估了XGBoost、LSTM、Transformer以及TokaMark CNN基线在六种基于物理的故障场景和三种插补策略下的表现。我们引入了鲁棒性分数(RS)以实现标准化的跨架构比较。核心发现是:临近破裂的传感器故障(在最终窗口时间步注入噪声)会导致序列模型性能崩溃(LSTM的NRMSE增加+212%),而统计特征模型则相对稳定(XGBoost增加+37%)。前向填充插补几乎消除了序列模型因随机丢失引起的性能退化(LSTM从+57%降至约0%),但当窗口末尾被破坏时帮助甚微。使用地面真值破裂时间戳进行的逐次报警评估显示,在临近传感器故障下,LSTM报警检测崩溃至TPR=0.00,而均值填充插补则将其恢复至TPR=1.00,这一模式与NRMSE中观察到的结果相反。在所有架构中,等离子体电流被证明是最关键的诊断量(移除后性能下降+73%至+140%)。代码、数据和训练好的检查点请访问 https://github.com/Neerav-Gupta/tokamark-robustness。
查看原文
查看缓存全文

缓存时间: 2026/07/20 21:26

论文页面 - 等离子体诊断模型中的传感器鲁棒性基准测试:在TokaMark上的系统评估

来源:https://huggingface.co/papers/2607.11915

摘要

用于托卡马克聚变装置的等离子体诊断模型几乎普遍都是在干净、完整的传感器数据上进行评估的。然而在实际中,聚变诊断设备会频繁出现故障:采集系统启动延迟、个别传感器失效、信号丢失在等离子体破裂即将发生时尤为集中。我们首次提出了一个针对等离子体诊断机器学习的系统化鲁棒性基准测试,使用包含11,573次MAST放电的TokaMark数据集,评估了XGBoost、LSTM、Transformer以及TokaMark CNN基线模型在六种物理故障场景和三种插值策略下的表现。我们引入了标准化跨架构比较的鲁棒性分数(Robustness Score, RS)。我们的核心发现是:临近破裂时的传感器故障(在最终窗口时间步注入噪声)会严重破坏序列模型性能(LSTM的NRMSE增加212%),而统计特征模型则保持相对稳定(XGBoost增加37%)。对于序列模型,前向填充插值几乎消除了随机丢失导致的所有性能下降(LSTM从+57%降至约0%),但当窗口末端被损坏时则帮助甚微。基于真实破裂时间戳的放电级报警评估显示,在临近传感器故障下,LSTM报警检测的TPR降至0.00,而均值填充插值可将其恢复至TPR=1.00,这与NRMSE中观察到的模式完全相反。在所有架构中,等离子体电流被证明是最关键的单个诊断信号(移除后NRMSE增加73%至140%)。代码、数据和训练好的检查点可在 https://github.com/Neerav-Gupta/tokamark-robustness 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2607.11915) 查看 PDF (https://arxiv.org/pdf/2607.11915) GitHub3 (https://github.com/Neerav-Gupta/tokamark-robustness) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11915)

在你的 agent 中获取此论文:

hf papers read 2607.11915

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.11915 即可从此页面链接。

引用此论文的数据集 1

Neerav-Gupta/tokamark-robustness-data (https://huggingface.co/datasets/Neerav-Gupta/tokamark-robustness-data)

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.11915 即可从此页面链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

TS-Fault:针对结构性故障的时间序列预测器基准测试

arXiv cs.LG

本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。