等离子体诊断模型中传感器鲁棒性的基准测试:基于TokaMark的系统评估
摘要
本文利用TokaMark数据集,首次对等离子体诊断机器学习模型进行了系统鲁棒性基准测试,评估了六种传感器故障场景下的架构性能,并引入了用于跨架构比较的鲁棒性分数。
查看缓存全文
缓存时间: 2026/07/20 21:26
论文页面 - 等离子体诊断模型中的传感器鲁棒性基准测试:在TokaMark上的系统评估
来源:https://huggingface.co/papers/2607.11915
摘要
用于托卡马克聚变装置的等离子体诊断模型几乎普遍都是在干净、完整的传感器数据上进行评估的。然而在实际中,聚变诊断设备会频繁出现故障:采集系统启动延迟、个别传感器失效、信号丢失在等离子体破裂即将发生时尤为集中。我们首次提出了一个针对等离子体诊断机器学习的系统化鲁棒性基准测试,使用包含11,573次MAST放电的TokaMark数据集,评估了XGBoost、LSTM、Transformer以及TokaMark CNN基线模型在六种物理故障场景和三种插值策略下的表现。我们引入了标准化跨架构比较的鲁棒性分数(Robustness Score, RS)。我们的核心发现是:临近破裂时的传感器故障(在最终窗口时间步注入噪声)会严重破坏序列模型性能(LSTM的NRMSE增加212%),而统计特征模型则保持相对稳定(XGBoost增加37%)。对于序列模型,前向填充插值几乎消除了随机丢失导致的所有性能下降(LSTM从+57%降至约0%),但当窗口末端被损坏时则帮助甚微。基于真实破裂时间戳的放电级报警评估显示,在临近传感器故障下,LSTM报警检测的TPR降至0.00,而均值填充插值可将其恢复至TPR=1.00,这与NRMSE中观察到的模式完全相反。在所有架构中,等离子体电流被证明是最关键的单个诊断信号(移除后NRMSE增加73%至140%)。代码、数据和训练好的检查点可在 https://github.com/Neerav-Gupta/tokamark-robustness 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.11915) 查看 PDF (https://arxiv.org/pdf/2607.11915) GitHub3 (https://github.com/Neerav-Gupta/tokamark-robustness) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11915)
在你的 agent 中获取此论文:
hf papers read 2607.11915
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.11915 即可从此页面链接。
引用此论文的数据集 1
Neerav-Gupta/tokamark-robustness-data (https://huggingface.co/datasets/Neerav-Gupta/tokamark-robustness-data)
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.11915 即可从此页面链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
TS-Fault:针对结构性故障的时间序列预测器基准测试
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。
面向预测涡轮燃气温度退化的机器学习不确定性量化方法基准测试
本文对五种用于神经网络预测涡轮燃气温度的不确定性量化方法进行了基准测试,评估了它们在覆盖范围、宽度和稳定性方面的权衡,以指导发动机的预测与健康管理。
RobustMAD:评估多模态小语言模型在可部署异常检测助手中的实际鲁棒性
RobustMAD 引入了一个基准,用于评估多模态小语言模型在实际部署的工业异常检测助手中的鲁棒性。它揭示了关键的失败模式,并为下一代系统提供了指导。
基于多传感器物理危害评估的大语言模型基准测试
该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。