Onnes:一种基于物理的多智能体LLM模拟器,用于量子计算基础设施的低温故障诊断

arXiv cs.AI 论文

摘要

介绍了Onnes,一种基于物理的多智能体LLM模拟器,用于量子计算基础设施的低温故障诊断。通过精心策划的少样本演示和自一致性投票,零样本LLM智能体面板实现了0.990的故障分类准确率,与监督式分类器相当,且无需参数更新。

arXiv:2607.05805v1 公告类型:新 摘要:稀释制冷机是超导量子计算机的关键基础设施,但其故障诊断仍主要依赖阈值报警——仅报告异常发生,而非具体问题。我们提出Onnes,一个基于物理的稀释制冷机数字孪生模拟器(包含正向物理模型和从真实制冷机中学习到的噪声指纹),驱动实时多智能体LLM运维层,并在低温故障诊断任务中对零样本LLM智能体面板与监督式ML分类器进行受控对比测试。该孪生系统结合了真实的稀释制冷平台、从真实BlueFors日志中学习的噪声-相关性指纹,以及六种基于物理的故障类别(其中三种设计为温度重叠但流量和压力不同)。在1000轮评估中,零样本面板在故障检测上与分类器无显著差异,但在分类上稍逊一筹,其错误集中在易混淆故障上。通过精心策划的对比性少样本演示和自一致性投票,分类准确率从0.685提升至0.990,与监督式分类器(0.985)持平,且无需参数更新,仅需六个标记演示;消融实验表明该增益几乎完全来自演示。在连续监控模式下(跨九个按种子注入故障的运行),智能体可在一次轮询间隔内捕获所有正在发展的故障,置信门控机制抑制了告警前虚警(其率依赖于后端)。作为初步的模拟到现实验证,仅基于真实BlueFoss遥测训练的分类器在实际硬件上的虚警率为6.4%,对注入到真实留出窗口的物理故障实现了100%召回率。所有数据均来自已发布的运行日志原文。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:38

# 基于物理的多智能体LLM模拟器用于量子计算基础设施低温故障诊断

来源:https://arxiv.org/html/2607.05805

Praneeth Narisetty, Uday Kumar Reddy Kattamanchi, Shiva Nagendra Babu Kore  
Onnes Research (https://onnes.ai/) | San Francisco, CA  
{praneeth, uday, shiva, research}@onnes.ai  

###### 摘要

稀释制冷机是超导量子计算机的关键基础设施,然而其故障诊断仍主要依赖阈值报警——它报告“有东西出问题了”,而不是“是什么出问题了”。我们提出**Onnes**,其核心成果是**无训练下的性能匹敌**:通过精心挑选的对比性少样本示范和自一致性投票,将零样本LLM智能体团队的低温故障分类准确率从0.685提升至0.990——与一个有监督分类器(0.985)相当,且无需参数更新,仅需六个标注示范;而一个仅使用真实BlueFors遥测数据训练的检测器,其真实硬件误报率为6.4%。Onnes是一个基于物理的数字孪生*模拟器*(一个前向物理模型,带有从真实制冷机学习到的噪声特征,而非硬件耦合的双向孪生),驱动着一个实时的多智能体大语言模型(LLM)运维层。借助它,我们进行了首次受控的正面比较:零样本LLM智能体团队与有监督机器学习(ML)分类器在真实诊断场景下的对比。该孪生模型结合了真实的稀释制冷级、从真实BlueFors日志中学习到的噪声与相关性特征,以及六个基于物理的故障类别,其中三个被故意设计为在温度上重叠,但在流量和压力上可区分。在1000轮评估中,零样本智能体团队在故障检测上与分类器无统计显著差异,但在分类上落后,其错误集中在设计上易混淆的故障上;上下文学习提升恰好填补了这些错误单元,消融实验表明这种提升几乎完全来自示范。当作为连续监测器运行,在9次故障×种子扫描中,智能体在一个轮询间隔内捕获了每一个正在发展的故障,而置信度门控抑制了发病前误报,我们发现其误报率与后端相关。作为首次模拟到现实的验证,我们将验证计划的初始阶段提前并执行:相同的检测器在真实保留窗口上对注入的物理故障达到100%召回率,因此其低误报率并非以漏报为代价。所有数据均直接来自已发布的运行日志。

**关键词:** 稀释制冷机,量子计算基础设施,数字孪生,LLM智能体,上下文学习,自一致性,故障诊断,标签效率,有监督机器学习,异常检测,仿真到现实迁移

## 引言

超导和自旋量子比特处理器在稀释制冷机的基础温度下运行,通常在混合腔(MXC)处为10–35 mK。这里影响故障诊断的现实因素有三方面:冷却过程耗时数天且成本高昂,因此停机代价巨大,制冷机健康状态始终处于实验关键路径上;硬件故障(泄漏、堵塞、失超)*罕见*且往往一次性发生,因此标注的故障事件非常稀缺;每台新制冷机投运时*没有*自身的故障历史。在实践中,监控仍然建立在阈值和变化率警报上,这些警报显示在仪表盘上:它们回答“某个通道是否超限?”,但无法回答“正在发展的是哪种物理故障,操作员应该怎么做?”缩小这一差距——在真实世界的标签稀缺条件下,将遥测数据转化为明确的诊断和建议操作——正是我们研究的问题。

我们认为这是LLM*智能体*的自然任务:输入是规模适中、异构、多通道的时间序列;输出是结构化的判断(检测/类别/严重程度/操作);推理过程受益于物理先验知识,这些知识可以通过提示告诉语言模型。但一个智能体只有在其性能通过真实数据上的强经典基线进行衡量时才可信。本文构建了该比较的双方,并诚实地报告结果,*包括智能体输掉的地方*。

(a)孪生 | (b)5角色智能体团队 | (c)有监督ML(300个标签)  
真实$T^2$级 + 指纹 | 故障热负载(6类) | 遥测窗口(一个种子)  
summarize_window | 种子指定  
Sentinel / Diagnostician / Operator / Guardian / Supervisor  
少量样本 + SC投票 | 120维特征 / RF / TabPFN  
类  
(d)评估:CP置信区间 + 配对McNemar检验(stats.py)  
(e)连续监测:滚动4小时窗口,30分钟轮询,置信度门控  

图1:端到端系统。孪生模型(a)从一个种子渲染一个遥测窗口;单个summarize_window将*相同*的窗口同时馈送给5角色智能体团队(b)和有监督ML路径(c)。由于两种方法看到的是相同的种子指定场景,正面比较使用精确的配对McNemar检验(d)。同一智能体团队作为连续监测器(e)运行,在固定轮询节奏下处理滚动窗口。紫色虚线:可选的少样本/自一致性杠杆(第7节)。

**贡献:**

1. **一个基于物理的孪生模型**(第3节),结合了真实的$T^2$稀释级、真实制冷机噪声与跨级相关性的特征,以及六个基于物理的故障类别,其中三个被设计为在温度上易混淆但可在流量/压力上区分,从而基准测试并非简单可解。
2. **一个实时的5智能体运维层**(第4节),以及在*相同*场景下与有监督ML对手进行的1000轮评估,得到诚实且不夸大的事实:零样本情况下,智能体在检测上*无显著差异*,在分类上*输掉*,差距可追溯到标签不对称(ML模型训练了300个标签;智能体完全没有)。  
3. **一个基于证据的干预**(第7节):受2025–2026年上下文学习结果启发,我们添加了对比性少样本示范和自一致性投票,并*有意避免*了争论和自我改进——近期研究表明这两种方法被计算成本所主导。在受控比较中,增强后的智能体团队填补了整个分类差距。我们并不声称这些ICL机制是新颖的——对比性少样本和自一致性是成熟技术。贡献在于它们对物理约束诊断任务的严格应用:基于*先验*热简并性(第7节)精心挑选的示范、隔离出哪个杠杆是关键的消融实验,以及基于2026年证据而非惯性得出的否定性结果方法(避免争论/自我改进)。
4. **一项连续监测研究**(第8节):一次不间断的24小时运行,智能体在氦气泄漏开始后29.5分钟检测到其发展。
5. **完全可复现性**(第10节):每一张图和每一个数字均由已发布运行产物生成,没有手工创作的内容。

**结论:** 在物理上易混淆的低温故障上,零样本智能体在检测上匹配有监督ML,一旦加入精心挑选的对比性少样本示范和自一致性投票,便在不更新参数且仅用六个标注示例的情况下填补了整个分类差距;消融实验表明,多智能体结构带来的是*可审计的安全性*(一个可分离的Guardian否决权和每次操作的动作轨迹),而非额外的准确性。除了具体结果,该孪生模型及其种子指定的测试框架是一个可复用的、受物理约束的基准,用于评估LLM智能体在多通道仪器遥测上的诊断推理能力。

## 相关工作

**低温监测:** 当前设施规模的制冷机监测基于阈值和延迟警报(Grafana/Slack风格)。机器学习故障检测已在邻近的大型低温与超导系统中得到展示:使用LSTM网络监测LHC超导磁体[10],CERN低温控制系统中的模型学习异常检测[11],大规模低温工厂的异常检测与维护优化[12],以及Jefferson实验室的SRF腔体故障分类[13]。在干式稀释制冷机中,mK温度下的振动监测等互补感知模式也正在兴起[23]。Onnes在真实稀释制冷机遥测之上增加了一个诊断*和*推荐动作层,并将其与LLM推理智能体而非固定ML模型配对。

**量子计算的低温基础设施:** 稀释制冷机是超导和自旋量子比特的关键平台,其混合腔微瓦级冷却预算是对规模化首要约束。近期工作综述了可扩展超导量子计算的关键技术[17],展示了在单台制冷机内包含超过500个超导量子比特的晶圆级封装[18],并在mK温度下运行了数字控制的硅自旋量子比特处理器[21]。一个主要方向是将控制和读出移至低温环境,包括低温CMOS和混合光子/CMOS控制器架构[20],以及容错机器的低温电子学资源估算[19],所有这些都在冷却最稀缺的地方增加了热负载。量子*光子*技术的低温系统面临类似的约束[22]。这些工作激励了一个运维层来保持这些负载日益增加的制冷机健康。在智能体方面,LLM已开始自主控制科学仪器[24],这正是我们的运维层为低温遥测带来的能力。

**上下文学习(ICL):** 少样本提示是分类的标准杠杆,但其行为很微妙。多样本ICL在某些任务上可缩放至数百个示例,然而2026年的工作表明,已建立的多样本规则*在推理任务上失效*[1],仅提示LLM“对序列进行推理”在时间序列场景中收效甚微[2]。真正起作用的*示例*及其选择。因此我们使用*精心挑选的*对比示范,而非多样本倾倒。

**自一致性 vs. 自我改进:** 自一致性——对求解器采样$N$次并采用多数投票[3]——是一种廉价、可靠的分类杠杆。最近的受控研究报告其是准确性-成本最优操作点,而迭代自我改进可能*降低*准确性(例如一项2026年研究中降低-4.6至-9.1个百分点,而自一致性提升+2.2个百分点)[4,5]。我们采用自一致性并避免自我改进循环。

**多智能体争论:** 争论框架报告了推理增益,但2026年的分析认为,在控制调用预算后,多智能体优势很大程度上是测试时计算成本增加的假象,而非协调带来的[6]。相关工作还记录了智能体链中的信念不稳定性和错误传播失败模式[7]。我们保持固定的可审计流水线,仅添加有强成本控制证据的机制。

**LLM智能体用于故障诊断:** 2025年快速增长文献将LLM和LLM智能体方法应用于工业旋转机械、暖通空调与建筑系统、电网以及卫星/航天遥感的故障诊断与预测维护,LLM也开始直接驱动科学仪器[24]。Onnes在两个大多数工作未涉及的维度上有所不同。首先,它是*基于物理的*:故障由带有真实制冷机噪声特征的稀释冷却前向模型生成,而非对无约束日志进行模式匹配,因此易混淆类别是由于原则性的物理原因而非偶然。其次,它针对*量子计算低温基础设施*——一个具有微瓦冷却预算、mK工作点和安全互锁(绝不能使磁体失超)的领域,一般工业预测维护并未建模。据我们所知,这是稀释制冷机故障诊断领域首个受控的智能体与有监督方法的正面比较。

**表格基础模型:** 在小型表格问题上,TabPFN及其后继者已将前沿从梯度提升树转向上下文转换器[8],尽管梯度提升在企业规模表格上仍极具竞争力[9]。我们使用随机森林作为主要的、完全可复现的对手,并在第9节讨论更强的表格模型。

## 数字孪生:Onnes

孪生模型输出经过验证的BlueFors/FRTMS遥测模式(五个级温度:50K、4K、Still、冷板、MXC;磁体通道;流量;压力$p_1$–$p_6$),因此它可无缝接入智能体和ML流水线(端到端流程,包括允许配对McNemar检验的种子指定配对,如图1所示;孪生模型、智能体团队和评估过程见算法1–3)。它由三个真实成分构建(图2)。

```
cryo_engine.simulate (现实路径)
    真实T^2稀释级 (已验证冷却定律)
    BlueFors指纹 (噪声 + 级间相关)
    基于物理的故障热负载
    传感器缺陷 (噪声、丢失、饱和)
    ↓
    FRTMS遥测窗口 (temp1–7, flow, p1–p6)
```

图2:孪生模型数据流。物理设置平均轨迹;从真实BlueFors日志学习到的指纹提供波动和跨级相关;故障是热负载扰动;传感器缺陷最后叠加。

**物理平均值:** 级温度遵循$T^2$稀释冷却级。对于混合腔热负载$\dot{Q}$,稀释单元的冷却平衡给出基础温度
$$T_{\mathrm{MXC}}(\dot{Q}) = \sqrt{\dot{Q} / \left[ \dot{n}_3 (95 - 11 f^2) \right]},$$
其中$\dot{n}_3$是$^3$He循环速率,$f$是浓度因子;冷板遵循类似的$T_{\mathrm{CP}} = 0.1 \sqrt{\dot{Q} / \dot{Q}_{100}}$,锚定到LD400在100 mK的指标。关键的是,冷却能力随着$T \to 0$而消失,因此存在真实的基础温度下限(与线性模型不同);上级(50K、4K)由脉冲管近乎固定。常数经过调谐,使得无负载的MXC大约在12 mK,与真实BlueFors基础状态一致。

相似文章

评估开源大语言模型在自主代号游戏模拟中的表现

Reddit r/AI_Agents

一位开发者构建了一个代号游戏模拟平台,用于评估开源大语言模型在长程协作中的表现。结果显示,DeepSeek v4 Flash 在游戏逻辑对齐方面表现优异,胜出其他模型;而 Qwen 3 Next 和 GPT 5.4 Nano 则在规则约束和视角转换方面存在困难。

QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架

Papers with Code Trending

QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。