QANTIS:基于IBM Heron的硬件校准序列POMDP信念更新

arXiv cs.AI 论文

摘要

本文提出QANTIS方法,利用IBM Heron量子硬件对部分可观测马尔可夫决策过程(POMDP)执行校准信念更新,重点在于跨序列决策步骤复用量子信念更新原语而不破坏后验。作者通过Tiger POMDP上的受控案例研究验证了该方法,表明硬件后验与精确贝叶斯推断选出的动作相同。

arXiv:2607.06760v1 公告类型:新 摘要:部分可观测条件下的自主系统基于信念(而非原始传感器事件)行动。QANTIS将量子处理器视为该循环中的校准信念更新服务:它接收先验和观测模型,估计稀有事件证据项,并将普通后验返回给经典规划器。本文探讨该服务能否在现有IBM Heron硬件上跨序列Tiger POMDP时间步重复使用,而不破坏面向规划器的后验。我们通过受控硬件案例研究来回答,而非宣称端到端自主性或时钟速度提升。该研究比较了同一轨迹上的无放大、防护Grover放大和全步定点放大,然后检查返回的后验是否会改变下游动作。全步FPAA在报告的8步和12步主运行中保持Tiger后验不变,20步和32步控制也处于相同工作带内。在每次报告的决策检查中,硬件后验与精确贝叶斯后验选出相同的即时动作。边界感知BIQAE稳定了接近零和接近一的振幅估计,同时稀有事件扫描绘制了百万分之一证据的逻辑样本复杂度包络。结果是硬件校准信念更新原语的工作包络,而非独立的硬件优势声明。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:54

# QANTIS: 在 IBM Heron 上进行硬件校准的序贯 POMDP 信念更新

来源:https://arxiv.org/html/2607.06760
Suayb S. Arslan https://orcid.org/0000-0003-3779-0731
Özgür Nazlı https://orcid.org/0009-0009-0784-0823
Mustafa Serhat Demirgil https://orcid.org/0009-0006-4310-3546
Furkan Deligöz https://orcid.org/0009-0008-7277-8408

###### 摘要

部分可观测条件下的自主系统基于信念而非原始传感器事件行动。QANTIS 在该循环中将量子处理器视为一个经过校准的信念更新服务:它接收先验和观测模型,估计罕见事件的证据项,并向经典规划器返回一个普通的后验。本文探讨的是,在当前 IBM Heron 硬件上,该服务能否在序贯 Tiger POMDP 的整个时间范围内被重复使用,而不会破坏面向规划器的后验。我们通过一个受控的硬件案例研究来回答这个问题,而非提出端到端的自主性或时钟速度提升的声明。该研究比较了在同一轨迹上无放大、有保护的 Grover 放大以及全步骤定点放大,然后检查返回的后验是否会改变后续动作。全步骤 FPAA 在已报告的 8 步和 12 步主要运行中保持了 Tiger 后验,而 20 步和 32 步控制运行也保持在相同的工作带内。在每一个报告的决策检查点,硬件后验和精确贝叶斯后验都选择了相同的即时动作。边界感知的 BIQAE 在接近零和接近一的振幅处稳定了幅度估计,同时一个罕见事件扫描绘制了百万分之一证据的逻辑样本复杂度包络。结果是为一个硬件校准的信念更新原语提供了一个工作包络,而非一个独立的硬件优势声明。

## I 引言

部分可观测条件下的自主系统不直接对原始传感器事件采取行动。它们首先将每个带噪声的观测转化为后验信念,然后经典规划器才决定下一步做什么。困难的情况是罕见观测:证据项很小,经典采样可能变得昂贵,并且任何推理错误都会作为下一个先验向前传递。

本文研究一个狭窄的硬件问题:在当前 IBM Heron 硬件上,一个经过校准的量子信念更新原语能否在多个 POMDP 决策步骤中被重用,而不会损坏规划器接收到的后验?答案是一个受控的硬件案例研究。我们不声称实现了端到端的自主系统演示、时钟速度提升或经过验证的大状态自主栈。验证的对象更小且更易于审计:图 1 (https://arxiv.org/html/2607.06760#S1.F1) 中 QANTIS 推理核心返回的面向规划器的后验。

QANTIS 混合信念推理模块
构建信念预言机
放大证据
测量 (BIQAE)
经典更新
第一个事件输入信念
第一次更新...构建信念预言机
放大证据
测量 (BIQAE)
经典更新
后续事件当前信念
后续更新下一个信念当前信念
先验
最终信念
时间
量子操作
经典操作

图 1: 本文研究的 QANTIS 推理核心。量子振幅放大和边界感知的 BIQAE 取代了采样密集的证据更新;策略优化、跟踪和 MTDA 保留为经典上下文,而非经过硬件验证的声明。

表 I: QANTIS 信念更新服务的操作契约。本文评估此模块,而非其周围的整个自主栈。

| 阶段 | 本文检查的契约 |
|------|----------------|
| 输入 | 来自经典规划器的先验信念和观测模型 |
| 量子步骤 | 使用校准的放大和 BIQAE 估计罕见事件证据项 |
| 安全检查 | 将返回的后验与精确贝叶斯进行比较,并验证是否会选择相同的动作 |
| 输出 | 一个普通后验分布;下游规划保持经典且不在范围内 |

本文反复使用少量缩写:振幅放大 (AA) 提升罕见证据事件;定点 AA (FPAA) 使用较软的相位以避免过冲;BIQAE 估计所得振幅;POMDP 是经典的信念与行动模型。使用 AA 的原因很简单:在罕见事件机制中,它将推理侧的采样负担从逆证据采样转变为逆平方根证据采样[6 (https://arxiv.org/html/2607.06760#bib.bib5)]。系统风险也同样简单:信念跟踪器是序贯的,因此一个步骤的微小后验误差会成为下一个步骤的先验。因此,我们评估的是后验保真度、相同轨迹的放大控制、标准 Tiger 决策规则下的动作一致性以及资源核算,而非报告孤立的振幅增益。

表 II: 整个 arXiv 修订版中使用的声明层级。这将主要结果与控制实验和探索性扩展证据分开。

| 层级 | 本文使用的证据 |
|------|----------------|
| 主要声明 | Heron 上的序贯 Tiger POMDP 信念更新,带有后验 Hellinger 距离、匹配镜头控制和动作/价值检查。 |
| 支持性控制 | Heron R3 迁移、20 步和 32 步重复轨迹、缓解措施 A/B、边界感知 BIQAE 以及罕见事件逻辑放大。 |
| 探索性证据 | 4 态走廊和 UCGate/QSD 试点,描绘扩展路径,但未建立现实的自主系统就绪性。 |
| 范围外 | 壁钟量子加速、硬件上的完整策略优化以及用于下游 MTDA 的硬件优势。 |

表 II (https://arxiv.org/html/2607.06760#S1.T2) 是阅读本文其余部分的关键。主要结果是序贯二态 Tiger 案例研究。更长的视界、Heron R3 运行、罕见事件包络和扩展试点是支持性证据或工作边界探针。它们被包含进来,以便读者可以看到该模块今天在哪里工作,以及下一代硬件仍然在哪里是需要的。

作为背景,QANTIS v1[11 (https://arxiv.org/html/2607.06760#bib.bib1)] 验证了一个更广泛的平台,该平台围绕 IBM Heron 上的有保护单次迭代 Grover-AA Tiger 更新,在已报告的 8 步循环中最大 Hellinger 低于 0.015。本次修订特意更窄。它保持下游自主栈经典,通过测试全步骤 FPAA 移除跳跃保护,在接近零和接近一的振幅处校准 BIQAE 估计层,添加动作/价值和资源检查,并将更长的视界和更大的编码视为工作边界证据,而非独立的自主性声明。

##### 贡献

本文做出四项重点贡献。

1. 面向规划器的序贯推理。FPAA 在 8 步运行中保持 Tiger POMDP 后验的最大 Hellinger 为 0.009,在 12 步运行中为 0.021;修订后的分析还报告了动作一致性和价值损失。
2. 匹配的控制和资源核算。在同一轨迹上比较了无 AA、有保护的 Grover-AA 和全步骤 FPAA,并明确列出了发射预算、电路计数以及缺失的排队/执行时序字段。
3. 边界感知估计。校准后的 BIQAE 将相同后端匹兹堡的边界误差从振幅 0.01 处的 0.6317 降低到 0.00224,从振幅 0.95 处的 0.4890 降低到 0.00773。
4. 工作边界。Heron R3 迁移、20 步和 32 步控制、罕见事件逻辑放大以及 UCGate 试点将每步电路深度确定为当前的相干性约束。

##### 论文组织

第 II 节 (https://arxiv.org/html/2607.06760#S2) 定义了最简记号。第 III 节 (https://arxiv.org/html/2607.06760#S3) 包含序贯硬件研究、匹配控制和决策影响检查。第 IV 节 (https://arxiv.org/html/2607.06760#S4) 给出边界感知的 BIQAE 校准。第 V 节 (https://arxiv.org/html/2607.06760#S5) 收集了迁移、资源、缓解和扩展证据。第 VI 节 (https://arxiv.org/html/2607.06760#S6) 以自主系统解释结束。

##### 相关工作与定位

先前的工作建立了围绕这项研究的各个部分,但未闭合序贯硬件循环。量子 POMDP 和量子 MDP 理论阐明了规划前景[1 (https://arxiv.org/html/2607.06760#bib.bib12),9 (https://arxiv.org/html/2607.06760#bib.bib19),8 (https://arxiv.org/html/2607.06760#bib.bib143),14 (https://arxiv.org/html/2607.06760#bib.bib154)];QANTIS v1 将一个有保护的单次迭代信念更新放在了 IBM Heron 上[11 (https://arxiv.org/html/2607.06760#bib.bib1)];最近的分析在模拟或理想噪声模型中解释了多步振幅放大失真[34 (https://arxiv.org/html/2607.06760#bib.bib24),30 (https://arxiv.org/html/2607.06760#bib.bib26),20 (https://arxiv.org/html/2607.06760#bib.bib25)]。

估计和系统相关部分同样接近但不同于当前目标。BIQAE 和贝叶斯振幅估计提供了估计器[18 (https://arxiv.org/html/2607.06760#bib.bib20),25 (https://arxiv.org/html/2607.06760#bib.bib91)],而边界偏差在迭代 QAE 中是已知的[22 (https://arxiv.org/html/2607.06760#bib.bib28)],但没有针对重复信念更新的硬件校准层。下游分配工作[29 (https://arxiv.org/html/2607.06760#bib.bib23),13 (https://arxiv.org/html/2607.06760#bib.bib22),24 (https://arxiv.org/html/2607.06760#bib.bib27)]是架构上下文而非实证焦点。因此,差距是狭窄的:在硬件上进行序贯 POMDP 信念更新,并具有保持循环稳定所需的边界校准。

相对于这些线索,本次修订在一个硬件叙述中结合了五个部分:全步骤定点放大、边界感知估计、罕见事件工作包络、Heron R3 迁移检查以及返回后验的直接验证。QANTIS v1 提供了最接近的基线,但它使用了一个在信念已经集中时跳过放大的保护。本研究移除了该保护,然后添加了保持序贯循环对规划器可读所需的校准层。

## II 问题设置与最小背景

本节是读者的地图,而非推导。在操作上,QANTIS 推理模块接收先验信念和观测模型,执行一次校准的量子辅助更新,并将后验分布返回给经典决策栈。因此,我们仅介绍三个要素:定义服务契约的贝叶斯更新、在罕见事件情况下有所帮助的量子原语,以及保持在被验证硬件声明之外的下游分配上下文。完整的推导出现在 QANTIS v1[11 (https://arxiv.org/html/2607.06760#bib.bib1)] 中。

我们特意保持记号简洁。标准 POMDP 符号仅在需要时引入;读者可以将本文视为一个服务契约:输入先验,输入观测模型,输出后验。当实验提到 8、12、20 或 32 步时,该数字是决策视界,而非转移核参数。

### II-A 决策循环中的信念更新

POMDP 维持对隐藏状态的信念,并通过贝叶斯规则[15 (https://arxiv.org/html/2607.06760#bib.bib8)] 进行更新:预测下一个隐藏状态分布,用观测似然加权,并通过证据概率归一化。对于案例研究,这个普通的贝叶斯更新就是接口。量子子程序可能有助于估计罕见事件证据和产生的后验,但规划器仍然消耗一个经典概率分布。在线规划器如 pomcp 在证据罕见时会付出高昂代价,因为它们每个信念节点需要更多样本[28 (https://arxiv.org/html/2607.06760#bib.bib9)]。本文研究的问题是,当更新必须在决策视界内重复序贯执行时,同一个信念更新阶段是否可以由量子子程序支持。

### II-B 量子推理原语

核心量子原语是振幅放大。一个状态制备幺正将小的标记振幅放入事件子空间,Grover 风格的反射使用事件概率的近似逆平方根(而非直接采样所需的逆概率)来提升该事件[6 (https://arxiv.org/html/2607.06760#bib.bib5),23 (https://arxiv.org/html/2607.06760#bib.bib2)]。在本文中,标记事件不是任意隐藏状态;它是观测在当前信念模型下被接受的证据。因此,放大器直接作用于推理瓶颈。

可靠使用此原语需要一个振幅估计层。当目标振幅未知时,BIQAE[18 (https://arxiv.org/html/2607.06760#bib.bib20)] 维持一个关于振幅角度的贝叶斯后验,运行一个选定的 Grover 深度,观察成功或失败,并用相应的正弦似然重新加权后验。精确更新是标准的;这里的系统问题是它在硬件上何处失败。由于序贯信念循环反复访问接近零和接近一的振幅,估计器稳定性与放大本身同样重要。因此,第 IV 节 (https://arxiv.org/html/2607.06760#S4) 开发了硬件运行所使用的边界感知校准层。

### II-C 下游分配上下文

经过验证的推理核心位于关联和跟踪任务的上游。在单扫描情况下,多目标数据关联简化为一个标准的匈牙利分配问题,具有三次时间复杂度的经典求解器[16 (https://arxiv.org/html/2607.06760#bib.bib17),4 (https://arxiv.org/html/2607.06760#bib.bib15)];多扫描扩展是 NP 难的[26 (https://arxiv.org/html/2607.06760#bib.bib16)]。这个下游层不在本文范围内;QECS 相关的混合量子分配公式(退火[29 (https://arxiv.org/html/2607.06760#bib.bib23),13 (https://arxiv.org/html/2607.06760#bib.bib22)] 和门模型[24 (https://arxiv.org/html/2607.06760#bib.bib27),27 (https://arxiv.org/html/2607.06760#bib.bib21),12 (https://arxiv.org/html/2607.06760#bib.bib6)])位于经过验证的推理模块旁边,而非内部。

## III Heron 上的 QANTIS 信念更新服务

本节是核心硬件故事。QANTIS v1 已经表明,一个有保护的放大 Tiger 信念更新可以在 IBM Heron 上运行[11 (https://arxiv.org/html/2607.06760#bib.bib1)]。这里的问题更具操作性:量子步骤能否被视为一个可重用的服务,在每个监听更新时运行,向经典规划器返回一个后验,并在信念变得非常集中时保持稳定?

本节以结果优先的顺序组织。我们首先定义硬件后验的含义,因为那是产品接口。然后我们在相同的 Tiger 轨迹上比较无放大、有保护的 Grover-AA 和全步骤 FPAA。最后,我们提出面向规划器的问题:这些后验差异是否会改变即时的 Tiger 动作或价值?

### III-A 推理核心与误差模型

在 QANTIS v1 中,应用于 IBM Heron R2 上 Tiger POMDP 信念预言机的单次迭代 Grover-AA 更新在 ISA 15–18 处产生了 5.1 倍的放大,以及一个最大 Hellinger 低于 0.015 的 8 步闭环运行[11 (https://arxiv.org/html/2607.06760#bib.bib1)],使用自适应跳跃保护,仅在有益时应用放大。本节保持相同的 Tiger 单元结构和相同的 Heron 后端,但移除了该保护:在每个监听步骤都应用放大,这是估计层的边界驱动不稳定性在操作上变得可见的情况。

现有文献尚未回答这个实证问题。Zecchi 等人[34 (https://arxiv.org/html/2607.06760#bib.bib24)] 推导了失真

相似文章

基于混合态原型的量子增量学习

arXiv cs.AI

本文介绍了一种基于可训练混合态原型的量子增量学习框架,能够在无需增加电路宽度的前提下添加新类别,同时缓解灾难性遗忘。

信念记忆:部分可观测性下的智能体记忆

arXiv cs.AI

本文介绍了 BeliefMem,一种专为大语言模型(LLM)智能体设计的新型记忆范式。该范式通过存储带有概率的多个候选结论来处理部分可观测性问题,并减少自我强化错误。在 LoCoMo 和 ALFWorld 基准测试中的实证评估显示,该方法优于确定性基线模型。