QFoldAgent:一种用于蛋白质结构预测的自主量子优化多智能体系统
摘要
QFoldAgent是一个闭环多智能体框架,用于量子经典蛋白质结构预测,通过VQE和反馈迭代优化哈密顿量惩罚项,在5残基片段上实现了改进的RMSD和结构有效性。
arXiv:2607.22549v1 Announce Type: new
Abstract: 混合量子经典蛋白质结构预测强烈依赖于哈密顿量惩罚权重,然而现有的基于晶格的工作流通常手动固定这些系数,并且仅在模拟中评估非常短的片段。我们提出QFoldAgent,一个用于5残基四面体晶格折叠的闭环多智能体框架,其中设计智能体提出序列条件惩罚,基于VQE的量子经典流水线在Qiskit Aer噪声下优化得到的哈密顿量,反馈智能体使用能量景观诊断和MolProbity验证信号来跨轮次改进惩罚。真实指标如RMSD从不暴露给智能体,仅用于评估。我们在两个互补数据集上研究该框架:55个来自QDockBank的具有已知结构的片段和100个覆盖度优化的未见序列。在QDockBank基准上,QFoldAgent将中位RMSD从3.64 \AA{} 降低到3.20 \AA{},在最难的目标上获得最大收益。在未见序列上,闭环将结构有效性从87.5%提高到98.7%,恢复了87%的初始无效案例,最强控制器在87%的序列上改善了第3轮能量,同时保持了96%的Ramachandran偏好几何构型。这些结果表明,迭代智能体控制可以系统性地改善优化行为并减少5残基量子设置中的失败案例。
查看缓存全文
缓存时间: 2026/07/28 06:23
# QFoldAgent:用于蛋白质结构预测的自主量子优化多智能体系统
来源:https://arxiv.org/html/2607.22549
###### 摘要
混合量子-经典蛋白质结构预测强烈依赖于哈密顿量惩罚权重,然而现有的基于格点的工作流程通常手动固定这些系数,并且仅在模拟中评估非常短的片段。我们提出 QFoldAgent,一个用于 5 残基四面体格点折叠的闭环多智能体框架,其中设计智能体提出序列条件惩罚,基于 VQE 的量子-经典流水线在 Qiskit Aer 噪声下优化所得哈密顿量,反馈智能体利用能量景观诊断和 MolProbity 验证信号来跨周期细化惩罚。真实度量标准(如 RMSD)从未暴露给智能体,仅用于评估。我们在两个互补数据集上研究该框架:55 个从 QDockBank 衍生且结构已知的片段,以及 100 个覆盖优化的未知序列。在 QDockBank 基准测试上,QFoldAgent 将中位 RMSD 从 3.64 Å 降低至 3.20 Å,在最困难的目标上增益最大。在未知序列上,闭环将结构有效性从 87.5% 提升至 98.7%,恢复了 87% 最初无效的案例,最强控制器在 87% 的序列上改善了周期 3 的能量,同时保持了 >96% 的拉马钱德兰偏好构象。这些结果表明,在 5 残基量子设置中,迭代智能体控制可以系统地改善优化行为并减少失败案例。
## I. 引言
蛋白质结构预测仍然是计算生物学的核心问题,因为分子结构强烈影响生化功能、分子间结合以及下游治疗设计。最近的深度学习系统显著推动了该领域的发展,AlphaFold 3[1 (https://arxiv.org/html/2607.22549#bib.bib1)] 将预测范围从单一蛋白质链扩展到包含蛋白质、核酸、配体、离子和修饰残基的复合物。然而,重要的挑战依然存在,尤其是在涉及柔性片段、模糊的局部几何结构、竞争性低能构象以及结构受限功能区域的工作[24 (https://arxiv.org/html/2607.22549#bib.bib25),18 (https://arxiv.org/html/2607.22549#bib.bib26)]中。最近的 CASP16[33 (https://arxiv.org/html/2607.22549#bib.bib9)] 评估进一步表明,复杂结构预测仍未解决,模型排名和化学计量预测仍然是主要瓶颈。在许多情况下,这些残余的困难不仅是预测问题,而且是在强结构约束下的搜索问题。对于量子计算,这些具有挑战性的案例可以被视为离散结构变量上的约束优化问题[22 (https://arxiv.org/html/2607.22549#bib.bib2)]。与其将结构预测仅仅视为端到端的模式识别任务,选定的子问题可以通过哈密顿量来表述,该哈密顿量作为一个基于能量的目标函数,根据候选构象满足编码的结构和物理约束的程度来评估它。这种视角在生物结构预测和量子优化之间架起了一座桥梁,使得选定的蛋白质建模任务适用于变分和混合量子-经典求解器。在这种设置中,目标不仅是搜索候选构象,还要构建一个其低能状态与结构上有意义的解相一致的目标函数。
参考图注
图1:基于 LLM 的平均 RMSD 与非智能体 QDockBank 基线(虚线,3.53 Å)在 55 个蛋白质上的对比。所有三个 LLM 在两种噪声条件下都产生更差的 RMSD,表明仅凭 LLM 惩罚选择无法超越非智能体基线。
在实践中,量子蛋白质优化的有效性关键取决于哈密顿量惩罚权重如何选择。这种调整通常是手动且迭代的,在量子蛋白质结构流水线中造成了一个主要瓶颈。这个瓶颈激发了一种智能体视角。关于生物大型语言模型(LLM)智能体的近期工作描述了从被动预测模型向能够规划、使用工具、解释中间输出并在多步骤科学工作流程中改进决策的系统的转变[6 (https://arxiv.org/html/2607.22549#bib.bib10),20 (https://arxiv.org/html/2607.22549#bib.bib11)]。然而,当前的智能体系统更多地用于工作流程协调或算法支持,而不是直接重新表述优化问题的数学目标。在这种设置中,基于 LLM 的方法仍然有限,并且没有迭代智能体控制就无法有效解决任务。如图1 (https://arxiv.org/html/2607.22549#S1.F1) 所示,我们评估了三个 LLM:Qwen3.5[21 (https://arxiv.org/html/2607.22549#bib.bib22)]、GPT-4o[15 (https://arxiv.org/html/2607.22549#bib.bib24)] 和 GPT-5.2[14 (https://arxiv.org/html/2607.22549#bib.bib23)] 用于哈密顿量惩罚预测,并针对 QDockBank[34 (https://arxiv.org/html/2607.22549#bib.bib5)] 对其性能进行基准测试。结果表明,基于 LLM 的方法表现不如 QDockBank,显示出更高的平均 RMSD[13 (https://arxiv.org/html/2607.22549#bib.bib29)]。这表明当前基于 LLM 的方法无法超越 QDockBank 中使用的手动优化方法。为了解决这一差距,我们引入了 QFoldAgent,一个用于量子蛋白质结构预测的闭环多智能体框架,以实现自适应的哈密顿量细化。QFoldAgent 并未将哈密顿量惩罚权重视为固定的专家定义选择,而是使用反馈引导的细化循环:设计智能体提出序列条件惩罚,变分量子本征求解器(VQE)[26 (https://arxiv.org/html/2607.22549#bib.bib30)] 优化器执行生成的哈密顿量,反馈智能体分析优化轨迹和结构验证信号,以便为下一个周期细化惩罚。该智能体作为一个控制层,利用迭代反馈来塑造优化公式并使哈密顿量适应每个序列。
本文做出三个贡献。首先,我们引入了 QFoldAgent,一个闭环多智能体框架,通过连接序列条件惩罚设计、VQE 执行、结构重建和跨周期反馈驱动细化,将量子蛋白质结构预测中的哈密顿量惩罚调整视为一个自适应控制问题。其次,我们为此问题建立了一个评估套件设置,使用 55 个从 QDockBank 衍生且具有真实结构的片段和 100 个覆盖优化的未知序列,并在两种 Qiskit Aer 噪声预设下进行测试。第三,我们提供了基于经验和消融的证据,表明迭代智能体控制能够跨周期改善惩罚细化,或独立于基于 LLM 的惩罚选择,同时在优化过程中不向智能体暴露真实结构度量标准。
## II. 相关工作
近期在智能体 AI 方面的进展表明,自主系统非常适合需要迭代推理、工具调用、执行和验证的科学工作流程。先前的研究识别出一种反复出现的架构模式,其中高层规划与执行分离,并与修订前的显式评估或反思相结合[30 (https://arxiv.org/html/2607.22549#bib.bib16)]。这一原则也反映在近期的科学智能体框架中。MCP-SIM 采用一种包含规划、行动、反思和修订的自校正循环用于物理模拟,而 VeriMAP 则将任务分解与多智能体设置中用于迭代细化的显式验证函数相结合[16 (https://arxiv.org/html/2607.22549#bib.bib17),31 (https://arxiv.org/html/2607.22549#bib.bib18)]。这些工作将智能体定位为结构化技术流水线的控制器,而非一次性文本生成器。这种视角与量子计算相关,因为量子计算的工作流程在数学上是结构化的,依赖于工具,并且难以端到端自动化。最近的研究报告称,AI 和智能体方法在量子堆栈中的使用日益增长,包括软件支持、校准、控制和系统操作[3 (https://arxiv.org/html/2607.22549#bib.bib12),25 (https://arxiv.org/html/2607.22549#bib.bib13)]。在这一更广泛的趋势中,LLM 已被探索用于电路生成和量子编程辅助等任务[9 (https://arxiv.org/html/2607.22549#bib.bib14)]。这些系统提高了可访问性并支持自动化,但其作用通常限于编码、解释或局部决策支持。更具体地在量子蛋白质折叠领域,先前的工作主要集中于编码策略和求解器设计,包括用于格点蛋白质构象的量子退火[17 (https://arxiv.org/html/2607.22549#bib.bib6)]、资源高效的量子门模型编码[22 (https://arxiv.org/html/2607.22549#bib.bib2)]、用于格点折叠的约束感知 QAOA 风格拟设[8 (https://arxiv.org/html/2607.22549#bib.bib3)],以及近期在量子计算机上的肽折叠研究[4 (https://arxiv.org/html/2607.22549#bib.bib4)]。这条工作线强调用于量子或混合蛋白质折叠公式的编码选择和求解器构建,而在优化过程中对哈密顿量参数化的迭代外部控制作用探索较少。
然而,当前量子计算中的 LLM 支持仍然受限。Quantum-Audit 表明,量子计算对于语言模型而言是一个具有挑战性的领域,因为它结合了抽象数学、非直观的物理原理和快速演变的术语;即使是强大的模型在专家编写的复杂任务上也会表现出显著的失败模式[2 (https://arxiv.org/html/2607.22549#bib.bib15)]。更重要的是,现有的大多数基于 LLM 的量子系统仍然以算法为中心:它们在预定义的工作流程内提供辅助,而不是调整支配优化本身的数学目标[3 (https://arxiv.org/html/2607.22549#bib.bib12),9 (https://arxiv.org/html/2607.22549#bib.bib14)]。QFoldAgent 针对的是这种探索较少的设置。与智能体系统[16 (https://arxiv.org/html/2607.22549#bib.bib17),31 (https://arxiv.org/html/2607.22549#bib.bib18)]中常见的规划器-执行器-验证器结构一致,我们的框架将智能体直接嵌入到优化循环中。其作用不仅仅是辅助量子编程或编排一组固定的工具序列,而是基于量子-经典流水线的反馈,迭代地细化用于蛋白质结构预测的哈密顿量。因此,其贡献不仅仅是在量子计算中使用 LLM,而是一种用于反复重述应用目标本身的智能体机制,重点在于工作流程的适应性,而非声称新的量子优势结果。
## III. 背景
蛋白质结构预测旨在确定氨基酸序列所采用的三维结构,因为结构强烈影响蛋白质功能。从计算角度来看,这个问题的难度在于可能构象的数量随序列长度迅速增长,而现实的建模必须强制执行空间约束、几何约束和相互作用约束。因此,当前的量子方法侧重于简化设置,例如短片段、局部基序、结合口袋或粗粒化表示,在这些设置中,构象选择可以在有限的离散搜索空间内表达,同时保留关键的物理约束。候选构象被编码为二进制或类自旋变量,并构建一个哈密顿量,使得低能状态对应合理结构。因此,工作流程的成功在很大程度上取决于生物问题如何被映射到量子可优化的目标。
参考图注
图2:传统的 Hamiltonian 细化人工在环工作流程。领域专家手动定义哈密顿量和实验设置,然后检查预测结构和验证指标,再修订公式以进行下一次迭代。由于每一轮都依赖于实验结果和专家评审,该过程缓慢且劳动密集。
用于蛋白质结构预测的常规量子工作流程首先将生物任务缩小为适合量子处理的子问题,因为当前硬件更适合局部或粗粒化公式,而非生物尺度上的全原子折叠[22 (https://arxiv.org/html/2607.22549#bib.bib2),7 (https://arxiv.org/html/2607.22549#bib.bib21)]。该工作流程通常包括选择目标片段或基序、定义离散结构表示、编码几何和物理约束、构建哈密顿量、将其映射为量子兼容形式、运行诸如 VQE 或量子退火等求解器,以及解码和验证所得结构。图2 (https://arxiv.org/html/2607.22549#S3.F2) 总结了这一常规循环。在实践中,人类专家在量子优化前后做出大多数关键公式决策。在此过程中,哈密顿量设计是核心专家任务。哈密顿量作为编码结构问题的目标函数,因此其项必须捕捉区分有效构象和无效构象的约束[22 (https://arxiv.org/html/2607.22549#bib.bib2)]。这需要决定包含哪些约束,如何编码它们,以及如何设置平衡结构现实性与可处理优化的惩罚系数。先前的量子蛋白质研究表明,这些选择强烈影响求解器能够恢复的结构[17 (https://arxiv.org/html/2607.22549#bib.bib6),22 (https://arxiv.org/html/2607.22549#bib.bib2),10 (https://arxiv.org/html/2607.22549#bib.bib19),32 (https://arxiv.org/html/2607.22549#bib.bib27)]。在当前实践中,这些决策通常通过领域知识和重复的经验测试手动做出。这个手动公式步骤很困难,因为约束定义或惩罚权重的微小变化都可能重塑能量景观,影响可行性、收敛性和解码结构质量。弱惩罚可能允许无效构象,而过强的惩罚可能过度限制搜索并阻碍优化[7 (https://arxiv.org/html/2607.22549#bib.bib21)]。因此,常规工作流程是迭代且由专家驱动的:研究人员检查输出,修改哈密顿量,重新运行优化,并重复直到公式表现可接受。
在这种设置中,AI 智能体可以作为控制层引入到周围经典工作流程中。近期工作表明,AI 越来越多地用于量子计算的预处理、控制、优化和后处理,使得混合经典-AI-量子流水线成为复杂技术任务的合理方向[3 (https://arxiv.org/html/2607.22549#bib.bib12)]。我们的设置建立在这一趋势之上,将 AI 置于公式循环内部,使其能够协助将生物问题映射为量子目标,并在迭代周期中细化该目标。
## IV. 方法
我们实现了一个包含五个阶段的闭环流水线(图3 (https://arxiv.org/html/2607.22549#S4.F3))。在阶段 1 中,一个*设计智能体*使用成分分析、基序检测、灵活性评分和 Miyazawa–Jernigan (MJ) 相互作用统计对输入氨基酸序列进行分析,然后提议初始哈密顿量惩罚权重 (λchiral\lambda_{\text{chiral}}相似文章
结构蛋白质组学引导的共折叠模型
介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。
VFEAgent: 一种用于端到端自动化有限元分析的多模态智能体框架
本文提出了VFEAgent,一种通过将视觉语言模型与验证优先的代码合成框架相结合来自动化有限元分析的多智能体系统,实现了从图像和问题描述到端到端模拟。
MALOQ: 用于量子输运的算符大规模加速学习
MALOQ 引入了一种大规模加速的机器学习模型,用于预测密度泛函理论的哈密顿矩阵/密度矩阵,利用 SO(2) 等变骨干网络和可扩展的图分布,支持对多达10万个原子的系统进行电子结构计算,在 Alps 超级计算机上实现了超过30%的每轮训练时间减少。
QuantFPFlow:连续强化学习中的Fokker-Planck策略优化的量子振幅估计
介绍QuantFPFlow,一种强化学习框架,利用量子振幅估计在连续控制的Fokker-Planck配分函数估计中实现二次加速,从而改善探索并避免局部最优。
一种多AI智能体框架实现固体力学问题的端到端有限元分析
本文提出了AbaqusAgent,一个利用大语言模型实现固体力学有限元分析自动化的多智能体框架。在50个问题上实现了86%的成功率,降低了入门级用户的使用门槛,实现了人机仿真交互。