ProtStructQA:蛋白质结构推理中的指称阈值

arXiv cs.CL 论文

摘要

ProtStructQA 引入了一个可执行的蛋白质结构问答基准,该基准将自然语言查询编译为类型化的 DSL 程序,以评估 LLM 在精确 3D 测量上的能力,揭示了一个依赖于能力的指称阈值:当模型规模超过一定大小时,思维链变得非常有益。

arXiv:2606.00451v1 公告类型:新 摘要:蛋白质语言系统通常根据其是否能生成合理的生物学文本来评估,但结构问题具有更精确的语义:它表示三维坐标系中的一个测量值。我们提出了 ProtStructQA,一个可执行的蛋白质结构问答基准,其中每个自然语言问题都是从隐藏的类型化领域特定语言(DSL)程序生成的,答案通过在该程序对 AlphaFold 预测的结构上执行而获得。ProtStructQA 发布了 382.2K 个问题,涵盖置信度、距离、预测对齐误差(PAE)、溶剂暴露、二级结构、拓扑和接触,以及留出组合:一个包含来自四个物种的 10K 个蛋白质的 330K 有效基准,加上一个 52.2K 的硬负例鲁棒性池。无需微调,我们评估了 Qwen3 模型(从 0.6B 到 8B)在直接提示、思维链、语法约束的可执行投票、带思维链的可执行投票以及多轮 ReAct 式工具使用下的表现,并在 Gemma-3-1B 和 Gemma-3-12B 上复现了主要发现。我们发现在 Qwen3-1.7B 和 Qwen3-4B 之间存在一个依赖于能力的指称阈值:低于该阈值时,工具介导的 ReAct 占主导地位,因为模型通常无法产生可执行的指称;高于该阈值时,思维链从大多有害转变为非常有益,并在大多数子集上成为最强策略。解析失败和家族级分析表明,该阈值是从不可解析语言到可执行结构指称的转变,而语法和执行对于 PAE 和二级结构查询仍具有选择性价值。ProtStructQA 将科学问答重新定义为从语言到测量的编译,并为语言模型何时能够将词语映射到可执行的 3D 结构测量提供了一个诊断测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

# ProtStructQA:蛋白质结构推理中的指称阈值

来源:https://arxiv.org/html/2606.00451

Aravind Mandiga, Guoming Li, Jin Lu, Ismailcem Budak Arpinar, Khaled Rasheed, Samuel E. Aggrey

佐治亚大学

{aravind.mandiga, gmli, jin.lu, budak, khaled, saggrey}@uga.edu

###### 摘要

蛋白质语言系统通常根据其生成合理生物学文本来评估,但结构问题具有更精确的语义:它表示3D坐标系中的测量值。我们提出**ProtStructQA**,一个可执行的蛋白质结构问答基准,其中每个自然语言问题都由一个隐藏的类型化领域特定语言(DSL)程序生成,答案则通过在该程序上对AlphaFold预测结构执行获得。ProtStructQA发布了382,200个问题,涵盖置信度、距离、预测对齐误差(PAE)、溶剂暴露、二级结构、拓扑和接触,以及保留的组合:一个330,000个问题的活跃基准,覆盖来自四个物种的10,000个蛋白质,加上一个52,200个问题的困难负样本鲁棒性池。无需微调,我们在0.6B到8B参数规模的Qwen3模型上评估了直接提示、链式思考、语法约束的可执行投票、带链式思考的可执行投票以及多轮ReAct式工具使用,并在Gemma-3-1B和Gemma-3-12B上复制了主要发现。我们发现了能力依赖的**指称阈值**,位于Qwen3-1.7B和Qwen3-4B之间:低于阈值时,工具介导的ReAct占主导,因为模型往往无法生成可执行的指称;高于阈值时,链式思考从大部分有害转变为强烈有益,并成为大多数划分上最强的策略。解析失败和家族级分析表明,该阈值是从不可解析语言到可执行结构指称的转变,而语法和执行仅在PAE和二级结构查询上仍具有选择性价值。ProtStructQA将科学问答重新定义为从语言到测量的编译过程,并为语言模型何时能将词语映射为可执行的3D结构测量提供了诊断测试平台。

**ProtStructQA:蛋白质结构推理中的指称阈值**

Aravind Mandiga, Guoming Li, Jin Lu, Ismailcem Budak Arpinar, Khaled Rasheed, Samuel E. Aggrey

佐治亚大学

{aravind.mandiga, gmli, jin.lu, budak, khaled, saggrey}@uga.edu

![参考标题](https://arxiv.org/html/2606.00451/extracted/6302861/figures/pipeline_v2.png)

图1: 两个ProtStructQA示例。每个面板:一个AlphaFold预测的蛋白质、自然语言问题、隐藏的DSL程序和黄金答案(执行获得)。

## 1 引言

AlphaFold(Jumper等,2021)和AlphaFold蛋白质结构数据库(AFDB)(Varadi等,2022;Bertoni等,2026)改变了结构生物学的瓶颈。对于大部分已收录的蛋白质,现在可以获得预测的3D结构,AFDB提供了超过2亿个预测结构的开放访问。剩余的挑战不仅是获得结构,还要对它们提出精确的问题:哪个区域置信度低、两个残基相距多远、某个窗口是否同时具有高置信度和丰富接触、或者两个结构域是否具有高预测对齐误差。这些不仅仅是文本问题,它们是对分子对象的测量。这在评估大型语言模型(LLM)时产生了不匹配。如果模型被问:“在AlphaFold结构中,残基207和220的α-碳相距多少埃?”仅回答流利是不够的;只有当答案匹配从预测坐标计算出的值时才正确。字符串重叠度量和LLM裁判可以评估回答是否类似于参考,但它们本身不能验证数字、残基集合、区域或结构标签是否从蛋白质结构派生而来。我们将蛋白质结构问答视为**指称语义**:一个自然语言问题对应一个隐藏的类型化程序,其含义是通过在蛋白质结构上执行该程序获得的值。例如,上面的问题表示`distance(residue(207), residue(220))`;在人类蛋白A6ND36的AlphaFold预测上运行该程序得到黄金答案(16.25Å)。在这种观点下,评估变成确定性的:只有当模型的预测与结构派生指称匹配时,模型才算正确。

我们提出**ProtStructQA**,一个大规模可执行的残基级结构问答基准,针对AlphaFold预测的蛋白质。ProtStructQA发布了382,200个问题:一个330,000个问题的活跃基准,涵盖七个结构家族,加上一个52,200个问题的困难负样本鲁棒性池。该基准覆盖来自人类、小鼠、果蝇和鸡的10,000个蛋白质,询问关于pLDDT置信度、Cα距离、PAE、溶剂暴露、二级结构、接触、拓扑以及这些原语的保留组合。每个问题由一个隐藏的DSL程序生成,并通过确定性执行而非文本重叠来评估。这种设置让我们能够提出一个受控的推理时间问题:**结构指称在哪里计算?** 直接提示一步编译;链式思考在语言中规划;语法约束的可执行投票采样并执行候选程序;ReAct式工具使用通过多轮工具调用来外部化结构访问。一个共享的执行器隔离了失败是因语言规划、程序语法、结构计算还是答案格式化。在从0.6B到8B的Qwen3模型上,我们观察到能力依赖的**指称阈值**,位于Qwen3-1.7B和Qwen3-4B之间,并在Gemma-3-1B和Gemma-3-12B上复制。低于阈值时,小模型通常无法产生可执行的指称,多轮工具使用占主导。高于阈值时,链式思考从大部分有害转变为强烈有益,自由形式CoT或执行CoT在几乎所有评估单元中胜出;这种转变机制上是从不可解析到有效结构指称的移位。我们的贡献如下:

*   **可执行结构问答**。我们提出ProtStructQA,一个大规模基准,其中每个自然语言蛋白质问题都有一个隐藏的类型化DSL程序和一个通过在AlphaFold预测结构上确定性执行获得的黄金答案。
*   **蛋白质问题的类型化指称语义**。我们将结构问答形式化为从语言到测量代数的编译,该代数作用于残基、区域、残基对、置信度、PAE、溶剂暴露、二级结构和接触。
*   **受控推理时间评估**。我们在无需微调的情况下比较了直接提示、链式思考、语法约束的可执行投票、带链式思考的可执行投票以及ReAct式工具使用,覆盖Qwen3(0.6B–8B)和跨家族复制的Gemma-3(1B和12B)。
*   **指称阈值**。我们展示了规模依赖的交叉点:低于阈值的模型从工具介导的指称中获益最多,而高于阈值的模型将链式思考作为从语言到结构测量的内部编译器。

## 2 相关工作

#### 蛋白质表示和基础模型基准。

TAPE(Rao等,2019)、PEER(Xu等,2022)和ProteinGym(Notin等,2023)共同评估蛋白质表示、功能/定位/相互作用预测以及突变效应任务。这些套件对于衡量蛋白质基础模型至关重要,但它们并非旨在评估自然语言问题,其答案必须从残基级3D结构测量中计算。ProtStructQA是互补的:它评估语言模型是否能够将表面问题映射到对AlphaFold预测结构上的可执行操作。

#### 蛋白质语言问答和聊天系统。

近期工作开始通过问答数据集、指令微调、蛋白质到文本生成和多模态蛋白质聊天将蛋白质与自然语言连接起来。PQA/Pika(Carrami和Sharifzadeh,2024)引入了针对自由形式询问的精选蛋白质问答基准,与先前针对PDB条目的预定义问题的PDB-QA数据集形成对比;ProtT3(Liu等,2024)从蛋白质序列输入生成文本描述;Mol-Instructions(Fang等,2024)和InstructProtein(Wang等,2024b)将生物分子知识与自然语言监督对齐;ProtChatGPT(Wang等,2024a)、ProteinGPT(Xiao等,2024)和Prot2Chat(Wang等,2025)允许用户通过LLM接口查询蛋白质序列和/或结构。这些工作使用词汇、语义或LLM裁判度量来评估生成,或使用任务特定问答评分。ProtStructFAQ在评估目标上有所不同:每个问题都有一个隐藏的残基级DSL程序和一个通过执行预测3D坐标产生的确定性答案。

#### 可执行和组合推理基准。

ProtStructQA继承了组合推理基准的传统:SCAN(Lake和Baroni,2018)(基于语法的组合泛化)、CFQ(Keysers等,2020)(可执行SPARQL查询)、CLEVR(Johnson等,2017)(合成视觉场景上的函数式程序)和GQA(Hudson和Manning,2019)(带有函数式程序的场景图问题生成)。ProtStructQA将这个指称思想引入科学领域:“场景”是AlphaFold预测的蛋白质,对象是残基和区域,答案是结构测量值,而不是视觉属性或数据库事实。

#### 结构化解码、程序和智能体。

语法约束解码在标记级别强制执行输出结构(Geng等,2023;Willard和Louf,2023;Koo等,2024;Park等,2025),JSONSchemaBench(Geng等,2025)大规模基准测试语法有效性。程序辅助方法如Program-of-Thought(Chen等,2023)和PAL(Gao等,2023)将推理与计算分开;自一致性(Wang等,2023)聚合多个推理轨迹。ReAct(Yao等,2023b)将推理与工具使用交错。ProtStructQA使用这些方法不仅测试格式合规性,还问何时有效结构变成正确的科学指称:一个语法有效的DSL程序只有在执行结果匹配问题所请求的结构量时才是有用的。

#### 定位。

总之,ProtStructQA不仅仅是另一个蛋白质问答数据集或另一个约束解码基准。它结合了蛋白质结构数据、类型化可执行语义和受控推理时间推理,以评估语言模型是否能够将自然语言问题编译成对预测分子结构的测量。这个交叉点是本文的贡献。

![蛋白质面板](https://arxiv.org/html/2606.00451/extracted/6302861/figures/overview_v3.png)

图2: ProtStructQA构建流水线:从蛋白质面板经过DSL和释义到训练不相交的评估轨道。给定固定种子,流水线是确定性的。

## 3 ProtStructQA基准

ProtStructQA围绕四个对象构建:一个预测的结构世界、一个自然语言问题、一个隐藏的类型化指称和一个确定性预言。世界是AlphaFold预测的蛋白质结构;问题是隐藏模板的释义;指称是DSL程序;预言是从坐标、置信度分数、PAE、溶剂暴露和二级结构注释计算答案的执行器。图2总结了构建流水线。简而言之,每个问题由一个隐藏程序生成,正确答案是该程序在蛋白质预测结构上运行的值。

### 3.1 蛋白质面板

我们从四个UniProt参考蛋白质组(The UniProt Consortium,2025)中采样10,000个AlphaFold预测的蛋白质结构:4,000个人类、2,500个小鼠、1,500个果蝇和2,000个鸡(表2,附录A)。人类作为分布内锚点,而其他物种定义了物种分层跨蛋白质组偏移:小鼠提供接近的哺乳动物比较,鸡提供非哺乳动物脊椎动物比较,果蝇提供无脊椎动物比较。物种选择旨在创建受控的蛋白质组级分布偏移,而非证明广泛的系统发育泛化。采样在物种内按长度分层(最终面板长度范围从16到2,321个氨基酸),预测结构来自AFDB v6(Bertoni等,2026),由AlphaFold(Jumper等,2021)产生并以CC BY 4.0许可发布。对于每个蛋白质,我们提取Cα轨迹、每个残基的pLDDT、PAE矩阵、由DSSP分配并折叠为螺旋/折叠/卷曲的二级结构(Kabsch和Sander,1983),以及相对溶剂可及表面积(SASA)。这些特征定义了执行器的结构状态,因此基准评估相对于AlphaFold预测结构和从它们派生出的每个残基注释的答案,而非实验性结构真相。图1显示了两个示例问题;按物种的蛋白质计数(表2)和面板的长度、pLDDT和二级结构组成(图4)报告在附录A中。

### 3.2 形式化指称设置

非形式地说,每个问题都与一个隐藏程序配对;在蛋白质上运行该程序返回一个数字、是/否、一个残基、一个区域、一个残基集合、一个残基对集合或一个二级结构标签。下面的形式化设置命名了这个流水线的各个部分,以便后续章节可以精确地引用它们。

设蛋白质p具有结构状态 S_p = (X_p, c_p, A_p, σ_p, ρ_p),其中X_p ∈ R^{n_p × 3}

相似文章

ProtSent:蛋白质句子转换器

arXiv cs.LG

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。

通过可微图划分对蛋白质语言模型表示的结构解释

arXiv cs.LG

本文提出了 SoftBlobGIN 框架,通过将蛋白质语言模型的表示投影到接触图上进行结构感知的消息传递,增强了其可解释性。该框架在酶分类和结合位点检测任务上展现出性能提升,同时提供了可审计的结构化解释。

重探语义处理的痛点:语言模型的语义推理基准测试

arXiv cs.CL

研究人员推出了 SemanticQA 基准测试,旨在评估语言模型在包含习语、名词复合词及动词结构等语义短语处理任务上的表现。结果显示,不同架构与规模的模型在语义推理任务上的性能存在显著差异。