知识先于推理:EC-Reason-Bench,一个无需训练的LLM酶分类诊断基准

arXiv cs.CL 论文

摘要

本文介绍了EC-Reason-Bench,一个无需训练的诊断基准,用于分析通用LLM为何在酶EC编号预测上失败。研究发现外部知识是关键并且必须优先于推理,而基于证据的推理充当了冲突近邻的仲裁者,而非新知识的来源。

arXiv:2607.26397v1 公告类型:新 摘要:酶功能预测是一种层次化、知识密集型的蛋白质功能分类形式。现有基准揭示了一个异常现象:通用LLM通常能正确预测粗粒度的第一层级,但一旦要求给出完整的EC编号,它们在第二至第四层级的准确率几乎降至零,而专门的模型和工具仍保持可用。我们提出了EC-Reason-Bench,一个无需训练的诊断评估协议,旨在回答两个问题:为什么通用LLM在EC编号预测上得分几乎为零,以及在不更新任何权重的情况下,可以恢复多少损失。我们将酶分类能力分解为四个正交的杠杆,每个都可以单独测量:输出结构、外部知识、推理结构和推理鲁棒性。我们使用推理时方法测试每个杠杆,与一个共享的零样本基线进行比较,该基线复现了先前报告的接近零的性能。使用几个强推理LLM的实验得出了四个主要发现。第一,外部知识是关键且必须优先于推理:统一较低的闭卷性能在开卷访问时急剧上升,缩小了模型差距。第二,在闭卷设置中,级联和思维链是帮助还是损害取决于模型是否倾向于弃权。第三,一旦证据可用,最佳LLM设置的总体得分与简单投票最近检索邻居的EC编号无法区分;这种平局是平均化的伪影,并且它隐藏了在对抗证据集上的巨大增益,同时伴随着多功能酶上的同等巨大损失。因此,基于证据的推理充当了冲突邻居的仲裁者,而不是知识的来源,而任何单一数字的排行榜都无法看到这一点。第四,准确率遵循同源可用性定律。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:57

# 知识先于推理:EC-Reason-Bench,一个免训练的LLM酶分类诊断基准测试  
来源:https://arxiv.org/html/2607.26397  
Linyu Li¹, Zhi Jin¹,†, Yichi Zhang², Dongming Jin¹, Yuanpeng He¹, Huanyao Zhang¹, Xuan Zhang¹, Gadeng Luosang³, Nyima Tashi³  

###### 摘要  
酶功能预测是一种分层、知识密集型的蛋白质功能分类形式。现有基准测试发现一个异常现象:通用大语言模型通常能正确预测粗略的第一层级,但一旦要求给出完整的EC编号,其第二至第四层级的准确率几乎降为零,而专门模型和工具仍保持可用。我们提出EC-Reason-Bench,这是一个免训练的、诊断性评估协议,旨在回答两个问题:为什么通用大语言模型在EC编号预测上得分几乎为零,以及在不更新任何权重的情况下,有多大程度的损失可以恢复。我们将酶分类能力分解为四个正交杠杆,每个杠杆可独立测量:输出结构、外部知识、推理结构和推理鲁棒性。我们使用推断时方法对每个杠杆进行测试,并与一个复现先前报道的接近零性能的共享零样本基线进行比较。使用多个强推理大语言模型进行的实验得出了四个主要发现。首先,外部知识起决定性作用,且必须优先于推理:统一低闭卷性能在开卷访问时急剧上升,缩小了模型差距。其次,在闭卷设置下,级联和思维链是否有帮助取决于模型是否倾向于弃权。第三,一旦有证据可用,最佳大语言模型设置的总体得分与直接对最近邻检索结果的EC编号进行投票得分无显著差异;这种平局是平均的假象,它掩盖了在面对对抗性证据集时的大幅增益,而这一增益在多功能酶上会被同样大的损失抵消。因此,对证据的推理充当冲突邻居的仲裁者,而非知识来源,任何单一数值排行榜都无法体现这一点。第四,准确率遵循同源性可用性定律。  

## 1 引言  
参照图注  
图1:EC-Reason-Bench的动机。(a) EC树。(b) 一次性自由生成下的层级准确率:通用大语言模型在第一层级后崩溃,而专业和蛋白质感知方法则平滑下降。  

酶功能注释是将序列与代谢联系起来的步骤,支撑着通路重建、药物发现和蛋白质工程。其标准形式是酶委员会(EC)编号。一个EC编号a.b.c.d从粗到细描述了酶催化的反应,自然形成了一个四层级树(图1(a)),有7个类别、约73个子类别、约245个子-子类别以及恰好4963个有效叶子节点。共享前缀即为父子关系,因此该树为任何分类器免费提供了强大的结构先验。  

##### 异常  
如图1(b)所示,通用大语言模型在此任务上崩溃。它们仍能以约0.28至0.54的准确率猜测7路第一层级,但一旦被要求给出完整EC编号,其第二至第四层级的准确率几乎降为零,而专业方法如BLASTp同源性搜索、Foldseek结构搜索、对比学习CLEAN和多模态双曲模型则平滑下降且保持可用。这是格式化和幻觉的特征,而非完全无知:一个毫无知识的模型在第一层级也应是接近随机水平的,而密集蛋白质表示能立即恢复准确率。然而,现有基准仅将这个接近零的数值作为与专业模型并列的一个条目报告,从未追问其来源或多大程度可恢复。  

##### 两层次损失  
我们认为,接近零的失败应拆分为两个部分并*分别测量*。*格式化*是任务和评估中可修复的方面:将原始序列交给文本模型、在4963个类别的封闭词汇上一次性生成、忽略层次结构、禁止弃权、使用不匹配的规则对多标签酶评分。*知识*是真正的差距:酶功能依赖于外部生物学先验,如同源信息、结构域注释、结构和活性位点,因此即使所有格式化问题都已修复,低同源性和长尾样本仍然困难。现有基准将两者混合在同一个数值中。  

##### 我们的方法  
EC-Reason-Bench将这个扁平分类任务重塑为沿四个*正交杠杆*进行消融的诊断性评估:输出结构、外部知识、推理结构和推理鲁棒性。每个杠杆有一个*免训练*的推断时方法,M1至M4,与一个复现先前报道灾难性设置的单一零样本基线B0进行比较(图2)。这四个方法共享相同的问题集、相同的离线证据缓存和相同的层次评分器,因此支持干净的消融且可堆叠。我们的贡献如下:(1) 首个将通用大语言模型作为酶功能分类中*一等主体*的研究,表明仅凭外部知识,无需改变任何权重,即可逆转其崩溃:第四层级准确率在闭卷时最多0.16,开卷时升至0.70–0.76。(2) 一个基于四个正交杠杆的诊断基准,使格式化和知识可单独测量,每个杠杆通过一个免训练方法进行隔离,使用完全离线构建的问题和证据,且遵循严格的归纳设置。(3) 在完整数据集上对五个强推理模型进行九个设置的完整运行,量化了知识起决定性作用,格式修复的帮助或损害取决于模型弃权的意愿,准确率遵循同源性可用性定律,并且大语言模型相对于邻居投票的净增益仅限于证据误导或倍增的划分。  

参照图注  
图2:EC-Reason-Bench概览。(A) 任务与崩溃。(B) 将接近零失败分解为可修复的格式化失败(A型)和真正的知识失败(B型)。(C) 完全离线构建EC树、检索数据库和四个划分上的1349个问题;*域*在此指从序列扫描到的模体,而非数据库注释。(D) 零样本基线B0和四个正交杠杆M1–M4。(E) 评估协议和主要发现。  

## 2 相关工作  

##### 酶功能预测与基准测试  
专业方法长期主导EC预测:序列和结构同源性搜索(Altschul等人,1990;Potter等人,2018;Van Kempen等人,2024)、对比学习(Yu等人,2023)、带有分类头的蛋白质语言模型(Lin等人,2023;Elnaggar等人,2021;Wang等人,2025)、层次监督(Ryu等人,2019;Sanderson等人,2023),以及最近转向结构和多模态的趋势(van der Weg等人,2025;Yuan等人,2025;Zhang等人,2025;Song等人,2026)。HIT-EC(Dumontet等人,2026)表明,层次约束和回答意愿在专业模型中也是耦合的,这与我们的M1和M4一致。在EC特定基准中,CARE(Yang等人,2024)首次报告了灾难性的通用大语言模型基线,EC-Bench(Davoudi等人,2026)比较了四个方法族,PoinnCARE(Xie等人,2026)在归纳检索设置下设立了最新技术水平。这三者都评估*专业*模型,从未追问大语言模型为何失败。附录扩展了此讨论并列出了我们的定位。  

##### 大语言模型推理与推断时方法  
Pika(Carrami和Sharifzadeh,2024)表明,将ESM嵌入输入大语言模型远优于仅用文本提示通用模型(Hurst等人,2024)。与我们最接近的是LLaPA(Peng等人,2024),它也从直接EC生成的崩溃出发,但将EC重编号和双路径检索绑定到一个*训练过的*系统中,因此无法说明每个部分贡献多少,这正是我们杠杆所分离的。PFUA(Fan等人,2026)表明,纯文本思维链无法迁移到蛋白质功能,而工具使用使准确率翻倍以上;Bio-KCoT(Lyu等人,2025)将其锚定在知识图谱中;它们共同为M2和M3设定了动机和限制。杠杆本身基于既定范式:由易到难提示(Zhou等人,2022)、思维链(Wei等人,2022)、自洽性(Wang等人,2022)、ReAct(Yao等人,2022)、检索增强生成(Lewis等人,2020)、免训练层次分类(Im等人,2023;Bhambhoria等人,2023)和SELF-DISCOVER(Zhou等人,2024)。我们的贡献不是新范式,而是一个受控协议,用于测量每个范式在一个知识密集型任务上的*净效果*。  

## 3 EC-Reason-Bench:任务与设计  

#### 任务:EC编号构成树  
设测试集为{(x_i, Y_i)}_{i=1}^{N},其中x_i是查询酶,Y_i是其真实EC编号集合,可能包含多个标签。一个EC编号e=a.b.c.d是EC树中从根到叶的一条路径,π_ℓ(e)是其第ℓ层级的前缀,因此π_2(1.1.5.4)=1.1;有效叶子节点集合满足|E|=4963。将预测约束到此树是我们基准与4963个类别扁平分类的区别所在。  

#### 诊断与四个正交杠杆  
失败的格式化方面可分解为具体的、可修复的选择:原始序列对于纯文本模型接近噪声;在封闭词汇上一次性自由生成必然导致无效EC编号的幻觉;忽略层次结构使得早期错误致命;强制回答不留弃权余地;多标签评分不匹配。知识方面则是缺失外部生物学先验,无约束的思维链退化为表面释义,长尾或低同源性样本本身就很困难。针对这些,我们设置了四个方法,每个隔离一个杠杆,与匹配的对照比较,而非仅与B0比较:M1用于输出结构,M2用于外部知识,M3用于推理结构,M4用于推理鲁棒性,所有细节见下一节。闭卷和开卷是叠加的*信息开关*,而非独立的方法。  

#### 数据构建与泄露控制  
除模型推理外,所有操作均本地离线运行,无网络访问,无本地GPU。解析4963个有效叶子节点得到EC树,从而得到每个节点的有效子节点,即M1和M2在每个层级的候选来源。对于每个测试酶,我们生成第1至第4层级的级联多项选择题,每个题目包含真实路径、干扰项和一个UNSURE选项;层级的选项在运行时根据刚提交的节点重新构建,因此仅在行走仍在正确路径时真实路径才可用。我们通过五个离线证据渠道(BLAST、HMMER、ESM-kNN、结构和活性位点)对查询进行搜索,每个命记录邻近酶、其EC编号和相似度分数。设置严格归纳:*检索数据库仅包含训练集,测试样本之间从不相互检索*;UniProt ID匿名化,避免记忆获得免费分数。四个划分为低同源性<30%(432项)、中等30-50%(560项)、对抗性价格(148项,其注释经过实验修正)和多标签混杂(209项),共1349项,约5396个层级决策。  

#### 难度分级  
每个样本沿四个正交轴评分,归一化到[0,1](同源性h^{split}、类别频率h^{tail}、分支因子h^{branch}和干扰项难度h^{distr}),按全局五分位数从D1(最简单)到D5(最难)分箱,使用未加权均值d_i=1/4(h_i^{split}+h_i^{tail}+h_i^{branch}+h_i^{distr})。干扰项难度可独立变化:将干扰项从远支替换为同一父节点下的兄弟节点,会在*不改动所需知识*的情况下考验细粒度判别能力。注意,此先验分数*不*考虑训练数据库中同源性的可用性,而测量到的准确率主要由同源性覆盖率驱动。这种不匹配本身就是一个发现,我们称之为同源性可用性定律。  

## 4 方法:一个基线,四个杠杆  

### B0:零样本直接生成  
B0复现了先前工作中的灾难性设置:模型看到查询(序列及我们称为*衍生特征*的长度、质量、疏水性、电荷和组成等内在描述符),加上开卷时的检索证据,然后一次性生成EC编号作为自由文本,无层次结构、无候选集、无弃权余地。我们从其输出中解析EC编号,使用与所有其他方法相同的层次指标评分,并报告有效EC率。  

### M1:层次级联(输出结构)  
M1结合了由易到难分解(Zhou等人,2022)与EC树中从根到叶的导航。不是询问EC编号是什么,而是在每个层级问要从有效候选中选择哪一个,使得一个层级的选择约束下一层级的候选。每一步是一个多项选择题:模型给出2至4句生化推理,然后选择一个*有效候选*或选择UNSURE停在父节点,并报告置信度分数。一次在4963个类别上的开放生成因此变为在第1层级从7个候选中、在后续层级最多从10个候选中封闭选择,无效EC幻觉在构造上降为零,尽管格式良好的输出并不意味着语义正确(Park等人,2024)。

相似文章

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

FALSIFYBENCH:利用规则发现游戏评估大语言模型的归纳推理能力

arXiv cs.AI

FalsifyBench 是一个用于评估大语言模型归纳推理能力的新型评测框架,灵感来源于 Wason 2-4-6 任务。在该框架中,智能体通过提出示例并接收反馈来发现隐藏的语义规则。对 12 个大语言模型的评估结果表明,推理模型的表现优于指令微调模型,而负面测试(即假设证伪)是决定成败的关键因素。