LLMs 是否能识别良好假设?基于 Logit 的能量评分在科学假设排名中优于提示式 LLM-as-Judge 方法

arXiv cs.AI 论文

摘要

本文提出一种基于 logit 的能量评分方法,用于使用大型语言模型评估科学假设,该方法在假设排名任务中优于提示式 LLM-as-judge 方法。

arXiv:2608.17270v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地用于科学假设生成。然而,评估生成的假设对于可信赖的AI驱动科学工作流程来说仍然是一个挑战。现有方法通常使用LLMs作为评判者或依赖语义相似性,这可能有利于熟悉的想法而非新颖的想法。我们提出了一种基于logit的能量评分方法,该方法使用语言模型的内在置信度而非比较判断来评估假设。我们在12个学科的1,323篇论文上对七种语言模型进行了基准测试。每篇论文都配有其假设和十五个不正确的替代方案。内在评分在两个评分器上的总和达到33.0%的Hit@1,而提示式列表排名为16.6%。最强配置是一个使用基于logit的能量评分的10亿参数模型,达到了53.1%,尽管这是从事后选择的14种模型-评分器组合中选出的最大值。总体而言,内在模型置信度显示出在科学假设评估中的潜力。这项研究也为基于置信度的方法在可信赖AI驱动科学发现中的未来研究提供了动力。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:55

# 大型语言模型是否能识别出优质假设?——基于逻辑值的能量评分在科学假设排序中优于提示式LLM评判
来源:https://arxiv.org/html/2608.17270
†这些作者对本工作贡献均等。

Swati Rajwal†1, Sanjay Das†1, Tirthankar Ghosal†

###### 摘要

大型语言模型(LLMs)正日益用于科学假设生成。然而,如何评估生成的假设仍然是可信AI赋能科学工作流程中的一个挑战。现有方法通常使用LLMs作为评判者,或依赖语义相似度,这可能使新颖的想法更倾向于被视为熟悉的想法。我们提出一种基于逻辑值的能量评分方法,该方法利用语言模型的内在置信度来评估假设,而非通过比较判断。我们在12个学科领域的1,323篇论文上对七个语言模型进行了基准测试。每篇论文都与其假设及十五个错误的替代选项配对。在两个评分器的综合评估中,内在评分的命中率(Hit@1)达到了33.0%,而提示式列表排序的命中率仅为16.6%。最强的配置——一个使用基于逻辑值能量评分的10亿参数模型——达到了53.1%,尽管这是从14种事后选择的模型-评分器组合中选出的最大值。总体而言,模型的内在置信度在科学假设评估中展现出潜力。本研究也为未来基于置信度的可信AI赋能科学发现方法的研究提供了动力。

###### 索引关键词:

大型语言模型,科学假设排序,基于能量的评分,科学发现。

††脚注文本:本稿件由UT-Battelle, LLC根据与美国能源部(DOE)签订的合同DE-AC05-00OR22725撰写。美国政府保留版权,出版商在接受本文发表时,确认美国政府保留非独占、已付费、不可撤销的全球许可,可出版或复制本稿件的出版形式,或允许他人为美国政府目的这样做。DOE将根据DOE公共访问计划(https://www.energy.gov/doe-public-access-plan)公开这些联邦资助研究的结果。

## I 引言

大型语言模型(LLMs)的最新进展已经改变了科学研究辅助的格局,使其在假设生成、文献分析甚至自主发现工作流程中展现出前所未有的能力。像谷歌的AI Co-Scientist或Sakana AI这样的开创性系统,就体现了这一技术趋势,展示了LLMs如何能够在人类专家的协作下或作为科学流程中的独立代理,提出合理的假设。这些发展为加速发现、促进跨学科研究以及在成熟和新兴领域中自动化基于假设的探索开辟了新的可能性。

图注图1:研究概览。给定一个背景和研究问题,候选假设由语言模型的内在置信度评分,而非通过提示进行比较。53%是14种模型-评分器组合中的最佳结果。
科学过程的核心步骤是提出一个既与现有文献一致,又能解释或预测所关注现象的假设。随着LLMs越来越多地被提议作为加速科学发现的工具(从基于文献的构思到自动化实验设计),一个更基本的问题变得重要:在激发研究的背景和研究问题下,语言模型能否识别出领域专家实际深入研究的几个候选假设中的哪一个?这个问题不同于,甚至可以说是生成新颖假设这一更难任务的先决条件:在能够信任模型提出新的科学想法之前,它首先应该能够区分正确假设和看似合理但错误的假设。

目前,对LLM生成的科学假设的评估主要依赖于“LLM作为评判者”的框架,该框架依赖于明确的言语反馈和语义相似度指标,或依赖于人类专家的手动验证。这两种范式都存在重大限制:自动评判者经常受到位置偏见、冗长偏见和倾向于常规想法的语义对齐倾向的影响[16 (https://arxiv.org/html/2608.17270#bib.bib21),15 (https://arxiv.org/html/2608.17270#bib.bib22),22 (https://arxiv.org/html/2608.17270#bib.bib23)],从而丢弃真正新颖的假设;而专家人类评审本质上是不可扩展、耗时且资源密集型的。

**关键发现**:模型对候选假设自身的似然度,是科学正确性比明确提示专有模型对候选假设进行排序更强的信号。我们测试的几乎每一个开源LLM都优于提示式基线。然而,哪个内在评分器更好,取决于具体模型:原始逻辑值能量准则对一些模型有显著帮助,而对另一些则失效,理解其原因是本研究的一个开放性问题。

为了克服这些局限性,我们提出了**基于逻辑值的能量评分**(Logit-based Energy Scoring),这是一种替代性的模型内在评估框架。通过利用输出逻辑值概率作为模型内部置信度的直接代理,我们的方法计算“能量分数”来可靠地识别最合理的候选假设,而不依赖于言语化的判断。在一个精心策划的数据集上进行的广泛基准测试表明,该机制从10亿参数模型到200亿系统以及顶级专有基线都能有效扩展。值得注意的是,像Llama 3.2 1B这样的轻量级开源模型,在任一内在评分准则下都能达到或超越高容量专有基线,其中原始目标逻辑值能量变体产生了最大的单项增益。我们强调,能量准则并非在所有情况下都优于似然度评分:其优势集中在部分模型子集上,而刻画该子集正是本项工作的贡献,而非其局限。最终,本工作展示了内在置信度指标在科学发现中的潜力,并为通过开源模型实现高级假设评估的民主化提供了一条路径。

我们的贡献如下:

1.  本研究引入了一种新颖的、完全自动化的LLM生成科学假设评估指标,该指标基于逻辑值衍生的能量评分,从而利用语言模型的内部置信度分布,这与依赖外部化判断或语义相似度衡量的传统评判者式方法形成对比。
2.  本文首次系统比较了一系列开源LLM和最先进的闭源商业LLM,评估了它们辨别正确科学假设的能力,从而突出了模型架构、模型规模和评估范式之间的性能差异。
3.  我们的分析表明,相比于显式的LLM评判者提示,模型的内在置信度提供了更可靠的科学假设有效性的信号。

文章其余部分的组织结构如下。第二节提供了关于基于LLM的科学假设生成和评估的背景。第三节描述了所提出的技术。第四节阐述了实验设置,第五节展示了结果。最后,第六节讨论了局限性和未来工作,第七节总结全文。

## II 背景与相关工作

### II-A 基于LLM的科学假设生成

越来越多的研究将LLMs作为科学发现过程的积极参与者,而非被动的写作助手。谷歌的AI Co-Scientist系统在“生成-辩论-排序”循环中协调多个LLM代理,在少量案例研究中产生了被领域专家积极评价的生物医学假设[2 (https://arxiv.org/html/2608.17270#bib.bib10)]。Sakana AI的AI Scientist追求全自动、闭环研究:一个LLM构思一个项目,编写并执行代码进行测试,并起草最终的论文[9 (https://arxiv.org/html/2608.17270#bib.bib11)]。相关系统则针对材料发现、逆合成规划以及自动化定理或猜想生成。纵观这些文献,假设生成本身在很大程度上被认为已解决,因为LLMs能可靠地生成流畅、领域适宜的候选假设;而更难且更不标准化的问题——也即本文的动机——是如何从众多听起来合理的候选者中,决定哪些是真正正确或有前景的。

### II-B 通过LLM评判者和语义相似度进行评估

当前实践中的两种评估策略是:(i)LLM评判者协议,其中(通常是大型、闭源的)模型被提示将候选假设与参考假设或其他候选者进行比较,并产生分数、排序或偏好[23 (https://arxiv.org/html/2608.17270#bib.bib13)];以及(ii)基于嵌入的语义相似度,其中候选假设和参考假设分别被编码,并通过余弦相似度或相关指标进行比较[14 (https://arxiv.org/html/2608.17270#bib.bib14)]。这两种策略被广泛采用,因为它们成本低廉、可自动化,并且在大多由先前记录的发现组成的整体基准测试中与人类判断具有合理的相关性。然而,这两种策略都预设了正确性与和参考的相似性紧密耦合。对于开放式或前瞻性的科学假设而言,这种耦合是一个弱得多的假设,因为正确的假设根据定义,尚未以评估者见过的形式被记录,并且表面合理性可能只是机械正确性的拙劣代理。

### II-C 置信度与似然度作为评估信号

科学发现文献之外的另一项研究线,研究了语言模型自身的基于标记的概率作为下游选择任务的信号,包括生成文本的重新排序、事实性估计以及分布外或幻觉检测[5 (https://arxiv.org/html/2608.17270#bib.bib15)]。基于能量的模型(EBMs)通过一个标量能量函数形式化了输入与候选输出之间的非归一化兼容性概念,其中较低的能量对应较高的兼容性,并已被用于重新解释分类器或语言模型的输出层,无需使用softmax归一化来获得适当的概率分布[6 (https://arxiv.org/html/2608.17270#bib.bib17),3 (https://arxiv.org/html/2608.17270#bib.bib16),7 (https://arxiv.org/html/2608.17270#bib.bib18)]。这些文献启发了我们使用原始的、预softmax的逻辑值幅度作为归一化对数似然度的补充信号:因为归一化是在每个位置的完整词汇表上计算的,它可能会压缩或扭曲区分得到良好支持的假设延续和仅表面流畅的假设的置信度信号,特别是在较小或校准不足的模型中。

## III 方法论

在本节中,我们介绍了研究基于逻辑值的模型是否能在不依赖比较判断的情况下可靠评估科学假设的方法。我们不是通过比较选择让模型受到表面流畅性或风格偏见的影响,而是测量给定背景上下文下其每标记的置信度。模型为得到良好支持的假设分配高概率,同时为不太合理的假设记录高“意外度”(分数),从而将假设评估重新定义为对模型内在可预测性的绝对评估。

### III-A 问题设定:作为合理性信号的置信度

对于给定的论文p,用b_p表示其背景综述,q_p表示其研究问题,H_p = {h_p^(1), ..., h_p^(16)}表示一组十六个候选假设,其中一个h_p^*是金标准假设,其余十五个作为看似合理但不正确的干扰项。我们不将H_p一起呈现并请求单一选择,而是独立评估每个候选假设:对于每个h_p^(i) ∈ H_p,一个开源语言模型以(b_p, q_p)为条件,其下一个标记的预测与h_p^(i)的标记进行比较。因为给定论文的所有候选假设都在相同的背景和研究问题下评分,分数的差异仅归因于假设文本本身,而被赋予最低预测意外度的候选假设被视为模型的首选。因此,假设评估被简化为一个排序问题,每个候选假设只需一次前向传播,没有明确的比较判断步骤。

### III-B 提示构建与假设片段隔离

每个候选假设使用固定的提示模板进行评分,该模板将论文的背景和研究问题放在前面,后跟候选假设:

**提示模板**  
背景:\[背景综述\]  
研究问题:\[研究问题\]  
假设:\[候选假设文本\]

完整的提示在一次前向传播中进行标记化和处理,在每个位置产生下一个标记的逻辑值。只有对应于假设片段的位置用于评分:对于给定论文,背景和研究问题在所有十六个候选假设中都是相同的,因此包含它们的标记级预测会增加共享噪声,无助于区分候选假设。假设片段的隔离方法是:单独标记化固定前缀(直到并包括字面字符串“假设:”的部分),并使用其标记长度作为完整标记化序列的偏移量。位于该偏移量及之后的标记位置构成假设片段H,并计入分数;其之前的标记位置则被丢弃。这确保了最终分数仅反映模型对假设文本的评估,而条件上下文保持固定。

### III-C 基于逻辑值的能量分数

令x = (x_1, ..., x_n)表示标记化后的提示,假设片段占据最后位置t ∈ H = {s, ..., n},其中s是在III-B节 (https://arxiv.org/html/2608.17270#S3.SS2) 中确定的偏移量。令z_t ∈ ℝ^|V|表示模型在位置t-1(即用于预测标记x_t的逻辑值)的输出逻辑值向量,其中V是模型的词汇表。从z_t我们推导出两个互补的标记级分数,一个归一化,一个未归一化,并将每个分数在假设片段上聚合为每个候选假设的一个标量值。

#### III-C-1 Softmax 负对数似然(NLL)能量分数

第一个分数是模型预测分布与该位置观察到的标记之间的标准逐标记交叉熵:

ℓ_t = -log softmax(z_t)[x_t] = -log (exp(z_t[x_t]) / Σ_{v∈V} exp(z_t[v]))  (1)

当模型的归一化概率分布在观察到的标记x_t上集中质量时,ℓ_t较小,否则较大。由于ℓ_t是在softmax归一化后计算的,它反映了模型对假设文本校准后的概率估计;较低的NLL表明模型的预测分布在某种程度上集中于文本中实际出现的标记。

相似文章

迈向可审计的AI科学家:面向LLM代理的假设演化协议

arXiv cs.AI

本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。

通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差

arXiv cs.CL

本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。

论LLM作为裁判在科学新颖性评估中的局限性

Hugging Face Daily Papers

本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。