Think-Probe-Respond:提升大型语言模型在研究想法新颖性评判中的表现

arXiv cs.CL 论文

摘要

本文介绍了Think-Probe-Respond,一种通过探测潜在判断并减少对中等新颖性评分的偏见来提升大型语言模型对研究想法新颖性判断的方法,实现了22.30%的性能提升。

arXiv:2608.25660v1 Announce Type: new 摘要:自动化新颖性评判可以通过高效评估、提炼和比较研究想法来加速科学发现。尽管大型语言模型越来越多地被用于这项任务,我们研究了一个先前被忽视的判断能力局限性:尽管生成的推理理由与人类专家高度相似,但其最终的新颖性判断往往存在显著差异。我们证明,这种校准错误源于系统性偏见,即将想法判断为“中等新颖”。为缓解此问题,我们提出了Think-Probe-Respond(TPR),一种轻量级方法,该方法在推理阶段从隐藏状态探测潜在新颖性判断,并使用探测到的判断来调节最终响应。在强基线对比中,TPR将新颖性判断性能提升了22.30%,并成功缓解了普遍存在的“中等新颖性”偏见。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:25

# 思考-探测-响应:提升大语言模型作为研究创意新颖性评判者的能力  
来源:https://arxiv.org/html/2608.25660  
LLM 大语言模型  
MAE 平均绝对误差  
RINoBench 研究创意新颖性评判基准  
SOTA 最先进  
TPR 思考-探测-响应  
CoT 思维链  
Tim Schopf  
Tobias Schreieder  
机构:德累斯顿工业大学与 ScaDS.AI 德累斯顿/莱比锡,德国  
邮箱:[[email protected]](mailto:[email protected])  
Akiko Aizawa  
机构:日本东京国立情报学研究所  
邮箱:[[email protected]](mailto:[email protected])  

###### 摘要  
自动化新颖性评判可通过高效评估、优化和比较研究创意来加速科学发现。尽管大语言模型在此任务中应用日益广泛,但其判断能力中此前被忽视的一个局限性值得探讨:尽管生成的推理逻辑与人类专家高度相似,其最终的新颖性判断却往往存在显著偏差。我们证明这种校准偏差源于一种系统性偏向——倾向于将创意判定为“中等新颖”。为此,我们提出**思考-探测-响应**(TPR)方法,该轻量级方案通过探测推理阶段隐状态中的潜在新颖性判断,并以此条件化最终响应。在强基线对比中,TPR 将新颖性评判性能提升 22.30%,并有效缓解了普遍存在的“中等新颖性”偏差。参考图例图 1:TPR 方法概览。雪花符号(参考图例)表示冻结参数,火焰符号(参考图例)表示可训练参数。  

## 1 引言  
评判研究创意的新颖性对科学进步至关重要,它既促成原创性贡献,也塑造未来科研方向。然而,人工评判需要深厚专业知识及对相关文献的广泛理解,耗时、主观且难以规模化(Picard et al., 2025 [链接])。随着科学产出持续快速增长(Fortunato et al., 2018 [链接]),自动化新颖性评判支持系统对研究者评估、优化和比较研究创意尤为重要。近期研究日益依赖 LLM 进行研究创意新颖性评判(Lu et al., 2024 [链接];Li et al., 2024a [链接];Si et al., 2025 [链接];Su et al., 2025 [链接];Lu et al., 2026 [链接];Gottweis et al., 2026 [链接];Mostafa et al., 2026 [链接];Wu et al., 2026 [链接],等)。然而关键差异依然存在:这些模型能生成合理且拟人的新颖性论证(Afzal et al., 2026 [链接]),但其最终判断与自身推理逻辑脱节,且未能与人类判断对齐(Si et al., 2025 [链接];Schopf and Färber, 2026 [链接])。本研究探讨该校准偏差的根本原因,并证明 LLM 存在系统性偏向保守的“中等新颖性”判断——即使其内部推理支持显著不同的结论。基于此发现,我们提出 TPR 方法(TPR),这是一种缓解新颖性校准偏差的轻量级方案。TPR 通过探测推理过程中隐状态的潜在新颖性信念,并以这些提取的信念作为条件生成最终响应。实验表明,TPR 在强基线基础上将新颖性评判性能平均提升 22.30%,同时产出偏差更小的新颖性判断。  

## 2 相关工作  
早期自动化研究创意新颖性评判研究已从基于引用和词汇的方法(Uzzi et al., 2013 [链接];Wang et al., 2017 [链接];Amplayo et al., 2019 [链接];Wang et al., 2019 [链接];Sarica et al., 2020 [链接])演进至语义嵌入方法(Gómez-Pérez et al., 2022 [链接])。尽管这些方法提升了语义匹配能力,但仍主要局限于表层相似度评估(Mysore et al., 2022 [链接])。近期研究采用 LLM 进行自动化新颖性评判(Wu et al., 2025 [链接];Si et al., 2025 [链接];Liu et al., 2025 [链接];Wang et al., 2025 [链接];Baek et al., 2025 [链接];Lin et al., 2025 [链接];Zhang et al., 2025 [链接];Tang et al., 2025 [链接];Li et al., 2025 [链接];Feng et al., 2025 [链接];Hou et al., 2026 [链接],等)。与既往研究不同,我们探讨 LLM 此前被忽视的失效模式:生成的新颖性论证与最终判断之间的系统性校准偏差。  

## 3 基准测试  
所有实验在 RINoBench(Schopf and Färber, 2026 [链接])上进行,这是唯一公开可用的研究创意新颖性评判基准,含人工标注的新颖性分数。基准包含 1,381 个专家撰写的创意,每个创意均配有相关文献、基于五点李克特量表的人工标注新颖性分数(评分标准见表 5 [链接]),以及支持该分数判定的专家撰写的理由。给定研究创意及其相关文献,模型需预测 1(不新颖)至 5(高度新颖)的新颖性分数,并生成基于先前研究比较的文本判定理由。表 1:RINoBench 测试集上新颖性评判的评估结果。报告指标包括宏平均 F1 分数(各评分标准类别 1-5)、平均绝对误差(MAE)、对齐度(ALI)、召回率、附加比率(%),以及针对“已知方面”和“新颖方面”的幻觉率(%)(指标详情见附录 B [链接])。  

## 4 LLM 新颖性评判的校准偏差  
尽管 LLM 的新颖性论证与人类推理高度一致(Afzal et al., 2026 [链接]),其最终判断却常与人类共识显著背离(Si et al., 2025 [链接];Schopf and Färber, 2026 [链接])。为探究该校准偏差并分析 LLM 为何难以产出准确判断,我们提示六个先进 LLM(Gemini 2.5 Pro [链接]、Gemini 3 Pro [链接]、Claude Sonnet 4.5 [链接]、Claude Opus 4.5 [链接]、GPT-5 mini [链接]、GPT-5.4 [链接])评判研究创意新颖性(提示模板见图 3 [链接])。如表 1 [链接] 所示,所有模型在新颖性评判任务中表现不佳,MAE 值约为 1,宏平均 F1 分数持续偏低,最优模型得分仅 17.1。  

**LLM 回避极端新颖性判断**  
主要失效模式是强烈的中间倾向偏差。各模型预测集中于新颖性类别 3 和 4,而最低和最高类别极少被正确预测。除 Gemini 3 Pro 偶尔分配类别 1 和 5 外,其他模型在这些极端案例上几乎完全失败。表 8 [链接] 展示了此类 LLM 行为示例。  

**潜在信念与表达判断的差异**  
这种中间倾向偏差与生成理由的质量形成对比。模型在人工标注论证理由上实现了高召回率,表明其常能识别人类专家指出的重叠、差异与新颖性方面。总体而言,这些结果暗示 LLM 往往“知晓”的真实新颖性水平远超其生成数值分数所揭示的。  

**核心洞察**  
因此,LLM 作为新颖性评判者的校准偏差最好理解为“潜在信念”与“表达判断”之间的错位——模型推理常包含准确判断的证据,但最终输出却偏向安全的中间类别。  

## 5 探测 LLM 潜在判断  
基于上述发现——LLM 内化的研究创意新颖性信念与人类专家高度相似(因此能生成可比的新颖性论证),却倾向于预测中等新颖性类别——我们提出 TPR 方法用于研究创意新颖性评判。TPR 显式利用模型关于新颖性的潜在信念生成偏差更小、更准确的量化判断,并将这些判断重用为条件信号,生成与预测数值一致且连贯的文本理由。  

如图 1 [链接] 所示,TPR 包含三个阶段:  
(1)**思考**:指示 LLM 评判研究创意的新颖性,并在生成最终响应前逐步推理。对于默认生成思考令牌的推理模型,省略显式“逐步思考”指令。关键点是:仅提供新颖性类别的文本描述(不含数值分数),指示模型仅基于这些描述评估新颖性而不生成数值判断。此设计鼓励模型定性思考创意新颖性,避免将内部表征锚定于可能偏差推理过程的显式数字结果。该阶段提示模板见图 4 [链接]。  
(2)**探测**:给定具有 L 个隐藏层的 LLM,令 H={h⁽¹⁾,…,h⁽ᴸ⁾} 表示隐藏状态堆栈。对于生成的推理(“思考”)令牌序列 T={t₁,…,tₙ},在生成最终思考令牌 tₙ 时终止生成,并提取隐藏状态 hₜₙ⁽ᴸ⁾(tₙ 的选择动机见第 6 节 [链接])。该表征 hₜₙ⁽ᴸ⁾ 随后用作逻辑回归探测分类器的输入特征向量。¹¹¹ 虽然探测中间层也是可行选择,但遵循既往研究(Maiya et al., 2025 [链接])表明最终层表征通常能提供强探测性能,且在常见开源 LLM 框架中比早期层更易提取最后一层隐藏状态。  
(3)**响应**:将预测新颖性类别的文本描述追加至 LLM 生成的输出后恢复生成。在先前推理与预测判断的共同条件下,LLM 生成最终响应,用作新颖性评判的理由。  

TPR 计算高效且轻量级:所有 LLM 参数保持冻结,仅用于推理;训练仅限于简单的逻辑回归分类器,可在 CPU 上高效学习。  

### 5.1 实验设置  
我们将 TPR 与多种方法对比评估,包括:  
- **零样本提示**(第 4 节 [链接] 所述方法)  
- **少样本提示**(改编自 Shahid et al., 2025 [链接],为每个新颖性类别提供一个示例)  
- **CoT 提示**(指示模型在给出判断前逐步推理)  
- 多种基于提示的方法(源自 MooseYang et al., 2024 [链接]、ResearchAgent [链接]、AI Scientist [链接]、AI Researcher [链接])  
- **微调方法**(使用 LoRA [链接] 对 LLM 进行微调,训练细节见附录 C [链接])  

由于需要访问模型参数,实验仅使用跨多模型家族的开源 LLM,包括:  
- 默认生成显式思考令牌的推理模型:Qwen3(4B, 14B, 32B)[链接] 与 GPT-OSS-20B [链接]  
- 非推理模型:通过显式逐步推理提示在 TPR 中触发思考令牌生成,包括 Gemma 3(4B, 12B, 27B)[链接] 与 Llama 3.1(8B, 70B)[链接]  

### 5.2 评估结果  
图 2:RINoBench 测试集上不同方法与 LLM 的宏平均 F1 分数。图 2 [链接] 展示了……

相似文章

通过比较性想法评估训练语言模型预测研究成功

arXiv cs.LG

本文探讨了通过比较成对想法来训练语言模型预测研究想法实证成功的方法。利用来自PapersWithCode的11,488个想法对数据集,作者表明微调(SFT)将准确率提升至77.1%,超越了GPT-5,而使用可验证奖励的强化学习达到了71.35%的准确率,并具有可解释的推理过程。

评估大型语言模型的创造力:测试、局限与新前沿

arXiv cs.AI

本文系统评估了针对大型语言模型的人类创造力测试,发现它们无法预测科学构思能力。文章介绍了DRAT,一种结合了聚合思维与发散思维的新测试,能够可靠地预测语言模型的科学构思能力。

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

论LLM作为裁判在科学新颖性评估中的局限性

Hugging Face Daily Papers

本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。