行动之前:面向前瞻性假设发现的LLM基准测试

arXiv cs.CL 论文

摘要

本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。

arXiv:2607.15766v1 公告类型:新 摘要:大型语言模型(LLM)擅长回答预先指定的问题,但它们在开放式、结论前阶段的探索能力在很大程度上仍未得到衡量。我们引入了前瞻性假设发现(PHD),要求模型自主地从非决定性证据(包括异常观察和碎片化记录)中构建有依据、可区分且可测试的假设空间,以指导后续研究。为了评估这一能力,我们提出了HypoArena,包括HypoData(一个涵盖六个科学和分析领域的988个案例的基准)和HypoEval(一个用于开放式假设集的评估框架)。为了大规模构建HypoData,我们提出了回溯上下文回归(Retrospective Context Regression),这是一个Forge--Audit流水线,通过移除显式结论、目标假设和回溯性因果归因,同时保留事实基础,从已完成专家文档中重建结论前上下文。由于PHD允许多个有效输出,HypoEval结合了双向成对判断与Bradley--Terry--Davidson聚合进行排名,以及六维评分标准进行诊断。在15个前沿LLM上的实验揭示了清晰的能力分层和结构化分析技能的模型依赖效应,HypoArena上几个较低性能的模型有所提升,但其他系统(包括一个顶级模型)出现了退化。与绝对评分标准相比,竞技场评估能分辨出模型间更细微的差异,聚合排名与人类专家和独立裁判具有高度一致性。总之,这些结果支持将PHD视为评估LLM在最终结论被隐藏时如何制定调查方向的一个独特目标。我们的代码和数据可在github.com/SKYLENAGE-AI/HypoArena和github.com/SKYLENAGE-AI/HypoArena公开获取。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:35

# 行动之前:在开放假设发现任务上对大型语言模型的基准测试

来源:https://arxiv.org/html/2607.15766

\[1\] 中国科学院大学  
\[2\] 中国科学院软件研究所  
\[3\] 阿里巴巴集团  

\contribution\[*\] 同等贡献。工作完成于阿里巴巴集团实习期间。 , †\{\\dagger\} 通讯作者。

王毅 蒋伟 王炜 陈轩昂 陆耀杰 叶世炜 施玉珍 杨博宇 王竟航 李涵 翟伟琪 赵兵 胡伟 于海阳 李永彬 林鸿宇 孙乐 韩先培

\[\[[[email protected]](https://arxiv.org/html/2607.15766v1/mailto:[email protected]) [[email protected]](https://arxiv.org/html/2607.15766v1/mailto:[email protected])

###### 摘要

大型语言模型(LLMs)在回答给定问题方面表现出色,但它们在开放式、结论未定的发现任务中的导航能力在很大程度上尚未被衡量。我们引入了 **前瞻性假设发现**(Prospective Hypothesis Discovery, PHD),该任务要求模型从尚无定论的证据中,包括异常观测和碎片化记录,自主构建有依据、可区分且可检验的假设空间,以指导后续探究。为评估该能力,我们提出了 **HypoArena**,包含 **HypoData**(涵盖六个领域的 988 个案例)和 **HypoEval**(一个针对开放式假设的评估框架)。我们通过 **回顾性上下文回归**(Retrospective Context Regression)构建 HypoData,这是一个从专家文档中重建结论前上下文的流水线,通过移除明确结论同时保留事实基础。由于 PHD 允许多个有效输出,HypoEval 结合了双向成对判断与用于排名的 Bradley–Terry–Davidson 聚合,以及用于诊断的六维度评分标准。在 15 个前沿 LLM 上的实验揭示了清晰的能力分层,并表明竞技场评估在揭示更细微模型差异的同时,与人类专家判断高度一致。这些结果共同支持将 PHD 视为评估 LLM 探究性推理的一个独特目标。所有代码、数据和评估工具均已公开,地址为:github.com/SKYLENAGE-AI/HypoArena 和 huggingface.co/datasets/HypoArena/HypoData。

## 1 引言

参见图注 图 1:从反应式问答到前瞻性假设发现。传统问答将预先形成的问题交给模型(*反应式*)。HypoArena 则重构了一个结论前形态的真实世界上下文,并要求模型*主动*构建一个合理的假设空间——我们称之为**前瞻性假设发现**(PHD)的能力。

现实世界的发现很少始于一个良好的问题。在科学研究、事故调查和金融分析中,首次遇到问题通常是一团异常观测、碎片化事实和不完整记录。此阶段的关键挑战不是检索已知答案,而是构建一个合理的假设空间:一组有根据、可验证且相互可区分的待探究主张。我们将这种能力称为**前瞻性假设发现**(PHD),并认为这是 LLM 一个独特且尚未充分衡量的能力。例如,当出现突发的服务器错误和碎片化日志时,一个有能力的系统应在任何原因被确认之前,就提出几个可验证的方向,如内存泄漏或微服务死锁。图 1 将此设置与传统 QA 式评估进行了对比。

现有基准并未直接针对这一能力。QA 和智能体基准(如 egg2025dabstep, jingdsbench, mitchener2025kosmos)根据预定义目标或任务完成标准对模型评分。科学发现与推理基准(如 discovery-bench, insight-bench, hypo-bench, sci-arena, inno-eval)通常提供结构化数据或预先形成的研究问题。开放式想法生成基准(如 wang2026fire, idea-bench, ai-idea-bench, research-bench)则从论文摘要或已完善的研究背景出发。这些设置均未询问:给定原始的异构事实且未形成结论时,模型是否能识别出多个合理的假设,区分它们,并为每个假设提供论证。一个能够孤立这一问题的基准是缺失的。

构建这样一个基准面临两大困难,一个在数据侧,一个在度量侧。在数据侧,专家文档(如科学论文、事故报告和分析师笔记)是在得出结论后撰写的。它们包含最终的论断、假设陈述和显式的因果联系,这些都是强烈的暗示性线索。将此类文档提供给模型会使 PHD 退化为重复已知答案,而手动编写不含结论的上下文既昂贵又难以规模化。在度量侧,高质量的 PHD 输出并非单一参考答案,而是一个开放的假设空间(如 sican)。同一上下文通常支持多个合法的方向,因此参考匹配度量会低估那些恰好落在标准答案集之外的合理假设(如 research-bench, papineni2002bleu, lin2004rouge),而绝对评分标准则难以区分表面质量相当的开放式输出(如 liu2023g)。

为应对这些挑战,我们构建了 **HypoArena**,一个包含 988 个案例的基准,涵盖六个领域:生物医学科学、机器学习、社会科学、金融分析、信息技术运维和安全调查。每个案例均源自人类撰写的文档,如研究论文、调查报告或专业博客。我们的核心动机源于这样一个观察:当人类撰写这些报告时,他们必须生成合理的假设,然而这些中间假设往往未在最终成品中记录下来。为近似这个中间推理阶段,我们通过**回顾性上下文回归**来构建案例。此过程并非恢复确切的历史信息状态,而是通过保留时间允许的事实内容,同时过滤掉明确的结论、目标假设和回顾性因果归因,来重建一个模型可见的上下文。我们将在操作上满足这些标准的上下文称为“无结论”上下文。相应的假设和证据保留在参考侧,用于验证和诊断评估。表 1 将 HypoArena 与先前的科学发现和想法生成基准进行了定位。

表 1:HypoArena 与相关基准的比较。我们将现有基准分为三类:QA 与智能体、科学发现以及想法生成。这里 D 表示数据库,Q 表示查询。

| 基准 | 输入 | 输出 | 回顾性 | 开放 | 多领域 | 无结论上下文 | 假设 | 规模 |
|------|------|------|--------|------|--------|--------------|------|------|
| **类别 1: QA 与智能体** | | | | | | | | |
| DABstep | Q + 数据 | 字符串/数字/列表 | × | × | × | × | 450 |
| DSBENCH | Q + 数据 | 代码/数字 | × | × | × | × | 540 |
| **类别 2: 科学发现与推理** | | | | | | | | |
| DiscoveryBench | D + 目标 | 单个假设 | × | × | × | × | 1.1k |
| InsightBench | D + 目标 | 洞察 | × | × | × | × | 100 |
| HypoBench | 数据集 | 单个假设 | × | × | × | ✓ | 194 |
| SciArena | Q + 文档 | 文献回应 | × | ✓ | ✓ | ✓ | 20K |
| InnoEval | IdeaEval 报告 | ✓ | × | × | × | 761 |
| **类别 3: 想法生成** | | | | | | | | |
| FIRE-Bench | Q | 完整研究 | ✓ | ✓ | × | × | 30 |
| IdeaBench | 摘要 | 想法 | × | ✓ | × | × | 2.4K |
| AI Idea Bench | 主题+论文 | 想法 | × | ✓ | × | × | 3.5K |
| ResearchBench | Q + 综述 | 灵感 | × | ✓ | ✓ | ✓ | 1.4K |
| **HypoArena (我们的)** | **上下文** | **开放假设** | **✓** | **✓** | **✓** | **✓** | **988** |

由于一个“无结论上下文”通常支持多个合理的探索方向,高质量输出不再是单一答案,而是一个开放的假设空间。为解决精确匹配或评分标准中存在的对创新假设的低估和评分偏差问题,我们设计了 **HypoEval**,一种基于成对比较的竞技场式评估协议。在同一上下文中,HypoEval 摒弃了对单一参考答案的依赖。相反,它比较两个模型生成的假设集,以判断哪一方在六个维度上表现更好:上下文基础、推理性洞察、证据论证、假设空间广度、方向区分度和分析实用性。随后,我们采用 Bradley–Terry–Davidson 模型聚合这些成对判断,计算更鲁棒的模型排名。同时,我们保留评分标准维度作为诊断工具,用于分析模型沿相同六个维度的性能。

我们系统地对 15 个当代语言模型在六个领域进行了实证评估。我们的 HypoEval 成对评估协议解决了传统评分标准的缺点。跨领域来看,竞技场评估产生了清晰分层的排行榜,而评分标准得分则集中在 1–5 分值范围内(子一分点范围内)。智能体模式的结构化分析技能产生了异质且依赖模型的效果。我们进一步通过人类专家对齐和跨裁判三角验证来评估竞技场排名的可靠性。

我们的贡献是:
- **任务定义与基准**:我们定义了**前瞻性假设发现**(PHD)任务,并引入了 HypoArena,一个涵盖六个科学和分析领域的 988 个案例的基准。
- **HypoData 与回顾性上下文回归**:我们提出了一种可扩展的 Forge–Audit 构建方法,该方法从已完成的专家文档中,在明确的泄漏控制、时间控制、忠实性和可支持性约束下,重建结论前上下文。
- **HypoEval 与系统性实证分析**:我们提出了一个双轨评估框架,将竞技场协议与 Bradley–Terry–Davidson 模型作为主要排名方法,辅以评分标准作为诊断。对 15 个当代 LLM 的研究表明,竞技场评估提供了比评分标准更精细的区分,并揭示了模型排序中依赖于协议方式的差异。

## 2 HypoData:发现能力基准测试

本节介绍 HypoData,它是 HypoArena 的基础数据组成部分,旨在系统评估前瞻性假设发现(PHD)。我们将假设生成形式化为一个跨六个领域的统一任务,将模型可见的 **上下文** 与隐藏的 **假设** 及其相关 **证据** 解耦。图 2 展示了完整的数据构建流水线。下文我们将正式定义任务组件和数学公式。

参见图注 图 2:HypoArena 流水线。(1) 从人类撰写的文档中进行多领域数据收集;(2) HypoData:回顾性上下文回归将源文档回滚到结论前的事实状态,并提取隐藏的假设-证据对作为参考;(3) 结构化上下文-假设-证据输出,其中上下文对模型可见,其余部分保留;(4) HypoEval:通过 Bradley–Terry–Davidson 聚合的成对竞技场排名,辅以评分标准作为诊断。

### 2.1 任务定义

**前瞻性假设发现**(PHD)定义为从重建的结论前上下文 C\\mathcal\{C\} 到假设集 H=\{\(hi,ei\)\}i=1K\\mathcal\{H\}=\\\{\(h\_\{i\},e\_\{i\}\)\\\}\_\{i=1\}^\{K\} 的映射。该任务要求模型从尚无定论的前提出发,自主构建合理的假设空间。不同于专注于检索预先存在答案的传统 QA,PHD 要求模型识别未解决的矛盾,并提出值得下一步探究的可验证方向。

##### 上下文 \(C\\mathcal\{C\}\)。上下文 C\\mathcal\{C\} 近似于形成结论前的原始、异构信息状态,包括异常观测、碎片化事实和不完整记录。为保持任务有效性,C\\mathcal\{C\} 必须满足两个约束:(i) **信息充足性**,意味着它提供足够的事实基础以支持非平凡的假设生成;(ii) **操作性结论缺失**,意味着明确的最终结论、目标假设和回顾性因果归因已从模型可见输入中移除。我们将满足第二个标准的上下文称为操作性“无结论”上下文。

##### 假设集 \(H\\mathcal\{H\}\)。输出 H\\mathcal\{H\} 由 \(hi,ei\)\(h\_\{i\},e\_\{i\}\) 对组成,每一对代表一个原子推理单元:
- **假设 \(hih\_\{i\}\)**:一个解释性或预测性主张,用于处理 C\\mathcal\{C\} 中的异常。每个 hih\_\{i\} 必须**基于**所提供的事实,并且可通过后续测试**验证**。当 K\>1K\>1 时,假设还应是**相互可区分**的。
- **证据 \(eie\_\{i\}\)**:对假设的领域特定论证。在科学研究中,表现为**验证计划**(例如,实验设计);在调查分析中,则表现为**诊断包**(例如,可操作的检查项和支持性证据日志),以证实主张并指导进一步探索。

假设集 H\\mathcal\{H\} 的基数 KK 依赖于领域。科学案例通常引出单一主要推测,强调深度和可检验性;而分析案例允许开放基数集,强调广度和区分性。单一推测案例仍可能在不同系统中产生多个有效输出,因此源自源文档的参考不被视为唯一答案。

### 2.2 数据收集

为提供广泛的领域覆盖并基于专家撰写的来源,我们从六个领域的数据源中提取素材,这些领域分为两类:**科学领域**(生物医学科学、机器学习、社会科学)和**分析领域**(金融分析、信息技术运维、安全调查)。实施了领域特定的时间截止点以最小化数据污染。详细的收集协议见附录 8。

### 2.3 使用 Forge–Audit 智能体循环进行数据构建

为平衡信息泄漏与上下文丰富度之间的权衡,我们的框架采用了一个迭代的 **Forge–Audit** 循环。在该流水线中,**Forge** 智能体生成候选上下文,而 **Audit** 智能体则根据基准约束对其进行验证,循环重复直到满足标准或预算耗尽。详细的构建协议和提示见附录 9 和附录 16。

**Forge 智能体** 通过两个连续组件运作:

##### 上下文 Forge。**上下文 Forge** 从源端事实材料中构建一个模型可见的结论前上下文 C\\mathcal\{C\},并在适当时使用外部检索的背景信息。外部搜索受限于特定来源的时间戳边界,排除在相关出版物、发布或事件截止日期之后的材料。这些控制措施降低了通过外部检索引入截止日期后材料的风险。我们根据领域应用不同的策略:
- **科学领域**:为避免依赖任何单一的、包含结论的文档,我们检索早于发现日期的一组文献,并使用**文档合并**将多方面来源综合成一个连贯的事实基础。
- **分析领域**:为保留原始证据同时剥离分析偏差,我们采用**结构去结论化**。此过程保留细粒度事实(例如,时间戳和度量)。

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

迈向可审计的AI科学家:面向LLM代理的假设演化协议

arXiv cs.AI

本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。