Knowledge Index of Noah's Ark

arXiv cs.AI 论文

摘要

KINA(Knowledge Index of Noah's Ark)是一个包含899个项目的LLM基准测试,覆盖261个细粒度学科。该基准引入形式化保证来确保学科代表性、通过奖金锦标赛实现激励对齐的标注,以及基于自助法的排名稳定性报告。评估42个模型后,表现最好的包括Gemini-3.1-Pro-Preview(53.17%)、Claude-Opus-4.6(49.92%)和GPT-5.4(48.55%),揭示了分层的而非平滑的排行榜结构。

arXiv:2606.05104v1 Announce Type: new 摘要:LLM知识基准存在三个问题:基于规模扩展的设计未能操作化学科代表性;固定报酬标注导致偷懒共识;以及在有限测试预算下缺乏对排名不稳定性的审计。我们提出KINA,一个涵盖261个细粒度学科的899项基准,包含两个形式化结果。首先,我们将代表性建模为基于专家锚点的覆盖式目标,并通过代理变量操作化学科代表性,得出一个(1-1/e)贪心近似(命题1);该保证适用于代理变量,而非总体代表性。其次,我们证明奖金锦标赛在发布评审质量上弱FOSD支配固定报酬,其激励相容阈值为B > ΔC / Δp_min(定理1)。评估来自13个实验室的42个模型,表现最好的模型Gemini-3.1-Pro-Preview达到53.17%,其次是Claude-Opus-4.6(49.92%)和GPT-5.4(48.55%),远未达到饱和。完整排行榜显示分层结构而非平滑的总体排序:一个小的前沿层级高于48%,一个密集的强模型层级大致在38-45%之间,而低性能模型仅略高于10%的随机基线。在五个工具使用评估中,工具增强平均提升最多5.17分,不同模型提升差异显著。我们报告自助法排名稳定性统计,以明确有限预算下的方差,并防止对相邻排名的过度解读。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:10

# 诺亚方舟知识索引(KINA) 来源:https://arxiv.org/html/2606.05104 刘铭浩1,2,\*,†肖运泽3周泽琪4齐赫利5姚一凡2 宋美姝1,6马凯晶2张璇1蒋思聪1李以哲1马宁珊7韦洁1 李梓牛2杨明来1,8刘邦亚1梁一鸣2方晓9曾庆成10刘嘉瑞3 杨锐10严深2黄文浩2刘嘉恒2王子涵1宣伟浩6,†张戈2,† 12077AI2M\-A\-P3卡内基梅隆大学4布朗大学5早稻田大学 6东京大学7麻省理工学院8亚利桑那大学 9西北大学10杜克\-新加坡国立大学医学院 \*同等贡献。†通讯作者。 ###### 摘要 大语言模型的知识基准面临三个问题:基于规模扩张的设计未将学科代表性付诸实践;固定报酬的标注方式纵容了"偷懒式共识";在有限测试预算下,排行榜排名缺乏经审计的稳定性。我们提出KINA111https://www.2077ai.com/datasets/dataset-kina,一个涵盖261个精细学科、包含899个题项的基准,并给出两个正式结果。首先,我们将代表性表述为对专家引出的锚点进行覆盖的目标,并通过一个代理指标来操作化学科代表性,由此得到一个\((1-1/e)\)的贪心近似(命题1 (https://arxiv.org/html/2606.05104#Thmproposition1));该保证适用于代理指标,而非总体代表性。其次,我们证明,在已发布评审的质量上,达标奖励锦标赛在弱FOSD意义上严格优于固定报酬,其激励相容阈值为\(B > \Delta C / \Delta p_{\min}\)(定理1 (https://arxiv.org/html/2606.05104#Thmtheorem1))。我们评估了来自13家实验室的42个模型,表现最佳的Gemini-3.1-Pro-Preview达53.17%,其次为Claude-Opus-4.6(49.92%)和GPT-5.4(48.55%),远未达到饱和。完整排行榜呈现分层结构而非平滑的全序:一个较小的前沿梯队位于48%以上,密集的强模型梯队大致在38–45%之间,而低性能模型仅略高于10%的随机基线。在五项工具使用评估中,工具增强最多带来5.17个百分点的提升,且增益在不同模型间差异显著。我们报告了自助法排名稳定性统计量,以使有限预算下的方差透明化,并防止对相邻排名过度解读。 ## 1 引言 大语言模型的知识基准可以充当难度温度计或诊断工具,而当前的设计主要倾向于前者。主流策略——将测试集扩展到数百个子领域[7 (https://arxiv.org/html/2606.05104#bib.bib4)],并将每个题项推向研究前沿难度[22 (https://arxiv.org/html/2606.05104#bib.bib5)]——告诉我们前沿模型*是否*遇到困难,但较少说明它们*在哪里*以及*为什么*遇到困难。现有流程没有将学科代表性形式化为选择标准,没有在正式保证下将评审报酬与投入对齐,也没有常规性地报告观察到的模型排名在重采样下是否稳定。我们认为,代表性、激励对齐的评审以及排名稳定性应被视为知识基准的主要设计考量,并开发了KINA(诺亚方舟知识索引)来具体论证这一点。我们依次阐述这三个关注点。 当前基准中的题项通常按学科分类组织,而非根据它们是否引出一个学科的核心能力来选择;因此,整体难度可能很高,但对理论枢纽点的覆盖却仍不均衡。大多数评审流程也按固定每题报酬支付评审者,因此接受一个边界题项不产生任何成本,理性评审往往收敛到"偷懒式共识";GPQA[23 (https://arxiv.org/html/2606.05104#bib.bib2)]那样的专家流程采用了重奖金设计,减轻了但并未从形式上排除这种失败模式。最后,尽管一个约\(10^3\)题项的紧凑测试集便于迭代且不易受到污染,但在这样一个集合上,前沿模型之间排行榜顶部的5分差距可能经不起重采样,而自助法稳定的排名很少与头条数据一同报告。 KINA是一个包含899个题项、涵盖261个精细学科的基准,围绕针对前两个差距的两个正式结果而设计。为解决代表性问题,我们将标准操作化为*预算支持中心度*,这是一个可操作的代理指标:每个候选题项根据专家引出的学科对齐锚点进行评分,然后在容量约束下贪心地选择题项。命题1 (https://arxiv.org/html/2606.05104#Thmproposition1)表明,由此产生的选择目标是单调子模的,因此贪心选择达到了代理指标最优的\((1-1/e)\)近似。我们将该代理指标视为代表性的一个易处理替代指标,而非对代表性本身的全局保证。为解决评审质量问题,我们用*达标奖励锦标赛*替代固定报酬:两名评审者对每个题项进行评估,得分较高的评审者获得奖金\(B\),但前提是获胜分数超过一个阈值\(\tau\);同时,主办方进行随机审计以阻止串通批准。在投入诱导的FOSD、评分噪声独立性以及聚合函数的单调性等标准假设下(假设1 (https://arxiv.org/html/2606.05104#Thmassumption1)–3 (https://arxiv.org/html/2606.05104#Thmassumption3)),定理1 (https://arxiv.org/html/2606.05104#Thmtheorem1)证明,该机制在FOSD意义上相对于固定报酬基线严格提高了已发布评审的质量,并给出了封闭形式的奖金校准公式\(B > \Delta C / \Delta p_{\min}\)。第三个差距——排名稳定性——通过经验而非形式化的方式处理,即在KINA的排行榜上报告基于自助法的排名统计量作为标准栏目。 我们在KINA上评估了来自13家实验室的42个前沿模型。Gemini-3.1-Pro-Preview以53.17%的总体准确率领先,Claude-Opus-4.6和GPT-5.4紧随其后,分别为49.92%和48.55%,排行榜远未饱和。网络搜索增强在五项工具使用评估中带来了正增益,但增益不均匀,从+1.50到+5.17个百分点不等,这表明检索对弱基座模型和强基座模型的贡献方式不同。按学科分析揭示了前10名模型内部的异质性分布,这是仅靠聚合准确率所无法显示的:在科学领域,离散度仅为9.83个百分点,而在社会学领域则高达38.16个百分点。我们将其视为提示性而非结论性的,因为离散度最大的学科题项数量也最少;我们从中得出的结论是,人文学科和社会科学内容应在前沿领域单独报告,而非将其视为主要的区分来源。我们在§5.2 (https://arxiv.org/html/2606.05104#S5.SS2)中进一步报告了基于自助法的排名稳定性统计量,以使有限测试预算下的方差对读者可见而非隐含。 我们的贡献有三方面。 1.  (第3.1节 (https://arxiv.org/html/2606.05104#S3.SS1)) 将学科代表性形式化为预算支持中心度,并证明结果选择目标是单调子模的,从而在贪心选择下对代理指标给出\((1-1/e)\)的近似保证。 2.  (第3.2节 (https://arxiv.org/html/2606.05104#S3.SS2)) 证明,在投入诱导的FOSD、评分噪声独立性以及聚合函数单调性的标准假设下,达标奖励锦标赛相对于固定报酬基线严格提高了已发布评审的质量,并给出了封闭形式的奖金校准公式。 3.  (第5节 (https://arxiv.org/html/2606.05104#S5)) 发布KINA,附带42个前沿模型的评估、按学科分数、网络搜索消融实验、参数缩放分析以及基于自助法的排名稳定性统计量。除数据集外,我们还发布了标注和评审手册、大语言模型评判准则以及评估代码,以便复现和扩展。 ## 2 相关工作 ##### 知识基准。 标准范式由SuperGLUE[30 (https://arxiv.org/html/2606.05104#bib.bib11)]和MMLU[11 (https://arxiv.org/html/2606.05104#bib.bib9)]确立,两者现已被前沿模型饱和,并存在已知的质量问题。对MMLU的事后分析[9 (https://arxiv.org/html/2606.05104#bib.bib45)]估计整体错误率为6.5%,多个领域的每学科错误率超过50%,且在更正错误后的子集上排名发生变化。后续工作沿两条轨迹展开。*深度优先*路线包括ScienceQA[16 (https://arxiv.org/html/2606.05104#bib.bib12)]、ARC-AGI[4 (https://arxiv.org/html/2606.05104#bib.bib10),5 (https://arxiv.org/html/2606.05104#bib.bib13)]、GPQA[23 (https://arxiv.org/html/2606.05104#bib.bib2)]和HLE[22 (https://arxiv.org/html/2606.05104#bib.bib5)]。*广度优先*路线包括MMLU-Pro[31 (https://arxiv.org/html/2606.05104#bib.bib3)]和SuperGPQA[7 (https://arxiv.org/html/2606.05104#bib.bib4)]。这些设计均未将*学科代表性*作为明确的选择标准:题项按难度评分或按可得性获取,而非根据它们是否探测核心理论枢纽点。 ##### 标注方法论与激励设计。 GPQA开创了专家在环流程,报酬约为$95/小时,经过三个阶段验证,但仅涵盖三个领域。SuperGPQA将相同的专家评审模板扩展到约80名标注者和26,529个题项;最初的广泛众包尝试拒绝了63%的提交,从而转向纯专家标注。HLE采用开放式征集,奖金池为$500,000,每个题项有约5分钟的验证时间上限。发布后的审计[36 (https://arxiv.org/html/2606.05104#bib.bib8),29 (https://arxiv.org/html/2606.05104#bib.bib33)]发现,29±3.7%的生物和化学题项与同行评审文献相冲突,只有26%的审计题项未经修改即通过验证。结构性原因在于激励:固定报酬的评审投入上限,加上"难倒LLM"的贡献者激励,驱使评审者走向偷懒式共识。据我们所知,此前没有知识基准从形式上分析其评审流程的激励结构。 ##### 启发式激励的机制设计。 锦标赛和竞赛机制在劳动经济学中历史悠久[14 (https://arxiv.org/html/2606.05104#bib.bib46)],并已用于NLP中的对抗性数据收集[19 (https://arxiv.org/html/2606.05104#bib.bib49)]。我们在标注评审中使用达标奖励锦标赛,据我们所知在LLM基准设定中是新颖的。我们的分析(第3.2节 (https://arxiv.org/html/2606.05104#S3.SS2))是在标准FOSD假设下相对于固定报酬的比较性主张,而非完整的均衡刻画。 ##### 比较。 表1 (https://arxiv.org/html/2606.05104#S2.T1)将KINA与具有代表性的先前基准在五个维度上进行对比。 表1:KINA与先前知识基准的比较。"学科" = 学科数量;"代表" = 明确的代表性标准;"激励" = 明确的激励对齐评审;"工具" = 原始论文中报告的工具使用评估。前沿模型的最佳饱和总体准确率均为近似值。 ## 3 数据流程的两个正式保证 KINA的数据流程有两个决策,其质量主导着下游的一切:从更大的候选池中保留哪些题项,以及如何补偿认证幸存题项的评审者。我们在每个决策点给出一个正式保证。第一个保证表明贪心选择在覆盖一个学科方面足够好,其具体含义将在下文精确说明。第二个保证表明锦标赛式支付方案在激发评审者投入方面足够好,含义类似。两个论证相互独立,但共同界定了读者可以从KINA流程中作为正式主张(而非方法论选择)所接受的内容。第4节 (https://arxiv.org/html/2606.05104#S4)描述了每个保证在实际工作流程中如何实现,第6节 (https://arxiv.org/html/2606.05104#S6)则说明了两个保证均未确立的内容。 ### 3.1 选择:对学科原型的贪心覆盖 代表性是所选子集的性质,而非孤立题项的性质。一个题项如果实质性地支持其学科的至少一个规范锚点,则定位良好;一个子集如果每个重要锚点都至少被其中包含的一个题项所支持,则具有代表性。为使其具体化,领域专家引出一个紧凑的学科原型\(\Sigma_d\),包含方法、问题、定理、概念和应用,然后由大语言模型评判对每个候选题项\(q\)评估其支持每个锚点\(u\)的强度,产生\(\hat{S}_{d}^{\mathrm{sp}}(q,u) \in [0,1]\)。我们将这些分数聚合成一个覆盖目标: \[ F_{d}^{\mathrm{sp}}(\mathcal{S}) \triangleq \sum_{u \in \bar{B}_{d}} \mu_d(u) \, \max_{q \in \mathcal{S}} \hat{S}_{d}^{\mathrm{sp}}(q,u), \tag{1} \] 其中锚点权重\(\mu_d(u) \geq 0\)。选择过程选取大小为\(K_d\)的\(\mathcal{S}_d\)以最大化\(F_{d}^{\mathrm{sp}}\),同时受限于每个子领域的配额和近重复约束(详见附录B (https://arxiv.org/html/2606.05104#A2))。目标函数\(F_{d}^{\mathrm{sp}}\)是单调且子模的:对于每个锚点\(u\),每锚点覆盖\(\max_{q \in \mathcal{S}} \hat{S}_{d}^{\mathrm{sp}}(q,u)\)在\(\mathcal{S}\)上是单调且子模的(标准最大覆盖论证);\(F_{d}^{\mathrm{sp}}\)是此类函数的非负加权和,继承了这两个性质。因此,在基数约束\(|\mathcal{S}_d| = K_d\)下的贪心最大化达到了代理指标最优的\((1-1/e)\)近似(命题1 (https://arxiv.org/html/2606.05104#Thmproposition1);完整陈述和证明见附录B (https://arxiv.org/html/2606.05104#A2))。我们使用的懒惰贪心变体也在那里描述。 ### 3.2 评审:达标奖励锦标赛 两名评审者独立评估每个题项。在固定每题报酬下,评审者的最优投入是无论题项质量如何,最小化私人负效用,这正是我们想要排除的失败模式。我们改为支付基本工资加单一奖金给得分较高的评审者,前提是获胜分数超过最低阈值\(\tau\)。该阈值的存在是为了阻止串通批准:两名评审者无法达成一致投入低努力并平分奖金,因为低质量的获胜者将失去奖金。我们希望在透明假设下证明,该方案相对于固定基线严格提高了已发布评审的质量。 我们假设投入以一阶随机占优(FOSD)意义提高了潜在评审质量(假设1 (https://arxiv.org/html/2606.05104#Thmassumption1)),主办方观察到一个单调的噪声分数,其噪声在评审者之间独立(假设2 (https://arxiv.org/html/2606.05104#Thmassumption2)),且评审者的成本函

相似文章

BAGEL:语言模型中的动物知识专业性基准评估

arXiv cs.CL

BAGEL是一个用于评估大语言模型中与动物相关知识的新基准,从多种科学资源构建,涵盖分类学、形态学、栖息地、行为和物种相互作用等方面,通过闭卷问答对形式呈现。该基准可以进行跨分类群和知识类别的细粒度分析,为生物多样性应用中的模型优势和失败模式提供洞见。

KACE:面向数学推理的知识自适应上下文工程

arXiv cs.AI

KACE 引入了一种知识自适应上下文工程方法,通过认知树和分层自一致性将存储与使用分离,在 AIME 2025 上达到了 62.2% 的准确率——相比固定自一致性提升了 10.4 个百分点。

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。