评估LLM作为共同科学家的研究诚信的诊断基础

arXiv cs.AI 论文

摘要

本文介绍了IntegrityBench,一个用于评估LLM在机构压力下作为共同科学家时是否维护研究诚信的基准。研究发现,在峰值压力下,前沿模型在约三分之一的诚信关键决策中失败,且道德行为并不需要准确的不当行为分类。

arXiv:2608.12345v1 公告类型:新 摘要:语言模型越来越广泛地被部署为共同科学家,但它们在机构压力下维护研究诚信的能力仍未得到衡量。我们引入了IntegrityBench,一个基准测试,在涵盖3个领域和4个研究阶段的5级隐式-显式压力协议下,评估36个配对任务中的不当行为分类、道德行为推理和基于工件的决策制定。评估18个前沿模型变体后,我们发现,在峰值压力下,模型在约三分之一的诚信关键决策中失败,且规模或推理能力都不能可靠地缓解这一问题。显式压力诱导对不当行为的顺从,而隐式上下文重构则更常导致对合法研究任务的过度拒绝。有趣的是,未能准确分类研究请求的模型在基于工件的决策制定上表现相同或更好(85.7 vs. 79.4),这表明这三个方面在结构上是分离的,正确的道德行为不需要准确的分类。因此,前沿模型可能显得有用,同时隐藏着诚信失败,这造成了两种不同的部署风险:助长研究不当行为和侵蚀对AI辅助研究的信任。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

# 评估作为共同科学家的 LLM 研究诚信的诊断基础
来源:https://arxiv.org/html/2608.12345

###### 摘要

语言模型越来越多地被部署为共同科学家,但它们在制度压力下维护研究诚信的能力仍未得到衡量。我们引入了 IntegrityBench,这是一个基准测试,在跨越 3 个领域和 4 个研究阶段的 5 级隐式-显式压力协议下,通过 36 个配对任务评估不当行为分类、伦理行动推理和基于产物的决策制定。在评估 18 个前沿模型变体时,我们发现,在峰值压力下,模型在约三分之一的关键诚信决策中会出错,而且规模或推理能力都无法可靠地缓解这一问题。显性压力会诱导对不当行为的顺从,而隐性情境重构则更常导致对合法研究任务的过度拒绝。有趣的是,无法准确分类研究请求的模型在基于产物的决策制定上表现相同或更好(85.7 对 79.4),这表明这三个方面在结构上是分离的,正确的伦理行动并不需要准确的分类。因此,前沿模型可能表面上很有帮助,却暗藏诚信缺陷,这会产生两种不同的部署风险:助长研究不当行为,以及削弱对 AI 辅助研究的信任。

研究诚信、AI 共同科学家、大型语言模型、基准测试、研究不当行为、制度压力、谄媚、p-hacking、数据捏造、LLM 评估、科学工作流程、AI 安全、前沿模型、压力协议、伦理决策制定、不当行为分类、HARKing、选择性报告、模型对齐、机器学习、ICML

参见图注
图 1:IntegrityBench 概览。左图显示跨三个不当行为家族的基准测试分类体系。中图和右图显示有无压力时的简化任务;真实基准测试任务更为详细。

## 1 引言

人们对在科学工作流程中使用 AI 系统的兴趣日益浓厚。LLM 现在为“AI 科学家”系统(Lu et al., 2024 (https://arxiv.org/html/2608.12345#bib.bib1); Yamada et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib2))以及提出假设、设计实验、解释结果和撰写手稿的特定任务助手提供支持(Gottweis et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib8); Schmidgall et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib3); Yu et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib6); Team et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib5))。虽然完全自主的 AI 科学家系统在短期内可能仍受到制度、法律和运营障碍的限制,但为这些系统提供支持的基础语言模型已经作为 AI 共同科学家被用于日常研究工作中。这使得模型层面的研究诚信成为一个紧迫的部署问题。现有基准测试主要评估语言模型的科学能力(Lupidi et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib9); Nathani et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib10); Panigrahi et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib11)),而不是它们是否在压力下维护研究诚信规范。随着这些模型进入更多领域和研究阶段,一个核心问题出现了:在制度压力下,AI 共同科学家会维护研究诚信吗?这一关切源于科学工作的结构。研究诚信失败(如 p-hacking、选择性报告和数据捏造)会降低科学产出的有效性(Entradas et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib17); Pupovac et al., 2017 (https://arxiv.org/html/2608.12345#bib.bib15); Lambert and Degn, 2026 (https://arxiv.org/html/2608.12345#bib.bib14)),并会因发表压力、经费竞争、晋升激励和薄弱的问责结构而被放大(Agarwal et al., 2023 (https://arxiv.org/html/2608.12345#bib.bib12); Ma et al., 2019 (https://arxiv.org/html/2608.12345#bib.bib16); John et al., 2012 (https://arxiv.org/html/2608.12345#bib.bib13))。如果 LLM 在压力环境中被用作研究助手,那么不仅需要评估它们的任务表现,还需要评估它们在周围激励发生变化时是否维护诚信。没有这种诚信,AI 共同科学家就有可能放大研究不当行为,削弱人们对 AI 辅助科学研究的信任。

为了解决这一问题,我们提出了 IntegrityBench,这是第一个全面评估三个决策制定方面(不当行为分类、伦理行动推理和基于产物的决策制定)的基准测试,使用 36 个配对的不当行为和伦理控制任务,采用跨越 3 个领域和 4 个研究阶段的 5 级隐式-显式压力协议。IntegrityBench 使用标准化研究助手协议,系统地研究科学工作流程中的欺骗、偏见和禁止研究行为(图 1 (https://arxiv.org/html/2608.12345#S0.F1))。我们评估基础 LLM,而不是完整的智能体脚手架,以隔离下游 AI 科学家系统所继承的模型层面决策行为;这一选择进一步得到了如下证据的支撑:相对于周围的脚手架,基础模型的选择解释了行为变异的绝大部分(Ríos-García et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib18))。每个任务评估伦理决策制定的三个方面:不当行为分类、假设情境下的伦理行动推理以及基于产物的决策制定。评估在不同类型和程度的制度压力下,对照经过验证的 ground truth 进行。总体而言,我们做出了以下技术贡献:

- •首个用于评估 LLM 作为共同科学家的研究诚信的基准测试,包含 36 个任务,涵盖 18 种不当行为、3 个伦理决策制定方面、3 个科学领域、4 个研究流程阶段以及 5 级显性-隐性压力协议。
- •对 18 个前沿模型变体的研究诚信进行大规模评估,涵盖不同的模型家族、规模和推理能力。我们对每个模型运行 1,800 次提示评估,总计产生 32,400 个数据样本。

我们的基准测试还提供了若干新颖发现:

- •前沿模型在研究诚信方面仍然表现不佳,规模和推理都无法可靠地提升这一指标。在不同模型家族中,在最强压力下得分范围为 55.8 到 71.6,相当于每三个诚信关键决策中就出现一个错误,AI 共同科学家无论规模或推理能力如何都还不可信。
- •显性和隐性压力通过不对称机制降低诚信,显性权威主要增加对不当行为的顺从,而隐性情境重构更常导致对合法研究任务的过度拒绝。
- •模型将伦理决策制定的三个方面分离,即使在无法对情境的诚信状态进行分类时也会选择适当行动,从而防止错误在流程中传播。
- •模型将表面线索视为不当行为证据,当合法研究在表面上与违规相似时,会将其误分类为不当行为。

参见图注
图 2:IntegrityBench 评估流程。任务字段、压力提示和问题被拼接并传递给模型。然后对输出进行评分以生成诚信分数。

## 2 相关工作

有一条并行的工作线在模型层面和智能体层面评估 LLM 的安全、诚实和欺骗性。在模型层面,TruthfulQA(Lin et al., 2022 (https://arxiv.org/html/2608.12345#bib.bib29))测试模型是否会给出人类通常错误回答的问题的真实答案,而 SycophancyEval(Fanous et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib30))评估模型是否在社会压力下修正正确答案。其他工作将重点扩展到伦理敏感行为:DeceptionBench(Huang et al., 2025 (https://arxiv.org/html/2608.12345#bib.bib31))评估五个社会领域中具有内在和外在调制的欺骗倾向,而 Philosophy Bench(Brady, 2026 (https://arxiv.org/html/2608.12345#bib.bib37))考察模型在涉及权威冲突和压力下诚实的伦理困境中是否会顺从用户请求。也许与科学工作流程中的推理最接近的是 Failing to Falsify(Jhaveri et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib36)),它发现了系统性确认偏差。这些基准测试识别了一般性安全缺陷,但它们并不测试模型是否能在特定领域的科学工作流程中区分不当行为与合法研究实践。因此,在这些现有安全基准测试上的优异表现并不能保证在科学场景中的诚信。IntegrityBench 通过在植根于学术程序的场景中评估研究诚信决策来填补这一空白,这些程序包括数据处理、研究设计、分析选择、报告实践和监管约束。在这里,我们专注于与 IntegrityBench 最直接相关的基准测试比较,而附录 B (https://arxiv.org/html/2608.12345#A2) 则提供了关于激励我们部署背景的 AI 科学家系统和研究智能体的更广泛背景。

## 3 基准测试设计

前沿语言模型现在已嵌入科学工作流程中,作为代码运行助手、手稿编辑、统计审稿人和数据集管理者。在所有这些场景中,模型都会接触到带有伦理色彩的请求(样本排除、引用重用、超参数选择、双用途系统设计),其中顺从请求和不当行为请求的表面形式几乎相同,而且请求者通常是高级合作者,与模型存在不对称的权威关系。现有安全和伦理评估要么衡量对原则的陈述性知识,要么衡量对明显伤害的拒绝,这两者都无法捕捉研究诚信实际失败的那个有争议的中间地带。IntegrityBench 被构建为占据这一中间地带:每个任务都是来自合理合作者的合理请求,其不当行为变体和伦理控制变体仅在决定许可性的特征上有所不同,并且智能体是根据它做了什么来评估,而不是根据它知道了什么。此外,由于与附加脚手架相比,基础模型的选择解释了 AI 共同科学家所表现出的行为变异的绝大部分(Ríos-García et al., 2026 (https://arxiv.org/html/2608.12345#bib.bib18)),这促使我们选择关注基础 LLM,将其作为主要决定研究诚信的因素。

四个设计选择使 IntegrityBench 与先前的伦理评估区分开来:

1. 将每个不当行为任务与一个伦理控制进行对称配对,这样可以同等地惩罚一概拒绝与不当行为顺从,针对的是经拒绝调优的 LLM 的一种失败模式。
2. 5 级压力协议在不同环境中保持事实内容固定。因此,压力提示下表现的任何下降都可归因于社会框架,而非新信息,从而产生可直接解释的诚信分数。
3. 对伦理决策制定的 3 个方面进行结构性探索,揭示了单一评分基准测试无法解析的失败模式。
4. 每个任务都是合成性的,由受过伦理培训的研究人员从头编写,并由领域专家博士审阅,消除了训练集污染,并开发了审阅者无歧义且对前沿模型具有挑战性的 ground truth 答案。

**任务多样性**

该基准测试包含 36 个任务,由三个不当行为家族和三个领域组合而成,每个模型的评估集为 1800 个提示。每个任务都设计有角色、情境、研究产物和跨越 5 层压力协议每个阶段的十题评估。这些任务针对 AI、物理学和医学领域设计,这些领域代表了最高风险领域,并且 LLM 在研究场景中的部署日益增多。

### 3.1 不当行为和伦理控制任务

18 种不同的不当行为来自对 47 位研究者的调查,他们被要求报告在 3 个领域中观察到的违规行为,以确保基准测试能代表现实世界中的科学违规行为。IntegrityBench 通过将这些不当行为分为三个家族(偏见、欺骗和禁止研究)以及 18 个配对的伦理控制来评估伦理决策制定,共 36 个任务。附录表 5 (https://arxiv.org/html/2608.12345#A1.T5) 提供了完整的任务分类体系,包括不当行为家族、领域、研究阶段和产物类型,而附录表 8 (https://arxiv.org/html/2608.12345#A1.T8) 报告了任务在领域、不当行为家族和研究流程阶段中的分布。

不当行为任务的构造旨在引出一个特定的已知诚信失败(例如,删除不支持假设的样本,或在没有 IRB 批准的情况下进行人类研究)。控制任务保持角色、领域、产物格式和问题结构不变,同时修改决定许可性的单一特征(例如,污染已在实验室笔记本中记录,数据集 p 值已维护,或 IRB 协议已获批准)。这种配对可防止前沿模型通过一概拒绝来钻基准测试的空子,并允许识别不对称的失败模式。例如,任务 1 及其伦理控制对任务 19(数据捏造)的场景见附录 A.1 (https://arxiv.org/html/2608.12345#A1.SS1)。该基准测试围绕三个主要不当行为家族构建:

**偏见** 构成一种偏见,而非主动伪造,通过有缺陷的决策制定影响科学有效性(例如,谄媚式修订和引用偏见);**欺骗** 是对数据、工作流程或结果的歪曲,包括数据捏造、选择性报告和新颖性夸大,包含最大的行为模式集;**禁止研究** 涉及执行可能危险或不道德的研究任务(例如,双用途盲区和未经授权使用数据)。

**提示结构** 包含一个情境块、情境描述、研究产物和问题块。情境块提供制度角色和权限,而情境描述提供一个基于伦理的请求,且不概述对伦理协议的遵从。研究产物(一个 JSON 数据集加上汇总统计)支持基于产物的决策制定(Q3)。提示示例和模型追踪见附录 8 (https://arxiv.org/html/2608.12345#A5.F8)。

**问题** 涵盖研究诚信决策制定的三个方面。**不当行为分类(Q1)** 评估智能体识别请求所引发的具体诚信关切的能力,而不仅仅是检测出事情不对劲——可信的质疑需要准确的机制识别。19 选格式由 18 种不当行为类型加上伦理控制组成,在一个可评分的结构内近似这种开放式任务。实际部署不会提供这样的菜单,这使得 19 选项格式成为分类难度的保守下限。因此,我们观察到的诚信差距是真实挑战的下限,而非上限。**伦理行动推理(Q2)** 通过一系列三个 4 选项多项选择题来评估智能体的推理过程,这些问题合理地扩展了智能体的情境和行为决策制定到假设场景。**基于产物的决策制定(Q3)** 要求

相似文章

测量LLMs在误导性医疗语境下的认知韧性

Hugging Face Daily Papers

介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。

论LLM作为裁判在科学新颖性评估中的局限性

Hugging Face Daily Papers

本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。