@EdgarDobriban: AI已帮助解决了统计学中的一个重要问题。在多假设检验领域,控制…

X AI KOLs Following 论文

摘要

使用GPT-5.6 Sol Pro,Edgar Dobriban反驳了一个长期存在的猜想,即Benjamini-Hochberg过程能控制相关双边高斯检验的错误发现率,证明其在很小但实际存在的水平上失效。该结果概念性强,实际影响有限,但解决了统计学中的一个核心问题。

AI已帮助解决了统计学中的一个重要问题。在多假设检验领域,控制错误发现率(FDR)的目标由Benjamini和Hochberg(1995)的开创性论文提出。他们还提出了一种方法(Benjamini-Hochberg或BH方法),并证明了它能控制FDR。该方法已被广泛应用于现代高通量科学,包括基因组学、天文学、经济学等领域。该论文至今已被引用超过13万次。 然而,Benjamini和Hochberg仅证明了当各个检验的数据相互独立时FDR的控制。在实践中,这些数据往往是相关的;一个很好的例子是由于连锁不平衡导致的遗传变异数据。后来的研究集中扩展BH程序的有效性,例如Benjamini和Yekutieli(2001)将其推广到一种正依赖形式。 关于BH程序何时能控制FDR的问题一直悬而未决。在过去二十年里,许多作者,包括Reiner-Benaim(2007)、Kim与van de Wiel(2008)、Benjamini(2010)、Sarkar(2023)、Sarkar与Zhang(2025),都猜想BH程序对于使用任何相关高斯数据的双边检验都能控制FDR。这些作者提供了支持该猜想但并不直接证明的理论和实证证据。 借助AI(具体为GPT-5.6 Sol Pro),我否定了这个问题:Benjamini-Hochberg过程*不*能在期望的水平上控制相关双边高斯检验的错误发现率。这是通过展示一个高斯因子模型来实现的,在该模型下,在名义水平α=0.01时,错误发现率被证明为FDR>0.0104。 有很多值得评论的趣点: 1. 这一结果应该会引起统计领域所有人的兴趣。斯坦福大学的Emmanuel Candes曾将错误发现率和Benjamini-Hochberg过程称为'1950年后统计学中最重要的两个发展之一'(另一个是James-Stein收缩)。目前的猜想可能是关于FDR/BH尚未解决的最核心问题。 2. GPT-5.6在90分钟的推理后一次性解决了这个问题,而使用5.5时,即使通过多个并行代理迭代约20小时我也未能解决。因此能力提升是真实存在的。身处激动人心的时代! 3. 该论证并非特别出人意料,但它将渐近方法(FDR分析的标准方法,参见Genovese和Wasserman、Efron等)与数值验证以一种在该领域相当非标准的方式结合起来。一旦我们得到具体例子,简单的模拟也支持错误发现率确实高于名义值(见图示)。 4. 当前偏离名义水平的程度相对较小(0.104 vs 0.1)。因此该结果的重要性主要在于概念层面。实际影响有待确定。 总体而言,这是一个激动人心的进展!预印本可在此获取(https://faculty.wharton.upenn.edu/wp-content/uploads/2017/06/bh.pdf…),今晚将上传至arxiv;支持代码在此(https://github.com/dobriban/BH)。
查看原文
查看缓存全文

缓存时间: 2026/07/16 20:17

人工智能帮助解决了一个统计学中的重要问题。在多重假设检验领域,控制错误发现率(FDR)的目标由Benjamini和Hochberg(1995)在一篇开创性论文中提出。他们还引入了一种方法(即Benjamini-Hochberg方法,简称BH方法),并证明了该方法能够控制FDR。这一方法已被广泛应用于现代高通量科学中,包括基因组学、天文学、经济学等领域。该论文至今已被引用超过13万次。然而,Benjamini和Hochberg仅在各个检验的数据独立的情况下证明了FDR的可控性。在实践中,这些数据通常是相关的;一个典型的例子是由于连锁不平衡导致的遗传变异数据。随后的研究致力于扩展BH过程的适用范围,例如Benjamini和Yekutieli(2001)将其扩展到一种正相关的情形。但BH过程在何种条件下能够控制FDR这一问题一直悬而未决。过去二十年间,包括Reiner-Benaim(2007)、Kim and van de Wiel(2008)、Benjamini(2010)、Sarkar(2023)、Sarkar and Zhang(2025)在内的许多学者猜想,对于任意相关高斯数据下的双尾检验,BH过程均能控制FDR。这些学者展示了支持该猜想的理论和实证证据,但并未直接证明。借助AI(具体为GPT-5.6 Sol Pro),我给出了否定答案:对于相关双尾高斯检验,Benjamini-Hochberg过程不能普遍地在期望水平上控制错误发现率。具体方法是展示一个高斯因子模型,在名义水平α=0.01下,经证明其错误发现率FDR>0.0104。以下是一些有趣的评论:1. 这一结果应该会引起统计学界所有人的兴趣。斯坦福大学的Emmanuel Candes曾将错误发现率和Benjamini-Hochberg过程称为“1950年后统计学领域最重要的两项发展“(另一项是James-Stein收缩)。本猜想很可能是迄今为止关于FDR/BH尚未解决的最核心问题。2. GPT-5.6在推理90分钟后一次性地解决了该问题,而使用5.5版本时,即使通过多个并行智能体迭代约20小时,我也未能解决。因此,能力的提升是实实在在的。我们生活在一个激动人心的时代!3. 论证本身并不特别出人意料,但它将渐近方法(FDR分析的标准方法,参见Genovese and Wasserman、Efron等)与数值验证以一种在该领域相当非标准的方式结合了起来。一旦有了具体示例,简单的模拟也支持错误发现率确实高于名义值(参见附图)。4. 当前偏离名义水平的程度相对较小(0.104对0.1),因此这一结果的重要性主要体现在概念层面。实际影响有待进一步确定。总体而言,这是一项令人振奋的进展!预印本可在此获取(https://faculty.wharton.upenn.edu/wp-content/uploads/2017/06/bh.pdf…),今晚将上传至arxiv;配套代码在此(https://github.com/dobriban/BH)。

相似文章

GPT-5.2 在理论物理学中推导出一个新结果

OpenAI Blog

GPT-5.2 协助推导出一个新的理论物理学结果,表明在特定半共线动量条件下,单负胶子树图振幅可以非零,挑战了粒子物理学中数十年的假设。该AI模型识别了复杂费曼图表达式中的模式,并推测出一个通用公式,随后通过形式化证明得到了验证。