@EdgarDobriban: AI已帮助解决了统计学中的一个重要问题。在多假设检验领域,控制…
摘要
使用GPT-5.6 Sol Pro,Edgar Dobriban反驳了一个长期存在的猜想,即Benjamini-Hochberg过程能控制相关双边高斯检验的错误发现率,证明其在很小但实际存在的水平上失效。该结果概念性强,实际影响有限,但解决了统计学中的一个核心问题。
查看缓存全文
缓存时间: 2026/07/16 20:17
人工智能帮助解决了一个统计学中的重要问题。在多重假设检验领域,控制错误发现率(FDR)的目标由Benjamini和Hochberg(1995)在一篇开创性论文中提出。他们还引入了一种方法(即Benjamini-Hochberg方法,简称BH方法),并证明了该方法能够控制FDR。这一方法已被广泛应用于现代高通量科学中,包括基因组学、天文学、经济学等领域。该论文至今已被引用超过13万次。然而,Benjamini和Hochberg仅在各个检验的数据独立的情况下证明了FDR的可控性。在实践中,这些数据通常是相关的;一个典型的例子是由于连锁不平衡导致的遗传变异数据。随后的研究致力于扩展BH过程的适用范围,例如Benjamini和Yekutieli(2001)将其扩展到一种正相关的情形。但BH过程在何种条件下能够控制FDR这一问题一直悬而未决。过去二十年间,包括Reiner-Benaim(2007)、Kim and van de Wiel(2008)、Benjamini(2010)、Sarkar(2023)、Sarkar and Zhang(2025)在内的许多学者猜想,对于任意相关高斯数据下的双尾检验,BH过程均能控制FDR。这些学者展示了支持该猜想的理论和实证证据,但并未直接证明。借助AI(具体为GPT-5.6 Sol Pro),我给出了否定答案:对于相关双尾高斯检验,Benjamini-Hochberg过程不能普遍地在期望水平上控制错误发现率。具体方法是展示一个高斯因子模型,在名义水平α=0.01下,经证明其错误发现率FDR>0.0104。以下是一些有趣的评论:1. 这一结果应该会引起统计学界所有人的兴趣。斯坦福大学的Emmanuel Candes曾将错误发现率和Benjamini-Hochberg过程称为“1950年后统计学领域最重要的两项发展“(另一项是James-Stein收缩)。本猜想很可能是迄今为止关于FDR/BH尚未解决的最核心问题。2. GPT-5.6在推理90分钟后一次性地解决了该问题,而使用5.5版本时,即使通过多个并行智能体迭代约20小时,我也未能解决。因此,能力的提升是实实在在的。我们生活在一个激动人心的时代!3. 论证本身并不特别出人意料,但它将渐近方法(FDR分析的标准方法,参见Genovese and Wasserman、Efron等)与数值验证以一种在该领域相当非标准的方式结合了起来。一旦有了具体示例,简单的模拟也支持错误发现率确实高于名义值(参见附图)。4. 当前偏离名义水平的程度相对较小(0.104对0.1),因此这一结果的重要性主要体现在概念层面。实际影响有待进一步确定。总体而言,这是一项令人振奋的进展!预印本可在此获取(https://faculty.wharton.upenn.edu/wp-content/uploads/2017/06/bh.pdf…),今晚将上传至arxiv;配套代码在此(https://github.com/dobriban/BH)。
相似文章
据Sam Altman称,GPT-5.6发现了新的数学发现
Sam Altman宣布,GPT-5.6发现了新的数学见解,标志着人工智能能力的重大进步。
GPT-5.6 解决又一个未解难题
GPT-5.6 取得了突破,解决了一个此前未解决的难题,标志着人工智能能力的重大进步。
@rohanpaul_ai: 这太棒了。GPT-5.6 Sol Ultra 在一小时内使用64个子代理证明了一个有五十年历史的猜想。该成果…
据报道,OpenAI 发布的 GPT-5.6 Sol Ultra 在一小时内使用64个子代理证明了已有五十年历史的 Cycle Double Cover 猜想,标志着人工智能领域的重大突破。
GPT-5.2 在理论物理学中推导出一个新结果
GPT-5.2 协助推导出一个新的理论物理学结果,表明在特定半共线动量条件下,单负胶子树图振幅可以非零,挑战了粒子物理学中数十年的假设。该AI模型识别了复杂费曼图表达式中的模式,并推测出一个通用公式,随后通过形式化证明得到了验证。
又一个50多年未解决的Erdős问题被GPT-5.6攻克
GPT-5.6又解决了一个由数学家Paul Erdős提出的50多年未解决的难题,展示了人工智能在数学推理能力上的重大飞跃。