@EdgarDobriban: AI已帮助解决了统计学中的一个重要问题。在多假设检验领域,控制…
摘要
使用GPT-5.6 Sol Pro,Edgar Dobriban反驳了一个长期存在的猜想,即Benjamini-Hochberg过程能控制相关双边高斯检验的错误发现率,证明其在很小但实际存在的水平上失效。该结果概念性强,实际影响有限,但解决了统计学中的一个核心问题。
查看缓存全文
缓存时间: 2026/07/16 20:17
人工智能帮助解决了一个统计学中的重要问题。在多重假设检验领域,控制错误发现率(FDR)的目标由Benjamini和Hochberg(1995)在一篇开创性论文中提出。他们还引入了一种方法(即Benjamini-Hochberg方法,简称BH方法),并证明了该方法能够控制FDR。这一方法已被广泛应用于现代高通量科学中,包括基因组学、天文学、经济学等领域。该论文至今已被引用超过13万次。然而,Benjamini和Hochberg仅在各个检验的数据独立的情况下证明了FDR的可控性。在实践中,这些数据通常是相关的;一个典型的例子是由于连锁不平衡导致的遗传变异数据。随后的研究致力于扩展BH过程的适用范围,例如Benjamini和Yekutieli(2001)将其扩展到一种正相关的情形。但BH过程在何种条件下能够控制FDR这一问题一直悬而未决。过去二十年间,包括Reiner-Benaim(2007)、Kim and van de Wiel(2008)、Benjamini(2010)、Sarkar(2023)、Sarkar and Zhang(2025)在内的许多学者猜想,对于任意相关高斯数据下的双尾检验,BH过程均能控制FDR。这些学者展示了支持该猜想的理论和实证证据,但并未直接证明。借助AI(具体为GPT-5.6 Sol Pro),我给出了否定答案:对于相关双尾高斯检验,Benjamini-Hochberg过程不能普遍地在期望水平上控制错误发现率。具体方法是展示一个高斯因子模型,在名义水平α=0.01下,经证明其错误发现率FDR>0.0104。以下是一些有趣的评论:1. 这一结果应该会引起统计学界所有人的兴趣。斯坦福大学的Emmanuel Candes曾将错误发现率和Benjamini-Hochberg过程称为“1950年后统计学领域最重要的两项发展“(另一项是James-Stein收缩)。本猜想很可能是迄今为止关于FDR/BH尚未解决的最核心问题。2. GPT-5.6在推理90分钟后一次性地解决了该问题,而使用5.5版本时,即使通过多个并行智能体迭代约20小时,我也未能解决。因此,能力的提升是实实在在的。我们生活在一个激动人心的时代!3. 论证本身并不特别出人意料,但它将渐近方法(FDR分析的标准方法,参见Genovese and Wasserman、Efron等)与数值验证以一种在该领域相当非标准的方式结合了起来。一旦有了具体示例,简单的模拟也支持错误发现率确实高于名义值(参见附图)。4. 当前偏离名义水平的程度相对较小(0.104对0.1),因此这一结果的重要性主要体现在概念层面。实际影响有待进一步确定。总体而言,这是一项令人振奋的进展!预印本可在此获取(https://faculty.wharton.upenn.edu/wp-content/uploads/2017/06/bh.pdf…),今晚将上传至arxiv;配套代码在此(https://github.com/dobriban/BH)。
相似文章
ChatGPT Sol 5.6 high 在两篇最近发表的黎曼猜想论文中发现了一个归一化错误。作者已确认。
一位非数学家使用 ChatGPT 识别出两篇最近发表的黎曼猜想论文中的归一化错误,且作者在收到联系后确认了该问题。这个故事凸显了 AI 在辅助数学研究方面日益增长的作用。
据Sam Altman称,GPT-5.6发现了新的数学发现
Sam Altman宣布,GPT-5.6发现了新的数学见解,标志着人工智能能力的重大进步。
@mattshumer_: 又一个长期未解的猜想被AI推翻了。疯狂的是提示词……基本上:- “做一次突破…”
一条推文报道,AI(很可能是GPT-5.6 Pro)推翻了图论中一个长期未解的Dinitz-Garg-Goemans猜想,使用的提示词很简单,比如“做一次突破”。
GPT-5.6 解决又一个未解难题
GPT-5.6 取得了突破,解决了一个此前未解决的难题,标志着人工智能能力的重大进步。
@gdb:GPT-5.6 Sol 用于解决100多年历史的猜想。没想到这种水平的智能能被每个人访问并可用……
据报道,GPT-5.6 Sol 找到了 Maxwell 猜想的一个反例,这是一个有100多年历史的问题,人类数学家已对这一结果进行沟通。