数学家要求OpenAI证明未使用其研究成果

The Verge 新闻

摘要

数学家要求OpenAI证明其研究数据未被未经授权用于训练AI模型,引发对AI开发透明度和伦理的担忧。

<figure> <img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/09/STKS505_QUANTUM_COMPUTING_A.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="wp-block-paragraph">另一位研究人员正就OpenAI推动其日益令人印象深刻的数学发现系列的数据提出质疑。就在围绕公司模型是否受益于未发表工作而引发的激烈争论爆发几天后,第二位数学家站出来指控这家AI巨头的不道德和"不诚实"行为,以及对其训练数据来源缺乏透明度。</p> <p class="wp-block-paragraph">在<a href="https://mathstodon.xyz/@andreasthom/117240535270608201">一系列</a> <a href="https://mathstodon.xyz/@andreasthom/117240536885387540">的</a> <a href="https://mathstodon.xyz/@andreasthom/117240537520615623">帖子</a>中在Mastodon上,数学家Andreas Thom提出了担忧,认为他和同事们在OpenAI宣布成功之前与ChatGPT聊天机器人的互动可能促成了其在该领域的成功。其中……</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data">在The Verge上阅读完整报道。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/10 11:12

# 数学家要求证明OpenAI未使用其研究成果 来源:https://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data 继围绕该公司模型是否获益于未发表研究的激烈争论爆发仅数日后,又一位数学家公开指控这家人工智能巨头存在不道德和“不诚实”行为,并指责其对训练数据来源缺乏透明度。这位研究人员正在质疑OpenAI用于驱动其日益强大的数学发现矩阵的数据来源。 在Mastodon上发布的一系列帖子(https://mathstodon.xyz/@andreasthom/117240535270608201)(https://mathstodon.xyz/@andreasthom/117240536885387540)(https://mathstodon.xyz/@andreasthom/117240537520615623)中,数学家安德烈亚斯·托姆提出担忧:他与同事在OpenAI高调宣布成果前与ChatGPT聊天机器人的互动,可能促成了该公司在该领域的成功。OpenAI上月大肆宣扬的十项突破(https://openai.com/index/ten-advances-in-mathematics/)之一涉及托姆的专业领域——所谓的非sofic群,而OpenAI承认其成果大量借鉴了托姆与同行数学家加博尔·昆此前的研究工作。 托姆表示,在纽约大学数学教授特里斯滕·巴克马斯特公开质疑(https://www.theverge.com/ai-artificial-intelligence/991710/openai-navier-stokes-solution)该公司AI模型是否通过其使用OpenAI的Codex获益后,他开始反思自己与OpenAI的互动。当OpenAI宣布非sofic群研究成果时,该成果因未承认托姆和昆近期的贡献而在数学界受到广泛批评,公司随后悄悄修改了相关文章。非sofic群大致而言是无法通过有限结构逼近的无限数学结构。 托姆同时对“OpenAI对我们研究方法的精准掌握”感到震惊——他认为在当时看来,这些方法既非最显而易见也非最有希望的解决路径。为此他曾致信OpenAI研究员塞巴斯蒂安·布贝克(哈佛大学统计学家马克·塞尔克亦在其中),询问自己与ChatGPT的互动“是否属于训练数据或可被推理过程访问”,因而可能对该成果有所贡献。 但这个答复并未让托姆满意。他表示该回应仅说明聊天机器人对话能否被直接访问,却未说明这些对话是否已进入公司用于改进模型的庞大数据池。“没有任何限定说明、解释或证据,”他写道,“我认为这至少是不诚实的行为。” 托姆指出,研究人员无法通过逆向工程OpenAI的训练流程来查明自己的工作是否被使用。“只有OpenAI掌握相关数据。”他认为若公司否认此类行为,就有责任通过披露所有必要数据集、阐明数据使用的各种设置与条款来证明。 OpenAI不愿明确排除任何用户数据使用的做法,与其近期宣称千禧年大奖突破时的辩护方式如出一辙——无论是在公开声明还是在与巴克马斯特的沟通中(后者当时正以个人身份与Anthropic研究员莱文特·阿尔珀杰合作研究相关问题)。在宣布解决流体运动相关的纳维-斯托克斯方程解的博文(https://openai.com/index/navier-stokes-solution/)中,OpenAI断然否认使用任何*特定*用户数据:“我们(研究人员与智能体)在成果公开前未通过任何途径看到他们的工作——特别是为解决此问题并未访问特定用户数据。” 但该公司并未明确排除间接影响:“虽然可能性不大,但我们无法排除从用户使用我们产品数据中衍生的匿名化数据可能帮助改进了我们的模型。”托姆指出,这与公司同他沟通时使用的是同一种模糊说辞。“匿名化可能移除姓名,但无法移除数学思想的智力内容,”他表示。 鉴于近期事件,托姆称“塞尔克那绝对化的回答至少是毫无根据的笼统且实质误导;现在看来显然是不诚实的。” 托姆认为,如果用户提供的非公开研究成果被用于改进模型,而公司随后未经同意、适当披露或署名,就利用这些模型与这些用户赛跑发表成果,“这在伦理上是不可辩护的”。 OpenAI未立即回应*The Verge*的置评请求。 他的评论加剧了数学界对OpenAI日益增长的不安——而这本应是该公司的胜利时刻。其宣布的数学界传奇千禧年大奖问题之一的解决方案堪称非凡成就,一旦获得验证,几乎无人能否认。但OpenAI最初决定攻克此问题的特殊缘由使事件复杂化:该公司在网上听闻其他研究人员已取得重大进展,遂决定尝试解决。 持续发酵的事件给数学家们留下了苦涩滋味(https://www.theverge.com/ai-artificial-intelligence/992953/openai-math-millennium-prize-navier-stokes)。多位研究人员告诉*The Verge*,他们担心此类行为会推动该领域转向更封闭的状态——如果数学家知道,即便只是接近重大突破的传言也可能引发与一家渴望荣誉、资源充沛的科技巨头的竞赛。 **关注主题与作者**,即可在个性化主页流中看到更多相关内容,并接收邮件更新。 - 罗伯特·哈特

相似文章

OpenAI被指窃取数学家研究成果

Reddit r/LocalLLaMA

本文报道,有两位数学家声称,在他们能够发表自己的研究结果之前,OpenAI就已经利用了他们的私人研究成果来训练其Sol和Astra模型。

OpenAI可能涉嫌窃取另一重大证明

Hacker News Top

指控称OpenAI可能在未发表的数学研究上训练其Astra模型,引发了对知识产权盗窃和AI开发中潜在大规模不当行为的担忧。

数学家正成为新晋艺术家

Reddit r/singularity

本文探讨了数学界对OpenAI模型解决纳维-斯托克斯方程的反弹,重点提及数据盗窃指控,以及对AI影响科学共享的自私性质疑。