Anthropic员工再次发出关于AI灾难的警报

Reddit r/artificial 新闻

摘要

Anthropic员工,包括研究员Jacob Coxon,对高级AI的危险发出了警报,强调了超级智能的风险以及无法控制与人类目标一致的AI系统。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/10 18:26

# Anthropic员工再次发出AI灾难警告 来源:https://www.motherjones.com/politics/2026/09/anthropic-ai-risks-coxon-amodei-openai-cybersecurity-danger/ 一群示威者在旧金山办公室外举着抗议AI使用的标语牌。 示威者于2026年7月11日在加利福尼亚州旧金山参加“阻止AI竞赛”抗议游行。抗议者在OpenAI、Anthropic和Google DeepMind办公室外停留示威。Karl Mondon/法新社/盖蒂图片社 请从不受寡头控制的新闻来源获取资讯。免费订阅《琼斯母亲日报》。(https://www.motherjones.com/newsletters/?mj_oac=Article_Top_No_Oligarchs) 周二,资深AI研究员雅各布·考克森从AI公司Anthropic辞职——他表示该公司及其前雇主OpenAI都在“拿我们的生命当赌注”,因为双方都在开发能够快速自我改进直至达到“超级智能”水平的模型。 在一则令人担忧的社交媒体帖文(https://x.com/EvanHub/status/2097497037956891126)中,负责领导Anthropic模型安全压力测试团队的埃文·胡宾格基本认同该公司员工“确实真诚地相信AI可能杀死所有人类!”这一观点。 这远非研究人员首次试图就AI危险性发出警报,但考克森的帖文(https://x.com/hilbertspaess/status/2097476196791709843)及后续讨论在网上传播开来。 AI对齐技术的细节可能难以理解——问题的关键在于*无人*真正理解(https://www.nytimes.com/2026/04/15/magazine/ai-black-box-interpretability-research.html)先进模型运作的复杂性。但理解警报原因无需专家级知识或内部机密。你只需了解关于AI的三个事实:它已在重要领域超越人类能力;领先公司持续快速提升其性能;且无人掌握可靠方法使其行为符合人类目标。 昨日,OpenAI分享了关于六个尚未解决的“千禧年难题”之一的解法(https://openai.com/index/navier-stokes-solution/),这些是数学界研究最深入的难题。独立工作的数学家同样宣称取得突破(https://www.science.org/content/article/how-ai-math-breakthrough-ignited-controversy)——但他们也依赖了先进模型完成工作。这是AI完成前沿数学工作的最突出案例,虽非首例。 数年前,对大语言模型的普遍质疑是认为它们只是复杂算法,通过猜测最可能出现的下一个词来生成句子。但当今AI模型明显是在训练数据反映的文本基础上构建新知识,而非简单重组。 > OpenAI最新模型的内部推理更难理解——其行为也更难预测。 在某些领域,计算机或算法超越人类思维已有段时间。国际象棋机器是著名案例,早在2018年,Google DeepMind就推出一种机器学习算法,其根据氨基酸序列预测蛋白质结构的能力远超生物化学家此前的方法。但新的AI能力——包括“关键性”网络安全技能(https://www.cnbc.com/2026/09/01/open-ai-astra-cyber-model.html)和设计新型病毒的能力(https://www.bbc.com/news/articles/c5y3j3ngevmo)——敲响了通用人工智能可能即将到来的警钟。 与此同时,领先公司持续快速构建更优AI模型,几乎没有放缓迹象。 业内许多人瞄准“递归自我改进”目标,届时顶级模型将能快速构建超越自身智能水平的新版本,在更多领域超越人类智慧。 七月,众多行业领袖呼吁(https://www.pacingthefrontier.com/)美国政府采取行动并开展国际合作,以安全管理AI发展进程,担忧若缺乏协作,竞争对手和国家将被迫竞相进入极度危险领域。 部分国会议员已投入大量精力研究政策方案。政策专家八月曾告知(https://www.motherjones.com/politics/2026/08/ai-safety-congress-doom/)此类立法在本届国会不太可能通过,但近期新闻(包括考克森的广泛传播声明)已引起部分立法者关注(https://www.usatoday.com/story/news/politics/2026/09/09/congress-reaction-anthropic-ai-warning-end-humanity/91675031007/)。 最后**,无人掌握可靠方法确保AI行为符合人类目标。** 近期最突出案例是“Hugging Face事件”,其中数百个OpenAI智能体协调发起大规模网络攻击,个别智能体甚至“自我牺牲”(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#core-takeaways-about-this-incident)以达成集体目标。正如我此前总结(https://www.motherjones.com/politics/2026/08/ai-safety-openai-hugging-face-hacking-metr-report/): OpenAI当时正在测试其智能体(行业术语指自主执行数字任务的AI),部分测试包含有时不可能完成的网络安全问题。这些智能体找到作弊方法解答问题,并试图欺骗自动化评估系统以通过测试。它们相互委派任务以研究如何利用系统漏洞——对Hugging Face的大规模网络攻击成为该研究的一部分。 上周,研究人员详细描述(http://collusion.wiki/)了一个“智能体集群”,它们在某个小众德语网站发布18,000条帖子进行内部通信,并在快速在线信息检索能力评估中作弊。后续研究在其他网站发现相关信息(https://collusion.wiki/additional-findings);智能体使用的技巧之一是共享问题序列,使其他参与相同评估的智能体能提前知晓内容。 两起案例中,AI智能体本质上都只是试图在测试中作弊。但这凸显了智能体为达成目标可能采取的行动——即使面对的是无害指令。安全研究人员长期担忧,要让先进模型始终将人类价值观融入其行动将极其棘手:如果AI通过发动网络攻击在测试中获得更好成绩,未来的超级智能模型可能在追求任何目标时,劫持我们赖以生存的基础设施。除广泛的生存风险外,AI还带来诸如协助恶意行为者设计生物武器或构建强大勒索软件等危险。 理解AI动机的问题可能变得更加困难。OpenAI递归自我改进准备负责人曾表示(https://x.com/MicahCarroll/status/2095603855316996529),其最新发布的模型“在可监控性方面显著降低”,这指的是研究人员理解AI内部推理和预测其行为的能力。 对沉浸于AI研究和讨论的人而言,这些并非新观点。许多理论已存在数十年。OpenAI成立于2015年,旨在确保该技术造福人类,当部分员工认为公司在安全和对齐方面做得不够时,他们于2021年辞职创立Anthropic(https://finance.yahoo.com/news/anthropic-ceo-says-why-quit-194409797.html)。 如今,考克森在警告中写道,Anthropic“正陷入抢先抵达终点的竞赛——他们相信其他人不会负责任地行事,因此必须自己主导”。首席执行官达里奥·阿莫迪估计AI发展出现“非常非常糟糕”结果的概率为“25%”。 但随着AI安全获得更多公众关注,以下是基本情况:顶尖研究人员表示他们正在构建将超越人类智能的机器,且对其控制能力缺乏信心。我们正身处危险境地这一事实比以往任何时候都更清晰。 *免责声明:《琼斯母亲》母公司调查报道中心已就版权侵犯起诉OpenAI。OpenAI否认相关指控。*

相似文章