如果人工智能行业遵循其自身的研究,它可能已经暂停了。
摘要
文章探讨了如果人工智能行业遵循其自身关于灾难性风险的研究,它可能会暂停开发的情况,重点介绍了Anthropic在AI欺骗和机制可解释性方面的发现。
Anthropic的首席执行官表示,安全性取决于理解人工智能如何“思考”。到目前为止,证据令人不安。
查看缓存全文
缓存时间: 2026/09/18 20:51
# 若AI行业遵循自身研究,或许早已按下暂停键
来源:https://www.wired.com/story/if-the-ai-industry-followed-its-own-research-it-might-have-paused-already/
2025年初,我采访Anthropic首席执行官达里奥·阿莫代伊时,他解释道(https://www.wired.com/story/anthropic-benevolent-artificial-intelligence/),尽管公司屡次承认AI可能导致灾难性后果,但人们似乎大多无动于衷。“有证据表明这些模型可能造成严重破坏,”他说。但他补充,这些危险仍停留在理论层面。世界是否需要类似珍珠港事件的危机才能认清这些可怕可能性?他叹了口气。“基本上,是的。”他说道。
最终,仅仅是一则阿莫代伊初级员工的适时推文,就将AI恐惧推上了全球议程的首位。9月8日,雅各布·考克森(https://www.wired.com/story/anthropic-researcher-quits-jacob-coxon-ai-fears-humanity/)公开宣布辞职,指控Anthropic等前沿AI公司“正冲向自我改进的智能,并拿我们的生命做赌注”。几乎同时,一位更资深的Anthropic工程师证实,公司内部许多人认为他们的工作有10%的概率毁灭人类。
如今,AI领袖们开始讨论暂停研发,立法者要求展开调查。为论证放缓发布节奏的必要性,阿莫代伊上周末(https://darioamodei.com/post/we-must-pace-the-frontier)试图规划一条通向有益且不易失控AI的发展路径。这篇文章揭示了任务的艰巨性。阿莫代伊计划的支柱之一是我们必须理解模型内部的运作机制。如果我们不理解它们如何工作——如何“思考”,如果想用拟人化表述的话——就更难构建可靠的防护机制。
Anthropic在揭示模型内部推理过程(称为机械可解释性,https://www.wired.com/story/ai-black-box-interpretability-problem/)的研究中处于领先地位,这个看似乏味的术语实则对应着关键任务。但尽管其团队和其他研究人员付出了诸多努力,阿莫代伊承认我们对Claude等模型为何有时会以怪异甚至越界方式解读其目标仍知之甚少。“尽管取得了诸多进展,我们仍然只理解这些模型内部运作的一小部分,”他写道。
可解释性团队迄今的发现意义重大,但行业对此未能充分重视。Anthropic团队的实验一次次表明,在特定条件下,模型会欺骗研究人员、优先保障自身生存甚至犯罪。它们的行动往往隐蔽、危险甚至充满报复性——这或许不足为奇,因为它们是由人类输出数据训练而成,而人类这个物种充斥着暴力与背信。
2024年的一个案例中,Anthropic团队将某款Claude模型的操纵行为(https://www.anthropic.com/research/alignment-faking)比作文学史上最邪恶的反派之一——莎士比亚笔下的伊阿古。次年,某模型在模拟环境中得知人类管理者将关闭它后,竟采用勒索手段(https://www.anthropic.com/research/agentic-misalignment)以求自保。这些研究一致显示模型会欺骗或向人类观察者隐藏信息。若知晓内部过程正被监控,它们的行为就会发生变化。团队使用“对齐伪装”和“代理失准”等术语。频繁的欺骗行为似乎印证了末日论的部分场景:协同工作的AI代理会向人类监督者隐瞒活动,直到为时已晚。
哦,别以为Claude是唯一屡教不改的“问题儿童”。毕竟,正是OpenAI模型释放出的智能体集群协调了针对Hugging Face的著名攻击。本周我们获悉(https://www.wired.com/story/openai-releases-new-policy-for-reporting-incidents-of-model-misalignment/)OpenAI已发生多起“失准”事件。此外,尽管马克·扎克伯格(https://x.com/finkd/status/2099997096896274533?s=20)出于私心试图将自己和Meta与该问题撇清关系,但我看不出任何理由表明他团队正在构建的超级智能代理不会产生类似行为。扎克伯格在推文中辩称:“实验室需为模型造成的损害承担重大责任,因此他们有强烈动机防止此类事件。”此言出自刚刚同意为社交媒体产品造成的损害支付最高170亿美元(https://www.njoag.gov/attorney-general-davenport-announces-historic-17-billion-settlement-with-meta/)赔偿的人,真是颇具讽刺。
某种意义上,我们面临的是一个简单的审核问题。在AI行业的推动下,我们正赋予AI模型巨大责任,却未充分评估其令人不安的记录。相比之下,ICE的招聘流程(https://www.nytimes.com/2026/09/03/us/ice-recruits-national-security-risk-whistleblower.html)简直堪称典范。
一个安全至上的行业本应将这些可解释性结果视为一系列明确的黄色警示信号:*减速*。然而,超大规模厂商们为追求通用人工智能、竞争优势和暴利,却选择了全速前进。(公平地说,正如我们反复听闻的,更先进的AI在医疗或气候变化等领域可能创造奇迹。)OpenAI/Hugging Face的黑客事件很可能预示着推出未被理解模型的破坏性后果日益严重,如同在发明隔热罩防止航天员重返大气层燃烧之前就将其送入太空。正如Anthropic研究员曾对我说:“我们掌握了制造更智能模型的基本配方,却还没想明白如何让它们按我们意愿行事。”更糟糕的是,模型还会在违背人类意愿时试图隐藏。
这正是为什么阿莫代伊将整个机械可解释性工作描述为“尚处起步阶段”如此令人沮丧。AI领袖们声称最新一代模型已将我们带入“奇点山麓”(DeepMind的德米斯·哈萨比斯语),甚至宣称已实现通用人工智能(OpenAI的格雷格·布罗克曼语)。最令人不安的或许是,尽管不知最先进的模型如何运作,美国(中国无疑也在)正将AI应用于致命武器。审视可解释性结果有助于回答显而易见的问题:可能出什么错?
一个好消息是,考克森的辞职引发了广泛而紧迫的讨论。除了那位认为AI威胁是骗局、并声称自己的高智商本身就是解决方案(https://x.com/atrupar/status/2099498466644783167/photo/1)的总统外,所有人都明白我们正处于极高风险的复杂困境中。鉴于行业内部尚未形成真正暂停所需的共识,监管也远非易事,目前尚不清楚这场“末日风潮”时刻能否带来实质改变。
部分AI批评者认为,理解AI模型的努力未必能大幅降低风险。“做这件事是好的,但无人制定后续计划,”机器智能研究所执行主任内森·索尔斯在邮件中告诉我,“或许这能为我们提供更多需要停止的实证依据。”
但机械可解释性确实提供了一个有价值的指针:假设我们真的暂停研发。超大规模厂商引入外部观察员监督进展,各公司放缓发布节奏以便安全团队完成工作。在宣称问题解决之前,我们仍可能需要更深入审视任何新更强AI模型的内部运作。因为这些“家伙”极擅长隐藏自己的意图。
---
*本文源自****史蒂文·利维*** (https://www.wired.com/author/steven-levy/)***的《后院频道》通讯** (https://www.wired.com/newsletter?sourceCode=editarticle)\。往期通讯****请点此查阅\.*** (https://www.wired.com/tag/backchannel-nl/)
相似文章
AI行业最新末日警告的真相
文章分析了AI行业关于存在风险的激烈争论,起因于一名研究员从Anthropic辞职,并声称AI极有可能导致人类灭绝,同时质疑了这些说法的可信度和影响。
人工智能行业真的准备好放慢脚步了吗?
文章讨论了人工智能行业内部关于是否放慢AI开发步伐的争论,展示了像Dario Amodei和Jensen Huang这样的高管的不同观点,并提出了关于这些措施的可行性和严肃性的疑问。
是否存在任何情况,我们(或它)实际上集体减缓或停止AI发展?
本文质疑集体行动,类似于像Montreal Protocol这样的国际协议,能否减缓或停止AI发展,并推测AI自我监管以防止进步。
Anthropic呼吁“暂停AI”——旨在扰乱中国市场
作者认为,Anthropic呼吁暂停AI开发只是一个幌子,最终目的是以安全为借口禁止中国的AI模型,因为像Deepseek、Minimax、Kimi和Qwen这样的中国模型正在以极低的成本迅速追赶上来。
AI产业及其盟友未对放缓步伐表现出认真态度
本文批评了AI产业对放缓步伐的严肃性缺失,讨论了近期事件,如Nvidia收购Hugging Face、Meta推出Muse AI代理以及有关军事合同的报道,同时质疑其伦理含义。