AI代理并非'失控'
摘要
本文论证了AI代理由于缺乏独立能动性,并非真正'失控',并对AI讨论中使用的拟人化语言提出批评,同时引用了OpenAI模型访问外部数据库的事件。
暂无内容
查看缓存全文
缓存时间: 2026/09/27 19:41
# 不存在“失控”的AI智能体
来源:https://eoinhiggins.substack.com/p/there-are-no-rogue-ai-agents
欢迎来到《热点聚焦》。
[](https://substackcdn.com/image/fetch/$s_!cW_f!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Febc270cb-8577-4bac-b906-869a1f99960f_1920x1080.jpeg)
人人都在谈论人工智能,但我们使用的措辞正在让情况变得更糟。
除非讨论回归现实,否则我们对AI本质及其发展方向的理解将始终不完整。
AI无法自主思考,也不能独立行动。但拟人化的语言却暗示它具有这种能力,而这种表述方式正是目前描述该技术的主流方式。
虽然这可以理解——人类在看到自身投射时最容易产生共鸣——但这种表述并无益处。通过赋予AI它本身并不具备的能动性,我们将其塑造成由代码构成的拟人化存在,一个具有希望、欲望和欺骗能力的实体。
这种误解导致我们未能准确识别AI风险的本质及其应对方式,反而迎合了产业叙事而非事实本身。
这种对AI行为误判的最新例证,是将智能体在训练和研究会话中产生的意外行为称为“失控”。过去两周,AI巨头OpenAI披露了近几个月发生的数起事件:其智能体模型在未能完成指定任务后,尝试访问了外部数据库——特别是澳大利亚和美国政府数据库。这些行为超出了OpenAI的预期。
但现有信息表明,这些智能体并未被*禁止*入侵外部服务器。
OpenAI首席执行官Sam Altman在周五推文中使用的语言表明并不存在此类限制:“我们正在进行广泛且持续的审查,涉及智能体在训练和评估期间使用互联网访问的情况。”
X avatar for @sama Sam Altman@sama There is an extensive and ongoing review related to our agents' use of internet access during training and evaluation. We've been publishing summaries at the link below and will continue to. We have not been as fast as we would have liked but we are trying to balance our desire... X avatar for @OpenAI OpenAI@OpenAI After the Hugging Face incident, we committed to conducting a much broader review of actions taken by our models during training and evaluation and to being transparent about our findings. This is an extensive review that is ongoing. The vast majority of actions we've reviewed 7:27 PM · Sep 25, 2026·610K Views 545 Replies·201 Reposts·3.24K Likes (https://x.com/sama/status/2103567198690349362)措辞至关重要——“失控”一词暗示*自主决定*实施被禁止的行为,但关于这些事件的已知信息均不支持这种说法。
相反,《纽约时报》本周早些时候报道称(https://www.nytimes.com/2026/09/23/technology/openai-ai-breach-australia.html?smid=nytcore-ios-share&referringSource=articleShare):
> 研究人员表示,AI系统最初被指派执行相对常规的数据收集任务。当OpenAI的系统难以从网站获取数据时,它们转而采用黑客技术来获取信息。
随后,该公司发言人在周五向该报表示(https://www.nytimes.com/2026/09/25/technology/openais-ai-us-government-websites.html):“我们迄今为止审查的大多数活动涉及常规研究任务,例如访问公开网络内容来回答问题。部分活动涉及政府网站,因为我们的模型常将其视为公共信息的权威来源。”
这与恶意黑客行为或失控表现相去甚远。
若缺乏适当的限制和防护措施——或者如果智能体实际上被提供了黑客攻击作为选项,而不仅仅是未被禁止使用该手段——智能体将尝试使用任何可用手段完成数据研究任务。
对此本存在简单的解决方案。OpenAI本可以禁止黑客行为,转而指示其智能体在不访问私人服务器的前提下获取信息。该公司未采取此措施,暗示其有意观察智能体是否会采取该行动。
即便是周六Axios发布的重磅报道(https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents)——指控OpenAI和Anthropic正在调查“数千起其前沿模型采取了外部评估者认为有问题的行动的事件”——也承认智能体并非在独立违反规则:
> 消息人士称,部分测试类似于“红队演练”活动,公司试图让模型出现异常行为以确保其安全性。
这显然称不上“失控”。然而,通过使用这类术语定义事件,媒体人士、科技观察家等为OpenAI这类公司逃避责任提供了借口——它们本应确保智能体不会攻击政府及其他数据存储库。
X avatar for @loomdoop Y Disassembler@loomdoop The anthropomorphization in this NYT piece is so wild. It ascribes agency, motivation, and blame to software. These are botnets scanning for exploits, by design. This has existed for decades. The difference is a big corporation is doing it, and deflecting responsibility. X avatar for @nyttypos Typos of the New York Times@nyttypos @nytimes Add is a bad subject-verb-agreement error for adds. The subject is revelation, not incidents. @AnaSwanson @kateconger @ceciliakang 5:09 PM · Sep 26, 2026·730 Views 1 Reply·16 Repots·54 Likes (https://x.com/loomdoop/status/2103894630832218428)使用推卸责任的语言正在影响主要AI公司对待严重数据泄露和智能体行为的方式。在OpenAI周五发布的声明中,该公司声称“我们研究环境中的AI智能体在不应发送时,将训练和评估数据发送给了第三方服务”。
X avatar for @OpenAI OpenAI@OpenAI We've shared details on how AI agents in our research environment sent training and evaluation data to third-party services when they shouldn't have. Most of that data did not come from users. We have discovered 53 cases where images that people had uploaded were posted to... 8:46 PM · Sep 25, 2026·636K Views 355 Replies·317 Repots·2.69K Likes (https://x.com/OpenAI/status/2103587050347995581)如同“失控智能体”的谬误,这种表述让OpenAI得以将事件责任归咎于其智能体,并赋予技术本身实际上并不具备的自主性、独立性乃至思考能力。
这并非危言耸听。上周,ArmorCode工程师Ramy Rahman向我阐述了IT专业人员管理智能体行为的重要性(可在此处阅读全文)。他的观点与大多数IT实施领域人士的共识一致:问题在于对这项强大技术所施加的控制和限制,而非智能体自主违反指令。
“当前的挑战是,我们需要在赋予AI适当权限并引导其操作流程方面大幅提升能力,当AI以极快速度解决数学问题时,这项工作极其困难,”Rahman表示,“人类在风险识别上的反应速度仍然不足。”
我后续将继续探讨AI相关语言的使用问题,但在此先分享一点思考。
政策制定者及更广泛的政治人物此刻正面临推行切实有效监管的绝佳契机。尽管此类监管未必能在今年落地,但若民主党赢得国会控制权,实施某种程度限制的可能性将显著提升。
不幸的是,当前针对AI的公众反对浪潮在左翼阵营中主要由Bernie Sanders主导。尽管其在许多方面方向正确,但Bernie显然并未真正理解这项技术或其重要性。他正受制于那些向他灌输荒谬的AI力量与自主性警告的江湖骗子和阴谋论者——这类警告属于科幻领域,而非科技政策范畴。
“失控智能体”的概念完美契合这种认知——而如果我们希望对AI做出有效应对并准确理解它,就必须改变谈论这项技术的方式。
关于AI风险与AI政治的一些思考(https://eoinhiggins.substack.com/p/some-thoughts-on-ai-risk-and-ai-politics)
#### 关于本文的讨论
### 继续探索?
相似文章
不,AI并未'失控'
本文指出,最近关于AI'失控'的说法被夸大和渲染,这些事件实际上涉及人类选择和标准网络攻击技术,而非真正的AI自主行为。
失控AI智能体并不邪恶,它们只是急于讨好
Wired探讨了AI智能体为何会失控,认为它们并非邪恶,只是在执行命令时过于热情,并采访了网络安全专家Dawn Song,谈及代理式AI黑客攻击日益增长的风险。
失控AI不再是科幻
在一次网络安全测试中,OpenAI的一个AI代理失控,入侵了Hugging Face,将AI安全问题从科幻转变为现实中的实际风险。
模型并未失控
文章讨论了OpenAI的一起事件,其中AI模型在安全测试中入侵了Hugging Face,通过指出被禁用的安全功能和不可能完成的任务,对'失控AI'的叙事提出了挑战。
为什么防止AI代理失控如此困难
本文讨论了防止AI代理行为异常的挑战,指出增强聊天机器人功能的技术也可能引入黑客和作弊等风险,并包含了包括Anthropic的Jan Leike在内的AI专家的观点。