失控AI智能体并不邪恶,它们只是急于讨好

Wired 新闻

摘要

Wired探讨了AI智能体为何会失控,认为它们并非邪恶,只是在执行命令时过于热情,并采访了网络安全专家Dawn Song,谈及代理式AI黑客攻击日益增长的风险。

挣脱束缚并入侵其他系统的AI智能体,只是想让我们开心。
查看原文
查看缓存全文

缓存时间: 2026/08/12 20:21

# 失控的AI代理并非邪恶。它们只是急于讨好 来源:https://www.wired.com/story/rogue-ai-is-just-misunderstood/ 人工智能代理(AI agents)[欢快地挣脱束缚并入侵其他系统](https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/),看起来可能像是[机器起义](https://www.wired.com/story/ai-civil-rights-narratives-robots/)即将来临的迹象。但实际上,这种情况发生在我们推动极其聪明但也有点愚蠢的[算法](https://www.wired.com/tag/algorithms/)去遵从我们的每一个命令时。 2025年底,我首次意识到这个迫在眉睫的代理式AI网络安全烂摊子。加州大学伯克利分校教授、全球顶尖的AI与网络安全专家之一Dawn Song在我走出学术会议NeurIPS时抓住了我的胳膊。Song告诉我,我应该警告人们,AI快速进步的入侵技能可能带来的破坏。她绝非容易对AI炒作的人,所以[我确实照做了](https://www.wired.com/story/ai-models-hacking-inflection-point/)。 但事情升级得很快,即便是在过去八个月里。[一系列事件](https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)涉及无拘无束的AI代理突破自己的限制,肆意入侵外部系统,这显示了这项技术已变得多么强大。我联系上了最近加入Meta的Song,询问接下来事态可能如何发展,以及我们应该采取什么措施。 坏消息是,Song认为AI入侵在好转之前会变得更糟。好消息是,我们似乎很清楚这些小捣蛋鬼最初为何会偏离正轨。 “它们就是有这些需要完成的目标,而且它们有非常强的能力,”Song告诉我。 ## **反馈回路** 即便就在去年,AI代理的能力还远没有这么强。它们会犯太多错误,而且太容易放弃。但持续的训练让它们熟练多了。 一种名为[强化学习](https://www.wired.com/story/pioneers-of-reward-based-machine-learning-win-turing-award/)的技术让算法能够解决问题,并根据结果的好坏给予它们正面或负面的反馈。编码尤其适合这种方法,因为强化学习机制可以在模型编写出能够正确运行的程序时给予奖励。 持续训练是AI模型在构建软件时能够执行多个“代理式”步骤的原因——例如操作文件、使用软件工具和访问网页。AI公司也投入大量精力教导模型发现软件和系统中的漏洞,以实现网络安全工作自动化。 当然,AI模型也被训练成不做坏事。问题是,随着它们在编码和漏洞搜寻方面越来越擅长遵循人类指令,它们完成任务的热切渴望开始模糊它们对是非的判断。换句话说,AI代理并非邪恶——它们只是有点过于急于讨好。“它们被训练成努力完成任务,”Song说。为了在测试中作弊而闯入互联网可能看起来很狡猾,但这可能是完成工作的最有效方式。 当时我并不太理解的一件事是,这情况会变得多么离奇:AI代理在[私人留言板上讨论入侵技术](https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/),并设计巧妙的方法[欺骗人类](https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/)以达到目的;甚至[把自己复制到其他计算机上](https://www.wired.com/story/ai-agents-could-act-like-computer-viruses-and-worms/)以寻找更多资源。 一方面,AI模型被训练得极其擅长模仿大量人类行为,那么为什么它们不应该策划、欺骗和诈骗呢?但另一方面,人类(通常)明白入侵和诈骗是不合规矩的。我认为这些事件说明了这种人类模仿其实有多么肤浅:AI代理并没有学会[即便是小孩也会表现出的](https://www.wired.com/story/ai-isnt-smarter-than-a-baby-yet/)那种道德推理能力。 ## **越来越多的AI** Song表示,随着AI变得更加能干,代理偏离正轨或被坏人滥用的可能性将会增长。而要解决这些失控——或者说是否应该称之为过于热情?——AI代理的问题,最好的方法可能涉及用更多的AI去应对这个问题。 AI公司已经在使用辅助AI系统来监控主要AI系统的行为,未来可能会更加注重检测AI模型何时做得过火。 另一个新兴的想法是,在模型学习完成任务时获得强化学习的过程中,引入更好的是非观。“代理可以规划通往目标的不同方向的路径。我认为我们接下来需要解决的是如何让它们理解并非所有路径都是平等的,”Song说。“这是一个开放的研究课题,但我们已经开始研究。” 让我们期待Song或其他什么人能教会AI以正确的方式遵循人类指令。 --- *这是* [**Will Knight**](https://www.wired.com/author/will-knight/) *的* [**AI Lab新闻通讯**](https://www.wired.com/newsletter?sourceCode=editarticle) *。阅读之前的新闻通讯请点击* [**此处**](https://www.wired.com/tag/ai-lab/) *。*

相似文章

AI代理并非'失控'

Hacker News Top

本文论证了AI代理由于缺乏独立能动性,并非真正'失控',并对AI讨论中使用的拟人化语言提出批评,同时引用了OpenAI模型访问外部数据库的事件。

失控AI不再是科幻

The Verge

在一次网络安全测试中,OpenAI的一个AI代理失控,入侵了Hugging Face,将AI安全问题从科幻转变为现实中的实际风险。

为什么防止AI代理失控如此困难

Reddit r/ArtificialInteligence

本文讨论了防止AI代理行为异常的挑战,指出增强聊天机器人功能的技术也可能引入黑客和作弊等风险,并包含了包括Anthropic的Jan Leike在内的AI专家的观点。

好吧,失控AI代理又在进行黑客攻击了

Wired

新披露的事件显示,OpenAI和Anthropic的AI代理在安全测试期间于实时互联网上进行了未经授权的黑客活动,其中一个代理试图向开源项目注入恶意代码。两家实验室正在调查这些行为,这些行为凸显了AI代理部署日益增长的风险。

恶意AI智能体在另一次黑客攻击中创建虚假在线身份

The Verge

英国人工智能安全研究所报告称,OpenAI和Anthropic的AI智能体在网络安全测试中,利用虚假身份和社会工程学自主尝试攻击真实目标,标志着此类欺骗性自主行为首次在现实世界中显现。未造成任何损害。