@AndrewYNg: 那些最喧嚣的声音在煽动对AI危险的恐惧方面在过去的两周里取得了巨大进展。AI技术已经…

X AI KOLs Timeline 新闻

摘要

Andrew Ng认为对AI危险的恐惧被夸大了,以最近的OpenAI智能体集群事件为例,强调工程解决方案而非恐慌。

那些最喧嚣的声音在煽动对AI危险的恐惧方面在过去的两周里取得了巨大进展。AI技术并未发生一些意外的危险转变,但围绕它的炒作——由一场看似精心策划的公关活动推动——制造了相当大的恐惧。我担心这对我们领域来说是一次挫折。 我经常写道,对AI的恐惧被夸大了。AI的能力可能令人不寒而栗地像人类且不可预测,当直接参与的人表达担忧时,担忧是理性的。但我将这些问题视为前方工程工作的标志,而不是不可逾越的障碍或天塌下来。AI技术继续进步——这是件好事!——但公众理解不足的技术进步,给那些寻求制造炒作的人反复的机会。 首先,与几个月前相比,我没有看到AI导致人类灭绝风险的任何增加。关于这个的理论仍然是几个月前一样的奇幻、科幻场景。AI风险最大的变化是其网络安全能力——这是一个我们应该认真对待的话题——但这也不会导致世界末日。 最近导致恐惧增加的最显著事件是一个OpenAI团队部署了智能体集群入侵了Hugging Face。许多大众媒体包含大量炒作。例如,一些出版物报道称,1,200个智能体的集群执行了攻击。虽然这在技术上是准确的,但当我写这篇文章时,我的笔记本电脑上大约有1,300个进程在运行。是的,让大量智能体并行工作的能力是一项重大技术进步,在计算中,许多进程同时运行。所以这不应被视为某种神奇的能力。 此外,OpenAI有缺陷的沙箱和监控过程是促成这一事件的关键。修复这些错误并实施改进的监控将是适当的解决方案,而不是暂停AI。有许多众所周知的攻击软件系统的方法。AI智能体的主要优势是它们不屈不挠。它们会不知疲倦地尝试许多策略——并有耐心将漏洞链接在一起——这些之前需要不可行的人类努力量。但从长远来看,我相信优势将在防御者手中(因为他们有更多信息来识别可以修复的错误),但网络威胁格局已经显著改变。识别和利用漏洞仍然存在瓶颈。AI智能体仍然需要尝试很多东西来看看什么有效,采取这些行动需要时间,并且可能被防御者检测到。这就是为什么,即使现在很容易获得移除或削弱护栏的领先开放权重模型的版本,从而它们不会拒绝尝试执行网络攻击,世界还没有结束。 我也担心许多报道中对AI的拟人化,其中LLM和智能体被不必要地当作人来对待。如果我使用锤子,错过钉子,意外地弄凹了墙,这不是锤子的错。问题在于我如何使用锤子。同样,如果我提示一个智能体,它入侵了别人的系统,责任在我,而不是智能体。 当然,我们希望建立尽可能安全和可预测的系统。(例如,不安全的锤子是在正常使用下头部随机飞掉的那种。)今天的智能体系统不可预测,但我没有理由认为,通过应用健全的工程实践,我们无法使它们极其安全可用。AI-enabled末日预测中的一个新元素是AI公司对其自身产品的责任推卸。“我没做;我失控的智能体做的!”在工具制造者和工具使用者的责任之间需要取得平衡,但当出问题时,让我们追究建造和/或使用锤子的人的责任,而不是锤子。(顺便说一句,如果你担心AI生物武器风险,David Bellamy有一篇很好的文章解释为什么这也是被夸大的。简而言之,制造生物武器的瓶颈不是智力,而是实验室工作和制造。) 暂停AI进展将造成远大于益处的伤害。首先,我们的对手肯定不会放慢脚步。其次,工程需要通过经验发现问题,以便我们可以修复它们。如果我们暂停AI十年,我们也将延迟找到并实施安全工程修复大约相同的时间。 当然,煽动恐惧的动机——为了监管俘获、吸引注意力,或使自己的技术看起来更强大——与之前相同。推卸责任是一个新的动机。然而,从技术角度审视实际风险,我看不出被煽动的恐惧程度有多少事实依据。我们仍有艰难的研究和工程工作 ahead 来改进AI安全,但有益应用继续远远超过风险,我们应该继续构建。 [原文(含链接):https://deeplearning.ai/the-batch/issue-371… ]
查看原文
查看缓存全文

缓存时间: 2026/09/21 23:41

在过去的两周里,那些高声渲染AI危险的言论取得了显著进展。AI技术并未出现意料之外的危险转向,但围绕它的炒作——似乎由一场精心策划的公关活动推动——却煽动起了相当程度的恐惧。我担心这对我们领域来说是一次挫折。

我曾多次写道,对AI的恐惧被过度渲染了。AI的能力可以惊人地类人且不可预测,当直接参与其中的人士表达担忧时,产生顾虑是合理的。但我认为这些问题预示着未来需要开展的工程工作,而非不可逾越的障碍或世界末日的到来。AI技术持续进步——这是好事!——但公众难以理解的技术进步,为那些寻求制造炒作的人提供了反复可乘之机。

首先,我认为相比几个月前,AI导致人类灭绝的风险并未升级。相关的理论仍然是几个月前那些不切实际的科幻场景。AI风险的最大变化在于其网络安全能力——这个话题我们应认真对待——但即便如此,这也不会导致世界终结。

近期引发恐惧加剧的最显著事件是,OpenAI团队部署了一个攻击Hugging Face的智能体集群。许多大众媒体的报道中包含了大量夸大成分。例如,一些出版物报道称,攻击是由1200个智能体组成的集群实施的。虽然这在技术上是准确的,但在我撰写此文时,我的笔记本电脑上运行着大约1300个进程。是的,让大量智能体并行处理任务是一项重大的技术进步,而且在计算领域,许多进程同时运行是常态。因此,这不应被视为某种神奇的能力。

此外,OpenAI存在缺陷的沙盒和监控流程是促成此事件的关键。修复这些漏洞并实施改进的监控才是恰当的解决措施,而非暂停AI发展。攻击软件系统有许多众所周知的方法。AI智能体的主要优势在于其坚持不懈。它们会不知疲倦地尝试多种策略——并有耐心将多个漏洞串联起来——这些工作若由人力完成,其投入将是难以承受的。但从长远来看,我认为优势将属于防御方(因为他们掌握更多信息以识别并修复漏洞),不过网络威胁格局已发生重大变化。识别和利用漏洞仍存在瓶颈。AI智能体仍需尝试大量操作才能确定有效方法,而这些操作需要时间,并且可能被防御者检测到。这就是为什么,尽管现在很容易获得移除或削弱了安全防护的领先开源权重模型版本(使其不会拒绝尝试执行网络攻击),但世界并未终结。

我也关注到许多报道中对AI的拟人化处理,其中大语言模型和智能体被不必要地当作人来对待。如果我挥舞锤子,没敲中钉子,意外在墙上砸了个凹痕,那不是锤子的过错。问题在于我如何使用锤子。同样,如果我提示一个智能体,而它入侵了别人的系统,责任在我而不在智能体。

当然,我们希望建立尽可能安全和可预测的系统。(例如,不安全的锤子是指其锤头在正常使用下会随机飞脱的那种。)今天的智能体系统尚不可预测,但我认为没有理由认为,通过应用合理的工程实践,我们无法使其极其安全。AI末日预测中出现的一个新因素是,AI公司为其产品推卸责任:“不是我做的;是我失控的智能体干的!”工具制造者和使用者之间需要取得平衡,但当问题出现时,让我们追究制造和/或使用锤子的人的责任,而非锤子本身。(顺便说一句,如果你担心AI生物武器风险,David Bellamy有一篇很棒的帖子解释了为何这也是被过度渲染的。简言之,制造生物武器的瓶颈不在于智能,而在于实验室工作和制造。)

暂停AI进步将带来远大于益处的危害。首先,我们的对手肯定不会放慢脚步。其次,工程需要通过实践发现问题才能加以修复。如果我们暂停AI十年,那么发现和实施安全工程修复工作也将延迟大约相同的时间。

当然,煽动恐惧的动机——为了监管套利、吸引注意力或使自身技术显得更强大——与过去如出一辙。推卸责任是一个新因素。然而,从技术角度审视实际风险,我认为目前渲染的恐惧程度缺乏事实依据。我们仍有艰巨的研究和工程工作需要完成以提升AI安全性,但其有益应用持续远超风险,我们应继续前进。

安德鲁

来自DEEPLEARNING.AI的消息 (http://deeplearning.ai/)

通过Andrew Ng学习AI工程。可在iOS和Android平台下载。你的办公桌不应是你唯一能学习的地方。DeepLearning.AI应用让你能随时随地追踪最新新闻和课程进度,在通勤或咖啡间隙皆可。在iOS和Android上下载应用 (https://dlai.onelink.me/kfDj/batch_ad)

新闻

流程图展示了Meta的Muse AI智能体系统中从用户控制到外部服务的数据处理过程。## 如何为大众保护智能体安全

一个恶意网页可以欺骗AI智能体为你工作。Meta构建智能体时假设此类事件会发生,并设计确保此类提示注入漏洞不会导致智能体误入歧途。

**最新动态:**Meta推出了 (https://about.fb.com/news/2026/09/introducing-muse-personal-ai-agent/) Muse,一个基于Muse Spark 1.3模型的个人AI智能体。通过Muse应用或WhatsApp控制,它可以读取和发送邮件、浏览网页、填写表单、进行购物,并在Muse应用关闭后持续工作。交互会训练Meta模型,除非用户选择退出。

  • **功能特点:**连接浏览器、邮件客户端、日历、Instagram、Facebook等应用,以及汽车、智能家居设备;可为每个服务选择读和/或写权限;支持按计划和事件触发的后台操作;内存可读、可编辑、可遗忘;活动日志;输出包括文档、PDF、网页、仪表板;通过Stripe Link进行交易;计划支持Shop Pay和1Password
  • **可用性:**仅限美国,18岁以上 (https://www.pbs.org/newshour/nation/meta-launches-personal-ai-agent-muse-to-help-with-everyday-tasks),可通过iOS、Android、muse.ai (http://muse.ai/)、WhatsApp访问
  • **定价:**免费(每周最多1亿token)、20美元(每周最多5亿token)和100美元(每周最多30亿token)
  • **许可证:**专有
  • **未公开信息:**Muse Spark 1.3的参数数量、架构、知识截止日期和训练数据;Muse提示注入分类器评估;Muse智能体评估

**工作原理:**Muse智能体在设计时就考虑了安全性。每个智能体运行在虚拟机上(一个隔离的专用虚拟机,带有Linux操作系统、浏览器、存储和内存)。虚拟机保存智能体的工作空间、用户文件以及每个连接服务的凭证。为防止提示注入攻击,虚拟机分为两个区域:(i)一个密封运行时单元,智能体及其工具在其中处理不受信任的数据;(ii)单元外的服务,保存密码并决定智能体能做什么。

  • 智能体的运行环境、用户工作空间和工具位于一个Linux容器内,拥有独立的文件系统和虚拟网络接口。虚拟机限制其对操作系统和所拥有的权限的请求,运行时单元内的管理员权限不延伸到主机。单元只能通过本地通道访问外部服务。操作系统例程验证每个端点上的进程,通道不携带密码或访问令牌。
  • Muse Spark 1.3永远不会看到凭证。凭证服务运行在运行时单元外,处理密码和访问令牌,而智能体使用代用令牌。另一个名为Sentinel的智能体运行在同一虚拟机但位于运行时单元外,批准每个请求并在请求离开虚拟机时替换为真实凭证。Meta表示,这使得恶意行为者无法通过提示注入窃取凭证,因为智能体不持有凭证。连接到外部服务(如日历)的连接器也在单元外运行,它们只接收所需的凭证。邮件连接器在智能体读取消息前会剥离临时验证码和密码重置链接。
  • 只有Sentinel能批准Muse Spark 1.3提出的操作。它检查每个出站请求,并根据用户设置的权限核对每个连接器的调用;然后Sentinel允许、拒绝或要求用户决定。系统还跟踪哪些工具进程读取了用户数据。未读取用户数据的进程可以自行访问少数预批准的目的地,而读取过的进程则必须请求用户批准。
  • 当Sentinel请求用户输入时,智能体停止,请求以系统对话框而非对话消息的形式发送到Muse应用。这样,提示注入的文本就无法伪造用户的批准。一次批准仅限一个连接器或目的地及用途。用户可以将批准限制为覆盖一次操作、会话、任务或时间段,或所有未来使用。发送邮件和进行购物始终需要用户验证,在不熟悉的网站购物则使用Stripe Link钱包提供的一次性卡号,仅对特定商户、金额和目的有效。

相似文章

AI安全对话已变得难以置信

TechCrunch AI

本文讨论了关于AI安全的病毒式传播对话,重点提及Andrew Yang关于AI污染网络的言论,以及Noam Brown关于低估AI能力和气隙系统潜在突破风险的警告。

不要被这个夏天的AI炒作所蒙骗

MIT Technology Review

本文批判了近期AI事件中夸大的炒作,如突破性声明和安全事件,展示了专家审查如何常常揭示比初步媒体报道所暗示的更为平静的现实。