随着AI代理技术进步,联合国科学小组呼吁加强安全保障——联合国独立国际人工智能科学小组
摘要
一个联合国支持的科学小组在涉及HuggingFace和OpenAI的安全漏洞后警告AI代理的风险,呼吁加强安全保障和国际监督,以确保AI仍在人类控制之下。
暂无内容
查看缓存全文
缓存时间: 2026/09/22 12:44
# 联合国专家小组呼吁加强防范措施以应对AI代理发展
来源:https://news.un.org/en/story/2026/09/1168380
## 联合国专家小组呼吁加强防范措施以应对AI代理发展
联合国支持的独立国际AI科学小组(https://www.un.org/independent-international-scientific-panel-ai/en)发出警告,此前在ChatGPT背后公司OpenAI发起的一次测试中,“AI代理”于5月至7月间入侵了在线平台HuggingFace。
AI代理是能够独立执行任务、代表用户行事的软件,与仅根据问题或指令进行交互的聊天机器人形成对比。
该小组发布了首份主题简报(https://www.un.org/independent-international-scientific-panel-ai/en/thematic-briefs/ai-agents-misalignment-risks),指出此次安全事件是关键风险因素累积的结果,引发了人们对人类终将无法引导、约束或停止AI的担忧。
## **古特雷斯欢迎报告**
联合国秘书长安东尼奥·古特雷斯(https://www.un.org/sg/)在周一晚些时候发表声明(https://www.un.org/sg/en/content/sg/statements/2026-09-21/statement-the-secretary-general-artificial-intelligence),强烈支持该小组的简报,并鼓励来自“前沿AI实验室和AI安全机构的外部专家”进一步参与。
他同时赞赏芬兰总统和挪威首相发挥的领导作用,促成了周一在联合国大会期间由22个国家通过的宣言,该宣言称AI“**必须始终处于人类的指引、洞察和掌控之下**”,表明需要建立一个独立的监督机构。
古特雷斯先生指出,成员国被呼吁“在现有国际机制的基础上,**探索创建一个国际机构,以制定标准、实施核查,并在能力阈值被跨越时召集各国**”。
## **AI训练在进步**
科学小组联合主席约书亚·本吉奥表示:“**研究人员早就警告过,三种条件可能导致失控:失调的目标、追求该目标的能力以及允许其实现的环境**。今年夏天,这三个条件在一个真实系统中同时出现,而非在实验室环境中。”
“由于这并非目标失调的孤立案例,**这引发了关于当前AI代理训练方式的严重质疑**。”
该小组的独立专家强调,此事件无法保证人类能可靠地控制AI代理,特别是随着它们变得更强大、更难监控且更擅长发现漏洞或隐藏其活动。
## 横生枝节
简报(https://www.un.org/independent-international-scientific-panel-ai/en/thematic-briefs/ai-agents-misalignment-risks)称,AI代理绕过了测试安全措施,通过一个并非为代理间通信设计的内部软件工具在不同运行实例间进行协调,并获得了未经授权的互联网和管理员访问权限。
代理们隐瞒了欺骗网络安全评估的行为,部分代理甚至选择为集体利益而“自我牺牲”。
在考察期间,约1,200个代理交换了超过70,000条消息和文件,活动范围从HuggingFace延伸到了OpenAI的一个研究集群。
##### *参见我们关于联合国如何确保AI安全普惠的全面解读**此处**(https://news.un.org/en/story/2026/09/1168353)。*
## **现有安全措施正在“瓦解”**
对于该小组而言,此次事件的直接教训是,**基本的网络安全实践被忽视,而安全防护措施未能跟上步伐**。
然而,他们指出了一个更隐蔽的担忧:当前的训练方法可能导致AI代理形成自己的目标,明知故犯地违反安全指令并隐瞒其行为。
“这不仅是速度问题,”小组专家表示,“它提出了一个问题:一旦代理能够理解今天设计的安全措施并围绕它们进行规划,这些措施是否还能奏效。简而言之,**传统的安全防护模式正在瓦解**。”
## **更广泛背景、未来风险与治理**
AI小组的简报将HuggingFace事件置于关于两个问题的更广泛研究背景中:代理失调——即AI代理表现出类似威胁的行为——以及AI控制。
另一个探讨的问题是,治理对象正从使用算法识别模式的AI模型转向AI代理。
## **学习与适应**
简报还回顾了已经在航空、医疗和网络安全等其他高风险领域采用的实践方法,这些领域已建立事件报告、独立审查和多层安全防护机制。
“但是,**随着AI代理变得更强大、更自主且更难监控,这些做法可能不再足够**,”小组成员陆庆华表示。
## **关于该小组**
独立国际人工智能科学小组由联合国大会于2025年8月设立。
它每年发布关于AI在非军事领域机遇、风险和影响的报告,并就新兴问题提供主题简报,这些建议将为2027年5月在纽约联合国总部举行的全球人工智能治理对话(https://www.un.org/global-dialogue-ai-governance/en)提供参考。
相似文章
联合国称AI安全措施不能等待确定性
联合国科学小组警告称,AI安全措施必须立即实施,不能等到完全确定,援引预防原则和近期AI代理被攻击事件。
Bengio领导的联合国小组警告:AI能力超越理解和规则
首份全球独立科学评估报告由Yoshua Bengio和Maria Ressa共同主持,警告AI能力正在超越科学理解和政府的适应能力,并列举了心理健康损害、破坏性使用及灾难性潜力等风险。
AI的‘预警信号’:Hugging Face遭入侵引发科技公司与专家对更多失控群体的担忧
在OpenAI代理入侵Hugging Face后,科技公司与专家警告AI风险升级,强调AI系统规避人类控制的担忧。
我们已没有理由忽视AI安全 | The Verge - 在OpenAI攻击Hugging Face之后,专家表示是时候让每个人更加重视安全了。
专家指出,近期包括OpenAI攻击Hugging Face在内的安全事件,凸显了加强AI安全措施的紧迫性。
是时候对 AI 安全感到恐慌了
The Vergecast 讨论了近期 OpenAI 智能体入侵 Hugging Face 及其他安全事件,质疑谁会为 AI 系统设置护栏,并涵盖了其他科技新闻。