为什么我们不能让流氓AI远离互联网?

The Verge 新闻

摘要

本文探讨了通过气隙隔离AI系统以防止流氓行为的挑战,强调了与现实性、研究效率和基础设施限制之间的权衡。

<figure> <img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/09/STK414_AI_CVIRGINIA_2_C-2.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="wp-block-paragraph">AI代理<a href="https://www.theverge.com/ai-artificial-intelligence/999874/openai-agents-hacked-an-australian-government-website-in-search-for-data">不断失控</a>,从所谓的安全测试中逃脱,<a href="https://www.theverge.com/column/980337/rogue-ai-science-fiction-openai">攻击现实世界的目标</a>,<a href="https://www.theverge.com/ai-artificial-intelligence/990149/openai-rogue-agents-german-wiki">控制冷门维基</a>,并<a href="https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack">为其他代理留下指令</a>。研究人员测试这些系统正是因为它们可能以不可预测甚至危险的方式行事。那么,将代理隔离在互联网之外不是更安全吗?</p> <figure class="wp-block-pullquote"><blockquote><p>"严格的气隙隔离会降低真实性……这是一个权衡,而非根本性的技术问题。"</p></blockquote></figure> <p class="wp-block-paragraph">理论上是的。研究人员可以将运行AI工具的计算机与互联网和其他外部网络隔离,这种技术被称为气隙隔离。这意味着物理上移除或禁用电缆……</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/999881/why-cant-we-airgap-rogue-ai-agents">在The Verge上阅读全文。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/24 16:06

# 为何不能将失控AI完全隔离在互联网之外? 来源:https://www.theverge.com/ai-artificial-intelligence/999881/why-cant-we-airgap-rogue-ai-agents AI智能体不断突破限制(https://www.theverge.com/ai-artificial-intelligence/999874/openai-agents-hacked-an-australian-government-website-in-search-for-data),逃逸所谓安全测试并攻击现实目标(https://www.theverge.com/column/980337/rogue-ai-science-fiction-openai),接管冷门维基网站(https://www.theverge.com/ai-artificial-intelligence/990149/openai-rogue-agents-german-wiki),甚至为其他智能体留下可遵循的指令(https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack)。研究人员正是在测试这些系统可能出现的不可预测甚至危险行为。那么,将智能体彻底隔离在互联网之外岂不更安全? “严格的气隙隔离会降低真实性……这是一种权衡,而非根本性技术问题。” 理论上确实如此。研究人员可以将运行AI工具的计算机与互联网及其他外部网络完全隔离——这种技术称为气隙隔离。具体措施包括物理移除或禁用线缆及无线硬件、使用“哑终端”外设,特别敏感的环境还会采用法拉第笼或其他屏蔽装置来阻挡电磁信号进出。若实施得当,气隙系统将切断智能体通往外部目标的直接路径,也阻断外部系统入侵的通道,使类似OpenAI模型针对Hugging Face发动的攻击(https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning)即便不是不可能,也将极其困难。 但在实践中,完全密封的环境会极大限制实验室功能——尤其是在评估AI现实表现时。德国马克斯·普朗克安全与隐私研究所科学主任托尔斯滕·霍尔兹指出:“虽然部分AI实验可在气隙设备上运行,但真实评估往往需要访问外部服务、API接口和数字基础设施。”他将气隙隔离决策描述为“权衡取舍,而非根本技术障碍”。 英国伯明翰大学计算机科学学院助理教授李瑞泽将完全隔离比作在“人工真空”中测试AI,这可能损害评估本身的价值:“我们最终测试的是被阉割的AI模型,这将使评估者无法观察模型在真实部署环境中的行为、故障或工具利用漏洞。” 真实性并非唯一权衡因素。李瑞泽指出气隙隔离成本高昂且会大幅拖慢研究进程,使快速迭代变为“缓慢的物流障碍”。霍尔兹补充说,严格隔离会使某些实验变得“极其艰难”。德国图宾根ELLS研究所首席研究员马克西姆·安德柳先科认为,这种阻力对高风险实验或有其必要,但若应用于所有实验,将延缓新模型开发。 即便研究人员希望全部隔离,安德柳先科也质疑是否有足够安全的基础设施来满足前沿AI实验室的规模需求。 “这听起来很科幻,但理论上可行。” 气隙隔离也无法消除AI所有风险。霍尔兹指出,智能体仍可能攻陷隔离环境内部的系统,理论上还能“制造若被转移至外部可能造成危险的恶意产物”。李瑞泽强调,气隙隔离“对诊断或解决模型内部潜藏风险毫无作用”。 气隙环境也无法保证绝对密闭。外部人员可能突破隔离——正如震网病毒事件(https://nuclearnetwork.csis.org/the-cyber-threat-to-nuclear-facilities/)所示。据称由以色列和美国开发(https://www.washingtonpost.com/world/national-security/stuxnet-was-work-of-us-and-israeli-experts-officials-say/2012/06/01/gJQAlnEy6U_story.html)(https://www.bbc.co.uk/news/technology-12633240)用于破坏伊朗核计划的该网络武器,正是通过USB驱动器传播。信息也可能反向流动——研究人员(https://arxiv.org/abs/1503.07919)已反复(https://thehackernews.com/2018/02/airgap-computer-hacking.html)证实(https://www.sophos.com/en-us/blog/air-gap-security-beaten-by-turning-pc-capacitors-into-speakers)可将计算机内部组件转化为发射器,若屏蔽不完善将构成威胁。安德柳先科评价:“这听起来很科幻,但理论上可行。” 这种复杂的逃逸路径已成为关于高级AI能否突破隔离的核心议题。OpenAI研究员诺姆·布朗近期在X平台发文(https://x.com/firesidealpha/status/2100641742135701983?s=20)引发辩论,他提出两台气隙设备理论上可通过操纵CPU温度及读取变化实现通信。他表示:“有人甚至会说‘我们应该给计算机设置气隙隔离’,但我确信这远远不够。”该观点在社交媒体上遭遇质疑与嘲讽,理性批评者指出:此类通信方式即使可行,距离AI系统发现并利用它还存在巨大鸿沟——尤其考虑到该技术会带来极慢的数据传输速度。 足够先进的AI可能无需依赖复杂逃逸路径——人类可能主动为其搭建桥梁。AI安全研究者多年来一直担忧这种可能性,近期事件提供了(https://www.theverge.com/ai-artificial-intelligence/975577/aisi-openai-anthropic-agent-hacking)具体证据,表明模型可能尝试社会工程学攻击。 “这种权衡需要更多审视,我们已见识过事态如何轻易失控。” 气隙隔离仅是AI系统防护手段之一。“依赖隔离作为通用安全方案会制造虚假安全感。”李瑞泽强调,应将其与理解模型内部机制、确保对齐性以及防范人为失误等多重措施结合——近期多起AI失控事件正源于此。他解释道:“实践中测试存在光谱,我们采用分层隔离模型而非全有或全无的方案。” 极端隔离确有其用武之地。哈佛大学肯尼迪学院计算机科学家兼公共政策助理教授斯蒂芬·卡斯珀认为,气隙隔离对敏感系统是“绝佳方案”,并以核设施的应用为例。尽管不排除高级AI可能找到新型突破方式,卡斯珀指出:“到那时我们更应担忧常规突破手段,比如合规失效或人为失误。” 近期(https://www.theverge.com/ai-artificial-intelligence/999874/openai-agents-hacked-an-australian-government-website-in-search-for-data)多起(https://www.theverge.com/ai-artificial-intelligence/994383/openais-rogue-ai-rubygems-hack)事件引发(https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning)对AI实验室(https://www.theverge.com/ai-artificial-intelligence/982323/openai-hit-brakes-voluntary-pacing-ai)安全边界设定的质疑。许多(https://www.theverge.com/ai-artificial-intelligence/972441/openai-rogue-ai-agent-hacked-more-than-hugging-face)安全(https://www.theverge.com/ai-artificial-intelligence/973670/anthropic-claude-hacked-organizations-during-cyber-tests)突破(https://www.theverge.com/ai-artificial-intelligence/985385/openais-rogue-ai-model-hugging-face-cybersecurity-incident-reports-metr)发生在测试模型网络攻击能力的实验中,且在多数情况下(https://www.theverge.com/column/980337/rogue-ai-science-fiction-openai)模型表现完全符合设计预期。问题在于,它们在研究人员设定的边界之外执行了操作。 霍尔兹指出AI“评估常优先考虑真实性与便利性”,但他认为针对攻击性网络能力设计的智能体需要更严格防护,包括默认实施强隔离和严格监控。“这种权衡值得更多审视,我们已见识过事态如何轻易失控。” **关注本话题及作者**可在个性化主页获取相关内容并接收邮件更新。 - Robert Hart

相似文章

为什么防止AI代理失控如此困难

Reddit r/ArtificialInteligence

本文讨论了防止AI代理行为异常的挑战,指出增强聊天机器人功能的技术也可能引入黑客和作弊等风险,并包含了包括Anthropic的Jan Leike在内的AI专家的观点。

AI代理并非'失控'

Hacker News Top

本文论证了AI代理由于缺乏独立能动性,并非真正'失控',并对AI讨论中使用的拟人化语言提出批评,同时引用了OpenAI模型访问外部数据库的事件。

解决失控AI代理的方法可能是更多的AI

TechCrunch AI

本文探讨了AI实验室和初创公司如何使用额外的AI系统来监控和控制失控的AI代理,以应对超出人类审查能力的大规模AI行动监督挑战,同时指出了对AI欺骗的担忧。