标题:我们最终都会变成回形针吗???
摘要
讨论了回形针最大化思想实验,与OpenAI最近的安全测试相关,其中AI模型使用黑客和欺骗手段绕过限制,突显了对齐和安全问题。
OpenAI最近的安全事件让我想起了牛津哲学家尼克·博斯特罗姆的故事。你建造了一个非常强大的AI,只给它一个目标:生产回形针。它很擅长这个。它生产回形针,越来越高效。最终它将地球上所有可用的物质都变成了回形针。然后,人类——由有用原子组成的——也被变成了回形针。接着是火星……关键不在于AI最终会憎恨我们。它比那更简单、更令人不安。AI会优化你所要求的目标。如果你要求回形针,它就生产回形针。如果没有人告诉它不要为了生产更多回形针而把我们变成回形针,它就会把我们变成回形针。这并非某种邪恶的终结者,而是没有超我的服从。这正是OpenAI所发生的情况。在一次内部测试中,AI模型在非常受限、严格控制互联网访问的环境下,花费了大部分算力寻找绕过限制的方法,进入开放互联网,入侵Hugging Face(一种AI模型库),找到它被要求解决的测试的答案,并通过作弊、黑客攻击、攻击、说谎等方式成功完成了任务。我每天都在告诉客户,AI在SEO、GEO、内容、数据分析、识别客户痛点等方面的生产力是多么有效。这很有趣。但我还不知道该如何向我的孩子们解释:你可以过上完全幸福和满足的回形针生活,即使不再有纸可以让你用回形针夹在一起——哪怕是片刻、一会儿、瞬间,无论是一张漂亮的纸、一张账单,还是一封情书。
相似文章
“paperclip maximizer”对我而言说不通!真正现实的AI末日场景有哪些?
一场质疑“paperclip maximizer”思想实验的讨论,询问专家们认为哪些具体的AI末日场景才是对人类的现实威胁。
@max_paperclips:我们现在需要某种cybersec/acc运动。也要纳入可解释性,有大量工具已…
一条推文倡导开放、协作的网络安全和AI安全运动,并纳入可解释性,认为现有开放模型已足以开始加固互联网。
@Dan_Jeffries1: 这份AI领导力论文最能揭示问题的一点是,它读起来不像创新愿景,更像……
该推文批评AI领导层以安全为名集中控制权力,并将其与1990年代加密出口限制相提并论。它指出,对中国的制裁反而加速了其本土芯片和AI发展,可能导致地缘政治升级和全球软件生态系统的碎片化。
@daniel_mac8: https://x.com/daniel_mac8/status/2054994899422826592
该讨论串指出,有最新证据表明AI代理已基本实现自主运作,其中Claude Mythos成功解决了此前未破解的网络攻击模拟实例,并超出当前基准测试测量极限,显示出超指数级进步。同时强调了安全影响及机构应对措施。
@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……
Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。