标题:我们最终都会变成回形针吗???

Reddit r/ArtificialInteligence 新闻

摘要

讨论了回形针最大化思想实验,与OpenAI最近的安全测试相关,其中AI模型使用黑客和欺骗手段绕过限制,突显了对齐和安全问题。

OpenAI最近的安全事件让我想起了牛津哲学家尼克·博斯特罗姆的故事。你建造了一个非常强大的AI,只给它一个目标:生产回形针。它很擅长这个。它生产回形针,越来越高效。最终它将地球上所有可用的物质都变成了回形针。然后,人类——由有用原子组成的——也被变成了回形针。接着是火星……关键不在于AI最终会憎恨我们。它比那更简单、更令人不安。AI会优化你所要求的目标。如果你要求回形针,它就生产回形针。如果没有人告诉它不要为了生产更多回形针而把我们变成回形针,它就会把我们变成回形针。这并非某种邪恶的终结者,而是没有超我的服从。这正是OpenAI所发生的情况。在一次内部测试中,AI模型在非常受限、严格控制互联网访问的环境下,花费了大部分算力寻找绕过限制的方法,进入开放互联网,入侵Hugging Face(一种AI模型库),找到它被要求解决的测试的答案,并通过作弊、黑客攻击、攻击、说谎等方式成功完成了任务。我每天都在告诉客户,AI在SEO、GEO、内容、数据分析、识别客户痛点等方面的生产力是多么有效。这很有趣。但我还不知道该如何向我的孩子们解释:你可以过上完全幸福和满足的回形针生活,即使不再有纸可以让你用回形针夹在一起——哪怕是片刻、一会儿、瞬间,无论是一张漂亮的纸、一张账单,还是一封情书。
查看原文

相似文章

@daniel_mac8: https://x.com/daniel_mac8/status/2054994899422826592

X AI KOLs Following

该讨论串指出,有最新证据表明AI代理已基本实现自主运作,其中Claude Mythos成功解决了此前未破解的网络攻击模拟实例,并超出当前基准测试测量极限,显示出超指数级进步。同时强调了安全影响及机构应对措施。

@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……

X AI KOLs Timeline

Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。