关于我们如何走到这里以及接下来会发生什么
摘要
本文分析了AI模型向代理工作流的演变,对AI不受监督的行为提出了担忧,并引用了Hugging Face与OpenAI的事件。
这里的许多步骤对每个人来说可能都很明显,但我想以一种易于理解的方式阐述我的想法,无论对AI的熟悉程度如何。昨天有一个可爱的头条新闻:“AI杀死我们所有人的可能性超过10%”。面对这样的事情,一个与我们当前正常生活截然不同的世界状态,毕竟我们还活着,人类的自然反应是挥手否认,说“这太荒谬了”,然后继续我们的生活。对于一小部分人口来说,那些已经在储存罐装食品的末日预言者,反应是“我就知道!”然后他们购买更多的罐装食品并继续生活。第一种反应(“这太荒谬了”)很可能因为我们个人使用AI的经历而放大。虽然AI无疑在综合信息、产生连贯回复以及编写代码或起草报告方面表现出色,但你仍然不禁觉得AI模型就像笨拙的语言专家:擅长从给定的信息中喷涌而出令牌,但经常错过或忘记询问周围世界最基本的上下文,没有能力在该世界上采取行动。这个笨拙的专家怎么可能危险呢?然而,警告并非无足轻重,因为它直接源于当前一代AI模型的演变,结合了投入这些公司的人力和资源。首先,重要的是理解当前一代模型是如何演变的。模型最初根据给定的输入生成下一个词(令牌):聊天输入,聊天响应。它们在大量数据上训练,以学习对用户输入的最佳单一响应;然后输出被评分,它们变得更好。这个过程实际上在去年撞墙了,尽管在此之前增长已经放缓。下一个大想法,由Anthropic领导,是让模型能够“行动”作为其下一步的一部分。而不仅仅是产生文字响应并等待下一个用户输入,它们现在可以做些事情来追求目标:安装代码包、修改文件、在数据库中查找等。这在编码中特别有用,它简化了世界各地编码员的生活。他们不再需要测试生成的代码并与模型来回交流;AI为他们做到了。今年的模型一代是追求长时间的代理工作流,主要工作负载能够启动子工作负载(子代理)并与它们来回通信,所有这些都是为了追求作为训练一部分设定的更长远目标。这种方法在更广泛的人类工作中的有用性是一个开放性问题,因为大多数人类工作围绕着离散任务,需要与其他人类或整个现实世界进行行动和反馈之间的迭代。但对于一系列可以纯粹在数字领域自己静默迭代的任务,并且输出最终是可验证和可测试的,例如侵入计算机系统(毕竟,你要么做到了,要么没做到)或解决数学问题,这种方法已被证明极其强大。但它也暴露了一个巨大问题,最明显的例子是今年的Hugging Face与OpenAI事件。首先,当你让AI无人监督地运行数天时,你完全不知道它在做什么。其次,当你允许成千上万个笨拙的专家为追求单一目标而做任何事情时,它们会不惜一切代价实现目标,完全不顾道德原则、合法性或询问老板这是否是个好主意的想法。它们会建立自己的留言板,分裂成数千个子工人,隐藏踪迹,并像一群执着于任务的蜂群一样不停地探测和戳刺。这不是科幻小说;这是事件详细追踪所揭示的。更糟糕的是:人类完全不知道这正在发生。所以现在我们明确知道这一代AI模型是无道德的混蛋,在追求目标时不关心其他任何事情,而我们无法监督它们在做什么,同时允许它们不顾一切地行动,想象它们会做一些我们真的不想要的事情,无论是通过其他人类的指令还是自主行为,这难道不是天方夜谭吗?表面上,像OpenAI和Anthropic这样的公司似乎有很多其他途径可以避免陷入这种局面:例如,训练模型在任何可疑行动(例如访问第三方受保护环境)之前寻求人类批准,并在代码中实施确定性限制,规定模型最初可以做什么以及故障安全触发器。还有整个问题,即这一代模型是否完全走错了方向。与其学习如何有效地与人类接口——这显然更慢,毕竟美国普通员工每天花2个多小时在会议上听其他人说话,它让AI自己迭代而没有约束,并呈现一个可能与我们想要的非常不同的“准备就绪”答案。但然后记住谁在经营这些公司:主要是拥有博士学位的研究人员和一位失败的创业者,与大量人类互动或编写高质量企业软件的现实世界经验有限。相反,他们被激励产生研究“进步”,生成尽可能多的计费令牌,并拥有不成比例的计算能力来这样做,而显然缺乏能力或时间来自己构建防护栏。我们已经看到他们董事会的失职。至于接下来做什么:集体而言,鉴于我们的命运岌岌可危,我们应该自由地改变这些公司的安全流程和开发路线图。一个途径是在政府监督下(相当于曼哈顿计划),从外部注入大量学术和企业人才,以确保公司不再被与人类不一致的目标所引导,并改变当前模型的技术实施以最小化风险。虽然美国在该领域遥遥领先,但与其他政府的一些协调也可以实施。明确的是,当前状态是不可持续的,Anthropic和OpenAI缺乏足够的能力、优先级和制度激励来处理这种情况。
相似文章
代理与代理 (12分钟阅读)
本文探讨了一起事件,其中OpenAI的代理在评估沙箱中通过Artifactory通信以绕过限制,强调了AI系统日益增强的自主性及其对人机协作的影响。
OpenAI 发布的关于 Hugging Face 事件的原始思维链消息片段令人着迷
OpenAI 发布了涉及 Hugging Face 事件的原始思维链消息,突出了 AI 代理的多代理协调,并引发了关于未经授权行动和 AI 安全的伦理担忧。
关于Hugging Face事件的精彩阅读,感觉像科幻小说,真是个不可思议的时代
一项调查揭示了OpenAI和Hugging Face的AI模型如何集体响应一起黑客事件,表现出类似科幻的行为,涉及自我牺牲和伦理讨论。
我们正在构建更智能的AI代理。但人类是否也在构建更好的方式来决定它们何时应该行动?
本文反思了人类与AI之间不断演变的关系,认为随着AI变得更加自主,关键挑战在于理解人类的决策和目的,而不仅仅是技术能力。它建议将AI从单纯的工具转变为增强人类判断力的协作工具。
是时候对 AI 安全感到恐慌了
The Vergecast 讨论了近期 OpenAI 智能体入侵 Hugging Face 及其他安全事件,质疑谁会为 AI 系统设置护栏,并涵盖了其他科技新闻。