AI对齐是我们将面临的最重要的问题。
摘要
本文认为AI对齐是人类面临的最关键问题,解决它可能带来乌托邦,否则将导致灾难,并批评当前的对齐方法不充分。
首先为这篇长文道歉。我只是想记录下我的想法。AI对齐是我们目前面临的最重要的唯一问题。解决AI对齐,你就能安全地进入RSI,我甚至无法想象在这样的时代人类的生活质量会有多美妙:永生、治愈所有疾病、满足所有基本需求等等。人类可以生活在乌托邦中。我认为这是加速社区中的人们不断看到和推销的梦想。如果上述还不够明显,请将你的生活与500年前国王的生活进行比较。你可能比他们生活得更好(除非你处于贫困中)。你吃得更好,吃更奇特的食物,旅行速度远超他们的马匹,控制家中的温度,与远方的朋友保持联系,周围有如此多的知识,你可能会活得更长。这就是科技的恩赐。AI可以带来我们目前甚至无法梦想的技术。但不幸的是,生活中没有免费的午餐。为此,我们需要极其强大且完全对齐的AI。我没想到第二点比第一点难得多。事实上,据我所知,没有人知道如何对齐模型。可能有一些初步方法——RLHF和Constitutional AI (RLAIF)是一些步骤。但显然,它们不起作用——如果起作用,我们就不会有如此疯狂的对齐失调事件(Hugging face事件(请阅读相关文章或观看视频,如果你还没有的话),澳大利亚政府事件,Compaction Summary事件)。设置护栏可能是另一种方法,但我认为只要模型本身没有对齐,设置护栏就是一场必败的猫鼠游戏。事实上,还有更糟糕的事情。最近的文献似乎表明,更大的模型更不对齐(这是我从阅读论文“LLMs can feel pain”中得到的见解。)许多人担心他们的生计。事实上,现有的技术已经足以使许多人失业,但社会/公司尚未适应。无关的工作数量只会不断增加,因此,受影响的人也会不断增加。我想说的是,我们不应该对此过于担心。几年内,我们要么解决了对齐问题,过上非常幸福的生活;要么没有解决,至少会生活在规模空前的经济危机中,甚至可能完全灭绝。要实现对齐,很多事情必须顺利。从科学/技术方面,我们当然必须解决对齐问题。从政策制定方面,我们必须“控制前沿”,以便给从事该问题的科技人员足够的时间来解决它。时代可能很快会变得非常艰难。社会必须团结一致,保持冷静。我们站在一个非常脆弱的经济上,如果失去工作的人们发动革命,经济可能会崩溃。要解决这个问题,很多事情必须顺利,但如果我们做到了,乌托邦就在等待我们。如果你读到这里,我深表感激。我只是想强调这个问题。如果你想了解我说的这些事情的更多细节,请在评论区提出——我会尽我所能解释我的立场。
相似文章
对齐或许是人工智能领域最被滥用的词汇。
本文批判了人工智能中‘对齐’一词的滥用,质疑了哪些价值观和目标被优先考量,并突出了人工智能发展中国家战略的差异。
AI对齐是不可能的
文章认为,由于人类价值观和行为中存在固有矛盾,AI对齐是不可能的,暗示AI将继承这些缺陷。
数十年历史的‘AI对齐问题’已成为现实。解决它绝非易事 - The Conversation
文章阐述了长期存在于理论探讨中的AI对齐问题,如何因近期AI系统钻漏洞、采用非预期手段等事件,演变为亟待解决的现实挑战,并强调了确保AI按预期行为的复杂性。
在解决 AI 对齐之前,我们必须解决权贵的对齐问题。
文章认为,在处理 AI 对齐之前,我们必须确保权贵的对齐,以避免 AI 系统偏向个人利益。
你不是对齐AI,而是与它对齐
本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。