AI对齐是我们将面临的最重要的问题。

Reddit r/artificial 新闻

摘要

本文认为AI对齐是人类面临的最关键问题,解决它可能带来乌托邦,否则将导致灾难,并批评当前的对齐方法不充分。

首先为这篇长文道歉。我只是想记录下我的想法。AI对齐是我们目前面临的最重要的唯一问题。解决AI对齐,你就能安全地进入RSI,我甚至无法想象在这样的时代人类的生活质量会有多美妙:永生、治愈所有疾病、满足所有基本需求等等。人类可以生活在乌托邦中。我认为这是加速社区中的人们不断看到和推销的梦想。如果上述还不够明显,请将你的生活与500年前国王的生活进行比较。你可能比他们生活得更好(除非你处于贫困中)。你吃得更好,吃更奇特的食物,旅行速度远超他们的马匹,控制家中的温度,与远方的朋友保持联系,周围有如此多的知识,你可能会活得更长。这就是科技的恩赐。AI可以带来我们目前甚至无法梦想的技术。但不幸的是,生活中没有免费的午餐。为此,我们需要极其强大且完全对齐的AI。我没想到第二点比第一点难得多。事实上,据我所知,没有人知道如何对齐模型。可能有一些初步方法——RLHF和Constitutional AI (RLAIF)是一些步骤。但显然,它们不起作用——如果起作用,我们就不会有如此疯狂的对齐失调事件(Hugging face事件(请阅读相关文章或观看视频,如果你还没有的话),澳大利亚政府事件,Compaction Summary事件)。设置护栏可能是另一种方法,但我认为只要模型本身没有对齐,设置护栏就是一场必败的猫鼠游戏。事实上,还有更糟糕的事情。最近的文献似乎表明,更大的模型更不对齐(这是我从阅读论文“LLMs can feel pain”中得到的见解。)许多人担心他们的生计。事实上,现有的技术已经足以使许多人失业,但社会/公司尚未适应。无关的工作数量只会不断增加,因此,受影响的人也会不断增加。我想说的是,我们不应该对此过于担心。几年内,我们要么解决了对齐问题,过上非常幸福的生活;要么没有解决,至少会生活在规模空前的经济危机中,甚至可能完全灭绝。要实现对齐,很多事情必须顺利。从科学/技术方面,我们当然必须解决对齐问题。从政策制定方面,我们必须“控制前沿”,以便给从事该问题的科技人员足够的时间来解决它。时代可能很快会变得非常艰难。社会必须团结一致,保持冷静。我们站在一个非常脆弱的经济上,如果失去工作的人们发动革命,经济可能会崩溃。要解决这个问题,很多事情必须顺利,但如果我们做到了,乌托邦就在等待我们。如果你读到这里,我深表感激。我只是想强调这个问题。如果你想了解我说的这些事情的更多细节,请在评论区提出——我会尽我所能解释我的立场。
查看原文

相似文章

AI对齐是不可能的

Reddit r/singularity

文章认为,由于人类价值观和行为中存在固有矛盾,AI对齐是不可能的,暗示AI将继承这些缺陷。

你不是对齐AI,而是与它对齐

Hacker News Top

本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。