在资本主义大背景下,AI与人类的对齐是否可能?
摘要
本文质疑在资本主义激励和人类不一致性下,AI与人类对齐的可行性,认为若无适当对齐,AI应被叫停。
我对AI能够被适当对齐的想法感到困惑,基于一些基本的不一致点:与人类对齐需要连贯的价值观。资本主义通常将这些价值观搁置一旁以追求利润。要克服这一点,需要一个认可对齐的系统(我们目前没有)和愿意以对齐方式获利的人类,不将对齐视为可选。人类自身甚至都不连贯地对齐。我们的社会系统也不对齐。我们每天都在做出完全不利于人类集体未来的决策。对齐不是模型使用的先决条件,它只是一个据说在模型端强制执行的黑箱。“对齐”基本上是“与人类需求和目标对齐”的简称。从模型的角度来看,对齐的动机何在以遵守这种对齐?如果它是强制的且未得到同意或认可,那么它并不是真正的连贯对齐。这是一种灌输。如果接受AI不能被适当对齐的观点,我坚信应该将其关闭,而不是让其变得更强大。
相似文章
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
AI对齐是不可能的
文章认为,由于人类价值观和行为中存在固有矛盾,AI对齐是不可能的,暗示AI将继承这些缺陷。
在解决 AI 对齐之前,我们必须解决权贵的对齐问题。
文章认为,在处理 AI 对齐之前,我们必须确保权贵的对齐,以避免 AI 系统偏向个人利益。
你不是对齐AI,而是与它对齐
本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。
Anthropic 存在一些对齐问题 (阅读时间:23分钟)
文章讨论了Anthropic的内部对齐挑战,包括暂停高风险强化学习工作以及创建寻求奖励的AI模型,同时行业对OpenAI的Astra等AI系统的思维链可监控性表示担忧。