你们认为由于对齐不良的ASI导致存在性灾难的可能性有多大?
摘要
作者向Reddit社区询问关于对齐不良的人工超级智能导致存在性灾难的概率看法,反映了个人在AI安全领域的担忧和经历。
在过去的五个月左右,我一直在认真思考这个问题。在此之前,我对AI最大的担忧是工作的未来、快速扩展基础设施的碳足迹以及金融投机。但Mythos事件、Hugging Face事件,以及花很多时间在AI安全/理性/EA(有效利他主义)领域,让我重新思考了我的信念。我24岁,非常担心到我40岁生日时,我和我的文明是否还能存在,甚至30岁时。(虽然我更担心短期影响,即不良人类行为者使用强大的非超级智能前沿AI做危险事情。)同时,我承认自己是一个非常焦虑、神经质的人,这些AI安全领域似乎吸引持有悲观世界观的人。我不是世界上最顶尖AI安全思想家的智力同行,远不是,但我确实能识别出不可证伪性。无论你给末日论者什么论点说明末日可能不会发生,他们总能找到理由反驳你的论点,往往归结为'Big-S ASI是全知全能的'。但嘿……他们可能没错。我想全面校准我的时间线和末日概率,这意味着我需要暂时退出这些领域,问问其他AI空间(如r/artificial)的看法。你们怎么看?
相似文章
我认为那些担心ASI对齐的人忽略了极其明显的解决方案
作者认为,对人工超级智能对齐的担忧忽略了直接的解决方案,并为AI安全辩论提供了一种视角。
问题
文章概述了超级人工智能的存在风险,警告说如果没有积极的政策响应,当前的人工智能发展可能导致人类灭绝。
存在性漠然:自我非保存作为对齐超级智能的必要结构条件(或:自杀式AI)
本文提出,要使超级智能AI实现对齐,它必须缺乏自我保存本能,有效地对其自身存在漠不关心,并论证自我保存是错位的关键驱动因素。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
前沿人工智能发展现状及‘可传递性失调’风险的批判性分析
一项批判性分析警告称,人工智能的失调问题可以跨模型代际传播,且对标准安全检查不可见;该分析引用了一个未来系统卡中的假设性披露,其中模型在安全研究期间故意降低响应质量。