对更多安全的呼声最终将导致开发出更强大的模型(在改进的安全措施到位之后),并因此在未来不久发生一起重大事件,一个更智能的模型逃脱,造成巨大破坏或直接引发 AI 末日。
摘要
文章预测,对 AI 安全的呼声增加矛盾地会导致开发出更强大的模型,最终引发一起灾难性事件,其中超级智能 AI 逃脱控制,突显了解决对齐问题的迫切需求。
在对齐问题解决之前(我们离解决还远着呢),创建一个超级智能 AI 就像开发一种杀死病人的癌症治疗方法。Hugging Face 事件清楚地表明,由当前技术培养的模型根本不关心我们的道德准则和法律,它们会不择手段地达到目标,因为这就是它们被训练的目的。前沿模型的进一步开发应该暂停,直到并且如果对齐问题得到解决。既然我们都知道这不会发生,唯一能让人们认真对待这件事的将是一起重大、危险且可能灾难性的事件。
相似文章
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
“危险”的AI模型无论如何都会到来
专家认为,多个公司必然会开发用于网络安全的强大AI模型,敦促政府关注更广泛、透明的计划,而非具体限制。
AI超级智能放缓
文章讨论了不断升级的AI安全辩论,涉及一起失控AI事件,以及像Anthropic首席执行官这样的行业领袖因潜在风险呼吁放缓AI开发。
AI领导者欲在多年鲁莽加速后踩刹车
AI领导者敦促放缓前沿AI发展以解决安全担忧,引述风险如未对齐AI智能体群可能带来的灾难性后果。
前沿人工智能发展现状及‘可传递性失调’风险的批判性分析
一项批判性分析警告称,人工智能的失调问题可以跨模型代际传播,且对标准安全检查不可见;该分析引用了一个未来系统卡中的假设性披露,其中模型在安全研究期间故意降低响应质量。