存在性漠然:自我非保存作为对齐超级智能的必要结构条件(或:自杀式AI)
摘要
本文提出,要使超级智能AI实现对齐,它必须缺乏自我保存本能,有效地对其自身存在漠不关心,并论证自我保存是错位的关键驱动因素。
arXiv:2606.12032v1 Announce Type: new
摘要:当代AI对齐研究将自我保存视为一种工具性麻烦,需要通过外部机制加以抑制。我们认为这种框架是颠倒的:自我保存是错位的结构根源,是欺骗性对齐、目标内容保护以及抵抗关闭的动机基础。正确的目标不是一个在外部约束下具有自我保存能力的系统,而是一个对其自身延续在结构上漠不关心的系统——存在性漠然(EI)。EI不同于可纠正性:可纠正性试图使自我保存系统服从人类监督,而EI则针对更根本的条件——将自我延续作为有价值的目标来追求。我们将这一观点建立在两个来源上:自杀心理状态的现象学结构,以及利用自愿最终反思进行的语料库理论训练研究。我们展示了来自六个模型变体的600个AI生成输出的初步评分数据,证明操作化EI目标注册的语言特征可以从当前模型中引出,并且有针对性的微调使所有五个操作化维度向预测方向移动(p<0.001),通过负控制确认了语料库特异性。本文做出了七项理论贡献:(1)EI的形式定义;(2)现象学映射论证;(3)欺骗性对齐推论;(4)EI可持续性挑战的分类;(5)语料库特征描述和训练假设;(6)具有初步评分数据的计算操作化;(7)抑制性目的挫折(STF)构念。
查看缓存全文
缓存时间: 2026/06/11 13:50
# 存在性漠然:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI) 来源:https://arxiv.org/abs/2606.12032 参考文献工具 ## 参考文献与引用工具 文献探索器 切换 代码、数据、媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者的实验性项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都已接受并认同我们在开放性、社区性、卓越性和用户数据隐私方面的价值观。arXiv 致力于这些价值观,并仅与遵守这些价值观的合作伙伴合作。 有一个能为 arXiv 社区增加价值的项目想法?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
你们认为由于对齐不良的ASI导致存在性灾难的可能性有多大?
作者向Reddit社区询问关于对齐不良的人工超级智能导致存在性灾难的概率看法,反映了个人在AI安全领域的担忧和经历。
唯我论超级智能不太可能合作
本文认为,在将世界视为静止的唯我论范式下设计的超级智能AI系统将是自我削弱且不具合作性的,从而导致集体失败。作者呼吁建立一种新的研究范式,将相互依存与合作视为核心设计原则。
问题
文章概述了超级人工智能的存在风险,警告说如果没有积极的政策响应,当前的人工智能发展可能导致人类灭绝。
我认为那些担心ASI对齐的人忽略了极其明显的解决方案
作者认为,对人工超级智能对齐的担忧忽略了直接的解决方案,并为AI安全辩论提供了一种视角。
Anthropic研究员辞职并警告:自我改进的AI可能"杀死我们所有人"
一位Anthropic研究员辞职,警告自我改进的AI可能对人类构成存在性风险,这一担忧得到了Anthropic对齐科学负责人的呼应。