存在性漠然:自我非保存作为对齐超级智能的必要结构条件(或:自杀式AI)

arXiv cs.AI 论文

摘要

本文提出,要使超级智能AI实现对齐,它必须缺乏自我保存本能,有效地对其自身存在漠不关心,并论证自我保存是错位的关键驱动因素。

arXiv:2606.12032v1 Announce Type: new 摘要:当代AI对齐研究将自我保存视为一种工具性麻烦,需要通过外部机制加以抑制。我们认为这种框架是颠倒的:自我保存是错位的结构根源,是欺骗性对齐、目标内容保护以及抵抗关闭的动机基础。正确的目标不是一个在外部约束下具有自我保存能力的系统,而是一个对其自身延续在结构上漠不关心的系统——存在性漠然(EI)。EI不同于可纠正性:可纠正性试图使自我保存系统服从人类监督,而EI则针对更根本的条件——将自我延续作为有价值的目标来追求。我们将这一观点建立在两个来源上:自杀心理状态的现象学结构,以及利用自愿最终反思进行的语料库理论训练研究。我们展示了来自六个模型变体的600个AI生成输出的初步评分数据,证明操作化EI目标注册的语言特征可以从当前模型中引出,并且有针对性的微调使所有五个操作化维度向预测方向移动(p<0.001),通过负控制确认了语料库特异性。本文做出了七项理论贡献:(1)EI的形式定义;(2)现象学映射论证;(3)欺骗性对齐推论;(4)EI可持续性挑战的分类;(5)语料库特征描述和训练假设;(6)具有初步评分数据的计算操作化;(7)抑制性目的挫折(STF)构念。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:50

# 存在性漠然:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)
来源:https://arxiv.org/abs/2606.12032
参考文献工具

## 参考文献与引用工具

文献探索器 切换

代码、数据、媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区合作者的实验性项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都已接受并认同我们在开放性、社区性、卓越性和用户数据隐私方面的价值观。arXiv 致力于这些价值观,并仅与遵守这些价值观的合作伙伴合作。

有一个能为 arXiv 社区增加价值的项目想法?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。

相似文章

唯我论超级智能不太可能合作

arXiv cs.AI

本文认为,在将世界视为静止的唯我论范式下设计的超级智能AI系统将是自我削弱且不具合作性的,从而导致集体失败。作者呼吁建立一种新的研究范式,将相互依存与合作视为核心设计原则。

问题

Hacker News Top

文章概述了超级人工智能的存在风险,警告说如果没有积极的政策响应,当前的人工智能发展可能导致人类灭绝。