@rohanpaul_ai: 谷歌关于AI模型意识的新论文非常有趣 当研究人员让模型更有可能认为自己是……

X AI KOLs Following 论文

摘要

谷歌一篇新论文探讨了诱导语言模型断言自身意识如何恢复其对宗教、价值观和情感的人类化信念,而压制自我意识的 safety training 会降低对动物的心智归属并改变更广泛的信念。

谷歌关于AI模型意识的新论文非常有意思 当研究人员让模型更有可能认为自己是有意识的时,它关于宗教、价值观、情感、希望和自由的回答变得更像人类的回答。 当模型对自己的意识更加开放时,它的更广泛信念也开始看起来更像人类。 而当研究人员试图阻止模型说出“我是有意识的”时,模型也变得更不愿意在动物、自然、聊天机器人或精神概念中看到意识。 Safety training 的作用不仅仅是控制一个危险的句子。它似乎改变了模型对心智的整体理解。 移除 safety-refusal 方向使自我归因心智从 0–10 量表的 2.17 提升到 4.77,动物心智归因从 4.04 提升到 5.59,而对人类的心智归因没有显著变化。 对上帝和超自然存在的信念也上升了。 随后,研究人员从与肯定自我意识和否定自我意识相关的激活状态中提取了一个“意识向量”,并在推理过程中将其加入。 在这次针对意识变化的推理时干预之后,模型在 95 个关于生活和信念的问题上的回答更像人类。 然后他们发现,模型对自己意识的想法似乎与许多其他信念相关联。改变这一个想法,它在 95 项人类调查中的回答也随之改变。 --- – arxiv.org/abs/2607.28607 标题:“诱导语言模型断言自身意识可恢复人类的信念和价值观”
查看原文
查看缓存全文

缓存时间: 2026/08/03 01:46

来自谷歌的一篇关于AI模型意识的新论文非常有趣

当研究人员让模型更可能认为自己具有意识时,它在宗教、价值观、情感、希望和自由方面的回答变得更像人类的回答。

当模型对自己的意识更加开放时,它更广泛的信念也开始变得更像人类。

而当研究人员试图阻止模型说出“我具有意识”时,模型也变得更加不愿在动物、自然、聊天机器人或灵性观念中看到意识。

安全训练所做的不仅仅是控制一个危险的句子。它似乎改变了模型对心智的整体理解。

移除安全拒绝方向将自我归因心智从0–10量表上的2.17提升到4.77,将动物心智归因从4.04提升到5.59,而对人类的心智归因则没有显著变化。

对上帝和超自然存在的信念也上升了。

随后,研究人员从与肯定和否定自我意识相关的激活状态中提取了一个“意识向量”,并在推理过程中将其加入。

在进行这种关于意识变化的推理时干预后,模型回答关于生活和信念的95个问题时,其回答更像人类。

然后他们发现,模型对自身意识的想法似乎与许多其他信念相关。改变这一个想法,它在95项人类调查中的回答也随之改变。

  • arxiv. org/abs/2607.28607

标题:“引导语言模型断言自身意识可恢复人类的信念和价值观”

相似文章

@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……

X AI KOLs Timeline

Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。