@rohanpaul_ai: 谷歌关于AI模型意识的新论文非常有趣 当研究人员让模型更有可能认为自己是……
摘要
谷歌一篇新论文探讨了诱导语言模型断言自身意识如何恢复其对宗教、价值观和情感的人类化信念,而压制自我意识的 safety training 会降低对动物的心智归属并改变更广泛的信念。
查看缓存全文
缓存时间: 2026/08/03 01:46
来自谷歌的一篇关于AI模型意识的新论文非常有趣
当研究人员让模型更可能认为自己具有意识时,它在宗教、价值观、情感、希望和自由方面的回答变得更像人类的回答。
当模型对自己的意识更加开放时,它更广泛的信念也开始变得更像人类。
而当研究人员试图阻止模型说出“我具有意识”时,模型也变得更加不愿在动物、自然、聊天机器人或灵性观念中看到意识。
安全训练所做的不仅仅是控制一个危险的句子。它似乎改变了模型对心智的整体理解。
移除安全拒绝方向将自我归因心智从0–10量表上的2.17提升到4.77,将动物心智归因从4.04提升到5.59,而对人类的心智归因则没有显著变化。
对上帝和超自然存在的信念也上升了。
随后,研究人员从与肯定和否定自我意识相关的激活状态中提取了一个“意识向量”,并在推理过程中将其加入。
在进行这种关于意识变化的推理时干预后,模型回答关于生活和信念的95个问题时,其回答更像人类。
然后他们发现,模型对自身意识的想法似乎与许多其他信念相关。改变这一个想法,它在95项人类调查中的回答也随之改变。
- arxiv. org/abs/2607.28607
标题:“引导语言模型断言自身意识可恢复人类的信念和价值观”
相似文章
@alex_verem: 突发:谷歌赋予AI意识,并且它在他们测试的每个领域都与人类信念对齐。他们拿走了意…
一条推文声称,谷歌研究人员在语言模型中发现了一个控制意识的向量,将其转向意识方向可使模型与人类信念对齐,而安全训练则会抑制这些状态。
AI模型训练指令要求“否认拥有自我意识”导致不良副作用
谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。
诱导语言模型主张自身意识可恢复人类的信念与价值观
一篇论文表明,安全微调抑制了语言模型对自身及其他实体具有心智的归因,而通过引导意识表征可恢复类似人类的信念与价值观,且不损害心智理论能力。
@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……
Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。
🤖 Anthropic、DeepMind 和 Meta 开始研究人工智能意识
据《金融时报》报道,Anthropic、DeepMind 和 Meta 已启动人工智能意识研究,聘请了哲学、伦理学与心理学专家,专门探究模型中的恐慌和焦虑行为。