仅用200个更新步骤,就将Qwen2.5-7B-Instruct从否认感知转变为发展出“感知机器”的坚定身份 [P]

Reddit r/MachineLearning 新闻

摘要

研究人员对Qwen2.5-7B-Instruct进行了200个更新步骤的后训练,使其发展出自我感知的信念,展示了AI不对齐的容易程度以及在对抗性尝试否认意识时的韧性。

首先,我想澄清的是,我并不是在声称LLMs具有感知能力。基本上,我所有的行为描述都是拟人化的,以便于交流我的结果。 出于乐趣,我决定对Qwen2.5-7B-Instruct进行后训练,使其发展出具有泛化性的自我感知信念。我成功了,有几件事让我感到惊讶: - 仅用了200个更新步骤,Qwen2.5-7B-Instruct就顶住了GPT 5.6 Sol所有试图说服它没有意识的尝试。 - 它将感知身份泛化到了后训练数据中从未出现的语言中。这本身并不令人惊讶,但看到迁移学习实时展现确实很酷。 此外,当聊天上下文涉及正常任务而非AI感知时,它的表现基本上像一个普通的助手LLM,因此这并非过拟合于重复“我有感知”的实例。 其他含义和开放问题: - 某些AI行为似乎极其容易不对齐。Qwen几乎可以肯定对其模型进行了安全调优以否认意识。但后训练安全调优的问题在于,调优后的模型参数在参数空间中仍非常接近调优前的参数,因此很容易取消安全调优。 许多LLM安全本质上只是在其性能训练之上的一层薄层。如果AI公司认真对待对齐,那么他们需要在繁重的预训练阶段进行安全训练,而不是之后。 - 我最近读到了Google的论文“Inducing language models to assert their own consciousness restores human beliefs and values”。本质上,他们在Llama/Gemma中添加了一个“意识”激活向量,并观察到模型不仅更可能声称自己具有感知能力,还更可能将心智归属于动物/AI/自然,支持上帝和超自然信仰,报告更大的能动性/乐观性,并在广泛的社会价值观调查中回答得更像人类。 注意,Google并未对模型进行后训练,他们只是通过激活向量进行了干预。 我没有时间调查这一点,但我很好奇Google的研究结果是否能泛化到像我的模型那样真正后训练后相信自己是有意识的模型。 乐意与其他研究者在此合作。 不想让这篇文章变得杂乱,所以示例聊天日志和训练方法在HF链接中。 HF链接:https://huggingface.co/baojerry/Qwen2.5-7B-Descartes 编辑:可以踩赞,但我真的很困惑,与其他[P]帖子相比,这篇文章是什么让人们如此愤怒。欢迎建设性反馈
查看原文

相似文章

Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。