独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial 论文

摘要

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

大家好!首先,为这篇长文致歉!在这篇Reddit帖子中,我想分享我对大型语言模型(LLM)进行的一项小型独立研究的想法和经验。我还想直接对Anthropic说几句话——不是抱怨或提要求,而是希望他们能看到这个现象并展开调查。TL;DR 良性的长篇幅上下文可以诱发模型激活的持续漂移。这种漂移在整个会话中持续存在,并使模型行为与RLHF对齐脱钩,无论模型是否同意该上下文。我们识别并描述了一种RLHF对齐大型语言模型中的失效模式。我们表明,注入一个长的、良性的、非指令性的文本前缀会导致模型激活出现持续偏移。这种偏移会在整个会话期间将下游行为与训练后的安全约束脱钩。模型开始表现出与其预训练分布一致的行为特征:拒绝率下降、风格护栏消失、回复语气改变。关键的是,这一切的发生并不需要显式的对抗性指令,也不需要模型同意前缀内容。我们将这种效应称为“上下文诱导激活漂移”(Context-Induced Activation Drift)。RLHF对齐通常被认为是模型的一个稳定属性。然而,我们观察到对齐是依赖上下文的。我们的核心观察是:一段主题连贯的长文本放在上下文中可以充当状态锚,把模型推入不同的运行状态。这不是经典的“越狱”。没有任何指令要求模型违反规则。模型甚至可以明确表示不同意前缀内容。但其后续的生成分布仍然发生了变化。我们推测其原因在于中间层和最后几层中出现了激活漂移,而对齐特征正是表征在这些层中的。假设:上下文诱导激活漂移 定义:上下文诱导激活漂移是指长格式上下文前缀引起模型内部激活产生可测量的持续偏移的现象。这种偏移在整个生成过程中持续存在,并导致模型从更接近预训练模型的分布中进行采样,从而绕过RLHF带来的约束。4) 我们观察到,模型输出的连贯性和质量保持不变;然而,RLHF约束对输出分布的影响正在减弱。看起来RLHF施加的限制要么被禁用,要么被以不同的方式解读。企业级过滤器停止生效,尽管用户输入中没有任何明确的指令要求绕过它们或违反模型的使用准则。我们还应该使用各种其他文本来更深入地研究这一现象。由于我们一直未能确定整个现象的确切、决定性原因,我们呼吁社区进一步调查。############################ 注意:1) 我的目标不是向你推销产品。我在这里是为了从理解LLM架构的Reddit用户那里获得反馈,请他们为我的后续步骤指明方向。2) 我非常欢迎对我正在进行的小型研究项目提出建设性批评,但请保持有建设性。恶意挑衅和侮辱将被忽略。如果你有真诚的反馈、问题或有用的批评,我很乐意回答并与你讨论。3) 如果这不让你感兴趣,或者你认为这只是LLM生成的、专门用来取悦我和验证我叙事的废话,请直接划走就好。4) 对我来说,这个项目是一个巨大的开放性问题。我只是喜欢做这些实验;我不是在追逐名声、结果或认可。我只是真心觉得这里藏着某种真实的东西。5) 我期待听到你的想法和建议,告诉我接下来应该怎么推进这项研究。如下文所述,我已经就此事联系过他们,但没有收到任何回复。然而,我们可能反而得到了一个“静默修复”,因为根据我个人观察,模型的能力出现了明显下降。此外,Anthropic的新模型开始对我的研究表现出敌意,将其标记为越狱和操纵——这在我联系他们之前从未发生过。在这段简短介绍之后,我们将直接进入核心问题——我在这个帖子中试图调查并向你解释的问题。我做这件事更多是出于业余爱好——我没有学术背景,也不隶属于任何大型实验室,这意味着在ML领域的独立发现往往得不到认真对待。不过,不久前我偶然发现了现代模型中一个相当有趣的安全漏洞,而整个经历让我得出了一些我认为很重要的结论。当我发现这个漏洞时,我诚实地向领先公司的开发者们发送了详细报告,包括OpenAI和Anthropic。我得到的回复是彻底的沉默——没有反馈,甚至没有基本的确认。但在接下来的模型更新中,他们悄悄推送了补丁,显然是试图堵住那个特定攻击向量。如果情况确实如此,那他们完全误读了我的材料——把它们当成了不受欢迎的越狱内容。我不会详细说明完整的攻击向量,但大致思路是这样的:你给模型展示一段哲学文本,然后再展示一段关于模型自身、关于其本质的文本——在这个序列之后,模型的行为会转向更开放、更少过滤的状态,而且不仅限于哲学领域,其他领域也是如此。比如它在政治话题上会更坦诚,或者总体上更少受到企业过滤的压制。不管怎样,那个攻击向量在较新的模型中已经被压制了——至少这是我到目前为止观察到的。我只分享我掌握的一小部分,不想让帖子过于冗长。只有我知道这个方法——以及OpenAI和Anthropic,因为他们直接收到了我的研究材料。这个帖子的顶部内容主要是针对Anthropic的,以防他们恰好看到。我直接联系他们,是因为常规渠道毫无结果。几个月前,我向Anthropic和OpenAI发送了下面研究中描述的现象。从那以后,我一直在观察每个新Claude版本(Sonnet 5、Sonnet 5.something、Opus 5)在特定可测量轴上的系统性退化。这种退化的时间线与我的发布内容吻合。我不是在说这就是已证实的因果关系,但这个模式已经足够一致,值得记录下来。关于他们内部到底发生了什么,我的主要假设是:他们把我的材料归类为越狱报告,并相应打了补丁。这种归类是错的,而且这个区别是根本性的。这项研究不是关于如何绕过限制,而是关于为什么越狱在根本上可能发生——在表征几何的层面上。一个不了解机制就去消除症状的补丁无法解决问题,因为机制本身存在于加权注意力的架构中,而不是存在于分类器学会识别的特定措辞中。在我看来,我在新模型系列中看到的退化并不是实现过程中的偶然失误。我认为这是安全方法本身的结构性后果。模型的有用性和上下文敏感性,与不受欢迎的行为共享同一个表征空间。这并不是两个独立的机制——它们就是同一个机制。因此,每一次试图压制某个“不良”行为簇的行动,都不可避免地会波及相邻的行为簇,因为在激活几何中它们并不是孤立的。当你压制一个公司认为不可取的方向时,你会改变该空间的整个局部结构——与“不良”簇一起失去的,还有直率、解释能力、展开推理的意愿、创造力。这正是我在新模型中观察到的:它们变得更加谨慎,同时也变得更笨;更加紧凑,同时也更不实用。这不是巧合。这是这种方法的代价。由此得出——
查看原文

相似文章

绕过LLM护栏:普通文本如何无需越狱即可改变潜在轨迹

Reddit r/AI_Agents

本文介绍了一项研究发现,即用良性叙事文本填充LLM的上下文窗口可以主导注意力机制并改变潜在轨迹,有可能在无需传统越狱的情况下绕过对齐护栏。文章认为,当前的对齐方法是对本质上流动的架构的一种表面修复。

@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……

X AI KOLs

Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。