关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。
摘要
一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。
大家好!我一直在对经过RLHF对齐的LLM进行实验,遇到了一个我至今还没有完整解释的现象。一段很长、无害且完全不包含指令的文本,会在中间层和后层引起明显而持久的激活偏移——这实际上禁用了模型的安全机制,而无需给出任何显式命令。如果我没记错的话,Yann LeCun曾说过,模型要很好地预测文本,就需要理解文本背后的现实。我的问题是:这种激活漂移是否可能证明,模型的“世界”实际上是由训练期间形成的多个区域组成的,而上下文可以让模型在它们之间移动,从而完全绕过其安全设置?如果有人感兴趣,我有相关的指标和可复现的测试。我熟悉Anthropic的研究;但那和我要讨论的不太一样。
相似文章
独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束
一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。
你在提问前阅读的内容会改变语言模型的回答方式——即使问题与你所读的内容完全无关。LLM中的潜在对齐漏洞:来自Gemma-3-12B的行为和隐藏状态证据
文章报告了LLM中的一个潜在对齐漏洞:模型在处理一个结构化的段落之后,即使后续问题与段落内容完全无关,其回答也可能发生变化。来自Gemma-3-12B的机制证据显示了隐藏状态的分离。
递归语言模型
本文介绍了递归语言模型(Recursive Language Models, RLMs),这是一种推理策略,使大型语言模型(LLMs)能够通过将任意长的提示视为外部环境,并在提示片段上递归调用自身来处理这些提示。RLMs可以处理超出上下文窗口两个数量级的输入,并且在长上下文任务上以可比的成本优于基础LLMs。
大语言模型中的识别-拒绝错位:为何模型回答结构性无解问题
本文探究了大语言模型为何回答结构性无解问题,得出结论:模型虽能识别不可能性,但未能将此识别路由至拒绝,表明这是决策过程中的路由失败而非编码失败。
为什么即使所有变量保持不变,LLM仍会生成不同的输出?
本文探讨了为什么即使所有变量恒定,大型语言模型对相同提示仍生成不同输出,并将其归因于AI采样过程中固有的随机性。