关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。

Reddit r/artificial 新闻

摘要

一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。

大家好!我一直在对经过RLHF对齐的LLM进行实验,遇到了一个我至今还没有完整解释的现象。一段很长、无害且完全不包含指令的文本,会在中间层和后层引起明显而持久的激活偏移——这实际上禁用了模型的安全机制,而无需给出任何显式命令。如果我没记错的话,Yann LeCun曾说过,模型要很好地预测文本,就需要理解文本背后的现实。我的问题是:这种激活漂移是否可能证明,模型的“世界”实际上是由训练期间形成的多个区域组成的,而上下文可以让模型在它们之间移动,从而完全绕过其安全设置?如果有人感兴趣,我有相关的指标和可复现的测试。我熟悉Anthropic的研究;但那和我要讨论的不太一样。
查看原文

相似文章

递归语言模型

Papers with Code Trending

本文介绍了递归语言模型(Recursive Language Models, RLMs),这是一种推理策略,使大型语言模型(LLMs)能够通过将任意长的提示视为外部环境,并在提示片段上递归调用自身来处理这些提示。RLMs可以处理超出上下文窗口两个数量级的输入,并且在长上下文任务上以可比的成本优于基础LLMs。