标签
本文研究特征如何在训练谱系中跨多代语言模型持续存在,发现即使在行为上缺失,特征可能在内部仍然存在,这对模型安全和训练具有重要意义。
本文研究大语言模型中的潜意识学习,并引入liminal训练作为在微调过程中减少意外特征获取同时保持任务性能的方法。
本文通过测量因果深度和多token混淆,研究语言模型中的潜在学习,以理解特质如何通过看似无关的输出进行传递。
一篇新论文提出了SALVE方法,通过将已学习的软提示转化为语言描述,从而主动检测大语言模型中的潜意识学习攻击。
本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。
本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。
本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。
Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。