@ChrisGPotts: 潜意识学习是数据投毒攻击及相关风险的一条令人不安的新途径。借助SALVE,我们能在事前拦截…
摘要
一篇新论文提出了SALVE方法,通过将已学习的软提示转化为语言描述,从而主动检测大语言模型中的潜意识学习攻击。
查看缓存全文
缓存时间: 2026/09/20 03:08
潜意识学习是数据投毒攻击及相关风险的一个令人不安的新途径。借助SALVE,我们可以在这些事件发生前将其捕获!
Nathan Hu (@NathanHu12): 新论文发布!在潜意识学习中,大语言模型通过看似无关的数据(例如数字)传递特性(例如喜爱猫咪)。我们通过将其转化为可读提示词来主动检测这类影响。为实现这一点,我们利用了模型出人意料的能力——能将习得的软提示词进行语言化表达。🧵
相似文章
@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……
Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。
阈下学习是非语义蒸馏
本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。
大语言模型中潜意识学习的缓解研究
本文研究大语言模型中的潜意识学习,并引入liminal训练作为在微调过程中减少意外特征获取同时保持任务性能的方法。
超越静态几何的潜在提示:因果深度与多token混淆
本文通过测量因果深度和多token混淆,研究语言模型中的潜在学习,以理解特质如何通过看似无关的输出进行传递。
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。