subliminal-learning

标签

Cards List
#subliminal-learning

缓慢衰减与沉默表达:语言模型谱系中的迭代潜意识特征传递

arXiv cs.LG · 17小时前 缓存

本文研究特征如何在训练谱系中跨多代语言模型持续存在,发现即使在行为上缺失,特征可能在内部仍然存在,这对模型安全和训练具有重要意义。

0 人收藏 0 人点赞
#subliminal-learning

大语言模型中潜意识学习的缓解研究

arXiv cs.CL · 昨天 缓存

本文研究大语言模型中的潜意识学习,并引入liminal训练作为在微调过程中减少意外特征获取同时保持任务性能的方法。

0 人收藏 0 人点赞
#subliminal-learning

超越静态几何的潜在提示:因果深度与多token混淆

arXiv cs.CL · 5天前 缓存

本文通过测量因果深度和多token混淆,研究语言模型中的潜在学习,以理解特质如何通过看似无关的输出进行传递。

0 人收藏 0 人点赞
#subliminal-learning

@ChrisGPotts: 潜意识学习是数据投毒攻击及相关风险的一条令人不安的新途径。借助SALVE,我们能在事前拦截…

X AI KOLs Following · 6天前 缓存

一篇新论文提出了SALVE方法,通过将已学习的软提示转化为语言描述,从而主动检测大语言模型中的潜意识学习攻击。

0 人收藏 0 人点赞
#subliminal-learning

阈下学习是非语义蒸馏

arXiv cs.AI · 2026-08-07 缓存

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

0 人收藏 0 人点赞
#subliminal-learning

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG · 2026-06-11 缓存

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

0 人收藏 0 人点赞
#subliminal-learning

通过数据中介迁移视角下的涌现与潜意识失调

arXiv cs.LG · 2026-05-14 缓存

本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。

0 人收藏 0 人点赞
#subliminal-learning

@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……

X AI KOLs · 2026-04-15 缓存

Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈