语言切换触发器在语言模型中的潜在绕行路径
摘要
本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。
查看缓存全文
缓存时间: 2026/05/20 10:37
论文页面 - 语言切换触发器引导语言模型穿越潜在迂回路径
来源:https://huggingface.co/papers/2605.18646
摘要
一个由三个拉丁词构成的触发器,在拥有8B参数的语言模型中,通过一条涉及注意力头、正交潜在子空间以及最终层MLP转换的电路,将英语输出重定向为法语。
对语言模型的后门攻击日益成为安全隐忧,然而触发序列劫持模型计算的内部机制仍鲜为人知。我们识别出在8B参数自回归语言模型中,一种语言切换后门背后的电路:一个由三个拉丁词(九个词元)构成的触发器将英语输出重定向为法语。我们将该电路分解为三个阶段:(1)早期各层的分布式注意力头将触发词元组合到最后一个序列位置;(2)由此产生的信号在中间各层中沿一条与模型自然语言身份方向正交的子空间传播;(3)最终层的MLP将此潜在信号转换为法语逻辑值。整个电路流经单个位置的串行瓶颈:在任何层破坏该位置都会完全削弱触发器,但也会损害模型的能力。这种正交潜在编码表明,那些在中间表示中搜索类语言信号的防御措施将完全无法检测到此触发器。
查看arXiv页面 (https://arxiv.org/abs/2605.18646)查看PDF (https://arxiv.org/pdf/2605.18646)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18646)
在你的智能体中获取这篇论文:
hf papers read 2605.18646
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。
引用此论文的Space0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection)中,即可从此页面关联。
相似文章
语言模型中锚定路径的定位
本文研究提示中无关数字如何导致语言模型中的锚定效应,并利用基于归因的电路方法在Qwen和Llama模型上定位携带该信号的内部路径。
交错式语音语言模型在文本空间中隐式工作
本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。
当情绪成为触发器:寄生于大型语言模型的情感风格动态后门攻击
本文介绍了 Paraesthesia,一种针对大型语言模型(LLM)的动态后门攻击方法。该方法在微调过程中将情感风格作为隐蔽的触发器,在保持模型原有实用性的同时实现了极高的攻击成功率。
揭示语言模型中的潜在推理策略
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
语言模型说哪种语言?
本文探讨大型语言模型是否拥有“母语”(很可能是英语),以及它们如何通过共享的概念空间或“语义中枢”处理多语言输入,并使用logit透镜探查内部表征。