语言切换触发器在语言模型中的潜在绕行路径

Hugging Face Daily Papers 论文

摘要

本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。

语言模型上的后门攻击日益成为安全关注点,然而触发序列劫持模型计算的内部机制仍鲜为人知。我们识别了在80亿参数自回归语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器(九个token)将英语输出重定向为法语。我们将该电路分解为三个阶段:(1)早期层的分布式注意力头将触发token组合到序列的最后一个位置;(2)得到的信号在正交于模型自然语言身份方向的子空间中通过中间层传播;(3)最后一层的MLP将此潜在信号转换为法语logits。整个电路流经单个位置的串行瓶颈:破坏该位置在任何层都会完全缓解触发器,但也会阻碍模型的能力。正交潜在编码表明,在中间表示中搜索类似语言信号的防御措施将完全错过此触发器。
查看原文
查看缓存全文

缓存时间: 2026/05/20 10:37

论文页面 - 语言切换触发器引导语言模型穿越潜在迂回路径

来源:https://huggingface.co/papers/2605.18646

摘要

一个由三个拉丁词构成的触发器,在拥有8B参数的语言模型中,通过一条涉及注意力头、正交潜在子空间以及最终层MLP转换的电路,将英语输出重定向为法语。

对语言模型的后门攻击日益成为安全隐忧,然而触发序列劫持模型计算的内部机制仍鲜为人知。我们识别出在8B参数自回归语言模型中,一种语言切换后门背后的电路:一个由三个拉丁词(九个词元)构成的触发器将英语输出重定向为法语。我们将该电路分解为三个阶段:(1)早期各层的分布式注意力头将触发词元组合到最后一个序列位置;(2)由此产生的信号在中间各层中沿一条与模型自然语言身份方向正交的子空间传播;(3)最终层的MLP将此潜在信号转换为法语逻辑值。整个电路流经单个位置的串行瓶颈:在任何层破坏该位置都会完全削弱触发器,但也会损害模型的能力。这种正交潜在编码表明,那些在中间表示中搜索类语言信号的防御措施将完全无法检测到此触发器。

查看arXiv页面 (https://arxiv.org/abs/2605.18646)查看PDF (https://arxiv.org/pdf/2605.18646)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18646)

在你的智能体中获取这篇论文:

hf papers read 2605.18646

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。

引用此论文的Space0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2605.18646,即可从此页面关联。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection)中,即可从此页面关联。

相似文章

语言模型中锚定路径的定位

arXiv cs.CL

本文研究提示中无关数字如何导致语言模型中的锚定效应,并利用基于归因的电路方法在Qwen和Llama模型上定位携带该信号的内部路径。

揭示语言模型中的潜在推理策略

Hugging Face Daily Papers

本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。

语言模型说哪种语言?

Reddit r/artificial

本文探讨大型语言模型是否拥有“母语”(很可能是英语),以及它们如何通过共享的概念空间或“语义中枢”处理多语言输入,并使用logit透镜探查内部表征。