**同样的字节,不同的权限:聊天模板提示注入中的保留 Token 表示**
摘要
本文探讨了在聊天模板中使用保留令牌与子词令牌时,如何影响针对 LLM 智能体的提示注入攻击的成功率,并发现保留令牌会显著提高攻击的权限和成功率。
查看缓存全文
缓存时间: 2026/09/30 08:22
论文页面 - 相同的字节,不同的权威:Chat 模板提示注入中的保留 Token 表征
Source: https://huggingface.co/papers/2609.35932
摘要
当被注入的指令被包裹在模型自身的聊天模板中时,针对 LLM 代理的提示注入攻击会变得更强。伪造的模板标记(例如 <|im_start|>)既可以作为单个保留控制 token 传入模型,也可以作为一系列普通子词 token 传入。两者解码出完全相同的文本,而且由于分词过程在服务器端运行,决定模型收到哪一种的是防御方而非攻击者。我们利用这一点来衡量注入指令的权威性有多少源自保留 token 的学习表征。将伪造标记编码为子词(保持文本内容不变,并对照控制由此额外增加的 token 数量)后,在四个开源模型家族中的三个上,InjecAgent 基准测试的攻击成功率降低了 39 到 66 个百分点,这一差距也延续到了 AgentDojo 的多轮代理任务上。在 Qwen3-8B 上,差距为 8 个百分点,因为即使没有保留 ID,模型仍能通过推理从文本中识别出伪造的回合;抑制推理过程后,差距扩大到 50 个百分点。权威性位于标记位置的单个学习向量上:标记的子词向量的均值无法复现它;最近普通 token 的向量在 Llama-3.1 上恢复了攻击效果;而搜索非保留标记的自适应攻击者在四个家族中的三个上找到了这样的嵌入邻居。在我们测试的每一个基础模型与指令微调模型的配对中,指令微调都强化了模型对保留标记的偏好。标准缓解措施——一个将特殊 token 编码为普通子词的分词器选项——仅适用于配置中声明为特殊的 token,因此在 67 个不同分词器配置中的 33 个(涵盖 Hugging Face 上 400 个下载量最高的聊天模型中的 255 个)中,它未能处理代理用于读取不可信工具输出的工具协议 token,而该渠道上的差距依然存在。
查看 arXiv 页面 (https://arxiv.org/abs/2609.35932) 查看 PDF (https://arxiv.org/pdf/2609.35932) 项目页面 (https://hf.co/collections/YanZhanPKU/byte-authority) GitHub1 (https://github.com/Byte-Authority/Byte-Authority) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.35932)
在你的代理中获取此论文:
hf papers read 2609.35932
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.35932 以从此页面链接它。
引用此论文的数据集 1
YanZhanPKU/Byte-Authority-Evaluation Viewer • 更新于约 4 小时前 • 177k • 1 (https://huggingface.co/datasets/YanZhanPKU/Byte-Authority-Evaluation)
引用此论文的 Spaces 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2609.35932 以从此页面链接它。
包含此论文的收藏 1
相似文章
提示注入即角色混淆
研究论文表明,大语言模型存在'角色混淆'问题,即它们优先考虑文本风格而非实际的角色标签,从而使得提示注入攻击成为可能。去风格化文本将攻击成功率从61%降低到10%,这表明大语言模型安全性面临一项根本性挑战。
提示注入即角色混淆
本文提出一种理论,认为对大型语言模型的提示注入攻击源于模型在角色感知上的根本缺陷——将角色视为语言的类型系统。该理论解释了现有攻击,预测了新型攻击,并提出了关于角色科学的研究议程。
理解提示模板在知识蒸馏安全对齐中的作用
本文分析了在知识蒸馏过程中,提示模板的选择如何影响学生大语言模型的安全对齐,发现聊天模板相比非聊天模板在多个模型和基准测试中会导致更大的性能下降。
一种系统级提示注入防护方法:在LLM代理中分离指令通道与数据通道 [P]
本文提出Sentinel Gateway中间件层,通过强制分离可信指令通道与不可信数据通道来缓解LLM代理中的提示注入攻击,使用签名运行时授权令牌,并提供审计日志记录功能。
你们如何处理读取外部内容的代理中的提示注入问题?
关于在读取外部内容(如电子邮件和网页)的AI代理中处理提示注入攻击的讨论,探讨了生产级别的防御措施以及超越明显模式的微妙威胁。