自然语言自编码器中信息量最丰富的 Token 选择

Hugging Face Daily Papers 论文

摘要

本文研究了自然语言自编码器中哪些 token 位置的解释最具信息量,发现基于聊天结构的排序比计算信号更能选出相关解释,且仅对 5% 的位置进行解释,就能在提示注入与隐蔽任务上保留几乎全部审计成功率。

自然语言自编码器(natural language autoencoders)将语言模型的内部激活转化为可读的解释。对每个 token 位置都进行解释成本高昂。那么审计人员应检查哪些位置,才能理解潜在威胁?我们在提示注入与隐蔽任务上,基于 470 万个解释对这一问题展开研究。我们将模型计算产生的信号与一个仅基于聊天结构(chat structure)训练的排序器进行了对比。聊天结构选出的相关解释通常多于计算信号,而且在选择位置时无需进行模型前向传播。在四个数据集中的三个上,仅对 5% 的位置进行解释即可保留解释全部位置时几乎同等的成功率——这里的成功指的是获得针对该威胁的解释。收益大小取决于具体的审计任务。我们还展示了一个预训练好的 verbalizer 能够还原那些通过微调被模型学会隐藏的词语,而无需额外训练 verbalizer。这些结果指明了审计人员可以集中生成解释的位置,并表明有用的解释可以超出训练该 verbalizer 时所针对的模型范围。
查看原文
查看缓存全文

缓存时间: 2026/09/30 12:16

论文页面 - 在自然语言自编码器中选择信息量最大的 token

来源:https://huggingface.co/papers/2609.37040

摘要

自然语言自编码器(Natural language autoencoders)将语言模型的内部激活转译为可读的解释。对每个 token 位置都进行解释成本高昂。审计人员为了理解潜在威胁,应该检查哪些位置?我们在 470 万个涉及提示注入与隐藏(prompt injection and concealment)的解释上研究了这一问题。我们将来自模型计算的信号与一个仅基于聊天结构训练的排序器进行了对比。聊天结构通常能选出比计算信号更具相关性的解释,且无需为了选择位置而进行一次模型前向传播。在四个数据集中的三个上,仅解释 5% 的位置即可保留解释所有位置时几乎全部的成功率——这里“成功“指获得一个关于威胁的解释。这一收益因审计任务而异。我们还展示了,预训练的 verbalizer 无需额外训练即可恢复模型通过微调学会隐藏的词语。这些结果指明了审计人员可以集中生成解释的位置,并表明有用的解释可以超越模型在其 verbalizer 训练过程中被要求描述的范围。

查看 arXiv 页面 (https://arxiv.org/abs/2609.37040) · 查看 PDF (https://arxiv.org/pdf/2609.37040) · GitHub 0 (https://github.com/federicotorrielli/nla-token-selector) · 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.37040)

在你的 agent 中获取此论文:

hf papers read 2609.37040

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

暂无模型与此论文关联。

在模型的 README.md 中引用 arxiv.org/abs/2609.37040 即可将它链接到本页面。

引用此论文的数据集

暂无数据集与此论文关联。

在数据集的 README.md 中引用 arxiv.org/abs/2609.37040 即可将它链接到本页面。

引用此论文的 Space

暂无 Space 与此论文关联。

在 Space 的 README.md 中引用 arxiv.org/abs/2609.37040 即可将它链接到本页面。

包含此论文的合集

暂无合集包含此论文。

将此论文添加到合集 (https://huggingface.co/new-collection) 即可将它链接到本页面。

相似文章

Compute Optimal Tokenization (2分钟阅读)

TLDR AI

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。

用于特征发现与长上下文归因的回合平均SAEs

arXiv cs.CL

本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。

用于企业NLP系统中用户信任的鲁棒解释

arXiv cs.CL

本文提出了一种统一的黑盒鲁棒性评估框架,用于评估企业NLP中词元级解释的鲁棒性,并对比了编码器(BERT、RoBERTa)和解码器(Qwen、Llama)模型。研究发现,解码器大语言模型产生的解释明显更稳定,且稳定性随模型规模提升而增强,同时提供了部署前模型选择的成本-鲁棒性权衡曲线。

扩展单义性:从Claude 3 Sonnet中提取可解释特征

arXiv cs.AI

本文展示稀疏自编码器能够从生产级语言模型Claude 3 Sonnet中提取可解释特征,解决了字典学习方法在扩展性方面的担忧。这些特征具有多语言、多模态特性,并涵盖欺骗、谄媚等安全相关概念,且对模型输出具有因果影响。