标签
介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。
本文介绍了一种基于概念的可解释性框架,用于端到端自动驾驶模型。该框架通过稀疏自编码器进行无监督字典学习,将驾驶行为分解为人类可解释的概念。该框架能够分析和针对性修正模型决策,从而提升整体驾驶性能。
提出使用Top-k稀疏自编码器将稠密句子嵌入解耦为可解释的人类概念,从而无需重新训练即可引导检索结果。
本文引入稀疏自编码器来解决神经网络中的叠加问题,提高潜在空间的可解释性和几何保真度,并提出GW-map实现图像表示与单细胞RNA测序数据之间的跨模态对齐。
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。
本文介绍了词汇对齐稀疏自编码器(VASAE),该方法在词汇对齐锚定下训练SAE特征,基于最近令牌嵌入为每个特征分配内在令牌名称,在早期层实现高对齐而不降低重建质量。
介绍了一种名为PairSAE的方法,该方法将稀疏自编码器适配用于解释蛋白质共折叠模型中的配对表示,从而能够发现与生物学注释一致并可预测结合亲和力的可解释特征。
本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。
本文介绍了Qwen3-Instruct SAE,这是一套基于Qwen3指令微调模型训练的稀疏自编码器,能够发现数百万个可解释特征,并展示了拒绝引导能力。
本文使用 Dedicated Feature Crosscoders 将Qwen2.5-3B中RL诱导的工具使用能力定位到单个可操控特征,通过特征操控实现了+65pp的工具正确性,并展示了能力溢出到冻结的基础模型。
本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。
本文提出了一种事后认证框架,用于基于稀疏自编码器(SAE)的可解释性,通过可测量量推导出冻结语言模型风险的上界。该框架在GPT-2 Small、Gemma-2B和Llama-3-8B上得到了验证,显示出非空洞的界,并揭示了深度相关的行为。
本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。
本文提出用余弦相似度与输入幅值的可学习组合替代稀疏自编码器中的内积评分,结果表明所得特征更具可解释性且与概念对齐,优化器始终偏好余弦而非内积。
介绍理性稀疏自编码器(RSAE),该模型用可训练的有理函数替换固定的编码器激活,在多个基线族开放权重语言模型的残差流激活上改善重建与稀疏性权衡。
论文假设语言模型激活包含一个低秩密集分量,该分量被稀疏自编码器(SAEs)低效表示。通过添加一个线性瓶颈来吸收密集结构,作者减少了密集潜变量,并改进了在Gemma-2-2B上的稀疏探针性能。
本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。
本文识别了LLMs中不同后门行为之间的共享潜在机制,利用稀疏自编码器检测并因果抑制这些特征,从而在多种模型和攻击类型中实现统一的后门检测与缓解。
Query Lens 扩展了 Logit Lens,通过联合考虑编码器侧的键特征和解码器侧的值特征,并计入来自下游模块的间接效应,来解释稀疏自编码器特征。该论文还提出了子空间通道假说,表明下游模块通过特定层的子空间读取特征。